基础大模型181 / 440 个项目
基础大语言模型(LLM)排行榜,收录 GitHub 上最热门的通用大模型项目,如 Llama、Qwen、Mistral 等,适合需要基础模型选型的开发者。
DeepSeek 的顶级开源大语言模型系列,采用 MoE 架构,性能对标顶级闭源模型。
Stability AI 的基础文生图模型,开源权重、高质量输出、庞大的工具生态。
Meta 开源大语言模型家族,8B 到 405B 参数规模,性能领先。
用于日常对话的生成式语音模型。
跨任务、跨语言、跨模态的大规模自监督预训练
阿里云提出的Qwen(通义千问)聊天和预训练大型语言模型的官方仓库。
中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)
开源多模态大模型,支持视觉、语音和文本,在手机和边缘设备上表现优异。
Janus 系列:统一多模态理解与生成模型
20多个高性能LLM,附带预训练、微调和规模化部署的配方。
易用且强大的 LLM 和 SLM 库,拥有出色的模型动物园。
文本和图像到视频生成:CogVideoX (2024) 和 CogVideo (ICLR 2023)
[CVPR 2024 Oral] InternVL系列:GPT-4o的开创性开源替代方案。接近GPT-4o表现的开源多模态对话模型
InternLM系列(InternLM、InternLM2、InternLM2.5、InternLM3)的官方发布。
中文LLaMA-2 & Alpaca-2大模型二期项目 + 64K超长上下文模型
[NeurIPS 2023] 思维树:利用大型语言模型进行深思熟虑的问题解决
通过强化视觉语言模型解决视觉理解问题
MedicalGPT: 使用 ChatGPT 训练流程训练你自己的医疗 GPT 模型。训练医疗大模型,实现了包括增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO。
Chronos:用于时间序列预测的预训练模型
MLX-VLM是一个用于在Mac上使用MLX进行视觉语言模型(VLM)推理和微调的包。
本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调
带有预训练骨干网络的分割模型。支持 Keras 和 TensorFlow Keras。
StarVector 是一个 SVG 生成基础模型,将矢量化转化为代码生成任务。采用视觉-语言建模架构,StarVector 处理视觉和文本输入,生成高质量 SVG 代码,精度卓越。
用于实时语音的快速多模态大语言模型
利用大语言模型和多模态大语言模型实现 AI 能力的通用技术
Databricks 基础模型的 LLM 训练代码
GLM-4.5:智能体、推理与编码(ARC)基础模型
用于语言表示自监督学习的轻量级BERT,海量中文预训练ALBERT模型
TimeGPT-1:生产就绪的预训练时间序列基础模型,用于预测和异常检测。基于超过1000亿数据点训练的时间序列生成式预训练Transformer。仅需几行代码即可准确预测零售、电力、金融和物联网等多个领域 🚀。
MOSS‑TTS 系列是来自 MOSI.AI 和 OpenMOSS 团队的开源语音和声音生成模型系列。专为高保真、高表现力和复杂真实场景设计,涵盖稳定长语音、多说话人对话、语音/角色设计、环境音效和实时流式 TTS。
ICML 2024 论文的代码和模型:NExT-GPT:任意到任意多模态大型语言模型
MiniMax-Text-01 和 MiniMax-VL-01 的官方仓库,基于线性注意力的大语言模型和视觉语言模型
Eagle:采用数据驱动策略的前沿视觉语言模型
InternGPT (iGPT) 是一個開源示範平台,你可以輕鬆展示你的 AI 模型。現在支援 DragGAN、ChatGPT、ImageBind、類似 GPT-4 的多模態聊天、SAM、互動式影像編輯等。試試 igpt.opengvlab.com (支援 DragGAN、ChatGPT、ImageBind、SAM 的線上 Demo 系統)
Skywork-R1V 是天工AI开发的高级多模态AI模型系列,专注于视觉语言推理。
无矩阵乘法语言模型的实现。
使用 peft 进行大语言模型微调
InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的全面多模态系统
一个跨平台的视频结构化(视频分析)框架。如果觉得有帮助,请给个星星 :) 跨平台的视频结构化(视频分析)框架,觉得有帮助的请给个星星 :)
[CVPR 2023 Highlight] InternImage:使用可变形卷积探索大规模视觉基础模型
LISA 的项目页面:通过大型语言模型进行推理分割。
dLLM:简单扩散语言建模。
一个简单、高性能且可扩展的Jax LLM!
FinGLM:致力于构建一个开放的、公益的、持久的金融大模型项目,利用开源开放来促进「AI+金融」。
[ICML'24] Magicoder:通过OSS-Instruct赋能代码生成
让 Claude(或任何 LLM)真正观看视频——从 URL 或本地文件获取场景感知、去重帧与转录文本。本地运行,MIT 许可。
自回归模型击败扩散:🦙 Llama用于可扩展图像生成
支持普通话、中文方言和英语的开源工业级ASR模型,在公开普通话ASR基准上达到新的SOTA,同时具备出色的歌词识别能力。
[ICLR 2025] LongWriter:从长上下文LLM中释放10,000+字生成能力
使用TikZ合成科学图形和草图的图形程序
Seed1.5-VL,一个视觉语言基础模型,旨在推进通用多模态理解和推理,在60个公开基准测试中的38个上达到最先进性能。
移动设备上的快速多模态大语言模型
ReSearch: 通过强化学习让LLM学会结合搜索进行推理 & ReCall: 通过强化学习让LLM学会结合工具调用进行推理
你家的视觉智能。
[ECCV 2024 Oral] DriveLM: 基于图视觉问答的驾驶
一个优雅的PyTorch实现的Transformers
仅使用文本任务描述作为输入,为特定基准任务调整LLM的超网络
用语言模型统一 3D 网格生成
Grounding DINO 1.5:IDEA研究院最具能力的开放世界目标检测模型系列
一个结合大语言模型的语音、语言、音频、音乐处理框架
GLM-TTS:基于多奖励强化学习的可控且情感表达的零样本TTS
中文法律 LLaMA (LLaMA for Chinese legal domain)
来自华东师范大学ICALK的开源教育对话模型。开源中英教育对话大模型。(通用基座模型,GPU部署,数据清理)致敬:LLaMA、MOSS、BELLE、Ziya、vLLM
纯 Rust 实现的最小生成式预训练 Transformer
基于Qwen-3和Stable Diffusion系列的DeepSeek Engram架构研究。
🤖 一个精选 Transformer 模型及其可组合组件的 PyTorch 库
我们引入了一个专为代码生成任务设计的新模型。其在 HumanEval 基础数据集上的测试准确率超过了 GPT-4 Turbo(2024 年 4 月)和 GPT-4o。
GLM-ASR-Nano:一个稳健的开源语音识别模型,拥有15亿参数
[NeurIPS 2025] 4KAgent: 智能任意图像到4K超分辨率。一个智能计算机视觉代理,能够神奇地将任何图像恢复到完美的4K!
个人从头训练一个1B参数的LLM,使用1T tokens
[CVPR 2024 Highlight] GenAD: 自动驾驶的通用预测模型。
更新LLM以记住事实信息的超网络
PhoGPT:越南语生成式预训练(2023)
QiZhenGPT:一个开源的中文医疗大语言模型
一个实时静默语音识别工具。
使用Kolmogorov-Arnold网络(KAN)进行语言建模的生成式预训练Transformer(GPT)的PyTorch实现
生成式表征指令微调
[ECCV 2026] SparkVSR: 基于稀疏关键帧传播的交互式视频超分辨率
LLaSA: 为基于LLaMA的语音合成扩展训练时间和推理时间计算
SEED-LLaMA (ICLR 2024)的官方实现
一个 SOTA 工业级一体化 ASR 系统,包含 ASR、VAD、LID 和 Punc 模块。FireRedASR2 支持中文(普通话、20+ 方言/口音)、英语、代码切换以及语音和歌唱 ASR。FireRedVAD 支持 100+ 种语言的语音/歌唱/音乐。FireRedLID 支持 100+ 种语言和 20+ 种中文方言。FireRedPunc 支持中文和英文。
面向AI编码者的自我评估面试
[CVPR 2025] 视频叙述作为词汇,视频作为长文档。
[ECCV2024] 基于局部视觉标记化的多模态大语言模型
使用纯、无依赖的 C 语言训练和推理 GPT 的最原子化方式
使用 AnglE 训练和推理强大的句子嵌入 | 🔥 在 STS 和 MTEB 排行榜上达到 SOTA
(ECCVW 2025) GPT4RoI:在感兴趣区域上对大型语言模型进行指令微调
LongCite:使 LLM 在长上下文问答中生成细粒度引用
LLM引导扩散:使用大型语言模型增强文本到图像扩散模型的提示理解(LLM-grounded Diffusion: LMD, TMLR 2024)
[NeurIPS 2025 Spotlight] Spatial-MLLM: 提升MLLM在基于视觉的空间智能中的能力——官方实现
ChatTS:与你的时间序列对话
多模态中文 LLaMA & Alpaca 大语言模型(VisualCLA)
BAAI 提出的 Aquila2 系列官方仓库,包括预训练和聊天大语言模型。
遵循指令的大语言模型用于信息抽取
首个面向半导体的开源行业特定模型
[ICML 2026] 让LLM发明并演化语言以实现高效推理。
真相就在其中:通过层级选择性秩缩减改进语言模型推理
活字通用大模型
Visual Med-Alpaca是一个开源的多模态基础模型,专为生物医学领域设计,基于LLaMa-7B构建。
Stream-Omni是一个类似GPT-4o的语言-视觉-语音聊天机器人,同时支持跨多种模态组合的交互。
论文《LLark:一个用于音乐的多模态指令跟随语言模型》的代码,作者:Josh Gardner、Simon Durand、Daniel Stoller和Rachel Bittner。
联合语音-语言模型——直接响应音频!
用于微调大型多模态模型的最小化代码库,支持llava-1.5/1.6、llava-interleave、llava-next-video、llava-onevision、llama-3.2-vision、qwen-vl、qwen2-vl、phi3-v等。
粋 (Sui) - 一种针对LLM代码生成优化的编程语言
LucaOne的资源,包括:模型代码、训练脚本、嵌入推理代码和训练好的检查点。
StyleLLM文风大模型:基于大语言模型的文本风格迁移项目。Text style transfer base on Large Language Model. #文字修饰 #润色 #风格模仿
[ACL2024 Findings] Agent-FLAN:为大型语言模型设计有效的代理微调数据和方法
论文《TreeLoRA:通过层级梯度相似性树引导的逐层LoRA实现高效持续学习》的PyTorch实现。
一个实时流式对话视频系统,使用自回归扩散将文本交互转换为连续、高保真的视频响应。
用于 VAR 和 AR 的高性能图像分词器
使用可验证Lambda演算的长上下文RLM方法。
文本到文本语言建模工具包。
电子鹦鹉 / 玩具语言模型
Phi-3.5 for Mac:适用于 Apple Silicon 的本地运行视觉与语言模型。
Phi-3.5 for Mac:适用于Apple Silicon的本地运行视觉和语言模型
关于为自动驾驶打造视觉基础模型的全面综述,包括挑战、方法和机遇。
基于多模态大语言模型的上下文目标检测
PosterGen的官方仓库 - CVPR Findings 2026
(CVPR 2025)《Chat2SVG:使用大型语言模型和图像扩散模型生成矢量图形》的代码
基于基础模型的医学图像分析
Tapestry 项目旨在为每个国家和参与者提供他们可以称之为己有的前沿 AI——联合全球联盟训练一个共享的前沿模型,合作伙伴从中构建并拥有符合其国家、社会文化和工业需求的主权模型。
[ICLR 2026] "CapRL: 通过强化学习激发密集图像描述能力"的官方实现
论文《RecurrentGPT:交互式生成(任意)长文本》的开源LLM实现。AI写小说,AI写作
原生Go语言实现的LLaMA-2
[ICLR 2026] 《超越固定:扩散大语言模型的无训练变长去噪》的官方仓库
多模态推荐系统的端到端训练
[EMNLP 2025] LightThinker:逐步压缩思考
论文《GAMA:具有高级音频理解和复杂推理能力的大型音频语言模型》的代码。
Chat LLaMA 仓库 - 在 HuggingFace 上使用 8 位或 4 位量化对 LLaMA(1 或 2)模型训练 LoRA。仅限研究用途。
DeSTA2.5-Audio通用LALM代码
使用中文指令数据集微调LLaMA-7B
[EMNLP 2025 主会] Video Compression Commander:面向视频大语言模型的即插即用推理加速
视觉搜索助手:赋能视觉语言模型作为多模态搜索引擎
一个开箱即用的本地Web UI,用于DeepSeek-OCR。基于FastAPI + Vue.js构建,支持PDF/图片上传、进度跟踪和带边界框的结果可视化。轻松体验顶级OCR模型的能力。
[ICML 2026] 分散损失抵消嵌入压缩并改善小语言模型的泛化能力
[CVPR 2026 Highlight] PersonaVLM:长期个性化多模态大语言模型
ZerolanCore集成了多种开源、可本地部署的AI模型,旨在整合大语言模型(LLM)、自动语音识别(ASR)、文本转语音(TTS)、图像描述、光学字符识别(OCR)、视频描述等一系列AI模型。
文本引导的蛋白质设计框架,Nat Mach Intell 2025 (https://www.nature.com/articles/s42256-025-01011-z)
[AAAI 2026] 《GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning》的官方代码库。
针对阿姆哈拉语 (አማርኛ) 的音节感知 BPE 分词器——快速、准确、可训练。
"AceCoder: Acing Coder RL via Automated Test-Case Synthesis" [ACL25] 官方仓库
[NeurIPS'25 | CVPR'26] OralGPT 和 MMOral Bench 的官方仓库。
PasLLM - 用 Object Pascal 编写的 LLM 推理引擎(从我的私人工作仓库同步)
Legend of Elya — N64游戏,在VR4300 MIPS III CPU上运行真实的819K参数Transformer。塞尔达风格地牢、AI NPC、字节级推理,速度60 tok/s。使用libdragon SDK构建。
使用 LoRA 微调 Gemma 4 31B,使其原生使用穴居人模式说话。风格:github.com/JuliusBrussee/caveman
LLaVA风格VLM的最小实现,具备交错图像、文本和视频处理能力。
使用 Infini-attention PyTorch 实现 + QwenMoE 实现 + 训练脚本 + 1M 上下文密钥检索的高效无限上下文 Transformer
顺序扩散语言模型 (SDLM) 通过自适应确定生成长度并保持 KV-cache 兼容性来增强预训练自回归语言模型,实现高效率和吞吐量。
使用 LLM 和 LoRA 进行文本分类
多轮共情对话模型PICA
[ACL 2024] LangBridge:无需多语言监督的多语言推理
《推理语言模型:蓝图》的官方实现
MLX 中的 VL-JEPA(视觉-语言联合嵌入预测架构)
WangChanGLM 🐘 - 多语言指令遵循模型
Bamboo-7B 大型语言模型
[CVPR 2024] 从语言嵌入特征场理解物理属性
wav2graph: 一个从语音中构建监督学习知识图谱的框架
[ECCV 2026🔥] SRUM:面向统一多模态模型的细粒度自我奖励机制
[ICLR 2024] "视觉辅助语言实现免训练组合图像检索"的官方仓库
从头逐步实现 Google Veo 3 架构
快速长视频理解 [TMLR2025]
使用LLM进行图像分类测试
基于 baichuan-7b 的开源多模态大语言模型
[Interspeech 2025] DualCodec: 一种低帧率、语义增强的神经音频编解码器。
浏览器LLM演示(类似ChatGPT)。使用JavaScript和WebGPU在本地运行。
论文《VisualWebBench:多模态大语言模型在网页理解与定位方面进展如何?》的评估框架
[NeurIPS 2025] 用于长视频理解的深度记忆回溯
[ICLR 2025] 通过解读注意力因果关系缓解多模态大语言模型中的模态先验诱导幻觉
多模态图学习:如何将多个多模态邻居及其关系编码到LLM中
R1-Track: 通过强化学习将多模态大语言模型直接应用于视觉目标跟踪。
珠算代码大模型(Abacus Code LLM)
该仓库实现了一种无需与转录参考对齐、使用可学习音频编码器的文本转语音方法
用于基准测试生成式心电图-语言模型(ELM)的统一框架
ThinkJEPA: 用大型视觉语言推理模型赋能潜在世界模型
Qwen2基础模型的视觉指令微调
一个高效的多模态指令跟随数据合成工具,以及Oasis的官方实现 https://arxiv.org/abs/2503.08741。
本仓库包含论文《MileBench:长上下文多模态大语言模型基准测试》的评估代码
使用Ollama视觉模型(LLaVA、Qwen3-VL、Llama Vision)自动为图像生成文本描述的工具
Anthropic 的 Claude API,领先的大语言模型,强大的推理、编程和安全能力。
数据来源:GitHub API · 人工精选 · 实时同步