文本模型342 / 657 个项目
文本模型分类收录 GitHub 上最热门的大语言模型(LLM)项目,包括基础大模型、推理增强模型、代码专用模型和嵌入向量模型,按 Stars 排名。
DeepSeek 的顶级开源大语言模型系列,采用 MoE 架构,性能对标顶级闭源模型。
Meta 开源大语言模型家族,8B 到 405B 参数规模,性能领先。
用于日常对话的生成式语音模型。
OpenMMLab检测工具箱和基准测试
训练斯坦福Alpaca模型的代码和文档,以及生成数据。
跨任务、跨语言、跨模态的大规模自监督预训练
阿里云提出的Qwen(通义千问)聊天和预训练大型语言模型的官方仓库。
中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)
开源多模态大模型,支持视觉、语音和文本,在手机和边缘设备上表现优异。
Janus 系列:统一多模态理解与生成模型
pix2tex:使用 ViT 将方程图像转换为 LaTeX 代码。
RWKV(读作RwaKuv)是一种具有出色LLM性能的RNN,也可以像GPT transformer一样直接训练(可并行化)。我们目前处于RWKV-7“Goose”版本。它结合了RNN和transformer的优点——出色的性能、线性时间、恒定空间(无kv缓存)、快速训练、无限上下文长度和免费句子嵌入
CLIP的开源实现。
20多个高性能LLM,附带预训练、微调和规模化部署的配方。
易用且强大的 LLM 和 SLM 库,拥有出色的模型动物园。
文本和图像到视频生成:CogVideoX (2024) 和 CogVideo (ICLR 2023)
易用的语音工具包,包括自监督学习模型、带标点的 SOTA/流式 ASR、带文本前端的流式 TTS、说话人验证系统、端到端语音翻译和关键词唤醒。荣获 NAACL2022 最佳演示奖。
来自复旦大学的开源工具增强型对话语言模型
基于 PyTorch 的语音工具包
[CVPR 2024 Oral] InternVL系列:GPT-4o的开创性开源替代方案。接近GPT-4o表现的开源多模态对话模型
OpenMMLab语义分割工具箱和基准。
ChatRWKV类似于ChatGPT,但由RWKV(100% RNN)语言模型驱动,并且是开源的。
易于使用的图像分割库,拥有出色的预训练模型库,支持语义分割、交互式分割、全景分割、图像抠图、3D分割等广泛的实际任务。
使用mesh-tensorflow库实现模型并行GPT-2和GPT-3风格模型
论文《Jukebox:一种音乐生成模型》的代码
中文版GPT2训练代码,使用BERT分词器。
基于Megatron和DeepSpeed库,在GPU上实现模型并行自回归Transformer的实现
InternLM系列(InternLM、InternLM2、InternLM2.5、InternLM3)的官方发布。
中文LLaMA-2 & Alpaca-2大模型二期项目 + 64K超长上下文模型
基于PyTorch的开源神经机器翻译和(大型)语言模型
一个最先进水平的开放视觉语言模型 | 多模态预训练模型
Google AI 2018 BERT pytorch实现
[NeurIPS 2023] 思维树:利用大型语言模型进行深思熟虑的问题解决
通过强化视觉语言模型解决视觉理解问题
MedicalGPT: 使用 ChatGPT 训练流程训练你自己的医疗 GPT 模型。训练医疗大模型,实现了包括增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO。
Chronos:用于时间序列预测的预训练模型
MLX-VLM是一个用于在Mac上使用MLX进行视觉语言模型(VLM)推理和微调的包。
生产优先且生产就绪的端到端语音识别工具包
本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调
Kodezi Chronos 是一个以调试为首的语言模型,在 SWE-bench Lite 上达到最先进结果(80.33%),真实世界修复准确率达 67%,比 GPT-4 好六倍以上。采用自适应图引导检索和持久调试内存构建。模型将于 2026 年第一季度通过 Kodezi OS 提供。
只需几行代码,即可在任何文本数据集上轻松训练任意大小和复杂度的文本生成神经网络。
StarVector 是一个 SVG 生成基础模型,将矢量化转化为代码生成任务。采用视觉-语言建模架构,StarVector 处理视觉和文本输入,生成高质量 SVG 代码,精度卓越。
用于实时语音的快速多模态大语言模型
利用大语言模型和多模态大语言模型实现 AI 能力的通用技术
Databricks 基础模型的 LLM 训练代码
华为诺亚方舟实验室开发的高效 AI 骨干网络,包括 GhostNet、TNT 和 MLP。
GLM-4.5:智能体、推理与编码(ARC)基础模型
用于训练大型多模态模型的开源框架。
TimeGPT-1:生产就绪的预训练时间序列基础模型,用于预测和异常检测。基于超过1000亿数据点训练的时间序列生成式预训练Transformer。仅需几行代码即可准确预测零售、电力、金融和物联网等多个领域 🚀。
MOSS‑TTS 系列是来自 MOSI.AI 和 OpenMOSS 团队的开源语音和声音生成模型系列。专为高保真、高表现力和复杂真实场景设计,涵盖稳定长语音、多说话人对话、语音/角色设计、环境音效和实时流式 TTS。
中文NLP解决方案(大模型、数据、模型、训练、推理)
Turbopilot 是一个基于大语言模型的开源代码补全引擎,在本地 CPU 上运行
这是一本关于 Phi 系列 SLM 的入门书,用于开始使用 Phi 模型。Phi 是微软开发的一系列开源 AI 模型。Phi 模型是目前最强大且最具成本效益的小语言模型 (SLM),在各种语言、推理、编码和数学基准测试中,性能优于同尺寸及更大尺寸的模型。
ICML 2024 论文的代码和模型:NExT-GPT:任意到任意多模态大型语言模型
MiniMax-Text-01 和 MiniMax-VL-01 的官方仓库,基于线性注意力的大语言模型和视觉语言模型
用于在新文本上轻松重新训练 OpenAI 的 GPT-2 文本生成模型的 Python 包
Eagle:采用数据驱动策略的前沿视觉语言模型
InternGPT (iGPT) 是一個開源示範平台,你可以輕鬆展示你的 AI 模型。現在支援 DragGAN、ChatGPT、ImageBind、類似 GPT-4 的多模態聊天、SAM、互動式影像編輯等。試試 igpt.opengvlab.com (支援 DragGAN、ChatGPT、ImageBind、SAM 的線上 Demo 系統)
Skywork-R1V 是天工AI开发的高级多模态AI模型系列,专注于视觉语言推理。
(M)LLM 的基础架构
CodeT5 的家:用于代码理解与生成的开源代码大语言模型
无矩阵乘法语言模型的实现。
Rust 原生、即开即用的 NLP 流水线和基于 Transformer 的模型(BERT、DistilBERT、GPT2 等)
Chinese-LLaMA 1&2、Chinese-Falcon 基础模型;ChatFlow中文对话模型;中文OpenLLaMA模型;NLP预训练/指令微调数据集
GPT2 for Chinese chitchat/用于中文闲聊的GPT2模型
使用 peft 进行大语言模型微调
InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的全面多模态系统
一个跨平台的视频结构化(视频分析)框架。如果觉得有帮助,请给个星星 :) 跨平台的视频结构化(视频分析)框架,觉得有帮助的请给个星星 :)
Lingvo
LISA 的项目页面:通过大型语言模型进行推理分割。
dLLM:简单扩散语言建模。
mPLUG-Owl: 强大的多模态大语言模型家族
一个简单、高性能且可扩展的Jax LLM!
FinGLM:致力于构建一个开放的、公益的、持久的金融大模型项目,利用开源开放来促进「AI+金融」。
Lumina-T2X是一个用于文本到任意模态生成的统一框架。
[AutoArk] GPA(通用音频)能用一个小模型完成 ASR、TTS 和语音转换!
[ICML'24] Magicoder:通过OSS-Instruct赋能代码生成
俄罗斯GPT3模型。
[ACL 2023] 一个嵌入器,任意任务:指令微调文本嵌入
让 Claude(或任何 LLM)真正观看视频——从 URL 或本地文件获取场景感知、去重帧与转录文本。本地运行,MIT 许可。
自回归模型击败扩散:🦙 Llama用于可扩展图像生成
大规模中文短文本对话数据集及中文预训练对话模型
支持普通话、中文方言和英语的开源工业级ASR模型,在公开普通话ASR基准上达到新的SOTA,同时具备出色的歌词识别能力。
[NeurIPS 2023] MotionGPT: 将人体运动视为外语,一个使用大语言模型的统一运动-语言生成模型
[ICLR 2025] LongWriter:从长上下文LLM中释放10,000+字生成能力
中文长文本分类、短句子分类、多标签分类、两句子相似度(Chinese Text Classification of Keras NLP, multi-label classify, or sentence classify, long or short),字词句向量嵌入层(embeddings)和网络层(graph)构建基类,FastText,TextCNN,CharCNN,TextRNN, RCNN, DCNN, DPCNN, VDCNN, CRNN, Bert, Xlnet, Albert, Attention, DeepMoji, HAN, 胶囊网络-CapsuleNet, Transformer-encode, Seq2seq, SWEM, LEAM, TextGCN
使用TikZ合成科学图形和草图的图形程序
[CVPR 2023] OneFormer: 一个Transformer统治通用图像分割
中文对话0.2B小模型(ChatLM-Chinese-0.2B),开源所有数据集来源、数据清洗、tokenizer训练、模型预训练、SFT指令微调、RLHF优化等流程的全部代码。支持下游任务sft微调,给出三元组信息抽取微调示例。
从文本生成图像。俄语版本
DELTA是一个基于深度学习的自然语言和语音处理平台。LF AI & DATA项目:https://lfaidata.foundation/projects/delta/
Seed1.5-VL,一个视觉语言基础模型,旨在推进通用多模态理解和推理,在60个公开基准测试中的38个上达到最先进性能。
移动设备上的快速多模态大语言模型
用于高效实验语音识别、文本转语音和NLP的工具包
多模态GPT
"Retinexformer:基于Retinex的单阶段Transformer用于低光照图像增强" (ICCV 2023 引用前十 🏆) & (NTIRE 2024 亚军 🏆) & (NTIRE 2025 冠军 🏆) & (NTIRE 2026 冠军 🏆)
ReSearch: 通过强化学习让LLM学会结合搜索进行推理 & ReCall: 通过强化学习让LLM学会结合工具调用进行推理
你家的视觉智能。
韩语BERT预训练模型(KoBERT)
该仓库是Disentangling Writer and Character Styles for Handwriting Generation(CVPR 2023)的官方实现
一个开源的知识型大型语言模型框架。
[ECCV 2024 Oral] DriveLM: 基于图视觉问答的驾驶
一个优雅的PyTorch实现的Transformers
论文《Prismer: 一种具有多任务专家的视觉语言模型》的实现。
仅使用文本任务描述作为输入,为特定基准任务调整LLM的超网络
Transformers4Rec是一个灵活高效的库,用于序列和基于会话的推荐,并与PyTorch配合使用。
袖珍多模态 AI,用于跨多语言文本、图像和即将推出的视频的内容理解与生成,速度比 OpenAI CLIP 和 LLaVA 快 5 倍。
各种自注意力机制的实现,专注于计算机视觉。持续更新的仓库。
用语言模型统一 3D 网格生成
[NeurIPS 2020] 论文 "DeepSVG: 用于矢量图形动画的分层生成网络" 的官方代码。包含用于 SVG 数据深度学习的 PyTorch 库。
[非官方] Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020) 的PyTorch实现
一个结合大语言模型的语音、语言、音频、音乐处理框架
GLM-TTS:基于多奖励强化学习的可控且情感表达的零样本TTS
中文法律 LLaMA (LLaMA for Chinese legal domain)
[CVPR2022] 用于快速鲁棒点云配准的几何Transformer
[SIGGRAPH 2025] RenderFormer:基于Transformer的三角网格全局光照神经渲染官方代码
一个基于序列到序列的语音处理引擎的开源实现
深度双向Transformer预训练用于语言理解:预训练TextCNN
来自华东师范大学ICALK的开源教育对话模型。开源中英教育对话大模型。(通用基座模型,GPU部署,数据清理)致敬:LLaMA、MOSS、BELLE、Ziya、vLLM
论文“CogView2:通过层次化Transformer实现更快更好的文本到图像生成”的官方代码仓库
PyTorch中的最先进语义分割模型
纯 Rust 实现的最小生成式预训练 Transformer
"graph2vec: 学习图的分布式表示" (MLGWorkshop 2017) 的并行实现。
一个由 LLM 驱动的开源基础 TTS 系统
TextGAN 是一个基于 PyTorch 的生成对抗网络 (GAN) 文本生成模型框架。
应用于时间序列的 Transformer 模型(最初来自《Attention is All You Need》)的实现。
[NeurIPS 2021] 你只看一个序列
基于Qwen-3和Stable Diffusion系列的DeepSeek Engram架构研究。
🤖 一个精选 Transformer 模型及其可组合组件的 PyTorch 库
一个站在巨人肩膀上的变化检测仓库
用于目标导向对话的大规模预训练模型
后期交互模型训练与检索
SGPT:用于语义搜索的GPT句子嵌入
"Medical Transformer: 用于医学图像分割的门控轴向注意力" - MICCAI 2021 的官方PyTorch代码。
我们引入了一个专为代码生成任务设计的新模型。其在 HumanEval 基础数据集上的测试准确率超过了 GPT-4 Turbo(2024 年 4 月)和 GPT-4o。
GLM-ASR-Nano:一个稳健的开源语音识别模型,拥有15亿参数
[ICLR2025] Kolmogorov-Arnold Transformer
[ICLR'23] DiffuSeq:基于扩散模型的序列到序列文本生成。
连接主义时序分类(CTC)解码算法:最佳路径、束搜索、词典搜索、前缀搜索和令牌传递。使用Python实现。
[NeurIPS 2025] 4KAgent: 智能任意图像到4K超分辨率。一个智能计算机视觉代理,能够神奇地将任何图像恢复到完美的4K!
个人从头训练一个1B参数的LLM,使用1T tokens
带有预训练权重的 BERT 的 Keras 实现
BERT、ALBERT和adapter-BERT的Keras TensorFlow 2.0实现。
更新LLM以记住事实信息的超网络
PhoGPT:越南语生成式预训练(2023)
QiZhenGPT:一个开源的中文医疗大语言模型
CKIP Transformers
一个实时静默语音识别工具。
[ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR
使用Kolmogorov-Arnold网络(KAN)进行语言建模的生成式预训练Transformer(GPT)的PyTorch实现
重新审视中文自然语言处理的预训练模型 (MacBERT)
[ICML 2025] “历史引导视频扩散”的官方 PyTorch 实现
生成式表征指令微调
[ECCV 2026] SparkVSR: 基于稀疏关键帧传播的交互式视频超分辨率
LLaSA: 为基于LLaMA的语音合成扩展训练时间和推理时间计算
[NAACL 2021] QAGNN: 使用语言模型和知识图谱进行问答 🤖
聚宝盆(Cornucopia): 中文金融系列开源可商用大模型,并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)
韩语预训练 ELECTRA 模型
基于 PyTorch 和 Hydra 的端到端韩语自动语音识别开源工具包。
一个 SOTA 工业级一体化 ASR 系统,包含 ASR、VAD、LID 和 Punc 模块。FireRedASR2 支持中文(普通话、20+ 方言/口音)、英语、代码切换以及语音和歌唱 ASR。FireRedVAD 支持 100+ 种语言的语音/歌唱/音乐。FireRedLID 支持 100+ 种语言和 20+ 种中文方言。FireRedPunc 支持中文和英文。
基于Detectron2的下一代视频实例识别框架,支持InstMove (CVPR 2023)、SeqFormer (ECCV Oral)和IDOL (ECCV Oral)
BERTweet:针对英文推文的预训练语言模型(EMNLP-2020)
Conformer的官方代码:局部特征耦合全局表示用于视觉识别
面向AI编码者的自我评估面试
使用 PyTorch 实现的端到端 ASR/LM。
基于 BERT 的多标签分类;来自 AI challenger 的细粒度情感分析。
[CVPR 2025] 视频叙述作为词汇,视频作为长文档。
[ECCV2024] 基于局部视觉标记化的多模态大语言模型
[CVPR 2023] 论文《BiFormer:具有双层路由注意力的视觉Transformer》的官方代码发布
带词典和语言模型的连接主义时序分类(CTC)解码器。
使用纯、无依赖的 C 语言训练和推理 GPT 的最原子化方式
使用 AnglE 训练和推理强大的句子嵌入 | 🔥 在 STS 和 MTEB 排行榜上达到 SOTA
蛋白质结构的扩散模型;三角学和注意力机制就是一切!
MusicLM的实现,这是Google Research发布的文本到音乐模型,并做了一些修改
[ICLR 2024] Lemur:面向语言代理的开放基础模型
(ECCVW 2025) GPT4RoI:在感兴趣区域上对大型语言模型进行指令微调
用于图像描述的网格记忆Transformer。CVPR 2020
用于多任务学习的BERT
[CVPR 2022] StyleSwin:基于Transformer的GAN用于高分辨率图像生成
LongCite:使 LLM 在长上下文问答中生成细粒度引用
论文 "OmniNet: A unified architecture for multi-modal multi-task learning" 的官方 Pytorch 实现 | 作者:Subhojeet Pramanik, Priyanka Agrawal, Aman Hussain
OmniVCus:基于多模态控制条件的前馈主体驱动视频定制(NeurIPS 2025)
VibeVoiceFusion是一个全栈多说话人语音生成Web系统,具备LoRA微调、批量生成和VRAM优化功能。基于微软的VibeVoice(AR + 扩散架构)。
LLM引导扩散:使用大型语言模型增强文本到图像扩散模型的提示理解(LLM-grounded Diffusion: LMD, TMLR 2024)
[NeurIPS 2025 Spotlight] Spatial-MLLM: 提升MLLM在基于视觉的空间智能中的能力——官方实现
ChatTS:与你的时间序列对话
韩语BART
多模态中文 LLaMA & Alpaca 大语言模型(VisualCLA)
[ACL 2022] LinkBERT:一个知识丰富的语言模型😎,通过文档链接预训练
BAAI 提出的 Aquila2 系列官方仓库,包括预训练和聊天大语言模型。
遵循指令的大语言模型用于信息抽取
首个面向半导体的开源行业特定模型
🤗 ParsBERT:基于Transformer的波斯语言理解模型
[ICML 2026] 让LLM发明并演化语言以实现高效推理。
真相就在其中:通过层级选择性秩缩减改进语言模型推理
活字通用大模型
Stream-Omni是一个类似GPT-4o的语言-视觉-语音聊天机器人,同时支持跨多种模态组合的交互。
用于符号音乐生成的MIDI事件变换器
联合语音-语言模型——直接响应音频!
用于微调大型多模态模型的最小化代码库,支持llava-1.5/1.6、llava-interleave、llava-next-video、llava-onevision、llama-3.2-vision、qwen-vl、qwen2-vl、phi3-v等。
数据来源:GitHub API · 人工精选 · 实时同步