多模态模型195 / 648 个项目
多模态模型分类收录 GitHub 上最热门的跨模态 AI 项目,包括图文理解、音视频理解和统一多模态模型,按 Stars 排名。
[NeurIPS'23 口头报告] 视觉指令微调(LLaVA),旨在达到 GPT-4V 级别能力及更高水平。
跨任务、跨语言、跨模态的大规模自监督预训练
开源多模态大模型,支持视觉、语音和文本,在手机和边缘设备上表现优异。
Janus 系列:统一多模态理解与生成模型
[ECCV 2024] 论文“Grounding DINO:将DINO与接地预训练相结合用于开放集目标检测”的官方实现
一个基于Apple MLX框架构建的文本转语音(TTS)、语音转文本(STT)和语音转语音(STS)库,在Apple Silicon上提供高效的语音分析。
通过强化视觉语言模型解决视觉理解问题
中文版CLIP,实现中文跨模态检索和表示生成。
BLIP 的 PyTorch 代码:引导语言-图像预训练以实现统一的视觉-语言理解和生成。
来自 Facebook AI Research (FAIR) 的视觉与语言多模态研究模块化框架。
Fengshenbang-LM(封神榜大模型)是IDEA研究院认知计算与自然语言研究中心主导的大模型开源体系,成为中文AIGC和认知智能的基础设施。
MOSS‑TTS 系列是来自 MOSI.AI 和 OpenMOSS 团队的开源语音和声音生成模型系列。专为高保真、高表现力和复杂真实场景设计,涵盖稳定长语音、多说话人对话、语音/角色设计、环境音效和实时流式 TTS。
OpenMMLab 预训练工具箱和基准
🪩 一行代码创建Disco Diffusion艺术作品
ICML 2024 论文的代码和模型:NExT-GPT:任意到任意多模态大型语言模型
MTEB:跨语言和模态的嵌入表示的最先进评估
InternGPT (iGPT) 是一個開源示範平台,你可以輕鬆展示你的 AI 模型。現在支援 DragGAN、ChatGPT、ImageBind、類似 GPT-4 的多模態聊天、SAM、互動式影像編輯等。試試 igpt.opengvlab.com (支援 DragGAN、ChatGPT、ImageBind、SAM 的線上 Demo 系統)
(M)LLM 的基础架构
InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的全面多模态系统
轻松计算CLIP嵌入并构建CLIP检索系统
OFA 的官方仓库(ICML 2022)。论文:OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
mPLUG-Owl: 强大的多模态大语言模型家族
mPLUG-DocOwl:用于文档理解的模块化多模态大语言模型
[ECCV2024] 用于多模态理解的视频基础模型与数据
让 Claude(或任何 LLM)真正观看视频——从 URL 或本地文件获取场景感知、去重帧与转录文本。本地运行,MIT 许可。
[ICLR & NeurIPS 2025] Show-o系列仓库,一个统一多模态理解与生成的单Transformer模型
设备端实时多模态AI。与完全在本地机器上运行的AI进行自然语音和视觉对话。由Gemma 4 E2B和Kokoro驱动。
面向高级文字机器的一系列原创、创新思想和算法。该项目由阿里巴巴通义实验室语言技术实验室OCR团队维护。
使用TikZ合成科学图形和草图的图形程序
用于统一多模态学习的元变换器
移动设备上的快速多模态大语言模型
多模态GPT
一种新颖的多模态大语言模型架构,旨在结构上对齐视觉和文本嵌入。
你家的视觉智能。
该仓库是Disentangling Writer and Character Styles for Handwriting Generation(CVPR 2023)的官方实现
[ECCV 2024 Oral] DriveLM: 基于图视觉问答的驾驶
袖珍多模态 AI,用于跨多语言文本、图像和即将推出的视频的内容理解与生成,速度比 OpenAI CLIP 和 LLaVA 快 5 倍。
CoCa(对比字幕器是图像-文本基础模型)在 Pytorch 中的实现
用语言模型统一 3D 网格生成
MOVA:迈向可扩展且同步的视频-音频生成
Aria的代码库——一个开放的多模态原生MoE
🩺 首个会看胸部X光片的中文多模态医学大模型 | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.
[ICLR'24 spotlight] 中英双语多模态大模型系列(聊天与绘画)| 基于CPM基础模型的中英双语多模态大模型系列
跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
[ECCV 2024最佳论文候选 & TPAMI 2025] PointLLM:赋能大语言模型理解点云
《CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval》的官方实现
小型大规模多模态模型框架
Pix2Seq代码库:基于生成建模(自回归和扩散)的多任务处理
NEO系列:从第一性原理出发的原生视觉语言模型。
这是论文Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection的第三方实现。
⚡ 可自托管的、兼容YesCaptcha的验证码求解器,基于FastAPI、Playwright和兼容OpenAI的多模态模型构建。
一个简单、统一的多模态模型训练引擎。精简、灵活,专为大规模黑客攻击而构建。
[ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR
Paddle多模态集成与探索,支持主流多模态任务,包括端到端大规模多模态预训练模型和扩散模型工具箱。兼具高性能和灵活性。
[CVPR 2019]:多元图像补全
此仓库包含"VLM2Vec" [ICLR 2025]、"VLM2Vec-V2 [TMLR 2026]"和"MMEB-V3"的代码
SEED-LLaMA (ICLR 2024)的官方实现
"Seg-Zero:通过认知强化进行推理链引导分割"的项目页面
"混合潜在扩散"的官方实现 [SIGGRAPH 2023]
在2B模型上探索多模态“顿悟时刻”
Hunyuan3D-Omni:一个用于可控 3D 资产生成的统一框架。
[ECCV 2024] 通过提示对任意内容进行标记化
《Blended Diffusion for Text-driven Editing of Natural Images》[CVPR 2022] 的官方实现。
[ECCV2024] 基于局部视觉标记化的多模态大语言模型
PyTorch 源码:"Stacked Cross Attention for Image-Text Matching" (ECCV 2018)
LLaVA-Mini 是一个统一的大型多模态模型(LMM),能够高效支持图像、高分辨率图像和视频的理解。
“Break-A-Scene:从单张图像中提取多个概念”的官方实现 [SIGGRAPH Asia 2023]
"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"的官方代码
[NeurIPS 2025 Spotlight] Spatial-MLLM: 提升MLLM在基于视觉的空间智能中的能力——官方实现
基于PaddlePaddle和PyTorch的多模态学习工具包,支持多模态分类、跨模态检索和图像描述等多种应用。
ChatTS:与你的时间序列对话
多模态中文 LLaMA & Alpaca 大语言模型(VisualCLA)
一个 CLI 工具/Python 模块,使用 OpenAI 的引导扩散和 CLIP 从文本生成图像。
训练 LLaVA-NeXT 的开源实现
OpenAI 的 DALL-E,用于在 mesh-tensorflow 中进行大规模训练。
迈向通用生物医学 AI
[CVPR 2025 Highlight] "Olympus: 计算机视觉任务的通用任务路由器" 的官方代码
[CVPR 2024 亮点] OPERA:通过过度信任惩罚和回溯分配缓解多模态大语言模型中的幻觉
[ICLR 2026] 论文 "Reconstruction Alignment Improves Unified Multimodal Models" 的官方仓库。通过自监督学习解锁统一多模态模型中的大规模零样本潜力。
Visual Med-Alpaca是一个开源的多模态基础模型,专为生物医学领域设计,基于LLaMa-7B构建。
用于多模态3D目标检测的虚拟稀疏卷积
创建图像索引,查询本地LLM,并向图像元数据添加标签
论文《LLark:一个用于音乐的多模态指令跟随语言模型》的代码,作者:Josh Gardner、Simon Durand、Daniel Stoller和Rachel Bittner。
LLaVA-交互式演示
论文《情感增强的说话人脸生成》(ICCVW'23 和 ACM-MMW'23) 的PyTorch实现
联合语音-语言模型——直接响应音频!
用于微调大型多模态模型的最小化代码库,支持llava-1.5/1.6、llava-interleave、llava-next-video、llava-onevision、llama-3.2-vision、qwen-vl、qwen2-vl、phi3-v等。
多模态情感分析——基于BERT+ResNet的多种融合方法
“扩展自回归多模态模型:预训练与指令微调”的开源实现,一种仅使用解码器生成文本和图像的全新多模态AI
[ICLR 2026] VisionReasoner:通过强化学习实现统一推理集成的视觉感知
'PaLM-E:具身多模态语言模型' 的实现
通过深度学习融合组织学和基因组学 - IEEE TMI
Phi-3.5 for Mac:适用于 Apple Silicon 的本地运行视觉与语言模型。
Phi-3.5 for Mac:适用于Apple Silicon的本地运行视觉和语言模型
语言模型能看见:在文本生成中插入视觉控制
UniMMAD:通过MoE驱动的特征解压缩实现统一多模态和多类异常检测
[CVPR 2023] 指代图像抠图
Video2Music:使用情感多模态Transformer模型从视频生成合适的音乐
多模态推荐系统的端到端训练
一个开箱即用的本地Web UI,用于DeepSeek-OCR。基于FastAPI + Vue.js构建,支持PDF/图片上传、进度跟踪和带边界框的结果可视化。轻松体验顶级OCR模型的能力。
论文 'RSTNet: Captioning with Adaptive Attention on Visual and Non-Visual Words' (CVPR 2021) 的官方代码
Zorro(掩码多模态 Transformer)的 PyTorch 实现
[MICCAI 2024,前 11%] Mammo-CLIP 的官方 Pytorch 实现:一种增强乳腺 X 光检查数据效率和鲁棒性的视觉语言基础模型
mPLUG:通过跨模态跳跃连接实现高效视觉-语言学习。(EMNLP 2022)
[ICLR 2025] 🏄 OVTR: 基于Transformer的端到端开放词汇多目标跟踪
[NAACL 2024] MMC:通过 LLM 指令微调推进多模态图表理解
基于关键点的鲁棒多模态图像配准
"PaLI:一个联合缩放的多语言语言-图像模型"的民主化
论文 "FLIP: Cross-domain Face Anti-spoofing with Language Guidance" 的官方实现。(ICCV 2023)
基于通用视觉表示的神经机器翻译(ICLR 2020)
[ICLR 2024] "视觉辅助语言实现免训练组合图像检索"的官方仓库
在PyTorch和TensorFlow中实现的鲁棒多模态集成方法
与 Set-of-Mark (SoM) 👁️ 相关的非官方实现和实验。
[NeurIPS 2024] GenRL:多模态基础世界模型通过将语言和视频提示转换为潜在世界模型状态序列,使其能够接地到具身领域。潜在状态序列可以使用模型的解码器进行解码,从而在训练代理执行之前可视化预期行为。
'Align and Attend: Multimodal Summarization with Dual Contrastive Losses'(CVPR 2023)的官方实现
CLIP:连接文本和图像(从自然语言监督中学习可迁移的视觉模型)
[ICML 2024] “DecisionNCE:通过隐式偏好学习实现具身多模态表示”的官方实现
从头逐步实现 Google Veo 3 架构
ICML 2025 - 不可能的视频
通过利用热启动改进胸部 X 光报告生成
[ICRA'23] 运动目标检测数据集;"RGB-Event Fusion for Moving Object Detection in Autonomous Driving" 的官方实现
快速长视频理解 [TMLR2025]
我对论文《KOSMOS-2.5: 多模态识字模型》中Kosmos2.5的实现
[NeurIPS'25 Spotlight] 《JavisGPT: 面向音视频理解与生成的统一多模态大语言模型》的官方实现
GroundVLP:利用视觉语言预训练和开放词汇目标检测实现零样本视觉定位(AAAI 2024)
使用LLM进行图像分类测试
CCKS 2022 任务“多模态产品知识图谱的链接预测”的基线
基于 baichuan-7b 的开源多模态大语言模型
[ICLR 2025] - 跨越鸿沟:通过模态反转揭示 CLIP 中的模态内错位
[CVPR 2024] 使用单参数集的统一多传感器跟踪器
论文《VisualWebBench:多模态大语言模型在网页理解与定位方面进展如何?》的评估框架
[NeurIPS 2025] 用于长视频理解的深度记忆回溯
[IJCAI 2024] 持续多模态知识图谱构建
[ICLR 2025] 通过解读注意力因果关系缓解多模态大语言模型中的模态先验诱导幻觉
多模态图学习:如何将多个多模态邻居及其关系编码到LLM中
Modality-Transferable-MER,具有零样本和少样本能力的多模态情感识别模型。
[SOICT 2024] 基于LLM的视频搜索:一个全面的多媒体检索系统
[CVPR 2021] SUTD-TrafficQA:一个面向交通事件视频推理的问答基准和高效网络
R1-Track: 通过强化学习将多模态大语言模型直接应用于视觉目标跟踪。
用于动作检测的图蒸馏
[ICLRW 2024] 通过协调迁移学习和模态对齐实现高效遥感。
“自适应协同注意力网络用于推文命名实体识别”(AAAI 2018)的 PyTorch 实现
[ICCV 2025] 《ProLearn:通过原型驱动语义近似缓解医学语言引导分割中的文本依赖》的官方实现
[ICLR 2026] 论文《VisionTrim:用于免训练 MLLM 加速的统一视觉令牌压缩》的官方代码仓库
[CVPR 2025] 用自反思令牌增强多模态大语言模型,用于基于知识的视觉问答
[ICLR 2025] MMFakeBench: 用于LVLM的混合源多模态虚假信息检测基准
PhyX:你的模型是否具备物理推理的“智慧”?
用于推荐系统的高效多模态基础模型适配
论文《MIRAGE:用于全面视网膜OCT图像分析的多模态基础模型与基准》的官方仓库,发表于npj Digital Medicine (2025)。
[CVPR 2024] 论文“合成、诊断与优化:迈向细粒度视觉语言理解”的官方实现
LIMoE的PyTorch实现
面向Llama 3的多模态指令微调
使用PyTorch实现的深度广义典型相关分析(DGCCA或Deep GCCA)。
[IEEE TMI 2024] MultiEYE:基于OCT增强的眼底图像视网膜疾病识别数据集与基准
用于基准测试生成式心电图-语言模型(ELM)的统一框架
结合 ViT 和 GPT-2 进行图像描述。在 MS-COCO 上训练。该模型大部分从头实现。
ThinkJEPA: 用大型视觉语言推理模型赋能潜在世界模型
[NeurIPS 2024] 论文《通过合成视觉-语言负样本改进CLIP的组合推理》的官方PyTorch实现
🐝 | 从数据到预后:嵌入多模态肿瘤学数据实现精准医疗
[𝐧𝐚𝐭𝐮𝐫𝐞 𝐦𝐚𝐜𝐡𝐢𝐧𝐞 𝐢𝐧𝐭𝐞𝐥𝐥𝐢𝐠𝐞𝐧𝐜𝐞] ImmunoStruct 实现用于免疫原性预测的多模态深度学习
基于Instagram数据和PyTorch的多模态标签预测(2019年OpenResource黑客马拉松第二名)
中文领域的多模态Bert
玩具级统一多模态模型实验——在 MLX/Apple Silicon 上使用混合 Transformer 进行无编码器理解与生成
为电商领域微调的最先进嵌入模型。与 ViT-B-16-SigLIP 相比,评估指标提升 67%。
DiffBlender: 可扩展且可组合的多模态文本到图像扩散模型
[ICML'25] MedTok: 多模态医学代码分词器
GATO风格通用多模态模型的实现,能够处理图像、文本、强化学习和机器人任务
ccks2022任务9子任务2 商品同款识别
基于图像和文本的多模态分类基线模型。文本表示来自预训练的BERT基础模型,图像表示来自预训练的VGG16模型。
Qwen2基础模型的视觉指令微调
一个端到端的图像描述项目,使用PyTorch中的CNN编码器(ResNet-50)和LSTM解码器。包括词汇构建、预处理、带有BLEU评估的训练和推理。为图像生成自然语言描述,并保存指标、模型检查点和可视化输出。
该仓库存放了多模态情感分析实验的配套代码。
[NeurIPS-2024] 《指令引导的视觉掩码》的官方实现
《视觉-语言基础模型中模态对齐的后预训练》(CVPR2025)的代码仓库
[WACV 2025] 利用层次关系和常识知识增强场景图生成
TemporalBench:多模态视频模型细粒度时间理解的基准测试
[NeurIPS 2025] 论文《Inst-IT:通过显式视觉提示指令调优提升多模态实例理解》的官方仓库
在CLIP中插入LoRA层的简易封装器。
一个高效的多模态指令跟随数据合成工具,以及Oasis的官方实现 https://arxiv.org/abs/2503.08741。
论文《Learn No to Say Yes Better》的实现。
ACM MM'23:双图故事:冻结与去噪图结构用于多模态推荐
微调HunyuanImage 3.0,一个800亿参数的统一理解与生成模型
本仓库包含论文《MileBench:长上下文多模态大语言模型基准测试》的评估代码
[MICCAI 2023] 基于眼底增强的疾病感知蒸馏模型用于OCT图像视网膜疾病分类
用于光学字符识别的逆DALL-E
多模态Transformer:融合临床笔记与结构化EHR数据,实现可解释的院内死亡率预测
[NeurIPS 2024] 视觉-语言模型中多对象幻觉的官方仓库
论文《联合训练大型自回归多模态模型》中交叉注意力机制的开源实现
使用Ollama视觉模型(LLaVA、Qwen3-VL、Llama Vision)自动为图像生成文本描述的工具
[CVPR '23] 联合与征服:使用扩散模型的即插即用多模态合成
论文《2D3MF:使用多模态中间融合的深度伪造检测》的代码和模型
[NeurIPS'23] 视觉语言模型中的词性基础子空间
[WACV 2025] I Dream My Painting: 通过提示生成连接多模态大语言模型和扩散模型,实现文本引导的多掩码图像修复
数据来源:GitHub API · 人工精选 · 实时同步