图文理解112 / 161 个项目
图文理解模型排行榜,收录 GitHub 上最热门的视觉语言模型(VLM)项目,支持图像理解和自然语言对话的开源模型。
[NeurIPS'23 口头报告] 视觉指令微调(LLaVA),旨在达到 GPT-4V 级别能力及更高水平。
LAVIS - 一站式语言视觉智能库
[CVPR 2024 Oral] InternVL系列:GPT-4o的开创性开源替代方案。接近GPT-4o表现的开源多模态对话模型
Qwen-VL(通义千问-VL)聊天和预训练大型视觉语言模型的官方仓库,由阿里云提出。
通过强化视觉语言模型解决视觉理解问题
BLIP 的 PyTorch 代码:引导语言-图像预训练以实现统一的视觉-语言理解和生成。
MLX-VLM是一个用于在Mac上使用MLX进行视觉语言模型(VLM)推理和微调的包。
StarVector 是一个 SVG 生成基础模型,将矢量化转化为代码生成任务。采用视觉-语言建模架构,StarVector 处理视觉和文本输入,生成高质量 SVG 代码,精度卓越。
MiniMax-Text-01 和 MiniMax-VL-01 的官方仓库,基于线性注意力的大语言模型和视觉语言模型
《Mini-Gemini:挖掘多模态视觉语言模型的潜力》的官方仓库
InternGPT (iGPT) 是一個開源示範平台,你可以輕鬆展示你的 AI 模型。現在支援 DragGAN、ChatGPT、ImageBind、類似 GPT-4 的多模態聊天、SAM、互動式影像編輯等。試試 igpt.opengvlab.com (支援 DragGAN、ChatGPT、ImageBind、SAM 的線上 Demo 系統)
Skywork-R1V 是天工AI开发的高级多模态AI模型系列,专注于视觉语言推理。
InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的全面多模态系统
用于训练和运行 ColVision 模型(例如 ColPali、ColQwen2 和 ColSmol)推理的代码。
OFA 的官方仓库(ICML 2022)。论文:OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
GLM-4.6V/4.5V/4.1V-Thinking:通过可扩展强化学习实现通用多模态推理
面向高级文字机器的一系列原创、创新思想和算法。该项目由阿里巴巴通义实验室语言技术实验室OCR团队维护。
Caption-Anything是一个多功能工具,结合了图像分割、视觉描述和ChatGPT,根据用户偏好生成具有多种控制的定制描述。https://huggingface.co/spaces/TencentARC/Caption-Anything https://huggingface.co/spaces/VIPLab/Caption-Anything
Seed1.5-VL,一个视觉语言基础模型,旨在推进通用多模态理解和推理,在60个公开基准测试中的38个上达到最先进性能。
一种新颖的多模态大语言模型架构,旨在结构上对齐视觉和文本嵌入。
基于Faster R-CNN和Visual Genome的图像描述与VQA的自底向上注意力模型
论文《Prismer: 一种具有多任务专家的视觉语言模型》的实现。
🦩 Flamingo的PyTorch实现,来自Deepmind的最先进的少样本视觉问答注意力网络
JoyCaption 是一个图像字幕视觉语言模型 (VLM),从头开始构建为一个免费、开放且未经审查的模型,供社区用于训练扩散模型。
Oscar和VinVL
图像描述的自批判序列训练及其他内容的非官方 PyTorch 实现
X-modaler是一个通用且高性能的跨模态分析代码库(例如,图像描述、视频描述、视觉语言预训练、视觉问答、视觉常识推理和跨模态检索)。
[CVPR 2024 🔥] 基础大型多模态模型(GLaMM),首个能够生成与对象分割掩码无缝集成的自然语言响应的模型
[CVPR 2024 亮点🔥] Chat-UniVi:统一视觉表示赋能大型语言模型实现图像和视频理解
《Show, Attend and Tell》的 TensorFlow 实现
UniWorld:用于统一视觉理解与生成的高分辨率语义编码器
NEO系列:从第一性原理出发的原生视觉语言模型。
开源SOTA多图像编辑模型
[CVPR 2026🔥] 🧑🎨 OmniLottie,一个开源的多模态指令矢量动画生成器,可生成Lottie JSON。
[ECCV 2026] SparkVSR: 基于稀疏关键帧传播的交互式视频超分辨率
此仓库包含"VLM2Vec" [ICLR 2025]、"VLM2Vec-V2 [TMLR 2026]"和"MMEB-V3"的代码
使用 VQAScore 评估文本到图像/视频/3D 模型。
[ECCV2024] 基于局部视觉标记化的多模态大语言模型
PyTorch 源码:"Stacked Cross Attention for Image-Text Matching" (ECCV 2018)
LLaVA-Mini 是一个统一的大型多模态模型(LMM),能够高效支持图像、高分辨率图像和视频的理解。
Chatbot Arena迎来多模态!多模态竞技场允许您以图像为输入,并排基准测试视觉-语言模型。支持MiniGPT-4、LLaMA-Adapter V2、LLaVA、BLIP-2等更多模型!
[CVPR 2021] VirTex: 从文本标注学习视觉表示
用于视觉问答的双线性注意力网络。
用于图像描述的网格记忆Transformer。CVPR 2020
论文 "OmniNet: A unified architecture for multi-modal multi-task learning" 的官方 Pytorch 实现 | 作者:Subhojeet Pramanik, Priyanka Agrawal, Aman Hussain
[ICLR 2024] 《InstructCV:指令调优的文本到图像扩散模型作为视觉通才》的官方代码库
训练 LLaVA-NeXT 的开源实现
[CVPR 2025 Highlight] "Olympus: 计算机视觉任务的通用任务路由器" 的官方代码
[CVPR 2024 亮点] OPERA:通过过度信任惩罚和回溯分配缓解多模态大语言模型中的幻觉
Stream-Omni是一个类似GPT-4o的语言-视觉-语音聊天机器人,同时支持跨多种模态组合的交互。
视频到文本:为给定视频生成自然语言描述。[视频字幕]
论文'图像描述中的注意力对注意力'的代码。ICCV 2019
'知道何时查看:通过视觉哨兵实现图像描述的自适应注意力' 的实现
使用InceptionV3和束搜索的图像描述生成
基于Transformer的图像描述扩展,用于pytorch/fairseq
一个使用CNN和RNN结合BEAM搜索为图像生成描述的神经网络。
Show, Control and Tell: 一个用于生成可控和基于事实的标题的框架。CVPR 2019
Phi-3.5 for Mac:适用于 Apple Silicon 的本地运行视觉与语言模型。
Phi-3.5 for Mac:适用于Apple Silicon的本地运行视觉和语言模型
《用于图像描述的X-Linear注意力网络》[CVPR 2020]的实现
使用Transformer的图像描述生成
一个基于Keras和TensorFlow构建的模块化库,用于为任何输入图像生成自然语言描述。
语言模型能看见:在文本生成中插入视觉控制
基于Caffe的自动图像描述模型,使用自底向上注意力的特征。
论文“Fine-grained Image Captioning with CLIP Reward”的PyTorch代码(NAACL 2022 Findings)
基于基础模型的医学图像分析
[ICLR 2026] "CapRL: 通过强化学习激发密集图像描述能力"的官方实现
论文《On the Automatic Generation of Medical Imaging Reports》的 PyTorch 实现。
基于空间和通道注意力的图像描述生成
论文《双层级协同 Transformer 用于图像描述》(AAAI 2021)的官方 PyTorch 实现
GRIT:更快更好的图像描述 Transformer(ECCV 2022)
ICCV 2017 论文《展示、适应和讲述:跨域图像描述器的对抗训练》的代码。
[已弃用] 基于Tensorflow的图像描述生成神经网络模型
视觉搜索助手:赋能视觉语言模型作为多模态搜索引擎
论文 'RSTNet: Captioning with Adaptive Attention on Visual and Non-Visual Words' (CVPR 2021) 的官方代码
用于 fairseq 的计算机视觉工具,包含文本识别和物体检测的 PyTorch 实现
使用深度学习为图像生成描述
CLIPxGPT Captioner是基于OpenAI的CLIP和GPT-2的图像描述模型
Show and Tell:一种神经图像描述生成器
基于TensorFlow(TensorLayer)的图像描述实现
ZerolanCore集成了多种开源、可本地部署的AI模型,旨在整合大语言模型(LLM)、自动语音识别(ASR)、文本转语音(TTS)、图像描述、光学字符识别(OCR)、视频描述等一系列AI模型。
论文《Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning》的PyTorch实现
基于自底向上和自顶向下注意力模型的图像描述生成
使用预训练编码器和语言模型从多媒体输入生成描述。
[NeurIPS'25 | CVPR'26] OralGPT 和 MMOral Bench 的官方仓库。
[ICLR2025 Oral] ChartMoE: 用于图表理解的多样化对齐专家连接器混合
适用于NVIDIA LocateAnything-3B的时尚、移动友好的Web UI——通过一次docker compose up,在您自己的GPU上进行开放词汇目标检测与定位。
LLaVA风格VLM的最小实现,具备交错图像、文本和视频处理能力。
MLX 中的 VL-JEPA(视觉-语言联合嵌入预测架构)
mPLUG:通过跨模态跳跃连接实现高效视觉-语言学习。(EMNLP 2022)
工作《在快速端到端训练中利用多序列长度进行图像描述》的实现代码
[CVPR 2020] Transform and Tell:实体感知新闻图像描述生成
此仓库包含论文《重新审视基于视觉语言模型的少样本目标检测》的实现
面向广播与专业音视频的 AI 驱动视觉推理工具。基于 Moondream VLM 的 PTZ 摄像机跟踪、目标检测和场景分析。由 StreamGeeks 和 PTZOptics 提供。
通过利用热启动改进胸部 X 光报告生成
[论文][ISWC 2021] 使用知识图谱的零样本视觉问答
[ICLR 2025] - 跨越鸿沟:通过模态反转揭示 CLIP 中的模态内错位
论文《VisualWebBench:多模态大语言模型在网页理解与定位方面进展如何?》的评估框架
[NeurIPS 2025] 用于长视频理解的深度记忆回溯
[CVPR 2025] 用自反思令牌增强多模态大语言模型,用于基于知识的视觉问答
PhyX:你的模型是否具备物理推理的“智慧”?
[CVPR 2024] 论文“合成、诊断与优化:迈向细粒度视觉语言理解”的官方实现
面向Llama 3的多模态指令微调
结合 ViT 和 GPT-2 进行图像描述。在 MS-COCO 上训练。该模型大部分从头实现。
ThinkJEPA: 用大型视觉语言推理模型赋能潜在世界模型
玩具级统一多模态模型实验——在 MLX/Apple Silicon 上使用混合 Transformer 进行无编码器理解与生成
一个端到端的图像描述项目,使用PyTorch中的CNN编码器(ResNet-50)和LSTM解码器。包括词汇构建、预处理、带有BLEU评估的训练和推理。为图像生成自然语言描述,并保存指标、模型检查点和可视化输出。
《视觉-语言基础模型中模态对齐的后预训练》(CVPR2025)的代码仓库
本仓库包含论文《MileBench:长上下文多模态大语言模型基准测试》的评估代码
用于光学字符识别的逆DALL-E
使用Ollama视觉模型(LLaVA、Qwen3-VL、Llama Vision)自动为图像生成文本描述的工具
[AAAI 2025] I-HallA v1.0 官方实现
数据来源:GitHub API · 人工精选 · 实时同步