视觉模型527 / 1896 个项目
视觉模型分类收录 GitHub 上最热门的计算机视觉 AI 模型项目,包括文生图、文生视频、图像编辑和图像理解等方向。
opencv(⭐89.8K),是 模型 领域的代表性开源项目,使用 C++ 构建,专注 c plus plus 方向,涵盖 computer vision 能力,已成为该领域的标杆级项目,适合 open_source 场景下的 AI 开发需求。
强大的节点式 Stable Diffusion 工作流编辑器,模块化管道实现高级图像生成。
Ultralytics YOLO26、YOLO11、YOLOv8——目标检测、实例分割、语义分割、图像分类、姿态估计、目标跟踪
Ultralytics YOLOv5在PyTorch > ONNX > CoreML > TFLite中的实现
面向直播和流媒体的跨平台、可定制机器学习解决方案。
OpenPose:用于身体、面部、手部和脚部估计的实时多人关键点检测库
即用型OCR,支持80多种语言和所有流行书写系统,包括拉丁文、中文、阿拉伯文、天城文、西里尔文等。
Invoke是Stable Diffusion模型的领先创意引擎,赋能专业人士、艺术家和爱好者,利用最新AI驱动技术生成和创建视觉媒体。该解决方案提供业界领先的WebUI,并作为多个商业产品的基础。
Vision Transformer的实现,一种在PyTorch中仅使用单个Transformer编码器即可在视觉分类中达到SOTA的简单方法
PyTorch中的图像到图像翻译
"3D高斯溅射用于实时辐射场渲染"的原始参考实现
即时神经图形基元:闪电般快速的 NeRF 等
pix2tex:使用 ViT 将方程图像转换为 LaTeX 代码。
基于Tensorflow的人脸识别
CLIP的开源实现。
能够从绘画生成照片、将马变成斑马、执行风格迁移等功能的软件。
COLMAP - 运动恢复结构与多视图立体视觉
面向NeRF的协作友好型工作室
语义分割模型,拥有 500 多个预训练的卷积和基于 Transformer 的主干网络。
🐍 用于空间 AI 的几何计算机视觉库
基于 Stable Diffusion 的自定义照片生成,从几张照片生成个性化图像。
使用条件对抗网络的图像到图像翻译
Ultralytics YOLOv3 在 PyTorch > ONNX > CoreML > TFLite 中的实现
🦙 LaMa图像修复,具有傅里叶卷积的鲁棒大掩码修复,WACV 2022
计算机视觉的最佳实践、代码示例和文档。
我们新被Pattern Recognition 2020接收的论文代码:"U^2-Net: Going Deeper with Nested U-Structure for Salient Object Detection."
PyTorch、TensorFlow、TensorFlow.js、ONNX、CoreML中的稳健视频抠图!
RF-DETR是Roboflow开发的实时目标检测与分割模型架构,在COCO上达到SOTA,专为微调设计。[ICLR 2026]
[NeurIPS 2024 最佳论文奖][GPT 击败扩散🔥][视觉生成中的缩放定律📈] “视觉自回归建模:通过下一尺度预测实现可扩展图像生成”的官方实现。一个*极其简单、用户友好且最先进*的自回归图像生成代码库!
领先的免费开源人脸识别系统
PaddlePaddle GAN库,包含许多有趣的应用,如一阶运动迁移、Wav2Lip、图像修复、图像编辑、照片转卡通、图像风格迁移、GPEN等。
OpenMMLab多模态高级、生成式与智能创作工具箱。解锁魔法🪄:生成式AI(AIGC)、易用API、精彩模型库、扩散模型,用于文本到图像生成、图像/视频修复/增强等。
一个跨平台的图像超分辨率工具
实时高分辨率背景抠图
使用条件GAN合成和操作2048x1024图像
无OCR文档理解Transformer(Donut)和合成文档生成器(SynthDoG)的官方实现,ECCV 2022
开源多视图几何库。三维计算机视觉和运动恢复结构的基础。
(CGCSTCD'2017)一个在非受限场景下用于中国车牌的简单、灵活且准确的车牌识别项目。CGCSTCD = 中国研究生智慧城市技术与创意设计大赛
中文版CLIP,实现中文跨模态检索和表示生成。
基于深度学习的文档图像分析统一工具包。
ECCV2022 - 用于视频帧插值的实时中间流估计
计算机视觉与体育
Single Shot MultiBox Detector的PyTorch实现。
Tiled Diffusion 和 VAE 优化,基于 CC BY-NC-SA 4.0 许可
DragGAN 的非官方实现 - "Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold"(DragGAN 全功能实现,在线Demo,本地部署试用,代码、模型已全部开源,支持Windows, macOS, Linux)
StableSwarmUI,一个模块化 Stable Diffusion Web 用户界面,重点在于使强大工具易于访问、高性能和可扩展性。
Torchreid:基于PyTorch的深度学习行人重识别。
🔎 使用残差密集网络和对抗网络超大规模放大图像并运行实验。
纯Go语言实现的快速人脸检测、瞳孔/眼睛定位和面部特征点检测库。
《Neuralangelo:高保真神经表面重建》(CVPR 2023)的官方实现
商汤科技单目标跟踪研究平台,实现了SiamRPN和SiamMask等算法。
[ECCV 2022] 这是BEVFormer的官方实现,一个仅基于摄像头的自动驾驶感知框架,例如3D目标检测和语义地图分割。
:man: 《通过直接体积CNN回归从单张图像进行大姿态3D人脸重建》的代码
[ICCV 2019] 从单张图像进行单目深度估计
一个用于在肖像图像(视频)中去除背景的OBS插件,方便在录制或直播时替换背景。
OmniGen:统一图像生成。https://arxiv.org/pdf/2409.11340
论文《Anydoor: zero-shot object-level image customization》的官方实现
用于训练大型多模态模型的开源框架。
用于动作识别的3D ResNets(CVPR 2018)
人像卡通化探索项目 (photo-to-cartoon translation project)
通过生成对抗网络进行交互式图像生成
SOTA行人重识别方法与工具箱
基于Pytorch的图像超分辨率迭代细化方法的非官方实现
[CVPR 2024] 用于实时动态场景渲染的4D高斯泼溅
Scenic:一个用于计算机视觉研究及其他领域的Jax库
用于图像自监督学习的 Python 库。
TPAMI 2017 论文《全姿态范围人脸对齐:3D 整体解决方案》的 PyTorch 改进版本。
🔥🔥基于PaddlePaddle和PyTorch的高性能人脸识别库🔥🔥
[CVPR19/TPAMI23] SiamMask:快速在线目标跟踪与分割框架
基于 PyTorch 的视觉跟踪库。
[CVPR2020] 对抗性潜在自编码器
3D 计算机视觉框架
使用深度神经网络自动着色。"Colorful Image Colorization." 发表于 ECCV, 2016。
FCOS:全卷积单阶段目标检测(ICCV'19)
HunyuanImage-3.0:一個強大的原生多模態影像生成模型。
透過 Textual Inversion 方式實現 Dreambooth,用於 Stable Diffusion。調整重點在於訓練人臉、物體和風格。
Towards Fast, Accurate and Stable 3D Dense Face Alignment, ECCV 2020 的官方 PyTorch 实现。
[CVPR 2025] MASt3R-SLAM:基于 3D 重建先验的实时密集 SLAM
(M)LLM 的基础架构
最大的多标签图像数据库;ResNet-101 模型;在 ImageNet 上达到 80.73% 的 top-1 准确率
OpenVSLAM:一个多功能的视觉SLAM框架
[ICLR 2023] 论文《DINO:改进去噪锚框的DETR用于端到端目标检测》的官方实现
Kandinsky 2 — 多语言文本到图像潜在扩散模型
针对日文文本的光学字符识别,主要关注日本漫画
用于通过几次点击将黑白图像上色的深度学习软件。
🔥 [ICCV 2025 Highlight] InfiniteYou:在保留身份的同时灵活重绘照片。
使用生成对抗网络进行图像去模糊
自动去除图像和视频中的马赛克,或为其添加马赛克
用于快速鲁棒图像拼接的Python包
这是我们新项目“高精度二分图像分割”的仓库
对比无配对图像到图像翻译,训练比 cyclegan 更快更轻量(ECCV 2020,PyTorch 实现)
使用Stable Diffusion turbo的一步图像到图像转换:草图转图像、白天转黑夜等。
YOLO ROS:用于ROS的实时目标检测
ICCV2019 - 基于模型的深度强化学习绘画。
用于动漫/插画的素描提取器。
一个用于使用生成神经网络编辑自然照片的简单界面。
本项目是 'DreamOmni2: 多模态指令式编辑与生成 (CVPR2026 Highlight)' 的官方实现
Cambrian-1 是一个以视觉为中心设计的多模态大语言模型家族。
Custom Diffusion: 文本到图像扩散的多概念定制 (CVPR 2023)
自回归模型击败扩散:🦙 Llama用于可扩展图像生成
:unlock: 唇语识别 - 基于3D架构的跨视听识别
Single Shot MultiBox Detector的Keras移植版
[ICCV'25最佳论文决赛] ReCamMaster:从单个视频进行相机控制的生成式渲染
面向高级文字机器的一系列原创、创新思想和算法。该项目由阿里巴巴通义实验室语言技术实验室OCR团队维护。
发现可解释的GAN控制 [NeurIPS 2020]
MobileNetV2-YoloV3-Nano: 0.5BFlops 3MB HUAWEI P40: 6ms/img, YoloFace-500k:0.1Bflops 420KB:fire::fire::fire:
用于统一多模态学习的元变换器
从文本生成图像。俄语版本
基于计算机视觉和深度学习的人脸口罩检测系统,使用OpenCV和Tensorflow/Keras
[CVPR 2025 Oral]Infinity ∞:扩展逐比特自回归建模以实现高分辨率图像合成
基于PyTorch的高质量、快速、模块化SSD参考实现
ChainerCV:用于计算机视觉深度学习的库
在 PyTorch 中实现 EfficientDet:可扩展且高效的目标检测
你家的视觉智能。
该仓库是Disentangling Writer and Character Styles for Handwriting Generation(CVPR 2023)的官方实现
实时且准确的开放词汇端到端目标检测
[ICCV 2025] 🔥🔥 UNO:一种适用于单主体和多主体条件的通用定制方法。
生成对抗变换器。
FireRed-Image-Edit是一个强大的图像编辑基础模型,实现了开源最先进的性能,具有精确的指令跟随、高保真生成、卓越的身份一致性和无缝的多元素融合。
一个简洁易读的PyTorch实现的CycleGAN
一个拥有30亿活跃参数的原生统一多模态模型,用于图像和视频的理解、生成与编辑。
[NeurIPS 2020] 用于数据高效GAN训练的可微分增强
Inpaint Anything扩展使用Segment Anything的掩码在浏览器UI上执行稳定扩散修复。
在更短的时间内用更少的数据构建计算机视觉模型。
[ICCV 2025] "MV-Adapter:轻松实现多视图一致图像生成"的官方实现
Paint by Example:基于示例的图像编辑与扩散模型。
Bernini是一个统一的视频生成和编辑框架,结合了基于MLLM的语义规划器和基于DiT的渲染器
用于SFM、标定、基准标记、跟踪、图像处理等的快速计算机视觉库。
SDEdit 的 PyTorch 实现:基于随机微分方程的图像合成与编辑
[ICLR24] 论文《MagicDrive:具有多样化3D几何控制的街景生成》的官方实现
"VITON-HD: 基于错位感知归一化的高分辨率虚拟试穿" (CVPR 2021) 的官方 PyTorch 实现
使用机器学习和计算机视觉技术进行车辆检测,适用于 Udacity 的自动驾驶汽车工程师纳米学位。
CogView4、CogView3-Plus 和 CogView3(ECCV 2024)
访问PixelLib的官方文档 https://pixellib.readthedocs.io/en/latest/
MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation的官方PyTorch实现,提出MultiDiffusion(ICML 2023)
EntitySeg工具箱:面向开放世界和高品质图像分割
基于 PyTorch 的轻量级实时语义分割模型(包括 SQNet、LinkNet、SegNet、UNet、ENet、ERFNet、EDANet、ESPNet、ESPNetv2、LEDNet、ESNet、FSSNet、CGNet、DABNet、Fast-SCNN、ContextNet、FPENet 等)
度量学习和检索流水线、模型和模型动物园
Segment Any 3D GAussians (AAAI-25) 的官方实现
深度图像抠图
[CVPR 2023 亮点] 神经核表面重建
[CVPR2022] 用于快速鲁棒点云配准的几何Transformer
该仓库实现了论文《我们离解决2D和3D人脸对齐问题还有多远?(以及一个包含23万个3D面部标志点的数据集)》中描述的网络演示。
MixNMatch的Pytorch实现
[ICLR 2026] 一种无需训练的长故事可视化迭代框架
一种实时方法,根据单目彩色图像估计的2D人体关节点,直接以流行的Bio Vision Hierarchy (BVH)格式估计3D人体姿态。我们的贡献包括:(a) 一种新颖且紧凑的2D姿态NSRM表示;(b) 一个人体朝向分类器和一组朝向调优的集成模型。
Pix2Seq代码库:基于生成建模(自回归和扩散)的多任务处理
[ECCV 2026] Skyfall-GS:从卫星图像合成沉浸式3D城市场景
Gated-Shape CNN用于语义分割(ICCV 2019)
[ICRA 2025 最佳论文] MAC-VO:基于学习的立体视觉里程计的度量感知协方差
:oncoming_automobile: “不仅仅是车辆计数!” 该项目利用 TensorFlow 对象计数 API 提供车辆速度、颜色和尺寸的预测。
该项目将Kolmogorov-Arnold网络(KAN)的创新架构思想扩展到卷积层,将卷积的经典线性变换改为每个像素中可学习的非线性激活。
[CVPR 2024 Oral] 重新思考表面法线估计的归纳偏置
论文《高分辨率虚拟试穿:处理错位和遮挡条件》(ECCV 2022)的官方PyTorch实现。
一个在tensorflow中实现的Kitti道路分割模型。
[CVPR 2022] FaceFormer: 基于 Transformer 的语音驱动 3D 面部动画
[CVPR 2016] 基于 GAN 的图像修复的无监督特征学习
3DMatch - 一种基于 3D ConvNet 的局部几何描述符,用于对齐 3D 网格和点云。
沉着的生成模型学习器
[NeurIPS 2021] 你只看一个序列
[CVPR 2020] CascadePSP:通过全局和局部细化实现类别无关和超高分辨率分割
无需 3D 监督,从图像回归 3D 人脸形状和表情
A minimalist SOTA LaTeX OCR model with only 20M parameters, running in browser. Full training pipeline available for self-reproduction. | 超轻量SOTA LaTeX公式识别模型,仅20M参数量,可在浏览器中运行。训练全流程代码开源,以便自学复现。
CVPR2023-占用预测挑战赛
《开放世界中的大规模长尾识别》(CVPR 2019 ORAL)的PyTorch实现
开源SOTA多图像编辑模型
微调SAM(Segment Anything Model)用于特定场景下的计算机视觉任务,如语义分割、抠图、检测等
PointFlow:使用连续归一化流的3D点云生成
论文“Camera Distance-aware Top-down Approach for 3D Multi-person Pose Estimation from a Single RGB Image”的官方PyTorch实现,ICCV 2019
无监督跨域图像生成的TensorFlow实现。
学习适应结构化输出空间用于语义分割,CVPR 2018(亮点论文)。
:zap: 一种新设计的超轻量无锚点目标检测算法,权重仅 250K 参数,相比 yolo-fastest 时间消耗减少 10%,后处理更简单。
[ICCV 2021 Oral] PoinTr:使用几何感知变换器进行多样点云补全。
Instruct-NeRF2NeRF:使用指令编辑 3D 场景(ICCV 2023)。
CVPR 2022 论文 EMOCA: Emotion Driven Monocular Face Capture And Animation 的官方仓库。EMOCA 以单张人脸图像为输入,生成 3D 重建。EMOCA 在野外高情感图像重建方面树立了新标准。
使用Habitat在连续环境中进行视觉与语言导航
[ICLR2025] Kolmogorov-Arnold Transformer
用于微调地理空间基础模型(GFM)的Python工具包
[CVPR 2024] GaussianDreamer:通过桥接2D和3D扩散模型从文本快速生成3D高斯
基于Taichi + PyTorch的NeRF变体实现
[ICRA 2022] 开源协作检测框架。OPV2V的官方实现
一个非常简单的CNN项目,用于识别美国手语手势
FLAME 3D头部模型的示例代码。演示如何从模型采样3D头部、将模型拟合到3D关键点和3D扫描
[CVPR 2022] “MonoScene:单目 3D 语义场景完成”:从单张图像进行 3D 语义占用预测
[NeurIPS 2025] 4KAgent: 智能任意图像到4K超分辨率。一个智能计算机视觉代理,能够神奇地将任何图像恢复到完美的4K!
DeepLabV3 的 PyTorch 实现,在 Cityscapes 数据集上训练。
APDrawingGAN的代码:使用分层GAN从人脸照片生成艺术肖像画(CVPR 2019 Oral)
这是PyTorch中3D FLAME模型的实现
从2D视频进行实时3D人脸跟踪和重建
[ECCV 2024 - Oral] ACE0 是一种基于学习的运动恢复结构方法,通过学习多视图一致的隐式场景表示来估计图像集的相机参数。
IJCAI2023 - 使用动漫角色表的协作神经渲染。
YoloDotNet - 一个C# .NET 8.0项目,用于图像和实时视频流中的分类、目标检测、OBB检测、分割和姿态估计。
富文本到图像生成。
使用 GAN 和 RL 从非配对图像数据集学习无限分辨率图像处理,采用可微分的照片编辑模型。
重新审视图像金字塔结构用于高分辨率显著目标检测(ACCV 2022)的官方PyTorch实现
支持坐标梯度的精确 RoI 池化,在论文《Acquisition of Localization Confidence for Accurate Object Detection》(https://arxiv.org/abs/1807.11590)中提出。
[CVPR 2021] Anycost GANs 用于交互式图像合成与编辑
🤖🖌️ 基于源图像或(即将推出)PBR 材质生成逼真的纹理。混搭、重制、融合!如果你想在主题上创建变体或对现有纹理进行精细加工,这将非常有用。
[ECCV 2024] InstructIR:遵循人类指令的高质量图像恢复 https://huggingface.co/spaces/marcosv/InstructIR
数据来源:GitHub API · 人工精选 · 实时同步