图像理解/OCR381 / 915 个项目
图像理解/OCR 模型排行榜,收录 GitHub 上最热门的图像识别和理解 AI 项目,包括 OCR、目标检测、图像分割等开源工具。
将任何PDF或图像文档转换为适用于AI的结构化数据。一个强大、轻量级的OCR工具包,弥合了图像/PDF与LLM之间的差距。支持100多种语言。
Tesseract 开源 OCR 引擎(主仓库)
Ultralytics YOLO26、YOLO11、YOLOv8——目标检测、实例分割、语义分割、图像分类、姿态估计、目标跟踪
Ultralytics YOLOv5在PyTorch > ONNX > CoreML > TFLite中的实现
支持超过100种语言的纯JavaScript OCR库📖🎉🖥
最大的 PyTorch 图像编码器/骨干网络集合。包括训练、评估、推理、导出脚本和预训练权重——ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer (ViT)、MobileNetV4、MobileNet-V3 & V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet、ConvNeXt 等。
OpenMMLab检测工具箱和基准测试
即用型OCR,支持80多种语言和所有流行书写系统,包括拉丁文、中文、阿拉伯文、天城文、西里尔文等。
基于Keras和TensorFlow的Mask R-CNN,用于目标检测和实例分割
Vision Transformer的实现,一种在PyTorch中仅使用单个Transformer编码器即可在视觉分类中达到SOTA的简单方法
pix2tex:使用 ViT 将方程图像转换为 LaTeX 代码。
这是“Swin Transformer:使用移位窗口的分层视觉 Transformer”的官方实现。
基于PaddlePaddle的目标检测工具包。支持目标检测、实例分割、多目标跟踪和实时多人关键点检测
超轻量级中文ocr,支持竖排文字识别, 支持ncnn、mnn、tnn推理 ( dbnet(1.8M) + crnn(2.5M) + anglenet(378KB)) 总模型仅4.7M
使用视觉模型进行OCR与文档提取
语义分割模型,拥有 500 多个预训练的卷积和基于 Transformer 的主干网络。
基于深度学习的目标检测论文列表。
Ultralytics YOLOv3 在 PyTorch > ONNX > CoreML > TFLite 中的实现
YOLOX 是一个高性能的无锚框 YOLO,超越 yolov3~v5,支持 MegEngine、ONNX、TensorRT、ncnn 和 OpenVINO。文档:https://yolox.readthedocs.io/
[ECCV 2024] 论文“Grounding DINO:将DINO与接地预训练相结合用于开放集目标检测”的官方实现
[CVPR 2024 Oral] InternVL系列:GPT-4o的开创性开源替代方案。接近GPT-4o表现的开源多模态对话模型
计算机视觉的最佳实践、代码示例和文档。
RF-DETR是Roboflow开发的实时目标检测与分割模型架构,在COCO上达到SOTA,专为微调设计。[ICLR 2026]
一个旨在赋能开发者构建具有自包含计算机视觉能力的应用和系统的 Python 库
无OCR文档理解Transformer(Donut)和合成文档生成器(SynthDoG)的官方实现,ECCV 2022
OpenMMLab的下一代通用3D目标检测平台。
NanoDet-Plus⚡超快速轻量级无锚点目标检测模型。🔥仅 980 KB(int8) / 1.8MB (fp16),在手机上运行可达 97FPS🔥
将 PDF、文档和图像转换为丰富的结构化数据。
YOLOv6:一个专为工业应用设计的单阶段目标检测框架。
基于深度学习的文档图像分析统一工具包。
OpenPCDet 工具箱,用于基于 LiDAR 的 3D 目标检测。
PointNet:用于 3D 分类和分割的点集深度学习
计算机视觉与体育
官方EfficientDet的PyTorch重新实现,具有实时SOTA性能和预训练权重。
Single Shot MultiBox Detector的PyTorch实现。
带有预训练骨干网络的分割模型。支持 Keras 和 TensorFlow Keras。
使用 PyTorch(纯 Python)实现的 PointNet 和 PointNet++,并在 ModelNet、ShapeNet 和 S3DIS 上运行。
OpenMMLab文本检测、识别和理解工具箱。
[ECCV 2022] 这是BEVFormer的官方实现,一个仅基于摄像头的自动驾驶感知框架,例如3D目标检测和语义地图分割。
TensorFlow中的单次多框检测器
一个使用Segment Anything Model(SAM)分割地理空间数据的Python包
一个简化实现的Faster R-CNN,复现原始论文性能
OpenMMLab 预训练工具箱和基准
用于目标检测的 Tensorflow Faster RCNN
🔥 技术报告“YOLOv3:增量改进”的 TensorFlow 代码
AdelaiDet 是一个用于多项实例级检测和识别任务的开源工具箱。
OpenMMLab YOLO 系列工具箱和基准。实现了 RTMDet、RTMDet-Rotated、YOLOv5、YOLOv6、YOLOv7、YOLOv8、YOLOX、PPYOLOE 等。
基于 TensorFlow 中 ctpn 模型的文本检测,身份证检测,连接主义文本提议网络
FCOS:全卷积单阶段目标检测(ICCV'19)
YOLO v3目标检测算法的PyTorch实现
D-FINE:將 DETR 的迴歸任務重新定義為細粒度分佈精煉 [ICLR 2025 Spotlight]
[ICRA'23] BEVFusion:使用統一鳥瞰視圖表示的多任務多感測器融合。
[驗證碼識別-訓練] 本專案基於 CNN/ResNet/DenseNet+GRU/LSTM+CTC/CrossEntropy 實現驗證碼識別。本專案僅用於訓練模型。
一個用於文件 AI 的儲存庫。
DAMO-YOLO:一种快速准确的目标检测方法,采用多项新技术,包括 NAS 骨干网络、高效 RepGFPN、ZeroHead、AlignedOTA 和蒸馏增强。
🔥🔥🔥🔥(早期 YOLOv7,非官方版本)结合 Transformer 和实例分割的 YOLO,支持 TensorRT 加速!🔥🔥🔥
一个简单且通用的目标检测与实例识别框架
TensorFlow 中的 Mask RCNN
EAST 文本检测器的 TensorFlow 实现
[python3.6] 运用tf实现自然场景文字检测,keras/pytorch实现ctpn+crnn+ctc实现不定长场景文字OCR识别
一个跨平台的视频结构化(视频分析)框架。如果觉得有帮助,请给个星星 :) 跨平台的视频结构化(视频分析)框架,觉得有帮助的请给个星星 :)
[CVPR 2023 Highlight] InternImage:使用可变形卷积探索大规模视觉基础模型
[ICLR 2023] 论文《DINO:改进去噪锚框的DETR用于端到端目标检测》的官方实现
针对日文文本的光学字符识别,主要关注日本漫画
[ECCV2024] T-Rex2 的 API 代码:通过文本-视觉提示协同实现通用目标检测。
LISA 的项目页面:通过大型语言模型进行推理分割。
轻量级 Python 库,用于为任何检测器添加实时多目标跟踪。
在 Tensorflow 2.0 中实现的 YoloV3
YOLO ROS:用于ROS的实时目标检测
轻量级裸体检测
Open3D 的扩展,用于处理 3D 机器学习任务。
detrex 是一个基于 DETR 的目标检测、分割、姿态估计和其他视觉识别任务的研究平台。
在Tensorflow 2.0和Android中实现的YOLOv4、YOLOv4-tiny、YOLOv3、YOLOv3-tiny。将YOLO v4 .weights转换为tensorflow、tensorrt和tflite。
全景驾驶感知的YOLO方法。(MIR2022)
[CVPR 2025] MambaVision的官方PyTorch实现:一种混合Mamba-Transformer视觉骨干网络
在卷积神经网络中使用注意力门控/医学图像分类与分割
Scaled-YOLOv4: 缩放跨阶段局部网络
[DEIMv2] 实时目标检测结合DINOv3
论文《CenterNet:用于目标检测的关键点三元组》的代码。
Single Shot MultiBox Detector的Keras移植版
面向高级文字机器的一系列原创、创新思想和算法。该项目由阿里巴巴通义实验室语言技术实验室OCR团队维护。
集成不同目标检测模型框的方法集合,包括"加权框融合(WBF)"方法的实现
用于KITTI/NuScenes目标检测的SECOND
用于点云中3D目标检测的深度霍夫投票
用于实例分割的SOLO和SOLOv2,ECCV 2020 & NeurIPS 2020。
MobileNetV2-YoloV3-Nano: 0.5BFlops 3MB HUAWEI P40: 6ms/img, YoloFace-500k:0.1Bflops 420KB:fire::fire::fire:
“YOLOv13:基于超图增强自适应视觉感知的实时目标检测”的实现。
这是一个 YOLOv4、attentive YOLOv4 和 mobilenet YOLOv4 的 pytorch 仓库,使用 PASCAL VOC 和 COCO 数据集
基于 Frustum PointNets 的 RGB-D 数据三维物体检测
EfficientDet 的 PyTorch 实现,忠实于原始 Google 实现并带有移植权重
使用YOLO3训练和检测目标
[CVPR 2025] DEIM:基于改进匹配的DETR实现快速收敛
基于PyTorch的高质量、快速、模块化SSD参考实现
动态语义SLAM 目标检测+VSLAM+光流/多视角几何动态物体检测+octomap地图+目标数据库
世界上第一个通用3D目标检测代码库。
完整的YOLO v3 TensorFlow实现。支持在自定义数据集上进行训练。
[CVPR 2023] 论文“Mask DINO:迈向统一的基于Transformer的目标检测与分割框架”的官方实现
[CVPR2026] 通过下一个点预测检测任何物体
"Retinexformer:基于Retinex的单阶段Transformer用于低光照图像增强" (ICCV 2023 引用前十 🏆) & (NTIRE 2024 亚军 🏆) & (NTIRE 2025 冠军 🏆) & (NTIRE 2026 冠军 🏆)
[ICLR 2023 Spotlight] 用于密集预测的Vision Transformer适配器
在 PyTorch 中实现 EfficientDet:可扩展且高效的目标检测
单次精炼神经网络用于目标检测,CVPR 2018
实时且准确的开放词汇端到端目标检测
使用扩散模型从医学图像中分割/重建器官 [AAAI 最具影响力论文]
用于实例分割和目标检测的 PANet。
基于YOLOv4的PyTorch实现,对应论文《Complex-YOLO: 点云上的实时3D目标检测》
Inpaint Anything扩展使用Segment Anything的掩码在浏览器UI上执行稳定扩散修复。
xmnlp:提供中文分词, 词性标注, 命名体识别,情感分析,文本纠错,文本转拼音,文本摘要,偏旁部首,句子表征及文本相似度计算等功能
在更短的时间内用更少的数据构建计算机视觉模型。
StarDist——基于星凸形状的目标检测。
Grounding DINO 1.5:IDEA研究院最具能力的开放世界目标检测模型系列
(CVPR 2021 Oral)开放世界目标检测
访问PixelLib的官方文档 https://pixellib.readthedocs.io/en/latest/
[ECCV2022] PETR:用于多视图3D目标检测的位置嵌入变换 & [ICCV2023] PETRv2:多相机图像3D感知的统一框架
多个流行目标检测框架的Caffe实现
EntitySeg工具箱:面向开放世界和高品质图像分割
基于 PyTorch 的轻量级实时语义分割模型(包括 SQNet、LinkNet、SegNet、UNet、ENet、ERFNet、EDANet、ESPNet、ESPNetv2、LEDNet、ESNet、FSSNet、CGNet、DABNet、Fast-SCNN、ContextNet、FPENet 等)
基于 TensorFlow 的高层网络定义及预训练权重
MetaSeg:Segment Anything 仓库的打包版本
:art: Pytorch YOLO v5 训练自己的数据集超详细教程!!! :art: (提供PDF训练教程下载)
场景文本位置感知与识别的论文资源与实现合集
用于自动驾驶的3D目标检测代码
Pix2Seq代码库:基于生成建模(自回归和扩散)的多任务处理
带有可变形注意力的Vision Transformer(CVPR2022)和DAT++:具有可变形注意力的空间动态Vision Transformer的仓库
Medical SAM 2:通过 Segment Anything Model 2 分割 3D 医学图像
:oncoming_automobile: “不仅仅是车辆计数!” 该项目利用 TensorFlow 对象计数 API 提供车辆速度、颜色和尺寸的预测。
半监督学习、目标检测、ICCV2021
[ICLR 2024] FasterViT的官方PyTorch实现:具有分层注意力的快速视觉变换器
该仓库是 2D 和 3D 医学分割的非官方 PyTorch 实现。
一个在tensorflow中实现的Kitti道路分割模型。
[ICLR2022] UniFormer 的官方实现
[NeurIPS 2021] 你只看一个序列
[CVPR 2020] CascadePSP:通过全局和局部细化实现类别无关和超高分辨率分割
A minimalist SOTA LaTeX OCR model with only 20M parameters, running in browser. Full training pipeline available for self-reproduction. | 超轻量SOTA LaTeX公式识别模型,仅20M参数量,可在浏览器中运行。训练全流程代码开源,以便自学复现。
在 Tensorflow (TF-Slim) 中实现 YOLO v3 目标检测器
"Medical Transformer: 用于医学图像分割的门控轴向注意力" - MICCAI 2021 的官方PyTorch代码。
:zap: 一种新设计的超轻量无锚点目标检测算法,权重仅 250K 参数,相比 yolo-fastest 时间消耗减少 10%,后处理更简单。
Darknet/YOLO目标检测框架
这是论文Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection的第三方实现。
用于手写文本识别的OCR软件。
一个使用 Pytorch 进行图像分类、人脸识别和图像检索的强大基线。
YoloDotNet - 一个C# .NET 8.0项目,用于图像和实时视频流中的分类、目标检测、OBB检测、分割和姿态估计。
该仓库是我们团队参与DOTA相关竞赛的代码库,包括旋转检测和水平检测。
CnSTD: 基于 PyTorch/MXNet 的 中文/英文 场景文字检测(Scene Text Detection)、数学公式检测(Mathematical Formula Detection, MFD)、篇章分析(Layout Analysis)的Python3 包
[CVPR 2020] CenterMask:实时无锚点实例分割
支持坐标梯度的精确 RoI 池化,在论文《Acquisition of Localization Confidence for Accurate Object Detection》(https://arxiv.org/abs/1807.11590)中提出。
[CVPR 2020] CenterMask:实时无锚点实例分割
基于mobilenet SSD的人脸检测器,由tensorflow目标检测API驱动,使用WIDERFACE数据集训练。
SSD: Single Shot MultiBox Object Detector的MXNet移植版。重新实现自https://github.com/weiliu89/caffe/tree/ssd
论文《Bag of Tricks for Image Classification with Convolutional Neural Networks》的实验以及其他提升CNN准确率的实用技巧
随机擦除数据增强。在CIFAR10、CIFAR100和Fashion-MNIST上的实验
基于不确定性边界框回归的精确目标检测 (CVPR'19)
DSOD:从零开始学习深度监督目标检测器。发表于ICCV 2017。
Python中的层次感知库,用于姿态估计、目标检测、实例分割、关键点估计、人脸识别等。
Python 中的多目标跟踪器
更易读和灵活的 yolov5,带有更多主干网络(gcn, resnet, shufflenet, moblienet, efficientnet, hrnet, swin-transformer 等)和(cbam, dcn 等),以及 tensorrt
在 Android 上使用 YOLO 网络和 TensorFlow 进行实时物体检测
Pytorch中Bottleneck Transformer的实现
从头开始训练最先进的yolov3目标检测器!
yolo-v1的实验,包括训练和测试
Gaussian YOLOv3:利用定位不确定性实现准确快速的目标检测器,用于自动驾驶(ICCV, 2019)
基于深度学习的驾驶员分心驾驶行为(疲劳+危险行为)预警系统使用YOLOv5+Deepsort实现驾驶员的危险驾驶行为的预警监测
FreeAnchor:学习匹配锚点用于视觉目标检测(NeurIPS 2019)
🚀🚀🚀 PaddlePaddle实现的YOLO系列,包括PP-YOLOE+、RT-DETR、YOLOv5、YOLOv6、YOLOv7、YOLOv8、YOLOv10、YOLO11、YOLOX、YOLOv5u、YOLOv7u、YOLOv6Lite、RTMDet等。🚀🚀🚀
基于yolo-high-level项目(检测\姿态\分类\分割\),包含yolov5\yolov7\yolov8\核心、改进研究、SwintransformV2和注意力系列。训练技巧、业务定制、工程部署C
该仓库提供训练和测试代码、数据集、检测与识别标注、评估脚本、标注工具和排名。
使用 PyTorch、OpenCV 和 Sort Tracking 的 YOLOv7 目标跟踪
在 PyTorch 中完整实现 YOLOv3
"Seg-Zero:通过认知强化进行推理链引导分割"的项目页面
[ECCV 2026] 基于扩散的文档OCR框架,用块级并行扩散解码替代自回归解码。
(提供预训练权重)Signatrix GmbH实现的EfficientDet:可扩展且高效的目标检测
[CVPR 2022] SparseInst:用于实时实例分割的稀疏实例激活
基于Detectron2的下一代视频实例识别框架,支持InstMove (CVPR 2023)、SeqFormer (ECCV Oral)和IDOL (ECCV Oral)
[CVPR 2025 Highlight] 仅编码器掩码 Transformer(EoMT)的官方代码和模型
简单且模块化的计算机视觉检测器、跟踪器和 SAM - 在 10 行代码内运行 YOLOv9、v8、v7、v6、v5、R、X
OBBDetection 是一个基于 MMdetection 的定向目标检测库。
在 TensorFlow、TFLite 和 TensorRT 中实现的 YOLOv4、YOLOv4-tiny、YOLOv3 和 YOLOv3-tiny 的广泛自定义函数
[CVPR 2024] 一次性对齐和提示所有内容以实现通用视觉感知
[CVPR 2022 Oral] DN-DETR 的官方实现。
yolo v3 目标检测的 Keras 实现。
这是 GGHL(通用高斯热图标签分配用于任意方向目标检测)的实现。
Conformer的官方代码:局部特征耦合全局表示用于视觉识别
伪装目标检测,CVPR 2020 (口头报告)
[ECCV'22]《探索用于目标检测的普通视觉Transformer骨干网络》的非官方实现
[CVPR 2023] 论文《BiFormer:具有双层路由注意力的视觉Transformer》的官方代码发布
基于重叠双层的深度遮挡感知实例分割 [CVPR 2021]
🚀 一个使用 YOLO11 ⚡️ 并由 ONNX-Runtime 驱动的高性能实时目标检测解决方案
我将yolov3的后端迁移到Mobilenetv1、VGG16、ResNet101和ResNeXt101
Detectorch - 用于 PyTorch 的 detectron
此仓库基于 detectron2 和 centernet 实现
基于计算机视觉的车辆检测与跟踪,使用 Tensorflow Object Detection API 和卡尔曼滤波
用于基于区域的卷积神经网络(RCNN)的 Keras 包
计算机视觉与体育交叉领域的酷炫实验 ⚽🏃。
基于传统 CV 算法的精确 GUI 元素检测方法 [2021年7月5日升级]。
ResUnet 和 ResUnet++ 的 PyTorch 实现。
AAAI 2021 论文《R3Det: Refined Single-Stage Detector with Feature Refinement for Rotating Object》的代码。
一个易于理解且性能更优的 CenterNet 版本。
在浏览器中使用基于 Tensorflow.js 的 Tiny YOLO 进行目标检测
CMU多摄像头监控视频目标检测与跟踪系统的即用代码和模型。速度优化的Faster-RCNN模型。基于Tensorflow。也支持EfficientDet。WACVW'20
使用tensorflow目标检测API的品牌标志检测系统。
数据来源:GitHub API · 人工精选 · 实时同步