模型3201 个项目
收录 GitHub 上最热门的 AI 模型开源项目,包括大语言模型(LLM)、视觉模型、多模态模型等,按 Stars 排名。适合 AI 开发者和研究者寻找最新前沿模型。
OpenAI 的通用语音识别模型,支持多语言转录和翻译。
DeepSeek-V3(⭐103K+),是 模型 领域的代表性开源项目,使用 Python 构建,已成为该领域的标杆级项目,适合 open_source 场景下的 AI 开发需求。
DeepSeek 的顶级开源大语言模型系列,采用 MoE 架构,性能对标顶级闭源模型。
DeepSeek-R1(⭐91.9K),是 模型 领域的代表性开源项目,使用 AI 构建,已成为该领域的标杆级项目,适合 open_source 场景下的 AI 开发需求。
opencv(⭐89.8K),是 模型 领域的代表性开源项目,使用 C++ 构建,专注 c plus plus 方向,涵盖 computer vision 能力,已成为该领域的标杆级项目,适合 open_source 场景下的 AI 开发需求。
将任何PDF或图像文档转换为适用于AI的结构化数据。一个强大、轻量级的OCR工具包,弥合了图像/PDF与LLM之间的差距。支持100多种语言。
Tesseract 开源 OCR 引擎(主仓库)
stable-diffusion(⭐73.1K),是 模型 领域的代表性开源项目,使用 Jupyter Notebook 构建,已成为该领域的标杆级项目,适合 open_source 场景下的 AI 开发需求。
强大的节点式 Stable Diffusion 工作流编辑器,模块化管道实现高级图像生成。
将截图转换为代码的 AI,拖入图片即可得到 HTML/CSS/JS 代码,支持 Tailwind CSS。
Stability AI 的基础文生图模型,开源权重、高质量输出、庞大的工具生态。
Meta 开源大语言模型家族,8B 到 405B 参数规模,性能领先。
1分钟的语音数据也可以用来训练一个好的TTS模型!(少样本语音克隆)
Ultralytics YOLO26、YOLO11、YOLOv8——目标检测、实例分割、语义分割、图像分类、姿态估计、目标跟踪
在5秒内克隆声音,实时生成任意语音
Ultralytics YOLOv5在PyTorch > ONNX > CoreML > TFLite中的实现
适用于Python和命令行的全球最简单的人脸识别API
🐸💬 - 一个用于文本转语音的深度学习工具包,经过研究和生产环境的实战检验
深度学习语音合成引擎,支持 1100+ 种语言、语音克隆和微调。
ChatGLM-6B: 开源双语对话语言模型 | 开源双语对话语言模型
用于 BERT 的 TensorFlow 代码和预训练模型。
用于日常对话的生成式语音模型。
Suno 的文本转音频模型,生成逼真的语音、音乐、音效和声音表达。
支持超过100种语言的纯JavaScript OCR库📖🎉🖥
GFPGAN 旨在开发用于真实世界人脸恢复的实用算法。
LLM 聊天的即时语音克隆,只需少量样本即可克隆任意声音,支持情感和口音控制。
最大的 PyTorch 图像编码器/骨干网络集合。包括训练、评估、推理、导出脚本和预训练权重——ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer (ViT)、MobileNetV4、MobileNet-V3 & V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet、ConvNeXt 等。
🚀 在 5 秒内克隆声音,实时生成任意语音。
面向直播和流媒体的跨平台、可定制机器学习解决方案。
Real-ESRGAN 旨在开发用于通用图像/视频恢复的实用算法。
VoxCPM2:用于多语言语音生成、创意语音设计和逼真克隆的无分词器文本转语音系统
Detectron2 是一个用于目标检测、分割及其他视觉识别任务的平台。
OpenPose:用于身体、面部、手部和脚部估计的实时多人关键点检测库
CLIP(对比语言-图像预训练),根据图像预测最相关的文本片段
控制 Stable Diffusion 输出的神经网络,支持边缘检测、深度图、姿态识别等多种控制方式。
OpenMMLab检测工具箱和基准测试
Facebook AI Research 用 Python 编写的序列到序列工具包。
用于 PC 直播或视频通话的实时换脸工具
训练斯坦福Alpaca模型的代码和文档,以及生成数据。
即用型OCR,支持80多种语言和所有流行书写系统,包括拉丁文、中文、阿拉伯文、天城文、西里尔文等。
最先进的2D和3D人脸分析项目
Deezer 源分离库,包含预训练模型。
SoftVC VITS歌声转换
Invoke是Stable Diffusion模型的领先创意引擎,赋能专业人士、艺术家和爱好者,利用最新AI驱动技术生成和创建视觉媒体。该解决方案提供业界领先的WebUI,并作为多个商业产品的基础。
Qwen3 是阿里云 Qwen 团队开发的大语言模型系列
TimesFM(时间序列基础模型)是 Google Research 开发的预训练时间序列基础模型,用于时间序列预测
Stability AI 的生成式模型
DeepSpeech 是一款开源嵌入式(离线、设备端)语音转文本引擎,可在从树莓派 4 到高功率 GPU 服务器的设备上实时运行
FAIR的目标检测研究平台,实现了Mask R-CNN和RetinaNet等流行算法。
SoTA开源文本转语音系统
基于Keras和TensorFlow的Mask R-CNN,用于目标检测和实例分割
Vision Transformer的实现,一种在PyTorch中仅使用单个Transformer编码器即可在视觉分类中达到SOTA的简单方法
PyTorch中的图像到图像翻译
论文《语言模型是无监督多任务学习者》的代码
[NeurIPS'23 口头报告] 视觉指令微调(LLaVA),旨在达到 GPT-4V 级别能力及更高水平。
OpenAI GPT(生成式预训练 Transformer)训练的极简 PyTorch 重新实现
DeepSeek Coder:让代码自我编写
上下文光学压缩
WhisperX:带词级时间戳(和说话人分离)的自动语音识别
一个用于 Python 的轻量级人脸识别和人脸属性分析(年龄、性别、情绪和种族)库
"3D高斯溅射用于实时辐射场渲染"的原始参考实现
多语言大规模语音生成模型,提供推理、训练和部署全栈能力。
一个工业级可控且高效的零样本文本转语音系统
多语言大型语音生成模型,提供推理、训练和部署全栈能力。
跨任务、跨语言、跨模态的大规模自监督预训练
Meta 的生成式音频 AI,包含 MusicGen(音乐)、AudioGen(音效)和 EnCodec(压缩)。
阿里云提出的Qwen(通义千问)聊天和预训练大型语言模型的官方仓库。
FinGPT:开源金融大语言模型!革命性🔥 我们在HuggingFace上发布了训练好的模型。
gpt-oss-120b和gpt-oss-20b是OpenAI发布的两个开放权重语言模型
Qwen3-VL是Qwen团队(阿里云)开发的多模态大语言模型系列。
工业级语音识别工具包:170倍实时速度、50多种语言、说话人分离、情感检测、流式传输和兼容OpenAI的API。
能够一次性生成超逼真对话的TTS模型。
中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)
让肖像活起来!
神经风格算法的 Torch 实现
[NeurIPS 2022] 基于码本查找 Transformer 的鲁棒盲脸恢复方法
开源多模态大模型,支持视觉、语音和文本,在手机和边缘设备上表现优异。
基于 tensorflow.js 在浏览器和 Node.js 中进行人脸检测和人脸识别的 JavaScript API
在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion
Janus 系列:统一多模态理解与生成模型
Grounded SAM:将 Grounding DINO 与 Segment Anything、Stable Diffusion 和 Recognize Anything 结合——自动检测、分割和生成任何内容。
即时神经图形基元:闪电般快速的 NeRF 等
Wan:开放且先进的大规模视频生成模型
Qwen3-Coder 是 Qwen3 的代码版本,Qwen3 是由 Qwen 团队开发的大型语言模型系列。
Wan:开放且先进的大规模视频生成模型
pix2tex:使用 ViT 将方程图像转换为 LaTeX 代码。
这是“Swin Transformer:使用移位窗口的分层视觉 Transformer”的官方实现。
GPT-3:语言模型是少样本学习者
让老照片重获新生(CVPR 2020 口头报告)
StableLM:Stability AI 语言模型
kaldi-asr/kaldi 是 Kaldi 项目的官方位置。
基于深度神经网络的人脸识别。
基于 Transformer 的端到端目标检测
RWKV(读作RwaKuv)是一种具有出色LLM性能的RNN,也可以像GPT transformer一样直接训练(可并行化)。我们目前处于RWKV-7“Goose”版本。它结合了RNN和transformer的优点——出色的性能、线性时间、恒定空间(无kv缓存)、快速训练、无限上下文长度和免费句子嵌入
基于大规模Hunyuan3D扩散模型的高分辨率3D资产生成
🚀 真正开源的AI头像(数字人)工具包,用于离线视频生成和数字人克隆。
基于Tensorflow的人脸识别
基于PaddlePaddle的目标检测工具包。支持目标检测、实例分割、多目标跟踪和实时多人关键点检测
论文实现 - YOLOv7:可训练的免费赠品包为实时目标检测器树立了新的最先进水平
基于潜在扩散模型的高分辨率图像合成,Stable Diffusion 的研究基础。
CLIP的开源实现。
🎬 火宝短剧 - 基于AI的一站式短剧生成平台 《一句话生成完整短剧,从剧本到成片全自动化》 Huobao Drama - An AI-Powered End-to-End Short Drama Generator "One Sentence to Complete Drama: Fully Automated from Script to Final Video"
闪电般快速、设备端、多语言 TTS——通过 ONNX 原生运行。
20多个高性能LLM,附带预训练、微调和规模化部署的配方。
首家工业级全流程 AI 影视生产平台。行业首个专业 AI Agent 平台,用于可控电影和视频制作。从短片到真人实拍,采用好莱坞标准工作流程。
PaddleFormers 是一个基于 PaddlePaddle 的易用预训练大语言模型库。
易用且强大的 LLM 和 SLM 库,拥有出色的模型动物园。
文本和图像到视频生成:CogVideoX (2024) 和 CogVideo (ICLR 2023)
享受扩散模型的魔力!
能够从绘画生成照片、将马变成斑马、执行风格迁移等功能的软件。
🏄 使用 CLIP 对图像和句子进行可扩展的嵌入、推理和排序
易用的语音工具包,包括自监督学习模型、带标点的 SOTA/流式 ASR、带文本前端的流式 TTS、说话人验证系统、端到端语音翻译和关键词唤醒。荣获 NAACL2022 最佳演示奖。
HunyuanVideo: 大型视频生成模型的系统框架
COLMAP - 运动恢复结构与多视图立体视觉
超轻量级中文ocr,支持竖排文字识别, 支持ncnn、mnn、tnn推理 ( dbnet(1.8M) + crnn(2.5M) + anglenet(378KB)) 总模型仅4.7M
使用视觉模型进行OCR与文档提取
100+ Chinese Word Vectors 上百种预训练中文词向量
来自复旦大学的开源工具增强型对话语言模型
Torch中用于字符级语言模型的多层循环神经网络(LSTM、GRU、RNN)
Meta 的 AI,让孩子们的涂鸦动起来,自动为人物形象添加动画。
基于PyTorch构建的开源NLP研究库。
面向NeRF的协作友好型工作室
使用深度学习进行图像超分辨率。
基于 PyTorch 的语音工具包
语义分割模型,拥有 500 多个预训练的卷积和基于 Transformer 的主干网络。
"ViMax:智能体视频生成(导演、编剧、制片人和视频生成器一体化)"
用于高质量图像语义分割的 U-Net 的 PyTorch 实现
基于深度学习的目标检测论文列表。
YOLOv10:实时端到端目标检测 [NeurIPS 2024]
🐍 用于空间 AI 的几何计算机视觉库
一个快速的本地神经文本转语音系统
LAVIS - 一站式语言视觉智能库
Kimi K2 是由 Moonshot AI 团队开发的大型语言模型系列
一款入门级的人脸、视频、文字检测以及识别的项目.
基于 Stable Diffusion 的自定义照片生成,从几张照片生成个性化图像。
用于快速风格迁移的 TensorFlow CNN ⚡🖥🎨🖼
[CVPR 2024] “MagicAnimate:使用扩散模型实现时间一致的人体图像动画”的官方仓库
Databricks 的 Dolly,一个在 Databricks 机器学习平台上训练的大型语言模型
极低延迟的语音转文本、意图识别和文本转语音,用于构建语音 Agent 和界面
使用条件对抗网络的图像到图像翻译
Ultralytics YOLOv3 在 PyTorch > ONNX > CoreML > TFLite 中的实现
YOLOX 是一个高性能的无锚框 YOLO,超越 yolov3~v5,支持 MegEngine、ONNX、TensorRT、ncnn 和 OpenVINO。文档:https://yolox.readthedocs.io/
[ECCV 2024] 论文“Grounding DINO:将DINO与接地预训练相结合用于开放集目标检测”的官方实现
一种简单的一键式方法,无需技术知识即可在电脑上使用AI创建精美艺术品。提供浏览器UI,用于从文本提示和图像生成图像。只需输入文本提示,即可看到生成的图像。
用于说话人日志的神经构建模块:语音活动检测、说话人变化检测、重叠语音检测、说话人嵌入
Pre-Training with Whole Word Masking for Chinese BERT(中文BERT-wwm系列模型)
Amphion (/æmˈfaɪən/) 是一个用于音频、音乐和语音生成的工具包,旨在支持可重复研究,并帮助初级研究人员和工程师入门音频、音乐和语音生成领域的研发。
AudioGPT:理解和生成语音、音乐、声音和说话头像
🦙 LaMa图像修复,具有傅里叶卷积的鲁棒大掩码修复,WACV 2022
:robot: :speech_balloon: 用于文本转语音的深度学习(讨论论坛:https://discourse.mozilla.org/c/tts)
[CVPR 2024 Oral] InternVL系列:GPT-4o的开创性开源替代方案。接近GPT-4o表现的开源多模态对话模型
一个稳健、高效、低延迟的语音转文本库,具备高级语音活动检测、唤醒词激活和即时转录功能。
微型视觉语言模型
端到端语音处理工具包
OpenMMLab语义分割工具箱和基准。
计算机视觉的最佳实践、代码示例和文档。
我们新被Pattern Recognition 2020接收的论文代码:"U^2-Net: Going Deeper with Nested U-Structure for Salient Object Detection."
论文"Attention is All You Need"中Transformer模型的PyTorch实现。
ChatRWKV类似于ChatGPT,但由RWKV(100% RNN)语言模型驱动,并且是开源的。
PyTorch、TensorFlow、TensorFlow.js、ONNX、CoreML中的稳健视频抠图!
一种面向Web的计算机视觉现代方法
易于使用的图像分割库,拥有出色的预训练模型库,支持语义分割、交互式分割、全景分割、图像抠图、3D分割等广泛的实际任务。
PyTorch中实例分割和目标检测算法的快速、模块化参考实现。
生成对抗网络的Keras实现。
单一视觉-语言模型中的多语言文档布局解析
开源SenseVoiceSmall模型,支持普通话、粤语、英语、日语和韩语的ASR、语言识别、情感识别和音频事件检测。
单一视觉语言模型中的多语言文档布局解析
Python 语音识别模块,支持多种引擎和 API,在线和离线。
多语言语音理解:ASR + 情感识别 + 音频事件检测。支持 50 多种语言,比 Whisper 快 15 倍,非自回归。
RF-DETR是Roboflow开发的实时目标检测与分割模型架构,在COCO上达到SOTA,专为微调设计。[ICLR 2026]
一个旨在赋能开发者构建具有自包含计算机视觉能力的应用和系统的 Python 库
使用 NeRF + Diffusion 的文本到 3D、图像到 3D 和网格导出。
CodeGeeX:一个开放的多语言代码生成模型(KDD 2023)
[NeurIPS 2024 最佳论文奖][GPT 击败扩散🔥][视觉生成中的缩放定律📈] “视觉自回归建模:通过下一尺度预测实现可扩展图像生成”的官方实现。一个*极其简单、用户友好且最先进*的自回归图像生成代码库!
SANA:基于线性扩散Transformer的高效高分辨率图像合成
“使用 Transformer 的可扩展扩散模型”的官方 PyTorch 实现
LTX-2 音频-视频生成模型的官方Python推理和LoRA训练器包。
EmotiVoice 😊:多语音与提示控制TTS引擎
基于深度学习的中文语音识别系统
Boson AI的文本-音频基础模型
BELLE: 开源中文对话大模型
使用mesh-tensorflow库实现模型并行GPT-2和GPT-3风格模型
Qwen-Image是一个强大的图像生成基础模型,能够进行复杂的文本渲染和精确的图像编辑。
Pythonic的AI图像和视频生成
领先的免费开源人脸识别系统
PaddlePaddle GAN库,包含许多有趣的应用,如一阶运动迁移、Wav2Lip、图像修复、图像编辑、照片转卡通、图像风格迁移、GPEN等。
论文《Jukebox:一种音乐生成模型》的代码
PULSE:通过生成模型的潜在空间探索进行自监督照片上采样
使用深度学习进行各种文本分类模型及更多
微软VALL-E X零样本TTS模型的开源实现。演示地址:https://plachtaa.github.io/vallex/
在Mac上原生运行Stable Diffusion
fast-stable-diffusion + DreamBooth
VITS:用于端到端文本转语音的条件变分自编码器与对抗学习
Stable Diffusion web UI
在PaLM架构上实现RLHF(基于人类反馈的强化学习)。基本上是ChatGPT但使用PaLM
用于多种人类语言的分词、句子分割、命名实体识别和句法分析的Stanford NLP Python库
利用BERT和c-TF-IDF创建易于解释的主题。
⚡ TabPFN:表格数据的基础模型 ⚡
使用Stable Diffusion实现Dreambooth (https://arxiv.org/abs/2208.12242)
一个基于Apple MLX框架构建的文本转语音(TTS)、语音转文本(STT)和语音转语音(STS)库,在Apple Silicon上提供高效的语音分析。
数据来源:GitHub API · 人工精选 · 实时同步