音视频理解176 / 372 个项目
音视频理解模型排行榜,收录 GitHub 上最热门的音频和视频理解 AI 项目,包括语音识别、音乐理解和视频分析等。
面向直播和流媒体的跨平台、可定制机器学习解决方案。
Deezer 源分离库,包含预训练模型。
SoftVC VITS歌声转换
DeepSpeech 是一款开源嵌入式(离线、设备端)语音转文本引擎,可在从树莓派 4 到高功率 GPU 服务器的设备上实时运行
WhisperX:带词级时间戳(和说话人分离)的自动语音识别
Meta 的生成式音频 AI,包含 MusicGen(音乐)、AudioGen(音效)和 EnCodec(压缩)。
工业级语音识别工具包:170倍实时速度、50多种语言、说话人分离、情感检测、流式传输和兼容OpenAI的API。
kaldi-asr/kaldi 是 Kaldi 项目的官方位置。
易用的语音工具包,包括自监督学习模型、带标点的 SOTA/流式 ASR、带文本前端的流式 TTS、说话人验证系统、端到端语音翻译和关键词唤醒。荣获 NAACL2022 最佳演示奖。
基于 PyTorch 的语音工具包
极低延迟的语音转文本、意图识别和文本转语音,用于构建语音 Agent 和界面
AudioGPT:理解和生成语音、音乐、声音和说话头像
端到端语音处理工具包
开源SenseVoiceSmall模型,支持普通话、粤语、英语、日语和韩语的ASR、语言识别、情感识别和音频事件检测。
Python 语音识别模块,支持多种引擎和 API,在线和离线。
多语言语音理解:ASR + 情感识别 + 音频事件检测。支持 50 多种语言,比 Whisper 快 15 倍,非自回归。
基于深度学习的中文语音识别系统
论文《Jukebox:一种音乐生成模型》的代码
一个基于Apple MLX框架构建的文本转语音(TTS)、语音转文本(STT)和语音转语音(STS)库,在Apple Silicon上提供高效的语音分析。
Facebook AI Research的自动语音识别工具包
适用于 Apple Silicon 的设备端语音 AI。
微软的统一语音-文本模型,支持语音合成、识别、声音转换和语音翻译。
基于 OpenAI Whisper 的带说话人日志的自动语音识别
生产优先且生产就绪的端到端语音识别工具包
Muzic:基于人工智能的音乐理解与生成
基于深度学习的设备端唤醒词检测
一个小型语音识别器。
Whisper的蒸馏变体,用于语音识别。速度快6倍,体积小50%,词错误率在1%以内。
日语文本转语音引擎,提供多种角色声音,开源,广泛用于内容创作。
用于实时音乐生成的稳定扩散
一个简单、高质量的语音转换工具,注重易用性和性能。
Lingvo
歌声转换与歌声克隆的核心引擎
多语言自动语音识别,支持词级时间戳和置信度
基于 TensorFlow 的中英文端到端自动语音识别
您应用中的前沿CoreML音频模型——文本转语音、语音转文本、语音活动检测和说话人日志。使用Swift编写,由最先进的开源技术驱动。
🐸STT - 用于语音转文本的深度学习工具包。训练和部署STT模型从未如此简单。
pytorch-kaldi是一个用于开发最先进DNN/RNN混合语音识别系统的项目。DNN部分由pytorch管理,而特征提取、标签计算和解码则使用kaldi工具包执行。
:microphone: 用于 iOS 和 Android 的 React Native 语音识别库(支持在线和离线)
[AutoArk] GPA(通用音频)能用一个小模型完成 ASR、TTS 和语音转换!
一个用于音乐生成的 AI
中文语音识别; Mandarin Automatic Speech Recognition;
设备端实时多模态AI。与完全在本地机器上运行的AI进行自然语音和视觉对话。由Gemma 4 E2B和Kokoro驱动。
支持普通话、中文方言和英语的开源工业级ASR模型,在公开普通话ASR基准上达到新的SOTA,同时具备出色的歌词识别能力。
开源大词汇量连续语音识别引擎
:unlock: 唇语识别 - 基于3D架构的跨视听识别
使用下一代Kaldi与ncnn进行实时语音识别和语音活动检测(VAD),无需互联网连接。支持iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A等。
DELTA是一个基于深度学习的自然语言和语音处理平台。LF AI & DATA项目:https://lfaidata.foundation/projects/delta/
用于高效实验语音识别、文本转语音和NLP的工具包
使用LLM、计算机视觉和自动语音识别分析视频
SALMONN系列:一套先进的多模态大语言模型
基于开源LLM的ASR模型系列,支持中文、方言、口音和多语言语音,集成FunASR、vLLM、流式和llama.cpp运行时。
用于口语语言处理的统一模态语音-文本预训练
Fun-ASR-Nano LLM-ASR 模型:31 种语言、方言、口音、歌词、热词、时间戳和说话人日志。
该神经网络模型能够从音频语音中检测五种不同的男/女情感。(深度学习、NLP、Python)
专为音乐、歌曲和音频生成设计的基础工具包
专为音乐、歌曲和音频生成设计的基础工具包
StreamSpeech是一个“全能”无缝模型,用于离线与实时语音识别、语音翻译和语音合成。
SincNet 是一种用于高效处理原始音频样本的神经架构。
逐字自动语音识别,具有改进的词级时间戳和填充词检测
微调 Whisper 语音识别模型,以支持无时间戳数据训练、有时间戳数据训练和无语音数据训练。加速推理并支持 Web 部署、Windows 桌面部署和 Android 部署
[非官方] Conformer: Convolution-augmented Transformer for Speech Recognition (INTERSPEECH 2020) 的PyTorch实现
适用于 Apple Silicon 的 AI 语音工具包——由 MLX 和 CoreML 驱动的 ASR、TTS、语音到语音、VAD 和说话人分离
一个结合大语言模型的语音、语言、音频、音乐处理框架
使用Vosk库的Android离线语音识别
:zap: TensorFlowASR:基于 TensorFlow 2 的近乎最先进的自动语音识别,支持使用字符或子词的语言
一个基于序列到序列的语音处理引擎的开源实现
一个轻量级、易于使用的RNN唤醒词监听器
用于音频源分离的Wave-U-Net实现
Whisper.net。使用 Whisper 模型简化语音转文本
Espresso:一个快速的端到端神经语音识别工具包
针对流式处理和设备端使用优化的 Whisper 模型
基于PaddlePaddle实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的DeepSpeech2、Conformer、Squeezeformer模型
语音活动检测(VAD)工具包,包括基于DNN、bDNN、LSTM和ACAM的VAD。我们还提供直接录制的数据集
如何使用或集成 DeepSpeech 的示例。
中文语音识别
GLM-ASR-Nano:一个稳健的开源语音识别模型,拥有15亿参数
连接主义时序分类(CTC)解码算法:最佳路径、束搜索、词典搜索、前缀搜索和令牌传递。使用Python实现。
Eesen项目的官方仓库。
基于PaddlePaddle实现的语音识别,中文语音识别。项目完善,识别效果好。支持Windows,Linux下训练和预测,支持Nvidia Jetson开发板预测。
一个实时静默语音识别工具。
Allosaurus是一个预训练的通用音素识别器,支持超过2000种语言
Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。
Android的私有设备端语音识别键盘和服务。
语音识别任务的基础模型
利用PyTorch-Lightning和Hydra的端到端语音识别开源工具包。
由深度学习驱动的设备端语音到意图引擎。
👁 👂 Nextcloud的智能媒体标签:识别面孔、物体、风景、音乐流派
基于OpenAI Whisper和TensorFlow Lite的Android离线语音识别
:speech_balloon: 一个本地部署的流式语音识别系统
由深度学习驱动的设备端流式语音转文本引擎
:speech_balloon: /so.nus/ 用于 Node.js 的语音转文本 (STT),支持离线热词检测
基于 PyTorch 和 Hydra 的端到端韩语自动语音识别开源工具包。
一个 SOTA 工业级一体化 ASR 系统,包含 ASR、VAD、LID 和 Punc 模块。FireRedASR2 支持中文(普通话、20+ 方言/口音)、英语、代码切换以及语音和歌唱 ASR。FireRedVAD 支持 100+ 种语言的语音/歌唱/音乐。FireRedLID 支持 100+ 种语言和 20+ 种中文方言。FireRedPunc 支持中文和英文。
这是华为诺亚方舟实验室开源语音技术的主仓库。
使用 PyTorch 实现的端到端 ASR/LM。
带词典和语言模型的连接主义时序分类(CTC)解码器。
以阿拉伯语为先的生成式语音识别——Audar-ASR-V1(Flash + Turbo)。在开放通用阿拉伯语ASR排行榜上排名第一。包含模型卡、基准测试和推理。
这是一个用C++实现ASR推理的项目,它依赖很少,安装也很简单,推理速度很快,在树莓派4B等ARM平台也可以流畅的运行。 支持的模型是由Google的Transformer模型中优化而来,数据集是开源wenetspeech(10000+小时)或阿里私有数据集(60000+小时), 所以识别效果也很好,可以媲美许多商用的ASR软件。
专为 SwiftUI 设计的语音识别框架。
自动语音识别(ASR)、文本转语音(TTS)引擎。中英语音识别、多角色语音合成,支持多语言,准确率高
一个基于 Vosk 的 WebAssembly 构建、在浏览器中运行的语音识别库
Phonetisaurus G2P
VOSK语音识别工具包
GTSinger(NeurIPS 2024 Spotlight)的数据集和代码:一个包含真实乐谱的全球多技巧歌唱语料库,适用于所有歌唱任务
libfaceid是一个用于人脸识别解决方案原型设计的研究框架。它无缝集成了多个检测、识别和活体模型,以及语音合成和语音识别。
UniSpeech - 大规模自监督语音学习
由深度学习驱动的设备端语音转文本引擎
用于音频和语音大型语言模型“听、想、理解”的代码、数据集和预训练模型。
Ming-UniAudio:用于联合理解、生成和编辑的语音 LLM,采用统一表示
🇺🇦 乌克兰语语音识别与合成
阿拉伯语语音识别、分类和文本转语音。
该仓库包含“基于少量样本的神经语音克隆”的实现
Stream-Omni是一个类似GPT-4o的语言-视觉-语音聊天机器人,同时支持跨多种模态组合的交互。
基于wav2vec 2.0框架的自监督学习语音转文本
使用Facebook的wav2vec 2.0模型进行实时语音识别。
视频到文本:为给定视频生成自然语言描述。[视频字幕]
基于Kaldi的韩语ASR(한국어 음성인식)开源项目
使用掩码变换器的音乐生成!
用于监督音乐生成的局部窗口注意力多乐器音乐变换器
基于注意力的深度学习自动语音识别,适用于 Nvidia Jetson。
借助 AI 实现的最佳音乐分离模型……至少在我看来是这样!👂👂
Theme Transformer 的官方实现。基于主题的音乐生成。IEEE TMM
ZerolanCore集成了多种开源、可本地部署的AI模型,旨在整合大语言模型(LLM)、自动语音识别(ASR)、文本转语音(TTS)、图像描述、光学字符识别(OCR)、视频描述等一系列AI模型。
用于NLP任务的最先进模型库(PyTorch)
Fast-HuBERT: 自监督语音表示学习的高效训练框架官方实现
SummerAsr 是一个基于C++的可独立编译且几乎没有额外依赖库的本地中文语音识别器。 Summer Asr is a Chinese automatic speech recognize project written with C++ that can be easily built standalone without any depencency.
用于自动语音识别和自动发音错误检测问题的Noisy Student Training的Pytorch实现
基于wav2letter的语音转文本,专为迁移学习构建
跨语言语音转换
论文《用于语音识别的随机投影量化器自监督学习》的 Pytorch 实现。
WavEncoder是一个Python库,用于编码音频信号、音频增强变换,以及使用PyTorch后端训练音频分类模型。
针对印度口音语音的传统ASR(信号与倒谱分析、DTW、HMM)和DNN(自定义模型+DeepSpeech)
William Chan所著"Listen, Attend and Spell"的Tensorflow实现。该项目利用Tensorflow的输入管道和estimator API,使训练和评估真正端到端。
包含关于如何训练和推理 wav2vec2 模型的实验平台的仓库。
openai/whisper + 额外功能
基于 FAIR 研究论文、使用 Pytorch 构建的语音识别模型。
一个多语言 ASR 模型,可识别十种突厥语系语言——阿塞拜疆语、巴什基尔语、楚瓦什语、哈萨克语、吉尔吉斯语、萨哈语、鞑靼语、土耳其语、维吾尔语和乌兹别克语。
一个自动语音识别API
在 Termux 中使用 Mozilla 的 DeepSpeech 进行 Android 离线语音识别的开源方案
ChunkFormer:用于长语音转录的掩码分块Conformer
百度 DeepSpeech 架构的 MXNet 实现
基于 PyTorch 的语音转文本
从音频和文本文件中识别情绪(仅俄语)
使用多项扩散模型进行语音转录,包含训练代码和模型。
最快的开源TTS模型
[ICASSP 2020] CIF:用于端到端语音识别的连续积分-触发机制(Continuous Integrate-and-Fire 机制的 PyTorch 实现)。
将口语转换为文本形式。
Drax:基于离散流匹配的语音识别
SincNet的Keras(TensorFlow)实现(Mirco Ravanelli, Yoshua Bengio - https://github.com/mravanelli/SincNet)
使用VITS的多说话人语音合成(韩语、日语、英语、中文)
印尼语的多语言语音识别
基于 TensorFlow 的 Conv-LSTM-CTC 端到端语音识别网络
混合语言语音识别系统;混合 (GMM+NNet) 模型;Kaldi + Keras。
一个用于 ASRT 语音识别系统的 Windows 客户端 SDK 和 Demo 软件。
🗣️ Unity 和 Android 上的语音识别,没有烦人的谷歌弹出窗口!
概念验证应用,演示了在 ObjC 中使用 KeenASR SDK。我们正在招聘:https://keenresearch.com/careers.html
ASRDeepspeech x Sakura-ML(英语/日语),基于 PyTorch 的 deepspeech2 模型,由 Zakuro AI 支持。
与 KALDI 语音识别工具包的荷兰语实例和用户组相关的代码
Brasil TTS 是一套巴西葡萄牙语语音合成器,为视障人士朗读屏幕内容。它将文本转换为音频,使盲人或低视力者能够访问屏幕上显示的内容。虽然文本转语音系统(如 Brasil TTS)的主要目标用户是视障人士,但这类程序也可供阅读障碍者、严重语言障碍者以及学龄前儿童使用。除了作为辅助技术工具外,语音合成器还具有教学和娱乐应用价值。
Taiwan Tongues ASR CE是一个开源语音识别模型项目,专为台湾多元语言环境设计。该模型支持国语、台语、客语与英语,提供本地多语混合语音识别,让开发者与信息服务者可运用此开源模型进行ASR模型训练、微调与发展在地化应用,以低成本、高效率进行ASR语音应用落地与智慧服务创新。本项目为数位发展部数位产业署「114年数位产业跨域软件基盘系统建置案」之实证成果之一,旨在推动台湾语音技术开源生态,协助信息服务业者强化智慧应用能量,落实在地AI技术自主发展,由台湾大哥大执行与维护。
论文《结合音频控制和风格迁移的潜在扩散方法》的代码仓库,被ISMIR 2024接收
Syn.Speech是一个灵活的、与说话人无关的连续语音识别引擎,适用于Mono和.NET框架
Interspeech 2023 论文《通过说话者不变聚类进行自监督微调以改进内容表示》的官方代码
基于C++17(ONNX + LiteRT)的设备端VAD/流式STT/TTS/说话人分离,带有语音代理流水线。支持Linux、Windows、Android。
语音增强
Wav2vec 2.0 自监督预训练
论文《wav2vec 2.0:自监督语音表示学习框架》的PyTorch实现
TensorFlow 语音识别挑战赛(https://www.kaggle.com/c/tensorflow-speech-recognition-challenge)中使用的模型源代码。该解决方案在私有排行榜中排名前 5%。
使用 Tensorflow 基于 Voxforge 数据集训练的俄语语音识别
Big-Little Net 的官方仓库
该仓库实现了一种无需与转录参考对齐、使用可学习音频编码器的文本转语音方法
文本提示引导的合成音频生成器
一个迷你、简单且快速的端到端自动语音识别工具包
使用Maixduino框架和PlatformIO开发的语音识别或唤醒词检测演示,运行在Sipeed Maix开发板的K210 MCU上
[ISMIR 2022] wav2vec 2.0迁移学习用于自动歌词转录
数据来源:GitHub API · 人工精选 · 实时同步