机器学习库与工具891 / 620 个项目
机器学习和深度学习库、NLP库、强化学习库、AutoML工具等通用ML框架
最先进的机器学习库,支持 PyTorch/TensorFlow/JAX,提供数千个预训练模型和推理管道。
Python中的张量和动态神经网络,具有强大的GPU加速功能。
实现 AI 驱动的全栈可观测性的最快路径,即使对于精简团队也是如此。
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
Unsloth Studio是一个用于本地训练和运行Gemma 4、Qwen3.6、DeepSeek、gpt-oss等开源模型的Web界面。
scikit-learn:Python中的机器学习
面向人类的深度学习
即用型云模板,支持RAG、AI流水线及企业级实时数据搜索。🐳兼容Docker。⚡与Sharepoint、Google Drive、S3、Kafka、PostgreSQL、实时数据API等保持同步。
Qlib 是一个面向 AI 的量化投资平台,旨在利用 AI 技术赋能量化研究,从探索想法到实现生产。Qlib 支持多种机器学习建模范式,包括监督学习、市场动态建模和强化学习,并配备了 https://github.com/microsoft/RD-Agent 以自动化研发流程。
Apache Airflow - 一个用于以编程方式编写、调度和监控工作流的平台
Ray 是一个 AI 计算引擎。Ray 包含一个核心分布式运行时和一组用于加速机器学习工作负载的 AI 库。
DeepSpeed 是一个深度学习优化库,使分布式训练和推理变得简单、高效且有效。
Caffe:一个快速的深度学习开源框架。
Qdrant - 面向下一代AI的高性能、大规模向量数据库和向量搜索引擎。也可在云端使用 https://cloud.qdrant.io/
SGLang是一个用于大型语言模型和多模态模型的高性能服务框架。
在 1 个或 10,000+ 个 GPU 上预训练、微调任意大小的 AI 模型,无需更改代码。
此仓库展示了检索增强生成(RAG)系统的各种高级技术。每种技术都有详细的笔记本教程。
可扩展、可移植和分布式梯度提升(GBDT、GBRT 或 GBM)库,适用于 Python、R、Java、Scala、C++ 等。可在单机、Hadoop、Spark、Dask、Flink 和 DataFlow 上运行。
fastai深度学习库
面向智能体、大语言模型和机器学习模型的开源 AI 工程平台。MLflow 使各种规模的团队能够调试、评估、监控和优化生产级 AI 应用,同时控制成本并管理对模型和数据的访问
模块化平台(包括MAX和Mojo)
并行分布式深度学习:工业实践的机器学习框架(『飞桨』核心框架,深度学习&机器学习高性能单机、分布式训练和跨平台部署)
☁️ 使用云原生栈构建多模态AI应用
🤗 最大的即用型AI模型数据集中心,配备快速、易用且高效的数据操作工具
ONNX Runtime:跨平台、高性能的机器学习推理和训练加速器
机器学习互操作性的开放标准
一个WebGL加速的JavaScript库,用于训练和部署机器学习模型。
一个基于决策树算法的快速、分布式、高性能梯度提升(GBT、GBDT、GBRT、GBM或MART)框架,用于排序、分类和许多其他机器学习任务。
欢迎来到 Llama Cookbook!这是您使用 Llama 进行构建的指南:从推理、微调、RAG 开始入门。我们还展示了如何使用 Llama 模型家族解决端到端问题,并在各种提供商服务上使用它们。
面向代理、助手和企业搜索的私有 AI 平台。内置代理构建器、深度研究、文档分析、多模型支持以及代理的 API 连接。
计算机视觉专用的数据集、变换和模型
微软认知工具包 (CNTK),一个开源深度学习工具包
深度学习模型和数据集库,旨在使深度学习更易用并加速机器学习研究。
面向人类的主题建模
AI 智能体的记忆层。用无服务器、单文件的记忆层取代复杂的 RAG 流水线。为智能体提供即时检索和长期记忆。
用于 Kubernetes 的机器学习工具包
🦉 数据版本控制和机器学习实验
Burn 是下一代张量库和深度学习框架,在灵活性、效率和可移植性上毫不妥协。
快速灵活的图像增强库。关于该库的论文:https://www.mdpi.com/2078-2489/11/2/125
轻松将文档转换为结构化数据。Unstructured 是开源的 ETL 解决方案,用于将复杂文档转换为干净、结构化的格式,供语言模型使用。访问我们的网站,了解更多关于我们企业级平台产品的信息,该产品适用于生产级工作流、分区、增强、分块和嵌入。
用于机器学习的张量库
Nano vLLM
用于机器学习实验的图像增强
用于TensorFlow、Keras、PyTorch和Apache MXNet的分布式训练框架
NLTK源码
Bullet物理引擎SDK:用于VR、游戏、视觉效果、机器人、机器学习等的实时碰撞检测和多物理仿真
ChatterBot是一个用于创建聊天机器人的机器学习对话引擎
用于在C++中构建真实世界机器学习和数据分析应用的工具包
一个非常简单的先进自然语言处理(NLP)框架
用于自动化机器学习生命周期的开源AutoML工具包,包括特征工程、神经架构搜索、模型压缩和超参数调优
Open3D:用于3D数据处理的现代库。
一行代码的数据质量分析和探索性数据分析,适用于Pandas和Spark DataFrames。
开放机器学习编译器框架。
💡 用于语义搜索、LLM 编排和语言模型工作流的全能 AI 框架
TensorZero是一个开源LLMOps平台,统一了LLM网关、可观测性、评估、优化和实验功能。
Cleanlab 的开源库是标准的数据中心 AI 包,用于处理混乱的真实世界数据和标签的数据质量和机器学习。
Turi Create 简化了自定义机器学习模型的开发。
精炼高质量数据集和视觉 AI 模型
示例 📓 Jupyter 笔记本,演示如何使用 🧠 Amazon SageMaker 构建、训练和部署机器学习模型。
💥 为研究和生产优化的快速最先进分词器
Kedro 是一个面向生产级数据科学的工具箱。它利用软件工程最佳实践,帮助您创建可重现、可维护且模块化的数据工程和数据科学管道。
大型语言模型文本生成推理
面向机器学习从业者的开源标注工具。
三行代码实现快速准确的机器学习
🌸 在家以BitTorrent风格运行LLM。微调和推理速度比卸载快10倍
内容感知图像缩放库
在任何AI基础设施上运行、管理和扩展AI工作负载。使用一个系统访问和管理所有AI计算(Kubernetes、Slurm、20多个云、本地)。
构建、管理和部署AI/ML系统
一个Python自动化机器学习工具,使用遗传编程优化机器学习管道。
借助Segment Anything等优秀模型的AI支持,实现轻松的数据标注。
一个用于表格、时间序列、图、文本、图像和音频数据异常检测的Python库。包含60多个检测器、基准支持的ADEngine编排以及面向AI代理的代理工作流。
基于TensorFlow的神经网络库
大规模中文自然语言处理语料
一个基于Ray的易用、可扩展、高性能的代理强化学习框架(PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 异步RL)
面向Python的开源低代码AutoML平台。PyCaret 4.0:sklearn原生引擎 + React控制面板。
AI驱动的开源推荐系统引擎,支持经典/大模型排序器以及通过嵌入实现的多模态内容
为TensorFlow提供更高级API的深度学习库。
简单、Pythonic的文本处理——情感分析、词性标注、名词短语提取、翻译等。
一个用于时间序列上用户友好的预测和异常检测的Python库。
机器学习的容器
在单个GPU上运行大型语言模型,面向吞吐量导向的场景。
ML.NET是一个面向.NET的开源跨平台机器学习框架。
深度学习的AutoML库
ModelScope:将模型即服务(Model-as-a-Service)的概念变为现实。
一个快速、可扩展、高性能的基于决策树的梯度提升库,用于Python、R、Java、C++的排序、分类、回归和其他机器学习任务。支持CPU和GPU计算。
Hello AI World 指南,使用 TensorRT 和 NVIDIA Jetson 部署深度学习推理网络和深度视觉原语。
Python 的 Web 挖掘模块,包含用于爬取、自然语言处理、机器学习、网络分析和可视化的工具。
🧙 构建、运行和管理用于集成和转换数据的数据管道。
服务 AI 应用和模型的最简单方式——构建模型推理 API、任务队列、LLM 应用、多模型管道等!
回测引擎,赋予你不公平优势。在别人完成一个交易想法之前,运行数千个
面向Python、机器学习、可视化和大数据表格探索的核外混合Apache Arrow/NumPy DataFrame,每秒处理十亿行数据 🚀
通过k位量化实现PyTorch可访问的大语言模型
DoWhy是一个用于因果推断的Python库,支持显式建模和测试因果假设。DoWhy基于统一的因果推断语言,结合因果图模型和潜在结果框架
大规模机器学习的生产基础设施
一个用于自动化特征工程的开源Python库
H2O是一个开源、分布式、快速且可扩展的机器学习平台:深度学习、梯度提升(GBM)和XGBoost、随机森林、广义线性模型(带弹性网络的GLM)、K-Means、PCA、广义加性模型(GAM)、RuleFit、支持向量机(SVM)、堆叠集成、自动机器学习(AutoML)等。
面向科学家和工程师的深度学习和强化学习库
机器学习数据集的可视化
用于AI/ML的开源特征存储
🔮 用于在Web上实现机器学习驱动用户体验的库和工具
一个解决机器学习中不平衡数据集问题的Python包
Flower:一个友好的联邦AI框架
AI搜索平台
官方维护,由PaddlePaddle支持,包括CV、NLP、语音、推荐、时间序列、大模型等。
用于多模态AI的开放湖仓格式。两行代码即可从Parquet转换,实现100倍更快的随机访问、向量索引和数据版本控制。兼容Pandas、DuckDB、Polars、Pyarrow和PyTorch,更多集成即将推出。
为ML/AI应用提供GPU加速的Postgres数据库。
ClearML - 自动化CI/CD以简化您的AI工作负载。在一个MLOps/LLMOps解决方案中集成了实验管理、数据管理、流水线、编排、调度和服务。
用于构建和分析推荐系统的Python scikit
一个灵活且强大的用于大规模机器学习的参数服务器
面向Web的友好机器学习!🤖
Python 和命令行工具,用于收集网络上的文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML 格式。
一个灵活、高性能的机器学习模型服务系统
在应用程序中使用深度度量学习的最简单方法。模块化、灵活且可扩展。使用PyTorch编写。
基于TensorFlow的神经网络训练接口,注重速度和灵活性
强化学习的膨胀。
Aim 💫 — 一个易于使用且功能强大的开源实验跟踪器。
Mooncake 是 Kimi 的服务平台,Kimi 是 Moonshot AI 提供的领先 LLM 服务。
Swift for TensorFlow。
时间序列 深度学习 机器学习 Python Pytorch fastai | 用于 Pytorch / fastai 中时间序列和序列的最先进深度学习库。
Swift机器学习库。
一个通过弱监督快速生成训练数据的系统
标准化的分布式生成式和预测性 AI 推理平台,用于在 Kubernetes 上进行可扩展、多框架部署。
⚡ 纯 Rust WebGPU 推理引擎——兼容 OpenAI API,原生支持 GGUF,可在任何 GPU 上运行。无需 Python。无需 llama.cpp。单个二进制文件。
一个 GPU 加速的库,包含高度优化的构建块和一个数据处理执行引擎,用于加速深度学习训练和推理应用。
从句子中提取关键词或替换句子中的关键词。
面向 AI 和多模态工作负载的高性能数据引擎。可处理任意规模的图像、音频、视频和结构化数据
mlpack:一个快速的、仅头文件的 C++ 机器学习库。
用于 Keras 的深度强化学习。
用于机器学习的 C++ 独立库
OpenSpiel是一个用于通用强化学习和游戏中搜索/规划研究的环境和算法集合。
Core ML工具包含用于Core ML模型转换、编辑和验证的支持工具。
cuML - RAPIDS机器学习库。
简单且分布式的机器学习。
Python中的概率时间序列建模。
将SQL和AI结合在一起。
为超大规模MoE模型打造的下一代训练引擎
Python数据分析和机器学习库的扩展与辅助模块库。
用于机器学习的Python图像增强库。
LightFM的Python实现,一种混合推荐算法。
EasyR1:基于veRL的高效、可扩展、多模态强化学习训练框架
Argilla是AI工程师和领域专家协作构建高质量数据集的工具
基于GPTQ算法的易用LLM量化包,提供用户友好的API。
用于从学术文档中提取信息的机器学习软件
使用 PyTorch 进行时间序列预测
在浏览器中运行 Keras 模型,通过 WebGL 支持 GPU
MlFinLab通过提供可复现、可解释且易于使用的工具,帮助希望利用机器学习力量的组合经理和交易员。
面向PyTorch的移动、嵌入式和边缘设备上的AI。
一个用于解析/规范化全球街道地址的C库。基于统计NLP和开放地理数据。
使用统计和计量经济学模型进行闪电般快速的预测。
TensorFlow中的概率编程语言。深度生成模型,变分推理。
一个引擎无关的Java深度学习框架
适用于NVIDIA Jetson和JetPack-L4T的机器学习容器。
MegEngine 是一个快速、可拓展、易于使用且支持自动求导的深度学习框架
高级库,用于在PyTorch中灵活透明地训练和评估神经网络。
一个MLOps框架,用于打包、部署、监控和管理数千个生产机器学习模型。
ALICE(自动学习与智能因果与经济学)是微软研究院的一个项目,旨在将人工智能概念应用于经济决策。其目标之一是构建一个工具包,将最先进的机器学习技术与计量经济学相结合,以实现复杂因果推断问题的自动化。迄今为止,ALICE Python SDK(econml)实现了正交机器学习算法,如Chernozhukov等人的双重机器学习工作。该工具包旨在测量某些处理变量t对结果变量y的因果效应,同时控制一组特征x。
放松!Flux是让你不张量的ML库。
一个Rust机器学习框架。
NLP 数据增强
🤗 AutoTrain高级版
TFDS是一个可直接与TensorFlow、Jax等一起使用的数据集集合。
Tengine是一个面向嵌入式设备的轻量级、高性能、模块化推理引擎
Merlion:时间序列智能机器学习框架
RLinf:用于具身和代理AI的强化学习基础设施
搜索所有中文 NLP 数据集,附常用英文 NLP 数据集
[EMNLP 2022] 知识图谱提取与构建开放工具包
RAG(检索增强生成)框架,用于构建模块化、开源的生产级应用程序,由 TrueFoundry 提供
一个用于自动机器学习(AutoML)和调优的快速库。加入我们的Discord:https://discord.gg/Cppx2vSPVP。
一个JavaScript深度学习和强化学习库。
大规模并行深度强化学习。🔥
在生产环境中服务、优化和扩展PyTorch模型
NeuralProphet:一个简单的预测包。
模块化量化框架。
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
可扩展且用户友好的神经:brain:预测算法。
LightLLM是一个基于Python的LLM(大语言模型)推理和服务框架,以其轻量级设计、易于扩展和高性能而著称。
Kubeflow的机器学习管道
深度学习GPU训练系统
最先进的自然语言处理
构建你自己的RAG应用所需了解的一切
轻松构建数据管道 🛠️
⚡️SwanLab - 一个开源、现代设计的AI训练跟踪和可视化工具。支持云端/自托管使用。集成PyTorch / Transformers / verl / LLaMA Factory / ms-swift / Ultralytics / MMEngine / Keras等。
FEDML - 用于大规模分布式训练、模型服务和联邦学习的统一可扩展ML库。FEDML Launch是一个跨云调度器,进一步支持在任何GPU云或本地集群上运行任何AI作业。基于此库,TensorOpera AI (https://TensorOpera.ai) 是您的规模化生成式AI平台。
容错、高度可扩展的GPU编排,以及专为训练数十亿到数万亿参数模型设计的机器学习框架
语言模型分词速度达到GB/s级别
优势演员评论家(A2C)、近端策略优化(PPO)、基于Kronecker因子近似的深度强化学习可扩展信任区域方法(ACKTR)和生成式对抗模仿学习(GAIL)的PyTorch实现。
一个可重定向的、基于MLIR的机器学习编译器和运行时工具包。
TensorFlowOnSpark 将TensorFlow程序引入Apache Spark集群。
用于隐式反馈数据集的快速 Python 协同过滤
超快速 AI 决策和多模态数据智能处理。
DeepVariant 是一个分析流程,使用深度神经网络从下一代 DNA 测序数据中识别遗传变异。
Java 数据框和可视化库
一个用于分布式 DNN 训练的高性能通用框架。
AI 基础设施 / AI 编排 / AI 控制平面。
用于文本文档和 HTML 页面自动摘要的模块。
Python 和 Julia 中的高性能符号回归
构建数据管道的最快 ⚡️ 方式。迭代开发,随处部署。☁️
Alink 是基于 Flink 的机器学习算法平台,由阿里巴巴计算平台 PAI 团队开发。
基于PyTorch的语言处理模型、数据加载器和抽象层
Python中快速、灵活且易用的概率建模工具。
数据来源:GitHub API · 人工精选 · 实时同步