模型部署65 / 390 个项目
模型部署排行榜,收录 GitHub 上最热门的 AI 模型部署和服务化工具项目,支持模型推理服务和弹性扩缩容。
面向大语言模型的高吞吐量、内存高效的推理与服务平台
一个开源、可自托管的PaaS替代方案,类似Vercel、Heroku和Netlify,让您轻松在自有服务器上部署静态网站、数据库、全栈应用以及280多种一键式服务。
Ray 是一个 AI 计算引擎。Ray 包含一个核心分布式运行时和一组用于加速机器学习工作负载的 AI 库。
Vercel、Netlify 和 Heroku 的开源替代方案。
服务 AI 应用和模型的最简单方式——构建模型推理 API、任务队列、LLM 应用、多模型管道等!
Chef Infra,一个强大的自动化平台,将基础设施转化为代码,自动化配置、部署和管理任何环境、任何规模的基础设施
用于全模态模型高效推理的框架
标准化的分布式生成式和预测性 AI 推理平台,用于在 Kubernetes 上进行可扩展、多框架部署。
⚡ 纯 Rust WebGPU 推理引擎——兼容 OpenAI API,原生支持 GGUF,可在任何 GPU 上运行。无需 Python。无需 llama.cpp。单个二进制文件。
一个MLOps框架,用于打包、部署、监控和管理数千个生产机器学习模型。
在此仓库中,我将分享一些关于在生产环境中部署基于深度学习的模型的有用笔记和参考资料。
LightLLM是一个基于Python的LLM(大语言模型)推理和服务框架,以其轻量级设计、易于扩展和高性能而著称。
轻松构建数据管道 🛠️
FEDML - 用于大规模分布式训练、模型服务和联邦学习的统一可扩展ML库。FEDML Launch是一个跨云调度器,进一步支持在任何GPU云或本地集群上运行任何AI作业。基于此库,TensorOpera AI (https://TensorOpera.ai) 是您的规模化生成式AI平台。
可扩展到数千个微调LLM的多LoRA推理服务器
用于大型语言模型的高性能推理框架,专注于效率、灵活性和可用性。
OpenMMLab 模型部署框架
开源推理服务器和生产集群,满足智能体所需的所有模型。
社区维护的vLLM在昇腾上的硬件插件
将任何计算机或边缘设备转变为计算机视觉项目的指挥中心。
OpenLake是一个高性能存储引擎,用于高效的LLM推理和GPU训练
AICI:提示作为(Wasm)程序
MLRun 是一个开源 MLOps 平台,用于快速构建和管理整个生命周期中的连续 ML 应用程序。MLRun 集成到你的开发和 CI/CD 环境中,并自动化生产数据、ML 管道和在线应用程序的交付。
基于Kubernetes的机器学习平台和推荐引擎
来自 CNCF 的开源 DevOps 工具,用于将 AI/ML 模型、数据集、代码和配置打包并版本化为 OCI 制品。
用不到 10 行代码在预算内部署 ML 推理服务。
面向内部开发者平台(IDP)的声明式意图驱动平台编排器。
Hopsworks - 具有特征存储的数据密集型AI平台
RTP-LLM:阿里巴巴面向多样化应用的高性能LLM推理引擎。
在生产环境中服务AI/ML模型的最简单方式
一个面向LLM的吞吐量优先高性能服务框架
TurboOCR,>200 img/s OmnidocBench。TensorRT FP16, PP-OCRv6, HTTP + gRPC
针对 Llama 及其变体的高度优化的 LLM 推理加速引擎。
一个高性能的 ML 模型服务框架,提供动态批处理和 CPU/GPU 流水线,以充分利用你的计算资源
面向代码优先内部工具的部署平台。在单节点或 Kubernetes 上声明式部署 Web 应用,支持 OIDC/SAML 认证和 RBAC。
10 步内训练并部署用于预测加密货币价格的 ML REST API
一个开源计算机视觉框架,可在几分钟内构建和部署应用
在 Kubernetes 上大规模部署模型 🦄️
一个自托管的开源平台即服务,支持轻松部署集群、负载均衡、自动 SSL、指标、分析等功能。
🐶 一个用于在任何平台上打包、服务和部署任何ML模型的工具。已归档,希望有一天能复活🤞
KubeStellar - 一个用于边缘、多云和混合云的多集群配置管理的灵活解决方案
经典机器学习模型的Ollama。一个AOT编译器,可将XGBoost、LightGBM、scikit-learn、CatBoost和ONNX模型转换为原生C99推理代码。一条命令加载,一条命令服务。比Python推理快336倍。
纯 Rust + CUDA LLM 推理引擎——无需 PyTorch,兼容 OpenAI,服务于 Qwen3 到 Kimi-K2
Python + 推理 - Python中的模型部署库。有史以来最简单的模型推理服务器。
开放模型引擎(OME)——用于LLM服务、GPU调度和模型生命周期管理的Kubernetes算子。可与SGLang、vLLM、TensorRT-LLM和Triton配合使用。
JetStream 是一个面向 XLA 设备(从 TPU 开始,未来支持 GPU——欢迎提交 PR)的 LLM 推理引擎,针对吞吐量和内存进行了优化。
使用云原生技术管理联邦学习工作负载。
FedScale是一个可扩展且可扩展的开源联邦学习(FL)平台。
在4步内部署和扩展无服务器机器学习应用。
BentoDiffusion:使用BentoML提供服务的扩散模型集合
一个专为研究目的设计的小而强大的LLM推理系统。仅用2k行代码(vLLM的2%)实现与vLLM相当的性能。
PMetal:用于本地LLM推理、LoRA/QLoRA微调、服务、量化和MLX/Metal加速的高性能Apple Silicon框架。
预测性和生成式AI的生产框架。一行代码将任何模型作为API提供服务,具有OpenAI/Anthropic/Ollama兼容端点、内置聊天UI和原生MCP。
一个用于全栈深度学习的多功能库。简化模型构建、API开发和模型部署。
一个可扩展、高性能的联邦学习模型服务系统
MONAI Deploy App SDK提供框架及相关工具,用于设计、开发和验证医疗影像领域的AI驱动应用。
以最少的额外代码部署深度学习/机器学习推理流水线。
使用 TorchServe 服务 PyTorch 模型 :fire:
:scroll: 使用Fabric轻松部署Home-Assistant
跨提供商的路由推断。
Pluto 提供统一的编程接口,让您无缝接入云能力并开发云和 AI 应用。
一个类似 Ollama 但针对 Apple MLX 模型的替代品
Hypergol是一个数据科学/机器学习生产力工具包,通过自动生成代码、数据和ML标准化结构以及开箱即用的并行处理,加速任何项目投入生产。
🔥 🔥 Ollama的替代方案 🔥 🔥 多模型<1ms LLM切换
面向智能体时代的自托管、兼容OpenAI的推理服务:推理LLM、通用工具调用、Responses API,以及嵌入、语音和图像模型——多个模型共享您的GPU,统一网关。由Ray Serve驱动。
数据来源:GitHub API · 人工精选 · 实时同步