GPU/推理优化226 / 442 个项目
GPU/推理优化排行榜,收录 GitHub 上最热门的 AI 推理加速和模型优化项目,包括量化、剪枝和蒸馏工具。
Python中的张量和动态神经网络,具有强大的GPU加速功能。
面向大语言模型的高吞吐量、内存高效的推理与服务平台
C/C++ 实现的 LLM 推理引擎,可在 CPU/GPU/边缘设备上运行,支持 GGUF 量化模型。
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
OpenAI Whisper模型的C/C++移植版
DeepSpeed 是一个深度学习优化库,使分布式训练和推理变得简单、高效且有效。
使大型 AI 模型更便宜、更快、更易访问。
SGLang是一个用于大型语言模型和多模态模型的高性能服务框架。
fastai深度学习库
使用 CTranslate2 实现更快的 Whisper 转录
ncnn 是一个针对移动平台优化的高性能神经网络推理框架
欢迎来到 Llama Cookbook!这是您使用 Llama 进行构建的指南:从推理、微调、RAG 开始入门。我们还展示了如何使用 Llama 模型家族解决端到端问题,并在各种提供商服务上使用它们。
Nano vLLM
基于 TurboQuant 构建的向量索引,使用 Rust 编写并带有 Python 绑定
Open3D:用于3D数据处理的现代库。
开放机器学习编译器框架。
LMCache:用最快的KV缓存层加速你的LLM。
示例 📓 Jupyter 笔记本,演示如何使用 🧠 Amazon SageMaker 构建、训练和部署机器学习模型。
大型语言模型文本生成推理
在任何AI基础设施上运行、管理和扩展AI工作负载。使用一个系统访问和管理所有AI计算(Kubernetes、Slurm、20多个云、本地)。
用于本地运行AI的生产就绪工具包
一个基于Ray的易用、可扩展、高性能的代理强化学习框架(PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 异步RL)
cuDF - GPU数据框库
轻松微调、评估和部署Gemma 4、Qwen3.5、Qwen3.6、gpt-oss、DeepSeek-R1或任何开源LLM/VLM!
一个快速、可扩展、高性能的基于决策树的梯度提升库,用于Python、R、Java、C++的排序、分类、回归和其他机器学习任务。支持CPU和GPU计算。
Hello AI World 指南,使用 TensorRT 和 NVIDIA Jetson 部署深度学习推理网络和深度视觉原语。
在 Intel XPU(例如,配备 iGPU 和 NPU 的本地 PC,以及 Arc、Flex 和 Max 等独立 GPU)上加速本地 LLM 推理和微调(LLaMA、Mistral、ChatGLM、Qwen、DeepSeek、Mixtral、Gemma、Phi、MiniCPM、Qwen-VL、MiniCPM-V 等);无缝集成 llama.cpp、Ollama、HuggingFace、LangChain、LlamaIndex、vLLM、DeepSpeed、Axolotl 等。
通过k位量化实现PyTorch可访问的大语言模型
数据中心规模的分布式推理服务框架
H2O是一个开源、分布式、快速且可扩展的机器学习平台:深度学习、梯度提升(GBM)和XGBoost、随机森林、广义线性模型(带弹性网络的GLM)、K-Means、PCA、广义加性模型(GAM)、RuleFit、支持向量机(SVM)、堆叠集成、自动机器学习(AutoML)等。
一个用于GPU加速模拟、机器人学和机器学习的Python框架。
Mooncake 是 Kimi 的服务平台,Kimi 是 Moonshot AI 提供的领先 LLM 服务。
找到在你的硬件上实际运行且性能最佳的本地 LLM。根据真实的、考虑时效性的基准排名,而非参数数量。一条命令,即刻运行。
FlashInfer:用于LLM服务的核函数库
用于全模态模型高效推理的框架
标准化的分布式生成式和预测性 AI 推理平台,用于在 Kubernetes 上进行可扩展、多框架部署。
一个 GPU 加速的库,包含高度优化的构建块和一个数据处理执行引擎,用于加速深度学习训练和推理应用。
一个用于构建复杂和创新 RAG 管道的低代码 MCP 框架。
用于量化金融的高性能TensorFlow库。
一个GPU集群管理器,用于高性能AI模型服务(vLLM、SGLang)和按需SSH可访问的GPU实例。
Superduper:用于构建自定义AI应用和代理的端到端框架。
cuML - RAPIDS机器学习库。
面向云、数据中心和边缘的模型混合系统级智能路由器
cube studio开源云原生一站式机器学习/深度学习/大模型AI平台,mlops算法链路全流程,算力租赁平台,notebook在线开发,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务VGPU虚拟化,边缘计算,标注平台自动化标注,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库,AI模型市场,支持国产cpu/gpu/npu 昇腾生态,支持RDMA,支持pytorch/tf/mxnet/deepspeed/paddle/colossalai/horovod/ray/volcano等分布式
基于GPTQ算法的易用LLM量化包,提供用户友好的API。
使用 PyTorch 进行时间序列预测
用于集体多GPU通信的优化原语
一个易于使用的PyTorch到TensorRT转换器
面向PyTorch的移动、嵌入式和边缘设备上的AI。
MegEngine 是一个快速、可拓展、易于使用且支持自动求导的深度学习框架
TNN:由腾讯优图实验室和光影实验室开发,是一个面向移动端、桌面端和服务端的统一深度学习推理框架。TNN 具有跨平台、高性能、模型压缩和代码剪枝等突出特点。基于 ncnn 和 Rapidnet,TNN 进一步强化了对移动设备的支持和性能优化,并借鉴了现有开源方案扩展性好、高性能的优点。TNN 已部署在腾讯多个应用中,如手机QQ、微视、Pitu等。欢迎贡献,与我们合作,使 TNN 成为更好的框架。
Transformer模型的快速推理引擎
超快速C++/CUDA神经网络框架
在生产环境中服务、优化和扩展PyTorch模型
CSGHub是一个全新的开源大模型管理平台,由OpenCSG团队开发。它提供开源和本地/SaaS解决方案,功能与Hugging Face相当。完全控制大模型、数据集和代理的生命周期,Python SDK与Hugging Face兼容。加入我们!⭐️
深度学习GPU训练系统
[ICLR2025 Spotlight] SVDQuant:通过低秩组件吸收异常值实现4比特扩散模型
基于 PaddlePaddle 的 LLM 和 VLM 高性能推理与部署工具包。
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量化注意力相比 FlashAttention 实现了 2-5 倍的加速,且在语言、图像和视频模型上不损失端到端指标。
为C、C++、CUDA、Python、Rust、Swift、JS和Go提供高达100倍速度的字符串处理,利用NEON、AVX2、AVX-512、SVE、GPGPU和SWAR加速搜索、哈希、排序、编辑距离、草图和内存操作 🦖
🚀 使用易于使用的硬件优化工具加速 🤗 Transformers、Diffusers、TIMM 和 Sentence Transformers 的推理和训练
具有学习保证的快速灵活 AutoML。
LightSeq:一个用于序列处理和生成的高性能库
面向 CPU 的稀疏感知深度学习推理运行时
用于大型语言模型的高性能推理框架,专注于效率、灵活性和可用性。
CV-CUDA™ 是一个开源的、GPU加速的库,用于云规模图像处理和计算机视觉。
SOTA 低位 LLM 量化(INT8/FP8/MXFP8/INT4/MXFP4/NVFP4)和稀疏性;在 PyTorch、TensorFlow 和 ONNX Runtime 上的领先模型压缩技术。
构建、个性化和控制你自己的 LLM。从数据预处理到微调,xTuring 提供了一种个性化开源 LLM 的简单方法。加入我们的 Discord 社区:https://discord.gg/TgHXuSJEk6
开源推理服务器和生产集群,满足智能体所需的所有模型。
用于推荐系统的Pytorch领域库
社区维护的vLLM在昇腾上的硬件插件
用于 Torch 和 TensorRT 的深度学习服务器和 CLI
Rust中用于ONNX模型的快速ML推理与训练
将任何计算机或边缘设备转变为计算机视觉项目的指挥中心。
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持
LUPINE是一个GPU over IP桥接器,允许将远程机器上的GPU连接到仅CPU的机器上。
OpenLake是一个高性能存储引擎,用于高效的LLM推理和GPU训练
micronet,一个模型压缩和部署库。压缩:1、量化:量化感知训练(QAT),高位宽(>2b)(DoReFa/用于高效整数算术推理的神经网络量化和训练)、低位宽(≤2b)/三值和二值(TWN/BNN/XNOR-Net);训练后量化(PTQ),8位(tensorrt);2、剪枝:常规、正则和分组卷积通道剪枝;3、分组卷积结构;4、用于量化的批归一化融合。部署:tensorrt,fp32/fp16/int8(ptq校准)、算子适配(上采样)、动态形状。
跨NVIDIA、AMD、TPU和Tenstorrent,在云、Kubernetes和裸金属上进行训练、推理和代理工作负载的供应商无关编排。
在 Kubernetes 上进行分布式 AI 模型训练和 LLM 微调
使用 node.js 绑定 llama.cpp 在本地机器上运行 AI 模型。在生成级别强制模型输出符合 JSON 模式。
AICI:提示作为(Wasm)程序
超快速的无服务器 GPU 推理、沙箱和后台任务
🔥 实时NVIDIA GPU仪表盘
一个用于优化Keras和TensorFlow ML模型部署的工具包,包括量化和剪枝。
一种用于高精度低位LLM推理的SOTA量化算法,针对CPU/XPU/CUDA进行了无缝优化,支持多种数据类型,并与vLLM、SGLang和Transformers完全兼容。
一个快速且用户友好的Transformer推理运行时(支持Bert、Albert、GPT2、解码器等),可在CPU和GPU上运行。
一个针对LLM、VLM、DiT和REC模型的高性能推理引擎,针对多种AI加速器进行了优化。托管于开放原子开源基金会。
为增强可用性、全面性和效率而设计的模型压缩工具包。
为Apple Silicon设计的OpenAI和Anthropic兼容服务器。支持连续批处理、MCP工具调用和多模态的LLM和视觉语言模型(Llama、Qwen-VL、LLaVA)。原生MLX后端,速度超过400 tok/s。可与Claude Code配合使用。
用不到 10 行代码在预算内部署 ML 推理服务。
华为诺亚方舟实验室开发的高效计算方法
RTP-LLM:阿里巴巴面向多样化应用的高性能LLM推理引擎。
用Rust构建的高性能、模块化、内存安全且生产就绪的推理、摄取和索引系统🦀
GraphVite:通用高性能图嵌入系统
使用 Modal 构建的程序示例。
用于 Kubernetes 的 AI 推理算子。在生产环境中服务 ML 模型的最简单方法。支持 VLM、LLM、嵌入和语音转文本。
LLM 模型量化 (压缩) 工具包,通过 HF、vLLM 和 SGLang 支持 Nvidia、AMD、Intel GPU 以及 Intel/AMD/Apple CPU 的硬件加速。
用于增强OpenVINO™推理的神经网络压缩框架
NVTabular 是一个用于表格数据的特征工程和预处理库,旨在快速轻松地处理用于训练基于深度学习的推荐系统的 TB 级数据集。
用于动态 GPU 共享及更多场景的虚拟化弹性 KV 缓存
RAFT 包含机器学习与信息检索中基础且广泛使用的算法和原语。这些算法经过 CUDA 加速,构成更易编写高性能应用的构建块。
[ICML2025] SpargeAttention:一种无需训练的稀疏注意力机制,可加速任何模型推理。
用 C++ 和 CUDA 构建你自己的高性能 LLM 推理引擎——vLLM 的简化版本
一个将ONNX文件转换为LiteRT/TFLite/TensorFlow、PyTorch原生代码(nn.Module)、TorchScript(.pt)、state_dict(.pt)、Exported Program(.pt2)和Dynamo ONNX的工具。也支持从LiteRT直接转换为PyTorch。
一个面向LLM的吞吐量优先高性能服务框架
TinyChatEngine:设备端LLM推理库
Bolt是一个具有高性能和异构灵活性的深度学习库
半二次量化(HQQ)的官方实现
[NeurIPS 2020] MCUNet:物联网设备上的微型深度学习;[NeurIPS 2021] MCUNetV2:面向微型深度学习的内存高效补丁推理;[NeurIPS 2022] MCUNetV3:256KB内存下的设备端训练
一个统一的接口,用于运行来自多个框架的深度学习模型
一个灵活、高性能的机器学习模型载体(『飞桨』服务化部署框架)
[ICLR2024 spotlight] OmniQuant 是一种简单而强大的 LLM 量化技术。
一个高性能的 ML 模型服务框架,提供动态批处理和 CPU/GPU 流水线,以充分利用你的计算资源
针对 TensorFlow 的性能优化轮子(SSE、AVX、FMA、XLA、MPI)
一个开源计算机视觉框架,可在几分钟内构建和部署应用
cuVS - 一个用于 GPU 上向量搜索和聚类的库。
在 Debian 上设置本地且完全私有的 LLM 服务器的端到端文档。配备聊天、网络搜索、RAG、模型管理、MCP 服务器、图像生成和 TTS 功能。
Python高性能视觉库。扩展你的研究,而非样板代码。
无需安装和 Bazel 即可在 C++ 中运行 TensorFlow 模型。
Talos网络的GPU工作节点客户端。与你的Talos账户配对,通过WebSocket提供开放模型推理任务,并报告运行时间以获取报酬。
用于Tensorflow的OpenCL 1.2实现
估计 Hugging Face 模型是否适合并在本地 GPU 上进行微调。
用于扩散和全模态模型的多模态RL训练框架
开源端到端计算机视觉平台。在统一平台上进行标注、构建、训练、调优、部署和自动化,支持任何云和本地环境。
[ICML 2024] SqueezeLLM: 密集与稀疏量化
使用 NVIDIA TensorRT 加速的 TensorFlow 模型
图数据科学:一个用于构建知识图谱的Python抽象层,集成了流行的图库——基于Pandas、NetworkX、RAPIDS、RDFlib、pySHACL、PyVis、morph-kgc、pslpython、pyarrow等。
经典机器学习模型的Ollama。一个AOT编译器,可将XGBoost、LightGBM、scikit-learn、CatBoost和ONNX模型转换为原生C99推理代码。一条命令加载,一条命令服务。比Python推理快336倍。
用于在Pytorch中加速固定的CPU <-> GPU传输的库
具有LLM支持的GPU环境和集群管理
用于知识蒸馏、剪枝和量化领域基准测试和扩展工作的 PyTorch 知识蒸馏库
纯 Rust + CUDA LLM 推理引擎——无需 PyTorch,兼容 OpenAI,服务于 Qwen3 到 Kimi-K2
将mmdetection模型转换为tensorrt,支持fp16、int8、批量输入、动态形状等。
使用 PyTorch 的最小失真嵌入。
⚡ 将 T5 模型的推理速度提升 5 倍,并将模型大小减少 3 倍。
MiniGPT4 的 C++ 移植版(4bit、5bit、6bit、8bit、16bit CPU 推理,使用 GGML)
Stable Diffusion 的实时推理 - 0.88 秒延迟。涵盖 AITemplate、nvFuser、TensorRT、FlashAttention。加入我们的 Discord 社区:https://discord.com/invite/TgHXuSJEk6
静态极简单批次纯 CUDA qwen3-0.6B 迷你推理引擎
Python + 推理 - Python中的模型部署库。有史以来最简单的模型推理服务器。
🏗️ 轻松微调、构建和部署开源 LLM!
适用于Apple Silicon的原生LLM推理服务器。兼容OpenAI + Anthropic API。无需Python。包含MLX Core macOS应用,支持聊天、代理模式和工具调用。
Cerebrium无服务器GPU的示例
一个面向生产环境的高性能大型语言模型推理系统。
用Rust编写的RDNA原生LLM推理引擎。
RDNA原生LLM推理引擎,使用Rust编写。
开放模型引擎(OME)——用于LLM服务、GPU调度和模型生命周期管理的Kubernetes算子。可与SGLang、vLLM、TensorRT-LLM和Triton配合使用。
在更短的时间内用更少的数据构建计算机视觉模型。
高效AI推理与服务
PyTorch 量化库。支持低精度和混合精度量化,并通过 TVM 实现硬件部署。
KVarN 是一个原生的 vLLM KV 缓存量化后端,适用于您的智能体:支持 3-5 倍上下文长度,吞吐量超过 FP16,且精度达到 FP16 级别。无需校准,一个标志即可启用。
JetStream 是一个面向 XLA 设备(从 TPU 开始,未来支持 GPU——欢迎提交 PR)的 LLM 推理引擎,针对吞吐量和内存进行了优化。
RAG(检索增强生成)聊天机器人,基于从Markdown文件集合中提取的上下文信息提供答案
[NeurIPS 2024] KVQuant:通过 KV 缓存量化实现千万级上下文长度的 LLM 推理
PiSSA:大语言模型的主奇异值与奇异向量适配(NeurIPS 2024 Spotlight)
T-GATE:时间门控注意力以免费加速扩散模型!
基于TensorFlow构建的NLP序列学习开源工具。
支持 7 倍更长上下文的 LLM 推理。纯 C 实现,零依赖。无损 KV 缓存压缩 + 单头文件库。
用于AI应用的高性能RAG管道。在一个简单的API中集成了摘要、检索/重排序和代码解释器。
[ICCV 2023] Q-Diffusion: 量化扩散模型。
Milvus内部的向量搜索引擎,集成了FAISS、HNSW、DiskANN。
一个创新的库,通过低比特量化实现高效的LLM推理
一个模块化、可扩展、高性能的 LLM、VLM、扩散模型和具身模型训练框架。
一个专为研究目的设计的小而强大的LLM推理系统。仅用2k行代码(vLLM的2%)实现与vLLM相当的性能。
由X位量化驱动的设备端LLM推理
ClearML Agent - 简化MLOps/LLMOps。MLOps/LLMOps调度与编排解决方案。
PMetal:用于本地LLM推理、LoRA/QLoRA微调、服务、量化和MLX/Metal加速的高性能Apple Silicon框架。
预测性和生成式AI的生产框架。一行代码将任何模型作为API提供服务,具有OpenAI/Anthropic/Ollama兼容端点、内置聊天UI和原生MCP。
☁️ 用于机器学习工作负载的Terraform插件:竞价实例恢复与自动终止 | AWS、GCP、Azure、Kubernetes
CacheRoute是一种创新的LLM调度方案,致力于在LLM系统中实现灵活的KV缓存复用,提升任务性能和系统效率。
从头构建的 Rust+CUDA 推理引擎,按构造位精确——NVFP4、MoE、MTP 推测解码,针对单块 RTX 5090 笔记本电脑(sm_120a)的测量极限进行调优。
在Kubernetes(及其他平台)上自动扩展LLM推理(vLLM、SGLang、LMDeploy)
[COLM 2024] TriForce: 通过分层推测解码实现长序列生成的无损加速
HDLTex: 用于文本分类的分层深度学习
[ICML'21 Oral] I-BERT:仅整数BERT量化
用于LLM基础设施的高性能轻量级代理和负载均衡器。跨本地和远程推理后端实现智能路由、自动故障转移和统一模型发现。
FasterAI:使用FastAI和PyTorch剪枝和蒸馏模型
针对pytorch模型的自动化模型结构分析和修改工具集,包含自动分析模型结构的模型压缩算法库
OramaCore是您项目、答案引擎、副驾驶和搜索所需的完整运行时。它包含一个功能齐全的全文搜索引擎、向量数据库、LLM接口以及许多其他实用工具。
一个开源、自托管的AI模型中心,兼容Hugging Face,加速vLLM/SGLang性能。
gpt_server是一个用于生产级部署LLMs、Embedding、Reranker、ASR、TTS、文生图、图片编辑和文生视频的开源框架。
RaBitQ算法及其在向量搜索中应用的官方轻量级库。
在Windows上一键推理Qwen3.6-27B。RTX 5090上158 tok/s,RTX 3090上72 tok/s。原生,无需WSL、Docker或遥测。
使用 LoRA 增强 LLM
该项目收集来自各种云提供商的 GPU 基准测试,并将其与固定的每令牌成本进行比较。使用我们的工具进行高效的 LLM GPU 选择和成本效益的 AI 模型。LLM 提供商价格比较、GPU 基准测试到每令牌价格计算、GPU 基准测试表
HierarchicalKV是NVIDIA Merlin的一部分,提供分层键值存储以满足推荐系统需求。其关键能力是将键值特征嵌入存储在GPU的高带宽内存(HBM)和主机内存中,也可用作通用键值存储。
RapidFire AI: 从RAG到微调的快速AI定制
基于FPGA的开源深度学习推理引擎
一个可扩展、高性能的联邦学习模型服务系统
用于中微子望远镜的深度学习库
ONNX 的模型压缩
针对配备Blackwell GB10 GPU(sm_121架构)的NVIDIA DGX Spark的一键式vLLM安装
轻量级AI交钥匙解决方案
AI 推理,简单打包。一个极快、零依赖的 WebGPU 运行时,可直接在浏览器中运行 GGUF 模型。具有对称 API,可实现无缝的本地执行和云提供商路由。使用 Rust 和 C++ 构建。
一个精简、经过全面测试的 LLM 推理服务器,适用于你已有的硬件 — 免费层、共享 VPS、2 核 ARM 盒子。基于 llama.cpp 的 OpenAI 兼容 API。在 CPU 上,从不重复计算相同内容:它将提示、前缀和过去的生成缓存到磁盘,因此第 100 次请求的成本只是第 1 次请求的一小部分。
✈️ 用于跨多个提供商部署和管理 AI 推理的 Kubernetes 原生平台
NVIDIA Alpamayo 开发者中心,包含微调、强化学习后训练、量化和部署的即用型配方。
采用 vLLM v1 请求调度策略和分块预填充的 Nano vLLM
Kubernetes原生平台,用于跨多个提供商部署和管理AI推理。
数据来源:GitHub API · 人工精选 · 实时同步