T
TensorRT-LLM
NVIDIA/TensorRT-LLM
TensorRT LLM为用户提供易于使用的Python API来定义大型语言模型(LLMs),并支持最先进的优化,以在NVIDIA GPU上高效执行推理。TensorRT LLM还包含用于创建Python和C++运行时的组件,以高性能方式编排推理执行。
★14.3kstars
Python
NOASSERTION
更新: 今天
📋 项目速览
点击展开
这是什么?一个数据与基础设施领域的blackwell/cuda工具,用Python构建、开源
作者是谁?由 NVIDIA 团队维护,GitHub 14.3K⭐,在 数据与基础设施 分类 3133 个项目中排名第 136
为什么诞生?blackwell在数据与基础设施中的需求持续增长,NVIDIA发现现有方案不够直观,于是创造了TensorRT-LLM来降低cuda使用门槛。
能干什么?核心场景:llm-serving、moe、pytorch
怎么用 AI 安装?推荐使用 AI 编码助手根据 GitHub README 自动完成 pip 安装和虚拟环境配置。
🔗 github.com/NVIDIA/TensorRT-LLM | 官网 https://nvidia.github.io/TensorRT-LLM
🔗 github.com/NVIDIA/TensorRT-LLM | 官网 https://nvidia.github.io/TensorRT-LLM
标签
blackwellcudallm-servingmoepytorch