暂无菜单项

TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

发布于 更新于
1

项目简介

TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

TensorRT LLM

安装要求和过程

环境要求

  • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
  • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
  • Python:3.10 或 3.12
  • PyTorch:2.11.0
  • 系统:Linux(主要支持)、Windows、WSL2

快速安装

# 推荐通过 pip 安装最新 release
pip install tensorrt_llm

# 或使用预编译容器(避免环境踩坑)
docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3

# 验证安装
trtllm-serve --help

更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

核心功能

TensorRT LLM 架构分层

  • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
  • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
  • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
  • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
  • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

典型使用场景

TensorRT LLM 核心优化技术

1. 高并发在线服务

在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

2. 本地化推理与边缘部署

通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

3. Agent 与长上下文应用

利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

推荐理由

TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

下载地址

0 点赞
0 收藏
分享
0 讨论
反馈
0 讨论
热门最新
总结
暂无总结
0 / 600