TensorRT-LLM
TensorRT-LLMNVIDIA 的推理加速库
亦作、亦称:NVIDIA TensorRT LLM
NVIDIA 开源的 LLM 推理优化库,通过内核融合、Tensor Core 加速、FP8/FP4 量化和编译期 CUDA 内核定制,在 NVIDIA GPU 上提供最高吞吐量和最低延迟的 LLM 推理。
核心架构
TensorRT-LLM 的架构分为三层:模型定义层(Python API)、编译优化层(TensorRT 引擎)、运行时层(C++ Runtime)。模型定义层提供 PyTorch 风格的 Python API,开发者可以定义 LLM 架构(Transformer、Attention、FFN 等)。编译优化层将 Python 模型编译为 TensorRT 引擎,执行内核融合、Tensor Core 映射、显存优化等编译期优化。运行时层是 C++ 实现的高性能推理引擎,支持 In-Flight Batching(动态批处理)、KV Cache 分页管理、FP8/FP4 量化推理。TensorRT-LLM 的核心优化包括:
- 内核融合——将多个算子合并为单个 CUDA 内核,减少显存访问开销
- Tensor Core 加速——针对 NVIDIA GPU 的矩阵运算硬件单元优化
- FP8/FP4 量化——在 H100+ GPU 上使用低精度推理,速度翻倍
- In-Flight Batching——动态批处理,在 Decode 阶段插入新请求,提高 GPU 利用率
性能基准
2026 年的基准测试(Spheron 2026 年 5 月、Morph 2026 年 6 月)显示,TensorRT-LLM 在 H100 + FP8 条件下达到以下性能:Llama 3.3 70B Instruct 峰值吞吐 10,000+ output tokens/s,首 Token 延迟(TTFT)35-50ms,比 vLLM 快 30-40%。
在 Blackwell GPU(B200/B100)上,TensorRT-LLM 支持 FP4 精度,性能进一步提升 50%。
与 vLLM 和 SGLang 的对比:TensorRT-LLM 在固定模型的长期生产中提供最高吞吐和最低延迟,但模型更换成本高(需要重新编译调优);vLLM 灵活性最好,支持所有 Hugging Face 模型格式,无需编译步骤;SGLang 在前缀重叠率高的场景(RAG、多轮对话)中 TTFT 最低。
选型建议:如果模型固定且需要极限性能,选择 TensorRT-LLM;如果模型频繁更换,选择 vLLM;如果工作负载有大量共享前缀,选择 SGLang。
生态集成
TensorRT-LLM 与 NVIDIA 生态深度集成。NVIDIA NIM(NVIDIA Inference Microservices)提供 TensorRT-LLM 的容器化部署,支持 Kubernetes 编排。Triton Inference Server 支持 TensorRT-LLM 引擎的多模型并发管理。NeMo Framework 提供 TensorRT-LLM 的微调和量化工作流。2026 年的新特性包括:
- Blackwell GPU 原生支持——针对 B200/B100 的 FP4 精度优化
- PyTorch 原生模型定义——使用 PyTorch 风格 API 定义模型,无需学习新框架
- 模块化 Python Runtime——支持自定义算子和调度策略
- 稳定的 LLM API——生产级部署的长期支持。TensorRT-LLM 的局限是学习曲线陡峭,需要理解 CUDA、Tensor Core、内核融合等底层概念。对于大多数团队,建议从 vLLM 开始,遇到性能瓶颈时再考虑迁移到 TensorRT-LLM
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「NVIDIA 的推理加速库」
- 「GPU 推理的极限性能」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是 AI Agent?它与大语言模型(LLM)的本质区别是什么?
AI Agent 是以 LLM 为大脑、能感知环境并自主规划、调用工具、多步执行并按反馈迭代以达成目标的系统;LLM 只是无状态的文本输入到输出函数。
- 中级概念查看详解 →
什么是 GPTCache?它如何帮助降低 AI 应用成本?
GPTCache 是面向 LLM 的语义缓存层,把"问题→回答"缓存,新请求先做语义相似度匹配,命中即返回缓存答案,从而省 token、降延迟、扛并发。
- 中级场景查看详解 →
智能工单分类系统中,AI 可参与哪些环节?技术选型思路是什么?
AI 可参与工单的自动分类打标、意图情绪识别、智能路由、相似聚合去重、知识推荐、回复草稿与 SLA 预警等环节。选型上高频固定类别用轻量分类模型、复杂少样本用 LLM,并可混合编排,配人工复核闭环。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
AI 推理引擎选型实战:vLLM vs SGLang vs TensorRT-LLM 2026 生产级深度对比
2026 年 LLM 推理引擎市场已形成三足鼎立格局:vLLM 以灵活性称王、SGLang 以 RadixAttention 前缀缓存称霸低延迟场景、TensorRT-LLM 以编译优化统治极限吞吐。本文基于 H100 80GB + Llama 3.3 70B Instruct FP8 基准测试,从架构原理、性能数据、部署复杂度、适用场景四个维度做生产级深度对比,附带完整选型决策树和代码示例。
- 2
本地大模型部署实战:Ollama + vLLM + 量化指南
系统掌握在本地和私有环境中部署大语言模型的完整方案。2026-06-15 更新:新增 vLLM v0.7.3 Blackwell GPU 支持、SGLang v0.4.3 前缀缓存对比、FP8 量化实战、NVIDIA NIM 容器化部署,以及 Ollama 4.0 的多模型并发管理能力。覆盖从模型量化到推理服务的全流程实践。
外部参考
维基百科:查看「TensorRT-LLM」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
