TensorRT 安装配置指南:从零跑通高性能 GPU 推理环境
【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT
想把 PyTorch、ONNX 里训好的模型放到 NVIDIA GPU 上跑得更快,TensorRT 就是标准答案——这个推理加速引擎会在层级别上优化模型、支持低精度计算,把单卡时延压到训练框架够不到的水平。
这篇文章带你把 TensorRT 安装、验证一遍,面向第一次接触它的你。看完你会清楚三件事:环境要备什么、怎么装、装完怎么确认真的跑通。除去下载等待,命令行操作大约 10 分钟。
从模型到推理,TensorRT 到底快在哪
- 层融合与自动调优:相邻算子合并成一个内核,构建时通过计时挑出当前 GPU 上最快的实现。
- 低精度推理:FP16 / BF16 / INT8 都支持,用精度换计算量和显存的明显下降。
- 可序列化引擎:构建一次产出 plan 文件,同硬件设备直接加载就能跑,不用重新编译。
框架侧兼容 ONNX、PyTorch(Torch-TensorRT)、HuggingFace Optimum 等主流导入路径,细节看 导入工作流说明。
动手前,先确认这几项 📋
| 项目 | 版本要求 |
|---|---|
| 操作系统 | Ubuntu 22.04 / 24.04、Rocky Linux 8 / 9,也支持 Windows |
| CUDA | 13.3(默认)或 12.9 |
| cuDNN | 8.9(可选) |
| 构建工具 | CMake ≥ 3.31、GNU make ≥ 4.1 |
| Python | 3.10 – 3.14,pip ≥ 19.0 |
| TensorRT GA 包 | 11.1.0.106(仅源码构建需要) |
别急着装,先把表过一遍。不满足的话,先跳去官方下载页补齐,回来继续;Docker 用户可以直接用仓库里自带的构建镜像,这一节大部分能跳过。
装 & 配:从空环境到能跑
先定路线:一行装主包,还是构建源码
别急着敲构建命令。如果你只想在脚本里用 Python API 建引擎,一条命令就够:
# Python 路线:一行装好,无需构建源码 pip install tensorrt搞完这步 Python 里就能直接import tensorrt。需要 ONNX 解析器、内置插件或 C++ 示例程序的话,接着往下看源码构建。
把底层运行时装好
CUDA 是 TensorRT 的计算底座,没有它什么都跑不起来:
# 以 Ubuntu 为例,安装 CUDA 13.3 sudo apt-get update sudo apt-get install -y cuda-toolkit-13-3 # 检查版本号是否出来 nvcc --version预期输出 V13.3 版本号;如果提示找不到 nvcc,先把/usr/local/cuda/bin加进 PATH。apt 源里没有对应版本时,从 NVIDIA 官网下 runfile 安装即可。
拉源码 & 更新子模块
源码构建要先克隆仓库、初始化子模块:
# 克隆仓库并拉取子模块(含 ONNX 解析器依赖) git clone -b main https://gitcode.com/GitHub_Trending/tens/TensorRT TensorRT cd TensorRT git submodule update --init --recursive搞完这步本地就有了 parsers、plugin、samples 等完整目录结构。
指向 TensorRT GA 包
源码构建需要链接官方二进制,从官方下载页拿到 GA 包并解压后,设置变量:
# 解压后,把 TRT_LIBPATH 指向它的 lib 目录 cd ~/Downloads tar --zstd -xvf TensorRT-11.1.0.106-*.tar.zst export TRT_LIBPATH=$(pwd)/TensorRT-11.1.0.106/lib设完用ls $TRT_LIBPATH应能看到 libnvinfer.so;漏设这个是 cmake 阶段报错最常见的原因。
构建源码
依赖就绪,正式进构建:
cd TensorRT mkdir -p build && cd build # 指定 GA 库位置和输出目录,然后并行构建 cmake .. -DTRT_LIB_DIR=$TRT_LIBPATH -DTRT_OUT_DIR=$(pwd)/out make -j$(nproc)构建成功后build/out/bin/下会生成 trtexec 命令行工具和插件库;如果 cmake 报找不到 CUDA,九成是底层运行时没装对,回到第一步检查。
验证 & 下一步
最短验证命令,按你的路线二选一:
# 源码构建路线 ./build/out/bin/trtexec --version # 或 Python 路线 python -c "import tensorrt; print(tensorrt.__version__)"输出=== TensorRT version 11.1或对应版本号,就说明环境就绪了。
接下来值得看两个地方:用 trtexec 快速基准测试和序列化你自己的 ONNX 模型,看 trtexec 用法;更多 C++ / Python 示例程序,见 samples 目录索引。
【免费下载链接】TensorRTNVIDIA® TensorRT™ is an SDK for high-performance deep learning inference on NVIDIA GPUs. This repository contains the open source components of TensorRT.项目地址: https://gitcode.com/GitHub_Trending/tens/TensorRT
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考