课程介绍
本期围绕 NVIDIA TensorRT-LLM 的大模型推理优化展开,讲解模型转换、精度与量化选择、内核与执行图优化、KV Cache、批处理和并行策略。课程通过实际运行与性能观察,说明如何在吞吐、首 Token 延迟、显存占用和模型质量之间取得平衡。
录像总时长:24 分 51 秒。
配套 Git 仓库:https://qytgit.qytang.com/qytadmin/2026-10-TensorRT-LLM
COURSE RECORDINGS
课程录像
完整录像公开播放,也可以前往原视频平台观看。
B 站01
