NVIDIA/TensorRT-LLM
github.com原文 ↗
TensorRT-LLM 以专用 kernel 和高性能 Python/C++ runtime 优化 NVIDIA 上的 LLM 与视觉生成推理。近期技术博客覆盖视频生成量化、trace replay 的 agentic serving 指标、Blackwell 上 DeepSeek 和 NVLink MoE 通信,反映它从单请求延迟优化走向模型与服务联合调参。
–浏览
github.com原文 ↗
评论 · Comments