Rethinking the CPU-GPU split for LLM inference
redhat.com原文 ↗
Red Hat 讨论在 LLM 推理中重新划分 CPU 与 GPU 的工作,把部分不必占用昂贵加速器的阶段或算子移回 CPU。该方向的评价标准应是端到端吞吐、首 token 延迟、互连开销和总成本,而不是单个设备利用率。异构拆分只有在数据搬运没有吞掉计算收益时成立,因此它更像部署级调度问题,而非“CPU 替代 GPU”的口号。
–浏览
评论 · Comments