每日 Harness 开源 · Source
返回本期 · Back to 2026-06-28

论文 · Papers2026-06-28 · Sunday, June 28, 2026

DSpark: Speculative decoding accelerates LLM inference

github.com原文 ↗

DSpark: Speculative decoding accelerates LLM inference
DeepSeek 这份技术报告讨论 DSpark,用推测解码减少大模型自回归推理中每个 token 都要完整前向的顺序瓶颈。它的基本工程思路是让轻量草稿路径先提出候选 token,再交给目标模型批量验证,目标是在保持输出语义一致的前提下提高吞吐或降低延迟。报告以方法和实验为中心,适合放在推理系统、serving runtime 和模型部署成本的语境里阅读。
浏览

评论 · Comments