DiffusionGemma: 4x Faster Text Generation
blog.google原文 ↗
Google 发布 DiffusionGemma,一个 Apache 2.0 的 26B Mixture-of-Experts 实验开放模型,推理时只激活 3.8B 参数。它用文本 diffusion 一次生成 256-token block,再迭代 refine,而不是自回归逐 token 解码;Google 称专用 GPU 上最高 4x faster,单 H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。文章也明确写出 trade-off:质量低于标准 Gemma 4,更适合低到中 batch、本地交互、inline editing、code infilling 等 latency-sensitive 场景。它的重要信息不是“扩散生成替代 LLM”,而是低并发本地推理的硬件利用方式开始分叉。
–浏览
评论 · Comments