每日 Harness 开源 · Source
返回本期 · Back to 2026-06-12

行业动态 · Industry News2026-06-12 · Friday, June 12, 2026

DiffusionGemma: 4x Faster Text Generation

blog.google原文 ↗

Google 发布 DiffusionGemma,一个 Apache 2.0 的 26B Mixture-of-Experts 实验开放模型,推理时只激活 3.8B 参数。它用文本 diffusion 一次生成 256-token block,再迭代 refine,而不是自回归逐 token 解码;Google 称专用 GPU 上最高 4x faster,单 H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。文章也明确写出 trade-off:质量低于标准 Gemma 4,更适合低到中 batch、本地交互、inline editing、code infilling 等 latency-sensitive 场景。它的重要信息不是“扩散生成替代 LLM”,而是低并发本地推理的硬件利用方式开始分叉。
浏览

评论 · Comments