DiffusionGemma Technical Report
arxiv.org原文 ↗
论文不是从零训练扩散模型,而是在 Gemma 4 MoE(3.8B 激活、25.2B 总参数)上用不到 10% 的原始训练 token 做两阶段微调:先学双向去噪,再用 RL 与采样器蒸馏兼顾质量和速度。评测平均每次前向生成约 20 token,并在 H100 上达到约 1,500 tokens/s;同时保留自回归模式,给实际部署留下回退路径。
–浏览
arxiv.org原文 ↗
评论 · Comments