每日 Harness 开源 · Source
返回本期 · Back to 2026-08-24

行业动态 · Industry News2026-08-24 · Monday, August 24, 2026

How we made a text-to-speech model respond in sub-50 ms

nari-labs.com原文 ↗

Nari Labs 把 Qwen3-TTS 的三个模块交给统一调度器,按首音频 deadline、播放耗尽风险和 batch 机会动态排队,并用首段静音裁剪、CUDA graph、KV/卷积状态缓存压低持续解码成本。单 H100 在 10 RPS 达到 p95 可听 TTFA <50ms、约 630 字符/秒,估算满载每百万字符约 2 美元;20 RPS 仍低于 100ms,且实现和基准公开,便于复现实验。
–浏览

评论 · Comments