How we made a text-to-speech model respond in sub-50 ms
nari-labs.com原文 ↗
Nari Labs 把 Qwen3-TTS 的三个模块交给统一调度器,按首音频 deadline、播放耗尽风险和 batch 机会动态排队,并用首段静音裁剪、CUDA graph、KV/卷积状态缓存压低持续解码成本。单 H100 在 10 RPS 达到 p95 可听 TTFA <50ms、约 630 字符/秒,估算满载每百万字符约 2 美元;20 RPS 仍低于 100ms,且实现和基准公开,便于复现实验。
–浏览
评论 · Comments