k2-fsa/OmniVoice
github.com原文 ↗
OmniVoice 用扩散语言模型式 TTS 覆盖 600 多种语言,支持零样本克隆、声音设计和内联非语言声音。README 给出的实时系数约 0.025,H100 batch=8 从 0.0298 优化到 0.0115,FlashInfer 还有 2 - 2.9 倍无损加速,表现力和吞吐被一起纳入设计。
–浏览
github.com原文 ↗
评论 · Comments