SpeechCompass
github.com原文 ↗
SpeechCompass 是 Google DeepMind 开源的方向感知群聊字幕系统。它把说话人方位作为多人对话 captioning 的输入线索,用空间信息帮助分离、归属和阅读,而不是只依赖音频转文本。对于会议、无障碍和多人录音处理,这类空间增强字幕比普通 speaker diarization 更接近真实场景。
–浏览
github.com原文 ↗
评论 · Comments