sgl-project/sglang-omni
github.com原文 ↗
SGLang-Omni 把全模态推理拆为预处理、编码器、自回归模型、talker、解码器、vocoder 和聚合器等 stage,再独立调度并跨设备传输。传输层覆盖共享内存、NCCL、NIXL 与 Mooncake,服务提供 OpenAI 兼容接口;CUDA 支持完整,XPU 尚属实验性。MiniMax Music 3 的 32kHz 立体声和 MOSS 的 48kHz 输出表明这套运行时在处理真正不同的数据速率,而不是只给文本框增加音频附件。
–浏览
评论 · Comments