Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
arxiv.org原文 ↗
论文把 LLM 路由从静态的质量 - 价格二目标扩展为随系统负载变化的质量 - 成本 - 延迟联合决策。方法用排队状态和请求特征估计端到端完成时间,在模型拥塞时动态改派请求;实验显示它能在满足质量约束的同时压低尾延迟,因此适合在线服务,而非只在离线基准上挑“最便宜的正确模型”。
–浏览
评论 · Comments