每日 Harness 开源 · Source
返回本期 · Back to 2026-07-24

论文 · Papers2026-07-24 · Friday, July 24, 2026

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

arxiv.org原文 ↗

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
论文把 LLM 路由从静态的质量 - 价格二目标扩展为随系统负载变化的质量 - 成本 - 延迟联合决策。方法用排队状态和请求特征估计端到端完成时间,在模型拥塞时动态改派请求;实验显示它能在满足质量约束的同时压低尾延迟,因此适合在线服务,而非只在离线基准上挑“最便宜的正确模型”。
浏览

评论 · Comments