AutoTuneBench: Trustworthy Measurement for Agent Auto-Tuning of LLM Serving Engines
arxiv.org原文 ↗
研究用四天 619 次调用揭出草台基线、跨机计时、饱和任务和基础设施缺陷四类假提升。协议把校验器放在 agent 修改面之外,并以配对种子和 5% 变异系数门槛约束结果;示例中 naive baseline 的 10.6x 只剩 honest baseline 的 2.03x。
–浏览
评论 · Comments