每日 Harness 开源 · Source
返回本期 · Back to 2026-08-19

论文 · Papers2026-08-19 · Wednesday, August 19, 2026

From LLM Inference to Agentic Workloads

arxiv.org原文 ↗

From LLM Inference to Agentic Workloads
AgentSysBench 用 10 个真实代理应用刻画模型推理、沙箱、工具和持久状态共同形成的系统负载;其中 5 个应用的非 LLM 阶段反而占主导,单个沙箱工作集可达 28 GB。不同阶段的延迟与资源需求最高相差 32 倍,针对性服务、放置和状态卸载分别带来 29% - 40% 延迟下降、4.5 倍吞吐提升和 4.6 倍内存缩减。论文的系统贡献是证明“只优化 token 生成”无法解释也无法解决代理基础设施瓶颈。
浏览

评论 · Comments