Invocation-Level Reliability of Tool-Using Agents
arxiv.org原文 ↗
在五个开源模型和深度 1 - 8 的多步任务中,作者分别测量工具选择与参数生成,并对比 teacher-forced 与自由运行上下文。深度 6 时约 70% 的干净上下文能力被自身早期错误吞噬;对 869 个中毒步骤和 580 个恢复步骤的 exact-match 结果显示严重度被评分规则固定为 0、恢复不可观测,条件于状态的重评分可把估计推入内部区间。
–浏览
评论 · Comments