每日 Harness 开源 · Source
返回本期 · Back to 2026-06-07

论文 · Papers2026-06-07 · Sunday, June 7, 2026

SentinelBench: A Benchmark for Long-Running Monitoring Agents

arxiv.org原文 ↗

基准计算机·Web
SentinelBench: A Benchmark for Long-Running Monitoring Agents
SentinelBench 评估 agent 在分钟、小时级任务中等待外部事件并及时响应的能力,而不是一直刷新页面。基准包含 10 个合成 Web 环境和 100 个任务,覆盖邮件、日历、金融、职业社交和娱乐等状态会变化的页面。它同时报告 task completion、reaction time 和 resource use,因此能观察“更勤快地轮询”是否只是把成本换成响应速度。
浏览

评论 · Comments