每日 Harness 开源 · Source
返回本期 · Back to 2026-09-14

论文 · Papers2026-09-14 · Monday, September 14, 2026

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization

arxiv.org原文 ↗

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
COBRA-Skills 把 skill 迭代看成候选空间会变化的预算化序列决策,用上下文 bandit 把评估次数投给最有希望或最有信息量的候选,再用执行反馈更新 skill 群体。六个异质基准、三种目标模型上,它比 SkillOpt 少花 55 - 58% 优化成本,每基准仅需 50 个独立样本,换 harness 或让目标模型自生成时仍稳健。
–浏览

评论 · Comments