COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
arxiv.org原文 ↗
COBRA-Skills 把 skill 迭代看成候选空间会变化的预算化序列决策,用上下文 bandit 把评估次数投给最有希望或最有信息量的候选,再用执行反馈更新 skill 群体。六个异质基准、三种目标模型上,它比 SkillOpt 少花 55 - 58% 优化成本,每基准仅需 50 个独立样本,换 harness 或让目标模型自生成时仍稳健。
–浏览
评论 · Comments