Is it agentic enough? Benchmarking open models on your own tooling
huggingface.co原文 ↗
Hugging Face 文章讨论如何在自有工具链上评测开源模型的 agentic 能力。它反对只看通用榜单,因为工具 schema、调用错误、恢复策略和环境延迟都会改变模型表现。更实用的结论是:agentic eval 应该贴近团队实际工具和失败模式,而不是复制一个外部 benchmark 名字。
–浏览
评论 · Comments