Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?
arxiv.org原文 ↗
研究将命令审批、记忆写入、工具选择和历史排序拆成四个带置信区间门槛的微任务。Qwen3 0.6B、1.7B、4B、8B 的 16 个配置全部未达标,4-bit RTN/GPTQ/AWQ 也没有把任何配置推过门槛;Llama-3.x 复测 12/12 仍不合格,说明量化不是弥补能力缺口的捷径。
–浏览
评论 · Comments