Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
simonwillison.net原文 ↗
Simon Willison 的本地测试认为 Qwen 3.8 27B 已有很强的代码与 agent 能力,但默认推理预算会在中等任务上膨胀,抵消本地部署的延迟优势。社区案例出现约 3 万生成 token 才完成一道适中工程题,通过限制思考长度或关闭 thinking 才改善可用性。文章把“答案能不能做对”与“要花多少 token、功耗和等待时间”放进同一评价函数,这是本地模型选型常被忽略的一半。
–浏览
评论 · Comments