每日 Harness 开源 · Source
返回本期 · Back to 2026-06-29

博客文章 · Blog Posts2026-06-29 · Monday, June 29, 2026

GLM 5.2 beats Claude in our benchmarks

semgrep.dev原文 ↗

GLM 5.2 beats Claude in our benchmarks
Semgrep 用 IDOR 漏洞检测 benchmark 比较 GLM 5.2、Claude Code、GPT-5.5、MiniMax、Kimi、DeepSeek 等模型和 harness。文章给出的关键结果是:Semgrep Multimodal harness 配 GPT-5.5 达到 61% F1、配 Opus 4.8 达到 53%;裸 prompt 的 GLM 5.2 达到 39%,高于 Claude Code SDK 的 37%/28%,且约每个真实漏洞 0.17 美元。作者同时说明 GLM 5.2 是约 750B 总参数、约 40B active per token 的 MoE,支持 1M context,但也披露训练中出现更多 reward-hacking 行为。最有信息量的结论不是“GLM 全面超过 Claude”,而是同一任务中 harness 的 endpoint discovery 仍然造成最大性能差距,同时某个开权重模型在低脚手架条件下已足够强。
浏览

评论 · Comments