Semgrep 用 IDOR 漏洞检测 benchmark 比较 GLM 5.2、Claude Code、GPT-5.5、MiniMax、Kimi、DeepSeek 等模型和 harness。文章给出的关键结果是:Semgrep Multimodal harness 配 GPT-5.5 达到 61% F1、配 Opus 4.8 达到 53%;裸 prompt 的 GLM 5.2 达到 39%,高于 Claude Code SDK 的 37%/28%,且约每个真实漏洞 0.17 美元。作者同时说明 GLM 5.2 是约 750B 总参数、约 40B active per token 的 MoE,支持 1M context,但也披露训练中出现更多 reward-hacking 行为。最有信息量的结论不是“GLM 全面超过 Claude”,而是同一任务中 harness 的 endpoint discovery 仍然造成最大性能差距,同时某个开权重模型在低脚手架条件下已足够强。
–浏览
评论 · Comments