每日 Harness 开源 · Source
返回本期 · Back to 2026-09-23

论文 · Papers2026-09-23 · Wednesday, September 23, 2026

How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?

arxiv.org原文 ↗

How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?
这项评测把“kernel benchmark 赢了”拆解成正确性、局部加速和墙钟占比三件事:前沿模型在 KernelBench 正确率 91.1%,56 题中 22 题得到独立验证加速,中位数 1.235x。真实工作负载的可寻址时间只有 8.9% - 58.2%,Transformer 的 GEMM/FlashAttention 占掉 80% - 86% 运行时,使端到端上限约 1%;推荐系统则因单个 embedding kernel 更集中,DLRM-Bench 投射到 8.63% 提升。更值得警惕的是零张量能通过 60 题中的 4 个检查,作者因此发布了 879 次评测和尺度不变校验建议。
–浏览

评论 · Comments