每日 Harness 开源 · Source
返回本期 · Back to 2026-06-09

论文 · Papers2026-06-09 · Tuesday, June 9, 2026

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

arxiv.org原文 ↗

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs
UnpredictaBench 评估 LLM 采样是否贴近目标分布,而不是只生成多样答案。它包含 448 个问题,覆盖标准统计分布、随机程序诱导分布和自然语言随机过程,并用 KS@N 衡量模型样本与 ground-truth 样本的 Kolmogorov-Smirnov 检验通过率;在 KS@100 上模型分数从接近 0 到 20%+ 不等,没有模型超过 40%。
浏览

评论 · Comments