每日 Harness 开源 · Source
返回本期 · Back to 2026-09-14

论文 · Papers2026-09-14 · Monday, September 14, 2026

Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning

arxiv.org原文 ↗

Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning
TASCO 不再把低熵等同于正确,而是要求置信度在局部前缀扰动下保持稳定;Random Perturbation 约束分布波动,Sharpness-Aware Perturbation 针对最坏敏感方向。模型参数冻结、没有外部 verifier 的条件下,多基准实验同时提升准确率和 token 效率,并避免高置信错误轨迹过早集中。
–浏览

评论 · Comments