Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM Reasoning
arxiv.org原文 ↗
TASCO 不再把低熵等同于正确,而是要求置信度在局部前缀扰动下保持稳定;Random Perturbation 约束分布波动,Sharpness-Aware Perturbation 针对最坏敏感方向。模型参数冻结、没有外部 verifier 的条件下,多基准实验同时提升准确率和 token 效率,并避免高置信错误轨迹过早集中。
–浏览
评论 · Comments