[KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn](https://arxiv.org/abs/2608.17150) - KNOWSIM 用带先修关系的信息单元图跟踪用户知识状态,再计算知识增益、交付校准和认知过载三项指标。与 705 场人类 session 对照时,排序与人工判断达到 73 - 74% sign agreement;九个模型的最佳名次会随用户水平改变,说明静态单轮榜单遗漏了适配关系。
arxiv.org原文 ↗
–浏览
评论 · Comments