这篇把 Agentic RAG 的 planner、evaluator、generator 阶段都变成不确定性信号源,再通过 Bayesian Network 汇总系统级失败风险和节点级故障指示。实验用 StrategyQA、HotpotQA、GPT-3.5-Turbo、GPT-4.1-Nano,并以 AUROC、AUARC、ECE、Brier Score 衡量 discrimination、selective prediction 和 calibration。HotpotQA 上不确定性跨多跳累积更适合 Bayesian propagation,而 StrategyQA 暴露上游信号误校准问题;这使它更像早期 monitor 机制,而非已经闭环的 RAG 可靠性方案。
–浏览
评论 · Comments