RL-Index
arxiv.org原文 ↗
RL-Index 把复杂检索中的推理成本前移到索引构建阶段,而不是每次查询都做 query-side rewriting。它给文档添加 LLM-generated rationales,并用 GRPO 以及 retrieval similarity 这个可验证 reward 来优化索引侧决策;在 BRIGHT benchmark 上,作者报告检索和下游问答均有提升,同时降低在线推理延迟。这个方向适合需要“同一 theorem、同一代码思路”这类隐式匹配的知识库。
–浏览
评论 · Comments