Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses
arxiv.org原文 ↗
论文把 ChatGPT、Claude、Grok、DeepSeek 的搜索决策、查询策略、来源偏好和引用落地放在同一生命周期里,结合真实交互与 API 受控实验。四个平台调用搜索的频率差异很大,且更常搜索并不自动带来更好的回答;结果域名存在平台偏好,最终回答也会使用未被引用的搜索结果。对代理搜索的评估因此不能只看检索召回,还要检查“为何搜索”和“哪些证据被写进答案”。
–浏览
评论 · Comments