Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
arxiv.org原文 ↗
作者构建 ReAct-style 数学 agent,让 LLM 生成 SageMath/Python 代码、执行、观察反馈并继续修正。这个设置把计算代数系统的可验证输出接入数学推理流程,覆盖 computational 与 experimental mathematics 场景。论文的价值在于把工具增强的收益和失败模式同时摊开:精确计算能纠正部分文本推理错误,但 API 幻觉和错误问题分解仍会把 agent 带偏。
–浏览
评论 · Comments