该基准先从 TeX Stack Exchange、GitHub 修复提交和包文档中核实 168 个 LaTeX 硬崩溃,做出 18 类故障 taxonomy,再以 48 个 AST-aware 算子扩展到 LaTeX、Typst 和 Markdown。最终包含 10,437 个实例、743 个开放许可种子、七个模型和 48,651 次尝试;基于真实错误分布的 DocMut 比模式突变难 5.6 - 9.2 个点。更关键的是,在 28,129 个已经能编译的修复里仍有 13.6% - 18.5% 实质改变正文,编译率排名也不等于内容恢复排名,这给“测试通过即修好”加了一层必要的语义检查。
–浏览
评论 · Comments