共计 1170 个字符,预计需要花费 3 分钟才能阅读完成。
AI 不只会写论文, 也开始帮人“查论文”。 近期围绕顶级 AI 会议论文复现与错误检测的多项尝试显示, 许多已经发表或接收的研究, 在可验证性上仍存在明显短板。这并不等同于“论文造假”, 但足以提醒学术界: 发表只是开始, 复核正在变得更重要。
📌 顶会论文为何会被 AI 重新审视
在传统同行评审中, 审稿人通常会关注方法、实验设计和结论合理性 , 但很难逐项下载数据、配置环境、运行代码并完整复现实验。随着 AI 研究规模扩大, 论文背后的模型、数据、依赖库和参数设置越来越复杂, 任何一个细节缺失都可能让结果难以验证。
AI Agent 的出现降低了这类复现工作的门槛。 它可以辅助阅读论文、定位结论性声明、检查代码仓库、运行实验脚本 , 并把复现结果与论文表述进行对照。换句话说, 过去成本极高的“学术复查”, 正在被自动化工具推向更大规模。
🔍 ICML 论文复现审计暴露哪些问题
有研究审查机构对 ICML 2026 口头报告论文进行系统性复现审计 。在全部 168 篇口头报告论文中, 有 92 篇包含至少 5 条可验证的结论性声明。审计结果显示,AI Agent 能够成功复现超过四成结论的论文为 34 篇; 能复现八成以上结论的仅有 8 篇。
材料中提到的具体问题包括: 有论文宣称仅训练基础模型 0.77% 的参数, 但开源 checkpoint 显示训练比例为 6.31%; 也有论文展示了基于某评判模型的表格, 却未在开源代码中提供相关模型或生成脚本。
💡 论文错误检测显示: 客观问题并不少见
除复现实验外,AI 也被用于检查已发表论文中的客观错误 。相关研究使用基于 GPT- 5 的论文检查系统, 面向顶级 AI 会议和期刊论文, 重点识别可客观验证的问题, 而不评价创新性或学术价值。
该研究给出的结果颇具冲击力: 平均每篇论文被检测出 4.7 个客观错误,99.2% 的论文至少被标记出一个问题 。错误类型中, 数学与公式相关问题占比最高, 包括方程式错误、推导漏洞、证明中存在不当假设等。
- 公式与数学错误: 占比约 54.0%, 是最常见类别。
- 影响解读的实质性错误: 部分 NeurIPS 与 ICLR 论文被标记出此类问题。
- 错误数量变化: 材料显示 NeurIPS 论文篇均错误数从 2021 年的 3.8 个升至 2025 年的 5.9 个。
📊 看点:AI 可能重整“旧知识”的可信度
围绕“AI 倒查论文 100 年!99.2% 的顶刊都有问题 …”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。
🚀 重点阅读:AI 核查不能替代学术判断
- 对作者而言, 代码、数据、依赖和实验脚本的完整性将更受关注。
- 对审稿与出版体系而言, 复现材料可能从“加分项”变成“基本项”。
- 对年轻研究者而言, 复查经典结论、梳理错误传播链, 也可能成为新的研究入口。