共计 1069 个字符,预计需要花费 3 分钟才能阅读完成。
Research repository ArXiv will ban authors for a year if they let AI do all the work
预印本平台 ArXiv 正在进一步收紧对 AI 生成论文的管理。针对大语言模型可能带来的虚假引用、错误内容和低质量投稿, 平台计算机科学板块负责人提出了更明确的处罚规则: 如果论文中出现无法否认的证据, 显示作者并未检查 LLM 生成结果, 相关作者可能被禁止在 ArXiv 投稿一年。
📌 预印本平台为何要加码治理
ArXiv 是科研领域使用广泛的开放预印本仓库, 论文通常会在正式同行评审前发布。尽管它并不等同于期刊审稿, 但在计算机科学、数学等领域,ArXiv 已成为研究成果传播的重要渠道, 也常被外界用来观察学术研究趋势。
随着大语言模型被更多研究人员用于写作、润色和整理材料,平台也面临新的质量压力。此前,ArXiv 已要求首次投稿者获得已有作者背书, 以降低低质量内容进入平台的风险。此次新规则则进一步聚焦于“作者是否真正承担核查责任”。
🔍 什么情况可能触发一年禁发
- 论文引用了并不存在或明显虚构的参考文献;
- 正文中残留了写给大模型的提示语, 或大模型回复中的不当注释;
- 直接复制了包含错误、偏见、误导性表述或抄袭风险的生成内容;
- 参考文献、论证过程与论文主题存在明显不一致且未被作者修正。
根据目前披露的规则,若相关问题被确认 , 作者将面临 一年内不得向 ArXiv 投稿 的处罚。禁发期结束后, 其后续提交还需要先被一家有声誉的同行评审机构接收, 才可再次进入 ArXiv。
💡 并非禁止使用 AI, 而是要求作者负责
值得注意的是,这一规则并不是全面禁止研究人员使用大语言模型。ArXiv 强调的重点在于, 无论论文内容是人工撰写、AI 辅助生成, 还是两者结合完成, 作者都必须对最终文本、数据、引用和结论承担完整责任。
在执行层面,这项措施被描述为类似“一次违规即处罚”的规则。不过, 处罚并非自动触发。相关问题需要先由版主标记, 再由板块负责人确认; 作者也将有机会对决定提出申诉。
📊 虚假引用正在成为学术出版的新风险
大模型“幻觉”在学术写作中尤其敏感。与一般文本错误不同, 虚构引用会直接影响论文可信度, 也可能误导后续研究者。近期已有同行评审研究指出, 生物医学研究中的捏造引用正在增加, 而这类现象很可能与 LLM 使用有关。
🚀 对研究者和平台的影响
- 逐条核对参考文献是否真实存在、信息是否准确;
- 删除所有提示词、模型回复痕迹和不应出现在论文中的说明;
- 确认实验结果、数学推导、代码描述与结论一致;
- 对 AI 生成段落进行事实校验, 而不是只做语言润色。