AI掀起百年论文纠错革命:顶刊错误率超三成,复现率不足一成

AI正推动对百年科学文献的首次大规模回溯审查,揭示顶刊普遍存在实质性错误:数学类错误占54%,NeurIPS/ICLR论文错误率分别达30.8%和23.8%,且呈上升趋势;AI工具虽具突破性,但检出率有限,复现率极低,多数失败源于技术断层而非造假。

当单场AI顶会ICLR的年投稿量从2018年的1013篇飙升至2026年的近2万篇,科学文献已进入人类个体无法穷尽阅读的‘超载时代’。一个微小的原始错误,一旦被后续研究反复引用,便如病毒般沿引用网络扩散,悄然固化为‘共识性谬误’。由于年代久远、链条冗长、人工复核成本高且激励缺失,这些沉睡在文献库中的错误长期未被系统性触碰。如今,以GPT-5为内核的Paper Correctness Checker等AI工具首次赋予我们回溯式审查百年科研记录的技术能力——但其83.2%的检测准确率背后,仍有约40%的真实错误漏网;数学与公式类错误占比高达54.0%,涵盖方程书写失准、推导逻辑断裂、证明前提虚设等深层缺陷。数据显示:30.8%的NeurIPS论文与23.8%的ICLR论文存在可能扭曲结论的实质性瑕疵;NeurIPS论文平均错误数更在四年间激增55.3%,从2021年的3.8处升至2025年的5.9处。实证复现结果更为严峻:仅34篇论文(占样本不到五分之一)能被AI Agent成功复现超40%的核心结论;仅8篇达到80%以上复现率。需强调的是,‘不可复现’不等于‘学术不端’——它更多源于代码缺失、环境依赖断裂、模型服务下线等工程性断层,其中4篇论文因所用模型永久关停,其结果已彻底不可验证。

来源:量子位

AI 前线

为Hermes打造个性化身:开源‘AI皮肤工坊’支持汉字雨、科幻主题与全维度人格定制

2026-8-11 7:45:11

AI 前线

告别PDF时代:ARA协议开启科研范式革命

2026-8-11 9:45:11

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索