当单场AI顶会ICLR的年投稿量从2018年的1013篇飙升至2026年的近2万篇,科学文献已进入人类个体无法穷尽阅读的‘超载时代’。一个微小的原始错误,一旦被后续研究反复引用,便如病毒般沿引用网络扩散,悄然固化为‘共识性谬误’。由于年代久远、链条冗长、人工复核成本高且激励缺失,这些沉睡在文献库中的错误长期未被系统性触碰。如今,以GPT-5为内核的Paper Correctness Checker等AI工具首次赋予我们回溯式审查百年科研记录的技术能力——但其83.2%的检测准确率背后,仍有约40%的真实错误漏网;数学与公式类错误占比高达54.0%,涵盖方程书写失准、推导逻辑断裂、证明前提虚设等深层缺陷。数据显示:30.8%的NeurIPS论文与23.8%的ICLR论文存在可能扭曲结论的实质性瑕疵;NeurIPS论文平均错误数更在四年间激增55.3%,从2021年的3.8处升至2025年的5.9处。实证复现结果更为严峻:仅34篇论文(占样本不到五分之一)能被AI Agent成功复现超40%的核心结论;仅8篇达到80%以上复现率。需强调的是,‘不可复现’不等于‘学术不端’——它更多源于代码缺失、环境依赖断裂、模型服务下线等工程性断层,其中4篇论文因所用模型永久关停,其结果已彻底不可验证。
来源:量子位
