短短19天内,一个人通过AI智能体复现了363篇论文
DRPP科研工作台上新科研工具,从文献检索到参考文献格式调整:去使用科研工作台>>
本文来源Science网站的一篇报道,原文题目是“Researchers presented 6000 papers at a major meeting. Could AI reproduce their findings?”
2026年8月,Jansen Tang在一场竞赛中拔得头筹。该竞赛要求参赛者利用AI复现国际机器学习大会(ICML)上发表的数千篇论文的研究结果。在短短19天内,Jansen Tang成功复现了高达363篇前沿论文,在1200多名参赛者中位居榜首。
Jansen Tang坦言,自己并非AI研究员。他成功的秘诀是什么?是他组建的AI智能体(Agent)团队。这些AI模型被设计为能自主执行特定任务。
这场黑客马拉松由计算与研究社区平台 Hugging Face 和 alphaXiv 联合举办,提出了一个极具野心的问题:在人类审稿人越来越难以应对的情况下,AI智能体能否实现大规模的科学工作核查?换言之,如果提供论文的数据、代码和方法,AI能否独立复现实验并得出相同的结果?
这是迄今为止利用AI复现顶级技术会议论文最大规模的一次尝试。与Jansen Tang一样,许多参赛者并非AI科班出身。尽管如此,他们最终共处理了2000多篇论文,并发现了数百个AI智能体无法复现或缺乏证据支持的结果,其中仅Jansen Tang的智能体就找出了21个。截至目前,黑客马拉松的组织者已确认,至少有十几篇论文发现了人类审稿人未能发现的实质性错误。
支持者表示,这一努力凸显了AI在帮助人类同行评审、提升日益激增的会议论文质量方面的潜在价值。此次黑客马拉松组织者之一Abubakar Abid表示:“我们已经证明,在理想情况下,每次提交论文时,智能体都会尝试复现,许多显而易见的问题会当场被发现。这将极大地维护科学研究的完整性。”
近年来,计算机科学会议的投稿量呈爆炸式增长。今年,ICML 接收了约6000篇论文,几乎是去年的两倍。但人类审稿人的数量并未同步增长,这种失衡已将同行评审系统推向了崩溃的边缘。
AI能否辅助同行评审引发了激烈争论,因为评审过程通常需要对研究的新颖性或重要性做出判断。理想情况下,这些判断应由人类专家在同行评审中完成。但在现实中,复现一项研究往往需要繁琐的“侦探工作”,去搜集散落在互联网各处的数据、代码和其他附件。此外,复现工作几乎不能带来任何职业回报。
但这恰恰可能是最适合AI承担的“吃力不讨好”的工作,尤其是对于机器学习领域的研究而言。与其他依赖物理实验室的学科不同,机器学习研究的复现有时只需运行随附的代码即可。
为了验证这一设想,黑客马拉松团队首先提取了ICML接收的6000多篇论文中的核心成果。接下来,由智能体确认这些结果能否使用研究附带的代码和数据来生成。在原始数据不可用的情况下,智能体可以寻找或生成类似的数据集,进行所谓的“玩具级(toy)复现”。
所有这些工作都被记录在日志中,许多日志包含了AI行动和推理的完整追踪过程。最后,由大语言模型 GLM-5.2 担任“裁判”,阅读每份日志并对每个结果给出四种裁决之一:已验证、被证伪、玩具级复现、不确定。
在被审查的2226篇论文中,约有一半论文至少有一个结果被AI独立验证,266篇的所有结果均被成功复现。另有502篇仅有“玩具级”证据,280篇因数据不可用等因素被判定为“不确定”。
有496篇论文至少包含一个被证伪(即参赛者得出了与原论文不同的结果)或存在争议的结果(即不同的复现团队得出了截然相反的裁决结果)。“
目前,Hugging Face 正在对AI的发现进行复查。迄今为止,他们已确认至少有12篇论文做出了错误声明。在其中一篇被评为“聚光灯(spotlight)”论文并获得极高评审分数的文章中,其实早有预警,一位人类审稿人写道:“我给出低置信度分数,是因为我没有仔细核查所有的证明。”在 Abid 看来,一些被证伪的结果甚至严重到足以让论文的核心论点变得完全错误:“在某些情况下,我认为这篇论文当初根本就不应该被发表。”
在其他案例中,问题则更为细节。例如,AI智能体标记出了麻省理工学院博士生 Idan Shenfeld 的一篇论文中的差异。该研究关注AI模型在部署后如何持续学习,尽管论文的理论分析指向一种方法,但实验却表明另一种方法效果更好。Shenfeld 此前已经在其他公共代码库中修正了这个错误,但忘了更新论文。尽管如此,Shenfeld 表示,看到智能体抓住了ICML 人类审稿人所遗漏的细节,还是令人备受鼓舞。
这次黑客马拉松并非是AI智能体复现论文的唯一尝试。上个月,芝加哥大学计算机科学家、初创公司 SAI Labs 联合创始人Chenhao Tan将目标锁定在会议的120篇口头报告论文上,这些通常被认为是会议中质量最高的论文。使用 SAI 的开源智能体后,仅有8篇论文有超过80%的结果被成功复现。还有几篇论文的复现成本高得令人望而却步,据估算,重新运行实验所需的硬件和计算资源成本可能高达220万美元。
获取专有数据和代码是另一个普遍存在的障碍,因为在企业主导的研究中,外部研究人员往往无法获取这些数据。让复现变得更容易的一个方法是,会议要求作者提交完整的代码和数据。但卡内基梅隆大学研究计算机科学与AI稿件评审的 Nihar Shah 表示,这本身也可能带来代价。他说,企业可能会干脆决定不参与。
不过,另一种选择就是接受许多已发表的声明可能永远无法被核查的现实。“论文中的许多结论从未被任何人验证过,它们很可能就是错的,如果我们把未来的知识建立在这些声明之上,那地基就是摇摇欲坠的。”
本文整理自:https://www.science.org/content/article/researchers-presented-6000-papers-major-meeting-could-ai-reproduce-their-findings
