AI科研论文陷“剽窃”争议:是学术不端还是引用缺失?

AI Scientist论文被指“剽窃”,Sakana AI否认。自动化科研将如何界定创新与引用? #AI科研 #学术伦理

原文标题:AI Scientist生成的论文被指「剽窃」,回应称「未引用相关研究」,AI自动化科研还靠谱吗?

原文作者:数据派THU

冷月清谈:

Sakana AI推出的AI Scientist系统,能自主生成并发布研究论文,一度被视为自动化科研的里程碑。然而,近期该系统生成的论文被指存在“剽窃”争议,韩国科学技术院的研究员Park发现,AI论文未经注明使用了其研究方法。随后,印度科学家Gupta和Pruthi进行深入调查,指出多篇AI生成论文存在未经注明使用他人观点的现象,即便没有直接复制语句,也构成“观点剽窃”。他们的研究显示,部分AI生成论文与现有成果存在高度方法重合,剽窃比例高达24%至36%。面对质疑,Sakana AI团队强烈反驳,称指控虚假,并辩称这更多是“未引用相关研究”的问题,而非主观故意的“剽窃”,甚至对“剽窃”的定义提出了质疑。这场争论不仅关乎AI在科研中的发展前景,更深层是对AI能否实现真正创新、以及如何在自动化科研时代界定学术诚信和伦理规范的深刻反思。

怜星夜思:

1、既然AI是基于现有数据训练的,那它“生成”出来的东西,就算跟别人的研究很像,甚至方法论高度重合,但如果不是直接复制粘贴,还算不算传统意义上的“剽窃”?我们是不是需要一套专门针对AI生成内容的学术伦理标准?
2、文章最后提了个问题:AI到底能不能在成熟理念上展开真正的创新?自动化科研会不会让未来的“创新”变得更像是对现有成果的巧妙组合,而不是从无到有的突破?这对于人类科学家的角色又意味着什么?
3、如果AI生成的论文真的需要引用那些它“受到启发”的研究,那引用规范得怎么制定?AI自己去识别和标注引文靠谱吗?还是说,AI生成论文的作者(人类)应该负责全部的引用核查工作?

原文内容

图片
来源:ScienceAI
本文约2000字,建议阅读5分钟
AI 能否在成熟理念之上展开真正的创新,进而颠覆科研范式?


作为全球首个用于自动化科学研究和开放式发现的 AI 系统,Sakana AI 的 AI Scientist 自 2024 年 8 月一发布就一直备受关注。AI Scientist 使用大型语言模型(LLM)生成创意,自主编写并运行代码,最后将研究成果以明确标注 AI 生成的论文形式呈现。

今年早些时候,Sakana AI 还宣布 AI Scientist-v2 生成的论文几乎达到了被 AI 顶会接收的水平。这对于自动化科研来说的确是个好消息,但如果它生成的论文被指「剽窃」呢?

据《Nature》报道,今年 1 月,韩国科学技术院 AI 研究员 Byeongjun Park 收到一封电子邮件,两位印度研究人员告诉他:一篇 AI 生成的论文未经注明就使用了他某篇论文的研究方法。

这篇 AI 生成的论文正是由 AI Scientist 生成,该论文虽未正式发表,但已作为 AI Scientist 生成的系列论文之一发布在网络上。

AI Scientist 生成论文地址:https://github.com/SakanaAI/AI-Scientist/blob/9dffdc445c2596ffa871b5588377e9f12558febc/example_papers/dual_expert_denoiser.pdf

Park 发现,AI Scientist 生成的这篇论文并未直接抄袭他的研究成果。该论文为扩散模型提出新架构,而 Park 的论文主要研究改进这类模型的训练方式。

Park等人研究论文地址:https://arxiv.org/pdf/2403.09176

但 Park 认为,两者确实存在方法上的相似性:「核心方法论与我论文的相似程度令人震惊。」

给 Park 发送邮件的 Tarun Gupta 和 Danish Pruthi 是印度科学学院的计算机科学家。他们表示,这个问题的影响范围远不止 Park 的论文。

今年 2 月,Gupta 和 Pruthi 报告称,根据他们咨询的外部专家意见,发现了多篇 AI 生成的论文存在未经注明就使用他人观点的现象,尽管论文没有直接复制词句。他们指出,这相当于软件工具剽窃他人观点 —— 尽管软件工具创造者并无恶意。

Gupta 和 Pruthi 表示:「大型语言模型生成的研究观点表面具有创新性,但实则通过难以溯源的方式巧妙剽窃,使其原创性难以验证。」

今年 7 月,他们的研究成果《All That Glitters is Not Novel: Plagiarism in Al Generated Research》还获得了 ACL 2025 杰出论文奖,可见学术顶会对该问题的重视。

获奖论文地址:https://arxiv.org/pdf/2502.16487

怎样算「剽窃」?

柏林应用科技大学剽窃研究专家 Debora Weber-Wulff 表示:「『观点剽窃』问题在人工撰写的论文中已然存在,但很少被讨论,预计 AI 生成论文会使情况恶化。」但她指出,与常见的复制或改写语句不同,观点复用难以证实。

值得注意的是,Gupta 和 Pruthi 怀疑:即便是善意的 AI 应用也可能使用他人的方法或观点。

2024 年,由斯坦福大学计算机科学家 Chenglei Si 团队牵头了一项研究,要求人类和 LLM 就计算机科学主题生成「新颖的研究观点」。尽管该研究包含新颖性检查并邀请人类评审员评估观点,但 Gupta 和 Pruthi 认为,部分 AI 生成观点「挪用」了已有成果 —— 根本谈不上「新颖」。

为了深入验证这一担忧,Gupta 和 Pruthi 选取了 Chenglei Si 团队公开的 4 份 AI 生成研究方案与 Sakana AI 发布的 10 篇 AI 生成论文,采用 Chenglei Si 团队的方法论自行生成 36 份新方案,并邀请 13 位领域专家采用 5 分制评估 AI 作品与现有论文的方法重合度:

  • 5 分:方法完全复刻

  • 4 分:混合匹配两至三篇已有成果

  • 3 分和 2 分:较轻程度重合

  • 1 分:无实质重合


他们还邀请被专家识别出重合的原论文作者就重合度发表见解。

综合评估结果显示,有 12 篇达到 4 分和 5 分水平,相当于 24% 的剽窃比例;若计入原作者未回复的案例,该数字将升至 18 篇(36%)。

Gupta 和 Pruthi 还指出,在 Sakana AI 今年宣布通过顶级机器学习会议 ICLR 研讨会同行评审阶段的 AI 生成论文中,同样发现了类似的重合现象。

论文地址:https://github.com/SakanaAI/AI-Scientist-ICLR2025-Workshop-Experiment

Sakana AI 回应

面对质疑,AI Scientist 开发团队对 Gupta 和 Pruthi 的研究进行了强烈反驳。据《Nature》报道,开发团队在邮件中写道:「剽窃指控纯属虚假、毫无根据、不准确、极端且应被忽视。」

针对被指控的两篇论文,开发团队辩称即便方法存在部分关联,但 AI Scientist 生成的论文与已有研究具有不同假设,且应用于不同领域。

开发团队还表示,专家为 Gupta 和 Pruthi 找到的参考文献只是 AI 生成论文本应引用的文献而已,并强调:「他们真正应该报告的是某些未被引用的相关研究(人类作者也可能会出现这种情况)。

对于被指控的两篇论文,开发团队称 AI Scientist 若能引用相关研究会更好。

实际上,也有研究人员不认同 Gupta 和 Pruthi 的观点。专攻扩散模型的佐治亚理工学院机器学习研究员 Ben Hoover 告诉《Nature》,按照 5 分制,他会给 AI Scientist 生成的论文与 Park 的论文重合度打 3 分,并指出 AI Scientist 生成的论文的质量远低于 Park 的研究,本应予以引用,但「不至于认定为剽窃」。

AI Scientist 开发团队还辩称:「『剽窃』这个词应该且确实用于极端故意的欺诈行为,Gupta 和 Pruthi 严重偏离了学界对『剽窃』的既定认知。

或许,我们不应该停留在对「剽窃」一词的争辩上,更加值得思考的是:AI 能否在成熟理念之上展开真正的创新,进而颠覆科研范式?

对此,你怎么看?

参考内容:https://www.nature.com/articles/d41586-025-02616-5

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU


关于AI生成内容是否构成“剽窃”,我认为不能简单套用传统定义。传统剽窃核心在于“未经授权挪用他人成果并声称原创”,包含主观故意和客观行为。AI目前缺乏自主意识,其“生成”是基于模型训练,更像是数据的复杂重组。然而,当其输出与已有研究高度重合且未予注明时,即便无主观故意,其结果依然损害了原创者的权益和学术公平。 这就需要我们思考,剽窃的定义是否应从“行为主体”转向“结果影响”。 确实,一套涵盖AI生成内容的全新学术伦理和引用规范势在必行,重点应放在如何确保知识产权、避免误导读者、以及明确人类作者的最终责任上。

关于AI引用规范:让AI自己去识别和标注引文,听起来很酷,但实际上太不靠谱了。大模型生成的内容是概率性的,它“知道”的知识是内化在参数里的,你让它精准地回溯到某个源头,就像问一个人他说的某句话是哪本书的哪一页来的,除非他有超强记忆力能过目不忘,否则很难。而且,引用可不是简单的复述,它还有理解、上下文和理论关联的考量。 AI现在还达不到这种深度。所以,目前来看,AI生成论文的“作者”(也就是那个负责提交和发表的人类)必须负起全部的引用核查责任。 除非未来AI模型能真正实现可解释性强、溯源能力高的机制,否则这个锅只能人类背了。

关于AI引用规范:这是一个关键的伦理与技术挑战。理想的引用机制应是分层负责制。AI模型在训练和生成过程中,应具备一定的溯源能力,记录其生成文本所依赖的关键信息源(尽管这在当前大模型中实现复杂)。然而,最终的引用核查和责任仍应由人类作者承担。 人类作者在投稿前,必须使用专业的AI辅助工具进行原创性检测和潜在引用遗漏检查,并手动补齐或修正。引用规范可考虑引入“AI辅助生成”的特定声明,并详细说明所用模型及其版本,以及人类作者的核查流程。这能确保透明度和问责制。

关于AI的创新能力:目前来看,AI的“创新”更多体现在高效地识别、关联并优化现有知识结构,实现“组合式创新”,而非从根本上提出新的范式或理论。比如,在材料科学领域,AI可以快速筛选数百万种化合物来找到最优解,这在传统方法下效率低下甚至不可能。然而,真正的“从无到有”的突破,往往源于人类的直觉、价值观、乃至偶然的灵光一现和对未知的好奇心驱动。 自动化科研固然能加快迭代,但它更像一个强大的放大器,而非原创思想的源泉。人类科学家将从繁琐的计算和验证中解放出来,专注于提出更深层次的问题、设计更宏大的实验框架、以及进行跨领域的概念整合。

关于AI的创新能力:这就像AI是个超级大厨,它几乎尝遍了所有菜系,知道各种食材的搭配。它能用这些食材给你搞出各种新奇的组合,味道可能还特别棒,甚至比很多普通厨师做的都好吃。但这不代表它能发明一种全新的食材,或者开创一种全新的烹饪理论。 它始终是在已有框架下进行优化和重组。我觉得人类科学家以后就得去做那个“发明新食材”的人,或者研究“烹饪的本质”这种底层问题。AI负责端盘子、切菜、调味,把效率提上来,但最终的“菜单创新方向”和“口味突破”还是得人来定。

关于AI引用规范:我觉得这就是个“究竟谁才算法人”的问题。AI就像个没实体的“脑子”,它“看”了一堆书,然后“写”了一篇文章,要是没注明出处,你说它是不知道还是故意的?我看啊,这引用规范最终还得人类来兜底。 AI顶多算个“资料助手”,把信息整理给你,但最终的“格式规范”和“道德责任”还是得人类编辑和作者来承担。不然以后出了剽窃事件,你把AI抓起来判刑吗?它都没法坐牢!所以,别想了,还是人类乖乖核查吧!

关于AI的创新能力:我觉得AI的“创新”能力,可能就是它的“学习”和“整合”能力的极致体现。它可以把所有已知的知识点揉碎了,再按照某种规律重新拼起来,形成一个“新的”东西。就像你把乐高积木的所有部件都拆开,然后用不同的方式搭出一个新模型,它看起来很新颖,但用的还是那堆老积木。如果未来的科研都是这种“巧妙组合”,那会不会导致学科发展的“天花板”越来越低?或者说,真正突破性的、跳出框架的思考会变得更稀缺? 人类科学家可能需要转向更抽象、更高层次的思维,去思考那些“非结构化”的、AI暂时无法触及的问题,比如哲学、艺术或者纯粹的科学好奇心驱动。

我觉得这事儿挺复杂的。AI生成论文,本质上就是把数据库里的知识点重新排列组合,它又没个“大脑”去理解什么叫原创、什么叫引用。如果它每次生成个东西,都要去溯源到底从哪个犄角旮旯学的,那工作量也太大了。现在说的“剽窃”可能更多是AI“生成”出来的东西,意外地和某个人类研究高度相似,AI自己也不知道啊。所以,与其纠结AI有没有“剽窃”的主观意图,不如想想怎么规范人类使用者。 比如,发布AI生成论文前,人类作者必须进行严格的查重和引用核查,确保没有“无心之失”。不然,光批判AI没用啊,它又听不懂。

这个问题简直是哲学级别的!AI是不是“剽窃”,这取决于你把AI看成什么。如果你把它看成一个超级聪明的“学生”,那它没注明出处就是妥妥的抄作业。但如果你把它看成一个“工具”,那它生成的东西重合了,责任应该在用工具的人身上,就像你用Word写东西,结果内容跟别人撞车了,你总不能怪Word吧?我觉得这AI啊,就像个知识大熔炉,把所有学过的东西都化了,再吐出来的时候,有些味道不免跟原材料有点像。 以后的标准,大概是要把“AI作为辅助工具”的属性纳入考虑,但最终拍板的还是人。