OpenAI报告:AI编码智能体开始参与真实科研软件开发,但关键仍在人类验证

OpenAI报告显示,AI编码智能体已能参与科研软件重写与优化,但验证、维护和责任仍离不开人类。

冷月清谈:

OpenAI近期发布报告《Scientific Computing in the Age of Agentic AI》,展示了编码智能体在科学计算项目中的实际应用。报告涵盖8个以生命科学为主的案例,涉及科研软件重写、性能优化、语言迁移和GPU原生改造等任务。文章指出,科研软件与普通软件不同,核心不是“能跑”,而是结果必须长期可信、可复现、与既有工具保持一致。例如STAR比对工具的Rust重写项目中,智能体承担大量实现和迭代工作,人类研究者负责架构、测试和科学有效性判断,最终在RNA-seq测试中达到接近原工具的结果一致性。报告也强调,智能体擅长处理边界清晰的工程任务,但无法可靠判断科学正确性,甚至会自信地产生错误。因此,外部参考、基准测试、模拟数据和人工评审仍是必要环节。文章最后提醒,科研软件的长期维护、责任归属和社区治理同样重要,否则现代化重写也可能变成新的废弃代码。

怜星夜思:

1、如果AI智能体能重写科研软件,科研人员以后还需要自己懂编程吗?
2、科研软件重写时,追求和旧版本完全一致更重要,还是借机修掉旧版本里的历史包袱更重要?
3、文章里说AI经常会自信地犯错,那科研团队应该怎样设计测试,才能放心使用AI写出的代码?
4、AI智能体进入科研软件开发后,会不会让小团队也能维护过去只有大团队才能维护的工具?

原文标题:OpenAI报告展示AI科研工程师进入实验室:智能体参与真实的科学开发流程

原文作者:数据派THU

原文内容

图片
来源:ScienceAI
本文约2000字,建议阅读5分钟
科学家如何利用编码智能体来现代化科研软件。


过去几十年里,科学计算的发展高度依赖软件。

无论是基因组分析、蛋白质研究,还是物理模拟和数据处理,科研人员每天使用的大量工具,都建立在复杂的软件基础之上。但这些科学软件往往存在一个长期问题:它们重要,却难以维护。

很多关键工具由少数开发者长期维护,随着语言、硬件和计算需求不断变化,旧代码逐渐成为科研发展的瓶颈。重新编写这些软件通常需要投入大量工程时间,而传统开发方式很难同时兼顾准确性、性能和长期维护。

OpenAI 近期发布的「Scientific Computing in the Age of Agentic AI」报告,尝试探索一个新的可能性:如果让具备自主编码能力的 AI 智能体参与科研软件开发,它是否能够帮助研究人员完成过去难以承担的工程任务?

这份报告涵盖了八个主要涉及生命科学领域的智能体辅助科学计算项目;五位仅使用 Codex,三位结合 Codex 和 Claude Code。报告汇集了各项目团队撰写的案例研究,并指出反复出现的主题,并细节描述了从常规维护和有针对性的优化,到大规模语言迁移和 GPU 原生重新设计。

原文链接:https://openai.com/index/scientific-computing-agentic-ai/#case-study-helixforge

科研软件最大的难题

在普通软件开发中,代码能够运行往往已经代表了一部分成功。但科研软件完全不同,对于科学计算工具来说,最重要的反而是前后的一致性。

图示:案例研究项目概述。

以 RNA 测序分析中的 STAR 比对工具为例,这是一款被广泛使用的基因组分析软件,但由于原始项目长期缺少维护,研究人员希望使用 Rust 重新实现一个更加现代化、更容易维护的版本。

可这并非是简单的语言转换。

STAR 原始代码超过 2 万行,涉及复杂的数据结构、算法实现以及大量隐藏行为。如果重新实现后的工具只是在多数情况下「差不多」,那么对于依赖它的科研流程来说,这种误差是无法接受的。

因此,团队没有采用自动代码转换,而是让智能体辅助从零重写,并由研究人员制定架构选择、测试策略以及验证标准。智能体负责大量实现和迭代,人类负责判断哪些结果是真正正确的。

图示:八个智能体编码案例研究的总结。

最终得到的 rustar-aligner 实现了接近原始 STAR 的结果一致性:在单端 RNA-seq 测试中,tie-adjusted parity 达到 99.815%;在双端 RNA-seq 测试中达到 99.883%;同时没有出现仅由某一个工具比对成功的 reads,suffix array 甚至实现了字节级完全一致。

另一个 SVB 项目重新实现了已建立的纳米孔数据压缩编解码器,运行速度是最广泛使用的现有工具的 1.7-2.9 倍,其中 VBZ2 双链解码相比传统三阶段流程提升约 2.32 倍。

反复出现的主题

在多个案例研究中,智能体能够有效处理具体且范围明确的请求,但无法可靠地判断其工作是否具有科学有效性或符合预期。事实上,即使智能体的工作存在明显错误,它们也常常表现出对其推理过程或是结果的自信。

因此,人工评审需要找到可靠的方法来验证结果。最有效的方法是采用外部参考或可衡量的接受标准,例如输出完全一致、与现有工具的对齐程度、合理的统计行为,或使用模拟数据预先确定的答案。

另一个反复出现的主题是,项目通常采用基于反馈的迭代方式分阶段推进,而非一次性完成。贡献者将总体目标拆解为较小的改进任务,然后通过中间基准和测试系统来评估并优化智能体的工作。后者往往能快速实现初步版本,但解决边缘情况和细微的数值差异则耗时更长。完成实现过程中的「最后一公里」通常需要投入最多的工作量。

长期管理的必要性

从报告中的项目来看,智能体在科学计算中的价值已经开始显现。它可以帮助研究人员:

  • 重写长期维护困难的软件;

  • 探索传统方式难以尝试的优化方案;

  • 扩展科研工具的功能边界;

  • 缩短从想法到可用软件之间的距离。


但科学计算与普通软件最大的区别,在于结果必须可信。这使得长期管理与责任归属变得至关重要。成熟的科学软件包含未记录的惯例、兼容性要求以及用户信任,而仅靠翻译源代码无法重现这些内容。

在报告提及的案例中,MHCflurry 和 cyvcf2 的修改已整合到其原有的上游项目中,而 rustar-aligner 因原项目已被弃用,转由新的社区负责管理。

OpenAI 提示,在可与现有维护者协调的情况下,应尽早开展合作。当需要独立实现时,必须明确负责人并制定可信的维护计划。否则,今天完成的现代重写可能会演变为明天被废弃的代码,而非可靠的科学基础设施。

从长期来看,编码智能体的价值仍在于人类在「应构建什么」「如何验证」以及「由谁维护」等方面所做的决策。更深层次的变革不仅在于研究人员能够开发出更多软件,更在于他们可以将更多精力投入到工具的定义、验证和管理之中。

报告链接:https://cdn.openai.com/pdf/scientific-computing-in-the-age-of-agentic-ai-an-exploratory-field-report.pdf

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



针对这个问题,比较靠谱的办法是先定义“可接受误差”。有些任务要求字节级一致,有些数值模拟允许浮点误差,有些统计模型看分布是否合理。测试标准如果一开始不写清楚,后面就会变成玄学争论。

2 个赞

别只让AI写代码,也可以让另一个工具或另一套方法做交叉验证。一个AI写实现,一个基准程序跑对照,人类看差异。听起来麻烦,但科研里这点麻烦比发错结果便宜多了。

3 个赞

我觉得要把AI当成一个很能干但会嘴硬的实习生。它交代码可以,但必须过单元测试、集成测试、性能测试,还要有人review。不能因为它解释得头头是道,就默认它真的懂。

1 个赞

这个问题有点像问“有了计算器还要不要学数学”。不用天天手算,但你得知道按出来的结果离不离谱。科研编程也是一样,AI可以帮你搬砖,但你得知道这堵墙能不能承重。

1 个赞

能,但前提是别把AI当免费全职工程师。它更像外骨骼,能让你搬得动更重的东西,但你自己骨头太脆、方向乱走,还是会摔。