OpenAI报告显示,AI编码智能体已能参与科研软件重写与优化,但验证、维护和责任仍离不开人类。
冷月清谈:
怜星夜思:
2、科研软件重写时,追求和旧版本完全一致更重要,还是借机修掉旧版本里的历史包袱更重要?
3、文章里说AI经常会自信地犯错,那科研团队应该怎样设计测试,才能放心使用AI写出的代码?
4、AI智能体进入科研软件开发后,会不会让小团队也能维护过去只有大团队才能维护的工具?
原文标题:OpenAI报告展示AI科研工程师进入实验室:智能体参与真实的科学开发流程
原文作者:数据派THU
原文内容
来源:ScienceAI本文约2000字,建议阅读5分钟科学家如何利用编码智能体来现代化科研软件。
过去几十年里,科学计算的发展高度依赖软件。
无论是基因组分析、蛋白质研究,还是物理模拟和数据处理,科研人员每天使用的大量工具,都建立在复杂的软件基础之上。但这些科学软件往往存在一个长期问题:它们重要,却难以维护。
很多关键工具由少数开发者长期维护,随着语言、硬件和计算需求不断变化,旧代码逐渐成为科研发展的瓶颈。重新编写这些软件通常需要投入大量工程时间,而传统开发方式很难同时兼顾准确性、性能和长期维护。
OpenAI 近期发布的「Scientific Computing in the Age of Agentic AI」报告,尝试探索一个新的可能性:如果让具备自主编码能力的 AI 智能体参与科研软件开发,它是否能够帮助研究人员完成过去难以承担的工程任务?
这份报告涵盖了八个主要涉及生命科学领域的智能体辅助科学计算项目;五位仅使用 Codex,三位结合 Codex 和 Claude Code。报告汇集了各项目团队撰写的案例研究,并指出反复出现的主题,并细节描述了从常规维护和有针对性的优化,到大规模语言迁移和 GPU 原生重新设计。
原文链接:https://openai.com/index/scientific-computing-agentic-ai/#case-study-helixforge
科研软件最大的难题
在普通软件开发中,代码能够运行往往已经代表了一部分成功。但科研软件完全不同,对于科学计算工具来说,最重要的反而是前后的一致性。
图示:案例研究项目概述。
以 RNA 测序分析中的 STAR 比对工具为例,这是一款被广泛使用的基因组分析软件,但由于原始项目长期缺少维护,研究人员希望使用 Rust 重新实现一个更加现代化、更容易维护的版本。
可这并非是简单的语言转换。
STAR 原始代码超过 2 万行,涉及复杂的数据结构、算法实现以及大量隐藏行为。如果重新实现后的工具只是在多数情况下「差不多」,那么对于依赖它的科研流程来说,这种误差是无法接受的。
因此,团队没有采用自动代码转换,而是让智能体辅助从零重写,并由研究人员制定架构选择、测试策略以及验证标准。智能体负责大量实现和迭代,人类负责判断哪些结果是真正正确的。
图示:八个智能体编码案例研究的总结。
最终得到的 rustar-aligner 实现了接近原始 STAR 的结果一致性:在单端 RNA-seq 测试中,tie-adjusted parity 达到 99.815%;在双端 RNA-seq 测试中达到 99.883%;同时没有出现仅由某一个工具比对成功的 reads,suffix array 甚至实现了字节级完全一致。
另一个 SVB 项目重新实现了已建立的纳米孔数据压缩编解码器,运行速度是最广泛使用的现有工具的 1.7-2.9 倍,其中 VBZ2 双链解码相比传统三阶段流程提升约 2.32 倍。
反复出现的主题
在多个案例研究中,智能体能够有效处理具体且范围明确的请求,但无法可靠地判断其工作是否具有科学有效性或符合预期。事实上,即使智能体的工作存在明显错误,它们也常常表现出对其推理过程或是结果的自信。
因此,人工评审需要找到可靠的方法来验证结果。最有效的方法是采用外部参考或可衡量的接受标准,例如输出完全一致、与现有工具的对齐程度、合理的统计行为,或使用模拟数据预先确定的答案。
另一个反复出现的主题是,项目通常采用基于反馈的迭代方式分阶段推进,而非一次性完成。贡献者将总体目标拆解为较小的改进任务,然后通过中间基准和测试系统来评估并优化智能体的工作。后者往往能快速实现初步版本,但解决边缘情况和细微的数值差异则耗时更长。完成实现过程中的「最后一公里」通常需要投入最多的工作量。
长期管理的必要性
从报告中的项目来看,智能体在科学计算中的价值已经开始显现。它可以帮助研究人员:
-
重写长期维护困难的软件;
-
探索传统方式难以尝试的优化方案;
-
扩展科研工具的功能边界;
-
缩短从想法到可用软件之间的距离。
但科学计算与普通软件最大的区别,在于结果必须可信。这使得长期管理与责任归属变得至关重要。成熟的科学软件包含未记录的惯例、兼容性要求以及用户信任,而仅靠翻译源代码无法重现这些内容。
在报告提及的案例中,MHCflurry 和 cyvcf2 的修改已整合到其原有的上游项目中,而 rustar-aligner 因原项目已被弃用,转由新的社区负责管理。
OpenAI 提示,在可与现有维护者协调的情况下,应尽早开展合作。当需要独立实现时,必须明确负责人并制定可信的维护计划。否则,今天完成的现代重写可能会演变为明天被废弃的代码,而非可靠的科学基础设施。
从长期来看,编码智能体的价值仍在于人类在「应构建什么」「如何验证」以及「由谁维护」等方面所做的决策。更深层次的变革不仅在于研究人员能够开发出更多软件,更在于他们可以将更多精力投入到工具的定义、验证和管理之中。
报告链接:https://cdn.openai.com/pdf/scientific-computing-in-the-age-of-agentic-ai-an-exploratory-field-report.pdf
编辑:文婧




