模型与研究

OpenAI 说,科学计算进入 agentic AI 时代,但真正的瓶颈是验证

OpenAI 发布针对科研计算的 field report,指出 agent 已能在迁移、维护和优化等明确工程任务上显著提升效率,但真正的瓶颈已转向验证、责任归属与长期维护。报告强调研究者角色从实现者转为验证者和编排者,需投入更多精力构建可靠的测试和验证框架。

OpenAI 说,科学计算进入 agentic AI 时代,但真正的瓶颈是验证

OpenAI 发布针对科研计算的 field report,指出 agent 已能在迁移、维护和优化等明确工程任务上显著提升效率,但真正的瓶颈已转向验证、责任归属与长期维护。报告强调研究者角色从实现者转为验证者和编排者,需投入更多精力构建可靠的测试和验证框架。

OpenAI 7 月 28 日发布《Scientific computing in the age of agentic AI》及配套论文《Scientific computing in the age of agentic AI: an exploratory field report》,称其从 8 个以生命科学为主的案例看到,编码代理已经能帮助科研团队 модерnize 旧有科研软件、加速迁移和维护;但随着代码生成本身变得更便宜,新的瓶颈反而转向了验证、责任归属和长期维护。

这份报告不是一个单一模型发布,也不是一个新产品的公开演示,而是 OpenAI 对“代理能在科学计算里做什么”给出的阶段性判断。它与 OpenAI 近几周围绕科研判断、工作流代理和评测质量的一系列文章形成连续叙事:7 月初的 GeneBench-Pro 试图衡量模型在计算生物学里处理歧义和判断的能力;ChatGPT agent 则把浏览器、终端和连接器整合到一个统一的代理系统中;而对编码基准噪声的审计也提醒外界,评测本身并不天然可靠。AIFlux 之前对 OpenAI 编码评测噪声审计ChatGPT Work 的报道,也都指向同一个方向:AI 叙事正从“会不会回答”转向“能不能把事情做完”。

八个案例,覆盖从维护到重写

OpenAI 说,这份 field report 汇集了 8 个 agent-assisted 科学计算项目,其中 5 个只使用 Codex,另 3 个结合了 Codex 和 Claude Code。项目范围从基础维护、包装和兼容性迁移,到性能优化、跨语言重写,再到面向新硬件架构的重设计,主要集中在生物信息学、基因组学和相关的数据密集型研究软件上。

报告给出的核心判断是:agent 已经足以在很多“有清晰目标、可验证结果”的工程任务上显著减轻劳动,但研究人员并没有因此退出流程。相反,他们的角色更像是在定义目标、拆分任务、设定验收标准,并判断结果是否真的科学有效。

该报告强调的不是“自动替代研究人员”,而是“把研究人员从实现者推向验证者和编排者”。

关键案例一览

案例 软件 / 任务 变化结果
MHCflurry 将老旧的 TensorFlow/Keras 后端迁移到 PyTorch,兼容既有模型 近 1 万行、130 个文件级别改写;已发布权重保持不变,预测值在小误差范围内一致
RustQC 将多工具流程重构为更现代的 Rust 方案,并优化相关工具链 在 1.86 亿条 reads 数据集上,总串行运行时间从约 15 小时 34 分钟降到 14 分 54 秒,磁盘流量从 2.5 TB 降至 0.1 TB
hifiasm 面向长读长基因组组装的热点路径优化 在一个 10 Mb 区域上,编辑阶段速度提升 9.69 倍,突变频率误差从 0.076 降至 0.034
cyvcf2 改善构建、测试和发布流程 在保留行为约束的前提下,运行时间下降 25.1%

OpenAI 还指出,某些更复杂的项目需要比单纯“改快一点”更严格的验证。例如,报告强调,agent 在小而明确的任务上表现最好;一旦任务涉及更大范围的科学行为变化,验证成本就会急剧上升。对研究人员来说,真正需要花时间的往往不是写出第一版代码,而是找到可靠的测试框架、处理边界情况,并确认结果没有在不易察觉的地方偏离科学目标。

验证,成了新的瓶颈

这份报告最重要的结论之一,是“写代码”的成本下降之后,最难的部分变成了“证明代码是对的”。OpenAI 写道,编码代理在面对外部参考、精确输出、已有测试套件或明确统计目标时最有效;但当目标变得模糊,或者必须依靠真实数据验证时,人的判断就重新变成决定性因素。

报告还特别提到,研究团队在大多数案例里都投入了大量精力构建验证框架,而不是单纯监督代码生成。换句话说,agent 可能会迅速给出实现方案,但人类仍要判断:结果是否合理、误差是否可接受、是否足以进入下一轮实验或发布。

这也解释了为什么 OpenAI 近来的几条产品和研究线索会彼此呼应。无论是 ChatGPT agent 里的浏览器与终端,还是微软在 Agent Framework harness 中强调的 Skills、Shell、CodeAct 与 Background agents,核心都不是“让模型多说一句话”,而是让系统更接近真实工作流;而在这种工作流里,控制、审查和可追责性都比过去更重要。

这场变化为什么发生在科学计算

OpenAI 的判断建立在一个长期存在的背景之上:科学计算软件往往由小团队或学术团队开发,目标是尽快完成方法论文或研究结果,而不是像成熟工业软件那样投入大量工程资源去打磨安装、测试、性能和长期维护。报告称,很多科研工具在发布后仍然难以在干净环境里稳定安装或运行,维护负担和技术债因此不断累积。

OpenAI 认为,编码代理之所以能在这一领域产生明显价值,恰恰是因为它们擅长那些长期缺乏工程人力的任务:补测试、改包装、迁框架、做局部优化、补文档、拆任务。对于基因组学等数据密集型领域,这种效率提升尤其有吸引力,因为数据生成的速度已经远快于下游分析和软件维护能力。

但报告同样警告,低成本重写也可能带来碎片化风险。若没有明确的维护者和 stewardship 计划,今天的现代化改写很可能变成明天的又一个弃用分支。对共享科研软件来说,代码是否能跑只是第一步,谁来维护、谁对结果负责,才是长期问题。

仍待确认的问题

这份 report 是回顾性的、探索性的,OpenAI 也明确表示,它并没有独立复现每一个 case study 的全部 benchmark。换句话说,报告更像是一个“方向性证据包”,而不是一份可直接外推到所有科研软件的性能宣言。

目前仍有几件事需要继续观察:

  • 这些提升有多少来自模型本身,有多少来自更好的任务拆解和更强的人工验证框架;
  • 报告中的速度和可靠性改善,能否在更多科研领域稳定复现;
  • 在多人协作、开源维护和长期托管场景里,agent 生成的改写应该如何被纳入主项目,而不是形成新的分叉;
  • 当验证成本继续上升时,哪些科学软件会率先受益,哪些领域反而会因为审查门槛过高而难以落地。

OpenAI 这次给出的答案相当清楚:agent 不是把科学计算里的“人”拿走,而是把人的工作重心,从实现迁到判断、验证和维护上。问题只剩下一个——当代码越来越容易写,谁能持续证明它真的对。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读