Agentic AI 做科学计算:写得快以后,验证才是主工作
Agent 能降低科学软件迁移、优化和维护的实现成本,但不会自动降低科学结论出错的成本。OpenAI 这份案例报告反复出现同一个变化:人的工作从逐行实现,转向定义目标、准备可信基线、检查数值与统计行为,并决定谁长期维护。真正可复用的做法不是“一次提示重写整个工具”,而是小步改动,每步都与外部参照比较。
它在解决什么问题
Section titled “它在解决什么问题”许多研究工具最初只是论文附带代码,由小团队在有限时间里完成。数据规模和环境继续变化,打包、测试、性能和维护却容易欠账。结果是安装脆弱、流程缓慢、复现困难。Agent 可以补充工程劳动力,但也会自信地产生明显错误;数值边界、隐含约定和兼容要求,往往比第一版实现更难处理。
官方汇总八个以生命科学为主的项目:五个只用 Codex,三个组合 Codex 与 Claude Code,范围从例行维护、定向优化到语言迁移和 GPU 重构。共同模式是先把大目标拆成阶段,再用中间 benchmark 和测试反馈迭代。可靠验收依赖模型之外的参照,例如与旧工具逐项一致、模拟数据的预知答案、合理的统计性质或明确性能目标。第一版通常很快,边界条件和细微数值差异构成“最后一公里”。
接到 Zero-to-AI 实践
Section titled “接到 Zero-to-AI 实践”这正是站内工作流编排与验证方法的交点:Explore 时先找到现有行为,Plan 时切小范围,Implement 后立刻 Verify,而不是等大重写结束再找错误。还要保留 git diff、测试输出和失败样本。若想另起重写版本,则先回答 owner、兼容范围和维护期限;“代码现在能跑”不等于形成可靠基础设施。
普通设备可做的低成本实验
Section titled “普通设备可做的低成本实验”输入: 一个读取小型 CSV 并输出汇总 JSON 的 Python 脚本、20 行固定样本、当前输出文件和一条需求,例如“减少重复遍历但保持结果完全一致”。不要用敏感或真实科研数据。
步骤:
- 在改动前运行脚本两次,保存命令、退出码和输出,确认基线稳定。
- 手工加入三个边界样本:空字段、重复记录、小数;先写出预期结果。
- 让 Agent 只改一个函数,并要求解释可能改变的排序、舍入和缺失值语义。
- 运行旧版与新版,做逐字输出比较;再查看 diff,确认没有顺手改格式或输入契约。
- 若主张更快,在同一设备、同一输入上多次测量并报告波动,不用一次结果下结论。
成功证据: 基线和新版命令均成功;固定样本与三个边界样本输出一致;diff 只触达批准范围;任何性能结论附原始测量。停止线: 无法写出预期答案、浮点容差尚未由领域需求定义、真实数据不可脱敏,或没有人愿意承担后续维护时,不推进迁移或发布。
- 测试通过不等于科学有效;测试可能只复制了同一个错误假设。
- 重写更快不等于值得替换;生态兼容、归属和维护成本可能更高。
- Agent 自述“等价”不算证据;要比较外部参照和真实输出。
原文与证据边界
Section titled “原文与证据边界”本文依据 2026-08-30 可读取的 OpenAI 官方页面。页面把报告明确称为回顾性、探索性 field report,案例与加速感受主要来自参与团队;本站未复现八个项目,也未核验其性能提升。官方原页经浏览器读取成功,但本轮 TraceFetch 抓取失败,因此没有 verification.valid=true 的本地正文包。上面的 CSV 实验是一个待执行的教学缩小版,只验证变更流程与输出一致性,不证明 Agent 能判断任何真实科研结论。
本文是原创中文实践解读,不是逐句翻译。阅读英文原文。