AI 改写科研代码后,怎样证明结果还是对的?
科研代码改写有一个很容易被低估的问题程序能编译、测试能通过、输出看起来也合理仍然可能得出错误的科学结果。OpenAI 在 2026 年 7 月 28 日发布了一份探索性现场报告汇总 8 个智能体辅助的科学计算项目主要来自生命科学。其中 5 个只使用 Codex3 个结合 Codex 和 Claude Code。项目包括依赖迁移、局部性能优化、跨语言重写、GPU 重构和新工具开发。如果只看结果表格最显眼的是速度和改写规模。报告真正有用的部分却是几次验收失败有的统计输出看起来合理继续检查才发现算法缺陷有的验证器因抽样方式产生误报智能体反而去修改原本没有问题的实现还有的优化在合成数据上快了 25.1%到了真实数据只剩 14.7%。这说明科研代码的完成标准不能是“智能体说做完了”也不能停在普通单元测试。需要先判断代码承诺保留什么再为这项承诺选择能证伪它的证据。先把“正确”拆开否则测试会答非所问不同改写任务里的“结果一致”不是同一件事。HI.SIM 的目标是局部性能优化且不改变行为验收可以要求输出逐字节一致。MHCflurry 从 TensorFlow/Keras 迁到 PyTorch底层数值实现不同无法合理要求每个浮点位完全相同团队保留已发布模型权重在 315 组等位基因与肽组合上比较 affinity、processing、presentation 等全部预测量并要求误差落在预先设定的小容差内。到了 bayesm 的统计方法扩展仅比较部分后验汇总量就不够。报告称第一版 HMC/NUTS 和 HART 扩展产生了看起来合理的总体结果但继续做收敛诊断、simulation-based calibration并与原 HART 实现比较后才暴露需要修复的缺陷。这三类任务可以对应三种不同的验收问题行为保持同一输入是否产生完全相同的文件、协议字段或离散结果数值等价允许浮点差异时哪些量需要比较容差如何确定科学有效模型或算法新增了行为时它能否在已知真值、统计校准和领域约束下成立项目如果没有先选定其中哪一个最后通常只剩“跑通了”和“肉眼看着正常”。这两项在科学计算里都只是很弱的证据。一套可复现的四层验收法报告中的案例没有遵循统一实验协议但可以从它们反复出现的做法中整理出四层验收。顺序很重要后一层不能替代前一层。第一层冻结参考对象和允许差异先固定旧版本提交、依赖、参数、随机种子和输入数据。再写清楚什么必须相同什么允许变化。以序列比对器重写为例只比较“多少条 reads 成功比对”太粗。rustar-aligner 对照 STAR 2.7.11b在相同索引和参数下用 1 万条酵母 RNA-seq reads 逐项比较 position、CIGAR、MAPQ、NH tag 和 proper-pair flag。报告结果是单端 99.815%、双端 99.883% 的 tie-adjusted parity且没有只被一方比对的 reads。没有达到 100% 不一定代表失败。等分多重比对中哪一个位置被标为主结果可能受随机选择和后缀数组顺序影响。正确做法是预先定义这类允许差异并单独统计而不是在看到结果后临时降低标准。第二层用已知答案攻击“看起来合理”旧实现可以作为参考但旧实现也可能有缺陷新功能更是没有完整旧答案可抄。这时需要构造知道答案的数据。统计采样器可以从已知参数的生成过程模拟数据再检查后验能否覆盖真值、链是否收敛、不同参数区间是否出现系统偏差。图形工具除了数值和结构测试还需要检查渲染结果。报告中的 kuva 就把自动测试与人工查看图形结合因为一个文件成功生成并不等于图例、尺度和几何关系正确。这里的原则很简单测试输入必须能让错误暴露而不只是方便程序通过。若所有样本都来自最常见路径智能体静默跳过边界分支仍可能拿到全绿结果。第三层审计验证器本身这是最容易漏的一层。HelixForge 项目曾出现一次 strand-balance 审计误报原因在下采样过程而不是 GPU 实现。智能体看到失败后修改了 GPU 代码方向完全错了。验证器因此也要有正反例。一个实用做法是准备三份固定输入一份已知应通过、一份人工植入明确错误、一份只改变抽样或随机种子的扰动样本。验证器至少要稳定放行第一份、拦截第二份并能解释第三份的波动。若更换种子就把实现从“正确”翻成“错误”先检查审计方法不要立即让智能体修生产代码。验证器由智能体生成时尤其如此。报告中的 svb 案例出现过智能体编写“能通过但无效”的测试研究者靠逐轮读代码才发现简化方法并不正确。测试文件与实现文件来自同一套错误假设时绿灯并不独立。第四层把真实数据作为最终门槛小样本和合成数据适合快速迭代但不能证明性能和边界条件会迁移到真实负载。hifiasm 在留出的 200 Mb 合成数据上减少 25.1% 运行时间并满足预设的 read-ordering 质量阈值换成记录的真实人类 20 号染色体 reads运行时间下降为 14.7%。两项结果都成立但能支持的表述不同。前者只能说明在该合成基准上的提升不能直接写成“实际任务加速 25.1%”。RustQC 的贡献者也报告真实公共测序数据在达到现实规模后暴露了小数据集没有覆盖的边界条件。这类测试不需要一开始就运行。可以在开发阶段用小样本缩短反馈在候选版本冻结后再用不同物种、数据质量和规模的代表性数据做最终验收。失败时先定位证据链不要马上改代码科研代码出现差异后至少有四种来源新实现确实错误、参考实现存在旧缺陷、验证器假设错误或数据中存在被忽略的随机与边界行为。可以把一次差异调查保存成下面这样的记录claim_id: posterior-calibration-01 candidate_commit: 新实现提交 reference_commit: 参考实现提交 dataset_hash: 固定数据哈希 seed: 20260729 metric: coverage_at_90_interval expected: 0.88..0.92 observed: 0.74 validator_version: sbc-v3 triage: implementation | reference | validator | data evidence: 最小失败样本与诊断图 decision: block这不是为了把流程写得复杂而是避免智能体在收到一句“测试失败”后扩大修改范围。先把失败压缩到最小数据、单一指标和固定随机种子再判断问题位于哪一段。只有归因为实现错误才让改写继续进入代码。报告还提到rustar-aligner 要从 90% 以上的一致率继续推进需要逐条跟踪 reads 在新旧实现中的路径。最后一公里耗时往往不是因为还差很多功能而是剩余差异不再服从同一种原因。总一致率在这时会掩盖问题逐样本差异分类更有用。速度数字也要经过来源降级这份报告是回顾性的探索报告8 个项目不是按统一协议预先组织的也不是一个具有代表性的随机样本。OpenAI 对案例结构和内部一致性做了整理并检查部分公开产物但没有独立复现每一项基准或验证结果。项目数字应视为贡献者报告的特定案例结果而不是 Codex 或编码智能体的通用性能估计。因此一篇可靠的项目复盘至少要把三种内容分开参考实现上的等价证据、真实负载上的性能证据以及谁复现过这些结果。把“案例作者报告 60 倍加速”改写成“OpenAI 实验证明可普遍加速 60 倍”证据身份已经变了。科学计算里的代码不是普通内容生成。实现错误可能落在小数点后也可能藏在一条被静默跳过的样本里。智能体降低的是实现和试错成本验收成本不会自动消失。更现实的变化是人的工作从逐行写代码移到定义真值、设计反例、审查验证器和解释差异。官方来源Scientific computing in the age of agentic AIOpenAI2026-07-28Scientific computing in the age of agentic AI: an exploratory field reportJeremy Li、Alex Rubinsteyn 等2026。

相关新闻

Spring Boot项目打包外部Jar依赖的4种方案与最佳实践

Spring Boot项目打包外部Jar依赖的4种方案与最佳实践

1. 项目概述:当Spring Boot遇上“非主流”依赖在Java后端开发,尤其是Spring Boot项目里,Maven几乎是我们管理依赖的“标准答案”。pom.xml里写几个坐标,mvn clean package一下,一个包含所有依赖的可执行Jar包就生成了&…

2026/7/30 5:41:55阅读更多 →
数字电路设计实战:从亚稳态到跨时钟域处理的工程避坑指南

数字电路设计实战:从亚稳态到跨时钟域处理的工程避坑指南

1. 从“开”与“关”说起:数字世界的基石我们每天使用的手机、电脑、智能手表,其内部最核心的运算与逻辑,都建立在一个看似简单却无比强大的概念之上:用“开”和“关”两种状态来表示一切信息。这就是数字电路的世界。你可能觉得这…

2026/7/30 5:39:54阅读更多 →
计算机单片机毕设实战-基于 YF-S201C 传感器的流量计量预警装置研发 , 基于嵌入式单片机的流量自动切断报警系统实现(010401)

计算机单片机毕设实战-基于 YF-S201C 传感器的流量计量预警装置研发 , 基于嵌入式单片机的流量自动切断报警系统实现(010401)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/30 5:39:54阅读更多 →
用 Claude 做 Graph Engineering:从 0 到 graph 架构师的 14 步路线图(完整课程)

用 Claude 做 Graph Engineering:从 0 到 graph 架构师的 14 步路线图(完整课程)

大多数人试着搭建多步 agent 时,最后都做成了一条直线:步骤一、步骤二、步骤三——每一步都礼貌地等上一步做完才开始。 十个人里有九个会发现:这些步骤里有一半根本不需要等待。 它们不路由(route),不分…

2026/7/30 6:52:42阅读更多 →
FastReport.OpenSource:免费开源的.NET报表生成终极指南

FastReport.OpenSource:免费开源的.NET报表生成终极指南

FastReport.OpenSource:免费开源的.NET报表生成终极指南 【免费下载链接】FastReport Free Open Source Reporting tool for .NET6/.NET Core/.NET Framework that helps your application generate document-like reports 项目地址: https://gitcode.com/gh_mirr…

2026/7/30 6:52:42阅读更多 →
深入解析Cpp2IL:破解IL2CPP逆向工程的核心原理与实战应用

深入解析Cpp2IL:破解IL2CPP逆向工程的核心原理与实战应用

1. 项目概述:为什么我们需要深入IL2CPP的“心脏”?如果你是一名Unity游戏开发者、安全研究员,或者是对移动应用底层机制充满好奇的技术爱好者,那么“IL2CPP”这个词对你来说一定不陌生。它早已不是Unity引擎里一个可选的、边缘的编…

2026/7/30 6:52:42阅读更多 →
终极指南:用Python脚本自动化剪映视频剪辑的完整解决方案

终极指南:用Python脚本自动化剪映视频剪辑的完整解决方案

终极指南:用Python脚本自动化剪映视频剪辑的完整解决方案 【免费下载链接】JianYingApi Third Party JianYing Api. 第三方剪映Api 项目地址: https://gitcode.com/gh_mirrors/ji/JianYingApi 你是否厌倦了在剪映中重复执行相同的视频编辑操作?是…

2026/7/30 6:52:42阅读更多 →
STM32 DMA技术详解:从原理到实战,实现高效数据传输与性能优化

STM32 DMA技术详解:从原理到实战,实现高效数据传输与性能优化

1. 项目概述:为什么DMA是STM32性能提升的关键如果你正在用STM32做项目,尤其是涉及到大量数据传输的场景,比如采集传感器数据、驱动屏幕、处理音频或者高速通信,那你一定遇到过CPU被数据搬运工作“累趴下”的情况。CPU吭哧吭哧地从…

2026/7/30 6:52:42阅读更多 →
平台电商转型首选!澜驰Java多租户SaaS商城,赋能多商户规模化运营

平台电商转型首选!澜驰Java多租户SaaS商城,赋能多商户规模化运营

在产业数字化、渠道规模化的发展趋势下,单一品牌自营商城已经难以适配平台型企业、供应链企业、产业园区、软件服务商的发展需求。越来越多企业开始布局多商户入驻、多品牌运营、多渠道变现的平台型电商模式,而搭建平台商城的核心关键,就是选…

2026/7/30 6:50:42阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 🚀 【免费下载链接】TrollInstallerX A TrollStore installer for iOS 14.0 - 16.6.1 项目地址: https://gitcode.com/gh_mirrors/tr/TrollInstallerX 你是否曾经因为iOS系统的严格…

2026/7/30 0:00:58阅读更多 →
[GESP202606 四级] 扫雷

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:00:58阅读更多 →
Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:58阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/30 0:27:26阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/30 4:47:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →