AI用两天想出科学家十年的结论!谷歌DeepMind看到最大瓶颈
Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对AI 让科学猜想变得廉价但验证依然昂贵这个差距正在撕裂整个科研体系。Google DeepMind 发布报告《Conjecture Machines: AI agents and the new validation bottleneck in science》10位研究员和工程师坐下来聊了一个问题AI Agent 涌入科学界之后接下来会发生什么在过去一年里Agent 已经改变了编程的意义。而科学研究可能就是下一步要被改变的领域。Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对一夜赶超十年功故事从伦敦帝国理工学院的微生物学家 José Penadés 讲起。他的团队花了将近10年研究一类超级细菌如何传播抗生素耐药性。结论有了但一直没发表只有实验室内部知道。2024年他把问题描述给了 Google DeepMind 的 Co-Scientist一个 AI Agent。两天后Co-Scientist 返回5个可能的解释按优先级排序。排第1的跟 Penadés 团队花10年证明的假设一模一样某些超级细菌从病毒那里获取尾巴用这些尾巴当钥匙在不同宿主物种之间跳跃。Penadés 愣住了。他第一反应是电脑被人入侵了赶紧发邮件给 Google 确认。对方回复没人偷看。一个基于 LLM 的系统被赋予目标和工具能自己规划步骤、并行调度多个子任务、发现并纠正错误还能调用外部数据库、写代码操作机器人。跟聊天机器人不同Agent 不是问一句答一句它拿到目标后会自己拆解、执行、迭代。为什么现在突然好用了报告归结为三股力量。前沿模型更强了。顶级模型在 Humanitys Last Exam、FrontierMath 这类高难度科学基准上已经超过人类专家。更关键的是推理时计算inference-time reasoning带来的深度思考能力模型会一步步推演、探索、修正再给出答案。脚手架scaffolding成熟了。这是一套包裹在模型外面的代码框架给 Agent 提供结构、记忆和工具调用能力。早期脚手架是定制的换个模型就不灵了。现在有了 Agent 间通信协议等新标准通用性好了很多。可定制性来了。Agent 技能skills让科学家把自己的方法论、流程偏好写成简单的文本指令Agent 就能按你的方式干活。计算生物学家 Natasha Latysheva 说她已经把自己的研究流程提炼成了技能。她的预判是科研工作会从亲手执行转向高层编排。每天上班先看看 Agent 昨晚跑了哪些实验和分析调整方向引导注意力。猜想廉价验证昂贵Agent 对科学最直接的改变你多了一个永不知疲倦的数字助手。文献梳理、数据库查询、数据分析、写基金申请以前花几小时几天的事现在几分钟搞定。但真正结构性的变化在别处。斯坦福大学的 Gary Peltz 研究肝纤维化每年140万人死于肝硬化。他凭自己的文献积累和几十年经验挑了2个候选药物做实验。同时他让 Co-Scientist 也挑。AI 挑了3个。结果 Peltz 自己选的2个在活体人类肝细胞实验中毫无效果。Co-Scientist 选的3个里2个不仅阻断了纤维化还促进了肝细胞再生。Co-Scientist 的工作方式是调度一群子 Agent生成多样假设、互相批评、排序、迭代模拟一个人类研究小组的运作方式但速度快得多。报告也坦承 Agent 的软肋。Co-Scientist 负责人 Vivek Natarajan 说输出第10页里一个编造的事实就能毁掉整份报告。漏掉这种错误浪费时间和资源抓住它需要一个领域专家。他提出一个关键概念叫认知谦逊epistemic humility模型得知道自己不知道什么并且说出来。AlphaFold 之所以受信赖部分原因是它会报告每个预测的置信度。但在更开放的科学推理中校准这种置信度仍是未解难题。科学家同时想要两样东西基于文献、没有错误的假设以及真正新颖的想法。Agent 调得谨慎就趋向安全和已知调得大胆就容易跑偏。在搜索最优解方面AlphaEvolve 是另一个代表。给它一个用代码表达的问题和一个评分函数它调度一组 Agent 生成大量候选方案留下得分最高的用幸存者繁殖下一代。无人值守地跑规模远超人类团队。它帮 Google 设计了下一代 TPU 芯片帮数学家 Terence Tao 解决了开放的 Erdős 问题改进了基因组数据分析。在材料科学等领域AlphaEvolve 的 top 选手只是线索不是最终结果。一个有前途的催化剂还是得在实验台上造出来、测一测。这就引出了报告最核心的判断。Karl Popper 说科学通过猜想与反驳前进。AI Agent 正在改变这对关系的经济学。猜想变得丰富且廉价反驳依然是物理的、制度性的所以昂贵且缓慢。数学和计算机科学是例外验证可以在硅基世界里完成。Agent 生成证明用 Lean 这类形式语言表示计算机就能无歧义地验证对错。今年2月数学家们办了首届 First Proof 挑战10个研究问题刻意不发表确保不在任何训练数据里。给一周时间。Aletheia一个把证明生成器和自然语言验证器配对的系统解决了6个是最好成绩。但数学家们已经开始抱怨 AI 生成的证明太长、难以消化。领导 Aletheia 项目的 Thang Luong 说我们正在走向一个严重的证明消化不良的未来AI 产出突破的速度超过人类审阅的速度。而在大多数学科验证鸿沟正在扩大。Agent 可以提出一个逆转细胞衰老的基因线索但没法确定它到底管不管用。细胞系需要时间生长化学反应需要时间完成。对大部分科学来说实验室设定了节奏。基础设施该升级了报告给政策制定者和科研资助机构提了4个紧迫优先级。确保科学家能用上 Agent。报告把这比作历史上提供超级计算机访问权的挑战。地缘政治讨论总聚焦于一个国家能不能训练自己的前沿模型但更少有人关注一个可能更重要的问题一个国家能不能把 Agent 部署到整个科学生态中。资助机构得决定实验室怎么选 Agent、怎么付费。计算开销大Agent 能力边界不断扩展总花费大概率会涨。需要新的公私合作模式美国的 Genesis Mission 是一个有希望的样板。让国家数据资产对 Agent 友好。开放或低风险数据应该通过文档完善的 API 暴露给 Agent。敏感数据集比如基因组学、病毒学领域有双重用途风险的数据需要开发类似 OpenSAFELY 那样的隐私保护方案让 Agent 也能安全访问。解决验证瓶颈。Agent 让假设越来越多实验设施的时间却就那么多。报告建议投资现有实验验证设施并开放共享同时加速自动化实验室建设。给同行评审配上 Agent。科学家已经在用 AI 写越来越多的基金申请和论文写作质量不再是可靠的区分标准。Agent 越深度参与规划和优化申请申请书就越少反映科学家的原创思考。报告建议分层应对使用者更清晰地记录 AI 参与情况推进水印技术和 Human-AI Interaction Cards人机交互卡片记录产生关键科学洞见的提示和输出。审稿人也应该能用 Agent先在检测错误这类客观领域试点。AI Agent 不能成为少花钱搞科学的理由那将是一个悲剧性的虚假节约。把这一刻当作真正结构性变化的国家才能释放最大的公共价值。这个窗口期的选择可能很难逆转。科学家用上 Agent 之后不会再回头了。技术会继续进步。但管理科学的那些制度实验室、团队、机构、同行评审、资助体系是为一个正在被加速的科研企业建造的它们自己还没跟上。

相关新闻

OpenZFS开发者入门:如何为开源存储系统贡献代码

OpenZFS开发者入门:如何为开源存储系统贡献代码

OpenZFS开发者入门:如何为开源存储系统贡献代码 【免费下载链接】openzfs OpenZFS on Linux and FreeBSD 项目地址: https://gitcode.com/gh_mirrors/op/openzfs OpenZFS是一款强大的开源存储系统,广泛应用于Linux和FreeBSD平台。作为开发者&…

2026/7/21 19:56:47阅读更多 →
Node-COBOL生产环境部署:最佳实践与注意事项

Node-COBOL生产环境部署:最佳实践与注意事项

Node-COBOL生产环境部署:最佳实践与注意事项 【免费下载链接】node-cobol :tv: COBOL bridge for NodeJS which allows you to run COBOL code from NodeJS. 项目地址: https://gitcode.com/gh_mirrors/no/node-cobol 在现代企业应用中,将遗留的C…

2026/7/21 19:56:47阅读更多 →
Chronotrains未来路线图:功能规划与社区发展展望

Chronotrains未来路线图:功能规划与社区发展展望

Chronotrains未来路线图:功能规划与社区发展展望 【免费下载链接】chronotrains Shortest times between train stations in Europe 项目地址: https://gitcode.com/gh_mirrors/ch/chronotrains Chronotrains作为一款创新的欧洲火车等时线地图工具&#xff0…

2026/7/21 19:56:47阅读更多 →
CocosCreator PageView深度调优:从原理到实战解决卡顿与误触

CocosCreator PageView深度调优:从原理到实战解决卡顿与误触

1. 项目概述:从“能用”到“好用”的必经之路在CocosCreator项目里,PageView(翻页视图)组件几乎是实现引导页、商城轮播、关卡选择这类横向滑动界面的首选。很多开发者,包括我自己在早期项目里,都是从官方文…

2026/7/21 23:45:12阅读更多 →
机器学习模型生产化落地:从Notebook到高可靠服务的工程实践

机器学习模型生产化落地:从Notebook到高可靠服务的工程实践

1. 项目概述:这不是一次“部署”,而是一场从实验室到产线的系统性迁移“From Notebook to Production: Running ML in the Real World (Part 4)”——这个标题本身就像一句暗号,老手一眼就懂:它不是在讲怎么调参、不是教你怎么画l…

2026/7/21 23:45:12阅读更多 →
贵阳贵安数字应用场景案例解析与实施经验

贵阳贵安数字应用场景案例解析与实施经验

1. 贵阳贵安数字应用场景案例发布背景解读2023年贵阳贵安优秀数字应用场景成熟案例和数字场景需求发布活动,是贵州推进"数字中国"战略落地的重要举措。作为全国首个大数据综合试验区,贵州近年来在数字经济领域持续发力,这次案例发布…

2026/7/21 23:45:12阅读更多 →
2026最新实测:5款AI写小说软件实测报告(内含使用对比+推荐)

2026最新实测:5款AI写小说软件实测报告(内含使用对比+推荐)

写小说最难的时候,是我盯着屏幕半小时,一个字都敲不出来。 过去这几个月,我写长篇写到怀疑人生,灵感断档、节奏脱轨、设定踩雷,几次都差点点开“放弃连载”按钮。也是在那时候,我开始试用几款AI写作工具&am…

2026/7/21 23:45:12阅读更多 →
2026实测盘点10款写小说软件:新手和老手都在用,提高码字效率!

2026实测盘点10款写小说软件:新手和老手都在用,提高码字效率!

如果你也是那种盯着文档发呆半小时,最后只憋出一句“他看着她”的写小说的,那这篇测评就是为你准备的。 以前我觉得码字就得靠死磕,结果日更三千差点把自己熬秃头。在被网文圈的卷王速度毒打后,我才发现,善用AI写小说…

2026/7/21 23:45:12阅读更多 →
Java性能调优:JDK诊断工具实战指南

Java性能调优:JDK诊断工具实战指南

1. JDK诊断工具全景概览作为Java开发者最亲密的战友,JDK内置的诊断工具链是我们排查线上问题的瑞士军刀。这套工具诞生于JDK早期版本,经过20余年的迭代已经形成了完整的监控-诊断-分析体系。我曾在一次生产环境FullGC频繁的紧急排查中,仅用js…

2026/7/21 23:43:12阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 0:51:49阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 0:51:49阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 0:51:49阅读更多 →
Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

📌教程适配:OpenClaw v2.7.9 | 兼容 Windows10/11、macOS 双系统 📖前言 当下各类本地 AI 工具层出不穷,多数产品仅能完成文字问答交互,很难直接操控电脑执行实际操作。OpenClaw,业内常称小龙虾 AI&#…

2026/7/21 0:01:46阅读更多 →
Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

聊《一次Codex项目复盘,问题最后出在流程而不是模型》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做&…

2026/7/21 0:01:46阅读更多 →
手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

大家好,还是我。前几期带大家做了心情日记本和可视化大屏,后台有朋友留言:“能不能教点好玩的?我想做游戏,但一行代码都不会。”行,这期就安排。今天的目标:从零做一个五子棋游戏。 带AI对战、三…

2026/7/21 0:03:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →