东南大学、华东师范与港科大等追问:AI科学家真的准备好了吗?
这项由东南大学、华东师范大学与香港科技大学联合开展的研究以预印本形式发表于2026年7月论文编号为arXiv:2607.11079有兴趣深入了解的读者可通过该编号查询完整原文。科学研究的核心说白了就是从数据里找答案。一个医生看完化验单要能判断病人是否有炎症一个气象学家分析温度数据要能预测明天会不会下雨一个生物学家测量了一百只小鼠的体重要能判断某种药物是否真的有效果。这些看似不同的工作背后都在做同一件事对数据进行科学分析然后做出可靠的判断。近年来以ChatGPT为代表的大型语言模型也就是俗称的大模型或AI正在越来越多地参与到科学研究过程中从预测蛋白质结构到自动生成研究假设AI的身影无处不在。那么问题来了——这些AI在科学数据分析这件事上到底做得怎么样它们真的能像一个合格的科研助手那样读懂数据、做出靠谱的判断吗研究团队发现目前学界对AI的科学数据分析能力的评测几乎都停留在考察能不能跑出代码这个层面——也就是说只要AI写的程序能运行、能输出结果就算过关了。但这就好像考驾照只考能不能发动汽车却不考能不能安全驾驶到目的地一样根本没有测到最关键的能力。于是这支团队决定造一张真正的科研能力体检表系统检验AI在六种不同类型的科学推理任务上究竟表现如何。这张体检表就是他们推出的SDABench基准测试。一、为什么现有的考试卷考不出真本事现有的AI科学数据分析测试大多是这样设计的给AI一个数据集让它写代码、跑分析、输出结果然后对比结果对不对。这类测试的问题在于它混淆了做对了计算和做了正确的科学判断这两件事。打个比方你让一个学生计算一组数据的平均值他算对了得了满分。但如果他根本不知道为什么要算平均值、在什么情况下平均值不适用、算完平均值之后该怎么解读那他其实并没有真正掌握数据分析的能力。现有的测试就是这种只考算术、不考理解的水平。更麻烦的是现有测试往往用一个总分来概括AI的表现这就像用一个数字来评价一个人的健康状况一样——100分意味着什么是心肺功能很好但骨密度很差还是整体均衡根本看不出来。不同类型的科学分析任务对AI提出的要求是截然不同的一个总分掩盖了所有的差异。研究团队认为科学数据分析的目的不是跑程序而是支撑科学主张。而科学主张有好几种不同的形态描述现象这堆数据长什么样、探索规律数据里有没有什么有趣的模式、推断结论基于这个样本能对更大范围做什么判断、做出预测根据已有数据未来会发生什么、分析因果改变某个变量会不会导致另一个变量改变、解释机制为什么会出现这种现象背后的原理是什么。这六种任务对应着科学研究中六种截然不同的思维方式当然应该分开来考察。二、SDABench一张真正的科研能力体检表是怎么造出来的研究团队基于麻省理工学院科学家Leek和Peng在《科学》杂志上提出的六类数据分析问题框架将其重新诠释为六种科学发现能力分别是描述性分析说清楚数据是什么样的、探索性分析在数据里寻找可能有意义的模式、推断性分析用样本数据对更大范围的现象做出有量化不确定性的判断、预测性分析用已知变量估计未知结果、因果性分析评估某种干预或变化对结果的影响、机制性分析用数据和领域知识解释某个现象背后的运作过程。在学科领域上SDABench覆盖了生物学、化学、环境科学、地理学和物理学五个核心理工科方向。这样的设计保证了测试不局限于某一个学科的特殊性而是检验AI在广泛科学场景下的通用推理能力。整个基准测试由两部分组成。第一部分叫SDA-Real收录了527道基于真实世界科学数据集的题目数据来源涵盖了多个已有的科学数据分析基准测试如KramaBench、BLADE、DiscoveryBench、LLM-SRBench、QRData、SciTS、ScienceAgentBench经过重新筛选和精心设计只保留那些数据结构清晰、分析目标明确、答案可以通过程序验证的高质量实例。第二部分叫SDA-Synth包含6000道基于合成数据集的题目。为什么要有合成数据因为真实科学数据集通常是为某一个特定研究设计的往往只能支撑某几种分析类型。如果每种分析任务都用不同的数据集那分析起来就很难判断AI表现的差异到底是题目难度不同造成的还是AI能力本身的差异。合成数据集则可以在同一组数据上同时支撑全部六种分析任务保证对比的公平性。合成数据的生成过程相当严谨。研究团队先让GPT-4o提出候选科学场景比如植物胁迫生理学、聚合动力学等每个场景都明确指定了哪些变量是可测量的、单位是什么、范围是多少。然后为每个场景构建一个语义有向无环图——这个图的每个节点代表一个变量边代表变量之间的因果或函数关系。每个非源头变量都有一个明确的数学机制代数方程或微分方程规定了它如何由其父变量决定。对于有因果关系的变量还专门用一套叫做内部标准化结构因果模型的框架来精确刻画干预效应是如何通过中间变量传递到目标变量的。整个数据集按照图的拓扑顺序生成源头变量随机采样其他变量通过执行对应的数学机制计算得出并加入了受控的测量噪声。最终得到50个经过专家审核的合成数据集每个领域10个每个数据集支持全部6种分析类型。题目的生成过程也有一套三阶段流水线。第一阶段由一个由四个AI子智能体组成的流水线来构建题目模板分类器把种子问题分配到对应领域和任务类型提取器把具体的数据集相关实体替换成占位符生成通用模板生成器把模板填入特定数据集的具体变量验证器负责排除逻辑矛盾、占位符未解析、答案泄漏等问题。第二阶段对每个模板实现一个确定性的答案推导程序给定数据集和具体参数就能自动计算出标准答案保证答案的客观可验证性。第三阶段为多选题生成干扰选项干扰选项通过四种扰动策略生成交换变量角色扩散扰动、修改某个局部参数混淆扰动、随机采样一个不同答案随机化扰动、简单数值变换默认扰动。这样的设计让干扰项看起来合理但实际错误真正考验AI是否走了正确的分析路径而不是靠排除法碰运气。每道题同时提供两种格式多选题四个选项里选一个和开放题直接给出答案。多选题便于自动批量评测开放题则更贴近真实科研场景能反映AI的真实推理能力。多选题答对的概率下限是25%随机猜开放题没有这个地板所以研究团队以开放题的得分作为主要评测指标多选题作为辅助参考。三、15个主流AI模型大考谁厉害、谁在哪里拉胯研究团队评测了15个代表性的大型语言模型涵盖了闭源商业模型和开源模型两类。闭源模型包括GPT-5.4、GPT-5.4 mini、Claude Sonnet 4.6、Gemini 3.1 Pro和Gemini 3.1 Flash开源模型包括DeepSeek V3.2、DeepSeek R1、Qwen 3.5-397B-A17B、Qwen 3-235B-Instruct、Kimi K2.5、GLM 5、Llama 3.3-70B-Instruct和Llama 3.1-8B-Instruct。此外还对Llama 3.1-8B-Instruct进行了微调形成两个变体。所有模型都在零样本设置下测试即直接给题目不提供任何示例。从整体得分来看最强的闭源模型GPT-5.4的开放题准确率为58.33%Gemini 3.1 Pro以56.88%紧随其后Claude Sonnet 4.6为55.79%。经过任务针对性微调的小模型Llama 3.1-8B-Instruct开放题准确率达到了55.33%已经接近顶级大模型的水平说明针对性训练对小模型的帮助相当显著。相比之下Llama 3.1-8B-Instruct的原始版本开放题准确率只有5.04%差距极为悬殊。按任务类型细分所有模型在描述性任务上表现最好顶尖模型的准确率可以达到90%以上。毕竟描述数据样本的基本特征这件事主要就是汇总和总结难度相对最低。然而当任务换成推断性分析需要从样本数据对更大范围做出判断和因果性分析需要评估干预效果时准确率明显下降。探索性任务和预测性任务则出现了不同方向的困难探索性任务要求在约束条件很弱的情况下搜索可能的规律类似于在杂乱的房间里寻找一件不知道放在哪里的东西预测性任务要求选择合适的模式并将其应用到没见过的情况类似于学会了一道菜的做法后用新食材做出同款口感。机制性任务则出现了有趣的格式差异给定多选项时强模型能够识别出合理的机制但在开放题格式下AI必须自己把变量、关系、中间步骤串联成一个完整的因果链这对现有AI来说相当困难。按科学领域分析环境科学的整体准确率最高达到46.9%生物学最低只有39.2%。这个差距并不是因为AI懂环境科学多于生物学而是因为环境科学数据中的变量往往是连续平滑的趋势比较直接生物学数据则常常包含高维度的非线性交互作用样本外预测难度更大。地理学的问题出现在探索性分析30.9%和机制性分析24.9%上因为地理数据需要从符号性数据中推断出空间结构这对AI来说是一个特殊的挑战。四、不只是对不对五层错误解剖刀找出AI卡在哪里研究团队没有满足于只报告准确率他们还开发了一套五阶段错误分析框架把AI的错误按照科学数据分析的执行流程逐层分类。这五类错误分别是范围错误误解了分析目标或任务边界、变量错误选错了分析变量、方法错误选了错误的分析方法或公式、关系错误对变量之间的关系——是否存在、方向、强度、结构——判断有误、结论错误最终推断与前面的分析结果不一致或不被数据支持。研究团队对所有错误案例都标注了第一个出错的环节然后计算每种错误类型的归一化发生率。按任务类型看方法错误在预测性任务中最为突出归一化错误率高达37.7%在推断性任务23.0%和描述性任务13.4%中也相当常见反映出AI在选择合适的统计方法或正确实现公式方面存在系统性问题。关系错误则在机制性任务32.1%和探索性任务29.9%中最为集中——在这两类任务里变量之间的关系结构本身就是分析的目标AI常常把噪声当成信号或者没有足够的机制知识来重建因果传递链。结论错误在推断性任务中最多见10.2%反映出AI在处理不确定性时容易做出过于武断的判断。按科学领域看生物学的错误主要集中在方法层面29.8%AI能识别出相关实体但会用通用统计方法替代领域专用的分析方法。化学24.6%和环境科学27.0%的主要问题是关系错误因为这两个领域的变量交互依赖于耦合过程、阈值效应或混杂因子AI难以准确把握。地理学的范围错误率最高9.9%说明AI经常误解地理分析的分析目标。物理学的变量错误率最高14.5%AI能找到正确的公式却搞错了哪个变量对应哪个物理量或者忽视了单位和物理角色的约束。按模型水平看规律相当清晰较小的基础模型如Llama 3.1-8B和Llama 3.3-70B的变量错误率极高常常超过30%说明它们连用哪些变量来回答这个问题都搞不清楚。更强的模型把这类基础性的定位错误大幅降低了但错误的重心随之转移到了执行层面DeepSeek R1、DeepSeek V3.2、Qwen 3.5和GPT-5.4主要被方法错误拖累说明它们理解了要做什么但选错了怎么做而Kimi K2.5、Claude Sonnet 4.6和Gemini 3.1 Pro方法错误率较低但关系错误率较高说明它们能够执行正确的操作但对变量之间关系的刻画仍然不够准确。这个发现的含义相当深刻随着模型变强错误并没有消失只是从早期阶段搞不清楚分析对象是什么转移到了晚期阶段能找到正确对象但分析过程和推断结论仍然出错。这意味着简单地把模型做大、做强并不能自动解决科学推理中最本质的难题。五、多选题陷阱与合成数据的可靠性研究团队注意到一个有趣的现象对于某些任务类型给AI提供多选项反而会降低它的表现。以Kimi K2.5为例在预测性任务的开放题上它表现正常但在同样内容的多选题上准确率几乎跌到随机猜测的水平25.75%。这说明看到选项之后AI反而被选项的外观特征所干扰开始做表面模式匹配而不是老老实实走一遍分析流程。相反Llama 3.3-70B-Instruct在多选题的因果任务24.00%和探索性任务23.50%上也接近随机水平但原因完全不同——它根本就不会做这类分析有没有选项都救不了它。这两种情况都说明多选题格式有其误导性它既可能让本来会做的AI因为看选项反而答错也可能让本来不会做的AI因为能猜而虚报高分。这对大量依赖多选题评测AI能力的研究来说是一个值得警惕的信号。在真实数据集SDA-Real上的测试结果与合成数据集上的规律总体吻合描述性和推断性任务相对较易探索性和预测性任务相对较难。但真实数据也暴露了合成数据无法完全模拟的特点真实数据集中的变量名往往是标准术语如温度湿度AI的预训练知识与这些术语高度匹配有时会让机制性任务的表现虚高而真实数据的模式更复杂、噪声更多探索性任务对此更敏感。研究团队认为正因为两类数据各有侧重、互为补充所以SDABench同时保留了两者。六、这些发现对未来AI科学助手意味着什么研究团队特别强调了一点更强的模型并不是因为知识不够才出错而是因为知识用错了地方。它们能认出公式能识别变量但在需要选择合适的假设检验方式、准确刻画多变量之间的耦合关系、或者把中间推理步骤串联成一个自洽结论时仍然频频出错。这三个方向——在不确定性下选择假设、对变量交互关系进行关系推理、以及对中间推理结果进行逐步验证——正是未来改进AI科学数据分析能力的关键突破口。SDABench提供的这套五阶段流水线式错误分类不仅是一个诊断工具还可以直接用于指导AI的训练课程设计按照分析流水线的阶段顺序针对每个阶段的能力短板分阶段施训而不是笼统地让AI多刷题。说到底这项研究要传达的核心信息很简单AI在科学数据分析这件事上还没有真正毕业。它们能做好最基础的描述题但在需要选对方法、理清关系、做出严谨推断这些更深层的科学思维任务上表现还差得远。更重要的是用一个笼统的通过/不通过来评价AI的科研能力就像用及格/不及格来评价一个医学生是否能独立行医一样远远不够精确。SDABench提供了一种更像体检而非过关的评测视角让我们能看清楚每一个具体的短板在哪里。对于普通人来说这项研究意味着当我们听到AI已经能做科学研究了这样的说法时要多问一句——它能做哪种科学研究描述数据样本的特征它也许真的能做得不错但如果你需要它帮你判断某种药物是否真正有因果效果、或者解释某个物理现象背后的运作机制它给出的答案可能看起来很自信实际却并不可靠。学会区分AI能力的层次比盲目信任或盲目拒绝都更明智。有兴趣进一步了解的读者可以通过arXiv编号2607.11079查阅完整论文原文包含了所有模型的详细评测数据、误差分析图表以及完整的基准构建方法说明。QAQ1SDABench和现有AI科学数据分析测试有什么本质区别A现有测试主要考察AI能不能跑出代码、输出结果相当于只考学生会不会按计算器。SDABench则把科学数据分析拆解成六种能力——描述、探索、推断、预测、因果、机制——分别测试还有一套五阶段错误分析框架能精确定位AI在分析流程的哪个环节出了问题而不是只给一个总分。Q2为什么多选题格式有时候反而会让AI表现更差A多选题提供了现成的答案选项有些AI看到选项后会做表面模式匹配——就是凭选项的样子来猜而不是老老实实地走一遍分析流程。SDABench的测试发现Kimi K2.5在预测性任务的开放题上表现正常但在同内容多选题上准确率近乎随机猜测说明显式选项确实会干扰某些AI的正常推理过程。Q3目前最强的AI在科学数据分析上的准确率大概是多少A以开放题为主要指标当前最强的闭源模型GPT-5.4准确率为58.33%Gemini 3.1 Pro为56.88%Claude Sonnet 4.6为55.79%。经过针对性微调的小模型Llama 3.1-8B-Instruct也能达到55.33%。总体而言开放式科学数据分析任务远未被解决尤其是预测、探索和机制性分析仍然是所有模型的明显短板。

相关新闻

大模型记忆系统:从短期记忆到长期存储的技术演进

大模型记忆系统:从短期记忆到长期存储的技术演进

1. 大模型记忆能力概述:从"金鱼脑"到"最强大脑"的进化之路作为一名长期奋战在AI应用一线的开发者,我深刻体会过大模型"健忘"带来的困扰。去年在开发客服对话系统时,客户反复抱怨:"每次都要重新…

2026/7/24 23:17:07阅读更多 →
从「能纠错」到「算得起」:量子计算真正的考验才刚刚开始

从「能纠错」到「算得起」:量子计算真正的考验才刚刚开始

文丨恩里科 排版丨恩里科 行业动向:4200字丨12分钟阅读 内容提要 在此前的文章容错跨过门槛:微软与 Quantinuum 取得量子纠错重大进展(内附Nature下载)当中,我们讲述了纠错领域的突破:微软与 Quantinuum…

2026/7/24 23:17:07阅读更多 →
给 AI Agent 的 Skill 装上”自我进化”引擎:一套可落地的优化闭环方案

给 AI Agent 的 Skill 装上”自我进化”引擎:一套可落地的优化闭环方案

本文整理自 Warp 创始人 Zach Lloyd 分享的一个工程实践:如何用”观察者 Skill”自动评估并迭代改进另一个 Skill,让 Agent 的能力越用越强,而不是一次性交付后就放在那里”等老化”。 一、为什么 Skill 需要”自优化” 如果你已经在用 Clau…

2026/7/24 23:17:07阅读更多 →
告别Office启动等待:3秒预览Word/Excel/PPT的终极方案

告别Office启动等待:3秒预览Word/Excel/PPT的终极方案

告别Office启动等待:3秒预览Word/Excel/PPT的终极方案 【免费下载链接】QuickLook.Plugin.OfficeViewer-Native View Word, Excel, and PowerPoint files with MS Office and WPS Office components. 项目地址: https://gitcode.com/gh_mirrors/qu/QuickLook.Plug…

2026/7/25 0:43:22阅读更多 →
免费文档下载神器:跨平台文档获取的终极解决方案

免费文档下载神器:跨平台文档获取的终极解决方案

免费文档下载神器:跨平台文档获取的终极解决方案 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您…

2026/7/25 0:43:22阅读更多 →
5步掌握Onekey:从Steam游戏解锁到自动化配置实战指南

5步掌握Onekey:从Steam游戏解锁到自动化配置实战指南

5步掌握Onekey:从Steam游戏解锁到自动化配置实战指南 【免费下载链接】Onekey Onekey Steam Depot Manifest Downloader 项目地址: https://gitcode.com/gh_mirrors/one/Onekey Onekey是一款专为Steam平台设计的开源游戏解锁工具,通过自动化流程简…

2026/7/25 0:43:22阅读更多 →
【AI安全治理成熟度自评工具包】:含NIST AI RMF映射表+自动化审计脚本(限前200家企业免费领取)

【AI安全治理成熟度自评工具包】:含NIST AI RMF映射表+自动化审计脚本(限前200家企业免费领取)

更多请点击: https://kaifayun.com 第一章:企业AI安全部署指南 在企业级AI系统落地过程中,安全并非事后补救环节,而是贯穿模型开发、训练、部署与监控全生命周期的核心支柱。忽视数据隐私、模型鲁棒性或访问控制,可能…

2026/7/25 0:43:22阅读更多 →
域名回购和域名赎回有什么区别?

域名回购和域名赎回有什么区别?

许多企业在域名管理过程中,常常混淆“域名回购”和“域名赎回”这两个概念。虽然都涉及花钱拿回域名,但两者的适用场景、操作方式和成本结构完全不同。域名赎回:域名过期进入赎回期,原持有人向注册商花钱拿回自己名下即将被删除的…

2026/7/25 0:43:22阅读更多 →
终极指南:3步轻松解锁网易云音乐NCM加密文件,实现音乐自由播放

终极指南:3步轻松解锁网易云音乐NCM加密文件,实现音乐自由播放

终极指南:3步轻松解锁网易云音乐NCM加密文件,实现音乐自由播放 【免费下载链接】ncmdumpGUI C#版本网易云音乐ncm文件格式转换,Windows图形界面版本 项目地址: https://gitcode.com/gh_mirrors/nc/ncmdumpGUI 还在为网易云音乐下载的…

2026/7/25 0:41:22阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 0:58:53阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 0:58:53阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 0:58:53阅读更多 →
突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:01:16阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:01:16阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:01:16阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/24 23:01:03阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/24 19:00:40阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/24 19:00:40阅读更多 →