论文里的 Figure / Table,为什么会成为多模态科研 Agent 的下一块入口?
导语2026 年科研 Agent 的瓶颈已经不只是“能不能找到论文”而是“能不能把论文里的图、表、原文上下文一起带回工作流”。如果检索系统只能返回文本片段却拿不到 Figure、Table 和原始上下文Agent 看到的往往只是结论不是证据。正文2026 年 7 月 22 日OpenAI 在《Advancing the next era of national science》中再次强调下一代科学工作流不只是模型能力竞赛还包括工具、数据和基础设施的协同。2026 年 7 月 27 日Cloudflare 发布 Agents SDK v0.20.0并加入 MCP SDK v2 支持说明 Agent 工具调用正在继续标准化。模型在变强协议在成熟但科研场景里真正难啃的问题并没有变: Agent 找到一段话之后怎么回到原论文怎么找到对应图表怎么核对实验条件和结果表格。这正是今天值得讨论的地方。很多科研 RAG 系统已经能做 chunk-level 检索也就是先返回若干命中文本片段。但科研结论常常不完整地写在片段里。误差条、消融实验、对照组、材料配比、样本量、显著性、图注说明往往藏在 Figure、Table 或它们附近的原文上下文里。文本召回解决的是“找到相关内容”并不自动解决“把结论和证据重新接回去”。所以科研 Agent 真正需要的不是单一搜索框而是分层的数据调用链。元数据层决定候选论文池证据层决定命中的语义片段原文层决定上下文核验资源层决定能不能把 Figure / Table 取回来。少了最后一层多模态 Agent 很容易停留在“读到一句话”而不是“看到整张图”。这也是 Sciverse 和传统学术检索系统定位差异最清楚的地方。OpenAlex 很适合做开放学术图谱和大规模元数据分析Crossref 长于 DOI 与出版元数据基础设施Semantic Scholar 在论文发现和引用网络上很强PubMed 在生物医学检索中仍是重要入口。但如果目标是把检索、原文回读、图表资源和 Agent 工作流串起来就需要一层更接近调用链的数据接口。维度SciverseOpenAlexSemantic ScholarCrossref结构化元数据检索支持强支持强自然语言证据片段检索支持非核心部分场景可替代非核心原文上下文回读核心能力需自行拼接非核心非核心Figure / Table 资源获取支持非核心非核心非核心面向 Agent 调用链强需自行封装需自行封装需自行封装这里的重点不是说谁替代谁而是场景不同。OpenAlex 更像地图Crossref 更像出版元数据底座而 Sciverse 更像面向科研 Agent 的 AI-ready 科学数据层: 不只给论文条目也给证据片段、上下文、资源路径和工作流接口。如果把 Figure / Table 当成这篇文章的主角那么 Sciverse 最关键的不是单个接口而是一条很短但很实用的链路:agentic-search - content - resource。第一步用agentic-search根据自然语言问题命中可引用证据片段并拿到doc_id、offset一类回读线索。第二步用content回到论文原文确认这段结论出现在哪个上下文里同时在返回内容里找到图表或表格资源引用。第三步用resource拉取对应的 Figure / Table 二进制资源把文字证据变成可供多模态模型进一步读取的视觉证据。这条链路的意义在于它把“文本召回”变成了“证据闭环”。科研 Agent 不是只会说“某篇论文提到了什么”而是能继续说“这句话对应哪一段原文、哪张图、哪张表以及这张图表是否真的支持前面的说法”。下面这个最小 Python 示例演示了如何围绕多模态证据做一个最小工作流。以下字段以最新线上文档 / OpenAPI 为准。importosimportreimporttimeimportrequests BASEhttps://api.sciverse.spaceTOKENos.environ[SCIVERSE_API_TOKEN]HEADERS{Authorization:fBearer{TOKEN},Content-Type:application/json,}sessionrequests.Session()session.headers.update(HEADERS)defrequest_with_retry(method,url,*,max_retries3,**kwargs):forattemptinrange(max_retries):respsession.request(method,url,timeout30,**kwargs)ifresp.status_code429:retry_afterint(resp.headers.get(Retry-After,5))ifattemptmax_retries-1:raiseRuntimeError(frate limited:{resp.text})time.sleep(retry_after)continueifresp.status_code400:raiseRuntimeError(f{resp.status_code}{resp.text})returnrespraiseRuntimeError(request failed after retries)querybattery materials stability comparison with experimental figuressearch_resprequest_with_retry(POST,f{BASE}/agentic-search,json{query:query,top_k:5,filters:{lang:en,publication_published_year:{gte:2022}}}).json()hitssearch_resp.get(hits,[])ifnothits:raiseRuntimeError(no evidence hits returned)top_hithits[0]doc_idtop_hit[doc_id]offsettop_hit.get(offset,0)content_resprequest_with_retry(GET,f{BASE}/content,params{doc_id:doc_id,offset:offset,limit:2000}).json()textcontent_resp.get(text,)print(Top title:,top_hit.get(title))print(Doc ID:,doc_id)print(Evidence snippet:,top_hit.get(chunk,)[:200])# 从原文 Markdown 中提取 Figure / Table 资源路径resource_pathsre.findall(r!\[[^\]]*\]\(([^)])\),text)resource_paths[pforpinresource_pathsifnotp.startswith(http)]fori,file_nameinenumerate(resource_paths[:3],start1):resrequest_with_retry(GET,f{BASE}/resource,params{file_name:file_name})suffixres.headers.get(Content-Type,application/octet-stream).split(/)[-1]outffigure_or_table_{i}.{suffix}withopen(out,wb)asf:f.write(res.content)print(saved:,out,from,file_name)这段代码的关键不在于“下载了图片”而在于它让 Agent 从问题出发一路走到原文和资源。对开发者来说这和普通论文列表 API 的差别非常大。因为你真正需要的不是十条标题而是一个能进入 Agent 工作流的数据层。从系统设计看这条链路至少能支持三类典型任务。任务主要问题建议链路Scientific RAG片段看起来对但上下文不完整agentic-search - contentClaim Checker结论是否真的被原文支持agentic-search - content - meta-searchMultimodal Review Agent需要图表、表格、图注与正文联动agentic-search - content - resource这也是为什么“Figure / Table 是下一块入口”这个判断并不夸张。科研工作里很多真正有区分度的信息并不在摘要里甚至不在正文主段落里而在图表和图注。一个只会读 chunk 的 Agent通常只能做第一轮筛选一个能把 Figure / Table 拉回来的 Agent才更接近科研助理。从产品角度看这也解释了为什么 Sciverse 不该被理解成普通文献搜索 API。它的价值不在“把论文搜出来”而在“把可调用的科研证据层整理出来”。meta-search让候选论文池可控agentic-search让证据片段可召回content让原文上下文可核验resource让图表和表格进入多模态链路。引用关系、聚合和计数能力则更适合扩展到系统综述、趋势分析和图谱工作流具体字段和公开能力边界仍应以最新官方文档为准。如果你今天还在把科研 Agent 理解成“模型 向量数据库”很可能会低估这个问题。科研场景真正难的不是回答要不要更流畅而是证据能不能被复核。文本片段只是第一层原文上下文是第二层Figure / Table 则是第三层。多模态科研 Agent 的下一步不是多返回几个 chunk而是让这些证据重新接回论文本身。评测 / 验证本文未进行实测跑分仅提供可复现评测方案。可以用下面三组任务验证一个科研 Agent 是否真正具备多模态证据能力。评测项任务设计观察指标图文一致性给出一个结论要求 Agent 找到对应 Figure / Table是否能返回原文段落、图表路径、图注位置上下文完整性对命中 chunk 继续回读前后文是否能避免脱离上下文复述证据可复核性输出结论时附带doc_id、offset、资源来源人工是否能按引用链回查如果一套系统只能返回“相关段落”却不能继续给出原文位置、图表资源和可追溯引用它更像检索增强问答而不是真正能进入科研工作流的 Agent。结尾 CTA如果你在做 Scientific RAG、Literature Review Agent、Claim Checker 或 MCP 工具链集成值得先看一遍 Sciverse 的官方文档和 OpenAPI再按你的工作流决定主用哪条链路。想做结构化筛选可以从meta-search和meta-catalog入手想做证据核验可以从agentic-search - content起步想做多模态科研 Agent则应该尽早把resource放进调用链。查看文档:Sciverse Docs接入工具:Sciverse-Agent-Tools直接试用 API:Sciverse Developer Console事实核查清单“Sciverse 是面向科研 Agent 的 AI-ready 科学数据层”。依据: 官方llms.txt、llms-full.txt和开发者文档定位。“Sciverse 当前公开核心能力包括agentic-search、meta-search、meta-catalog、meta-paper-relations、content、resource”。依据: 官方llms-full.txt、Sciverse-Agent-ToolsREADME、公开 OpenAPI。“Sciverse-Agent-Tools 当前 README 展示 6 个工具其中包含list_paper_relations”。依据: GitHub README 最新公开内容。“2026 年 7 月 22 日 OpenAI 发布《Advancing the next era of national science》”。依据: OpenAI 官方页面。“2026 年 7 月 27 日 Cloudflare 发布 Agents SDK v0.20.0并加入 MCP SDK v2 支持”。依据: Cloudflare 官方 changelog。“本文未提供准确率、延迟、吞吐、成本等实测数值”。依据: 本文仅给出可复现方案未做跑分。参考来源Sciverse llms.txtSciverse llms-full.txtSciverse Developer DocsSciverse API OpenAPISciverse-Agent-Tools READMEOpenAI: Advancing the next era of national scienceCloudflare Changelog: Agents SDK v0.20.0 / MCP SDK v2

相关新闻

重磅!Ollama发布UI界面,告别命令窗口!

重磅!Ollama发布UI界面,告别命令窗口!

重磅!Ollama发布UI界面,告别命令窗口! 引言在人工智能和机器学习领域,Ollama 一直以其简洁高效的命令行工具闻名,帮助开发者快速部署和运行大型语言模型(LLMs)。然而,长期以来&#…

2026/7/29 0:23:50阅读更多 →
物联网硬件安全:SE050与MKV58的硬件级防护方案

物联网硬件安全:SE050与MKV58的硬件级防护方案

1. 物联网安全现状与硬件级解决方案的必要性在2023年全球物联网连接设备数量突破290亿台的背景下,安全事件同比增长了67%。传统基于软件的安全方案(如TLS加密)已难以应对物理攻击、侧信道攻击等新型威胁。这正是SE050 Plug&Trust安全元件…

2026/7/29 0:21:49阅读更多 →
航空发动机燃油喷嘴焊完就裂?精密激光焊接三道防线

航空发动机燃油喷嘴焊完就裂?精密激光焊接三道防线

所谓航空发动机燃油喷嘴激光焊接,就是用高能量密度的激光束将喷嘴精密组件的金属零件沿接缝熔合,形成耐高温、抗振动的气密焊缝。这道工序的难度在于:喷嘴要在燃烧室上千度高温下稳定雾化燃油,焊缝一旦出裂纹,轻则雾化…

2026/7/29 0:21:49阅读更多 →
【2026必藏】6款智能降AI率网站全网首测,一键实现AI检测丝滑过审!

【2026必藏】6款智能降AI率网站全网首测,一键实现AI检测丝滑过审!

步入 2026 年,学术圈的风向早已彻底改变。曾经让人焦头烂额的查重问题,如今已不再是唯一的心头大患。随着 AI 检测技术的不断进化,高校对论文的审查标准也愈发严苛,AI 痕迹的识别能力已经精准到连句式结构和用词习惯都能被一网打尽…

2026/7/29 1:46:12阅读更多 →
网络流最小割:从“切断补给线”到“追查坏牛奶”

网络流最小割:从“切断补给线”到“追查坏牛奶”

如果说最大流是“如何用最快的速度把水从A送到B”,那么最小割就是“如何用最少的代价切断A到B的所有通路”——它用一张网络和一把“剪刀”,回答了所有阻断问题的最优解。引言假设你是一名指挥官,敌军有一条从后方基地到前线的补给线网络——…

2026/7/29 1:46:12阅读更多 →
JavaEE(JVM、多线程、网络编程)核心知识点全梳理

JavaEE(JVM、多线程、网络编程)核心知识点全梳理

# JavaEE初阶核心知识点全梳理(面试复习版)> 本文基于《Java后端极速唤醒计划》的Day 1-2内容,结合多份PDF学习资料,系统整理了JavaEE初阶必须掌握的**JVM、多线程、网络编程、HTTP/HTTPS**四大核心模块。目标读者是“学过但遗…

2026/7/29 1:46:12阅读更多 →
???????????-145928

???????????-145928

做无人机接单需要多少钱,结论是:找任务或发布需求本身未必收费,真正要预算的是项目执行费。以飞飞手册这类无人机接单平台为例,若其公开页面显示飞手、企业可免费入驻和沟通,应先截图留存并在下单前复核;航…

2026/7/29 1:46:12阅读更多 →
振动马达驱动仿生机器人制作:从非对称振动原理到虫虫机器人实践

振动马达驱动仿生机器人制作:从非对称振动原理到虫虫机器人实践

1. 项目概述:一场关于“虫虫机器人”的动手创造之旅上周六,我在北京创客空间主持了一场名为“虫虫机器人工作坊”的活动。这听起来可能有点孩子气,但实际参与下来的朋友,无论是刚入门的新手,还是有一定电子基础的爱好者…

2026/7/29 1:46:12阅读更多 →
哈密尔顿环问题:从NP难到C++回溯法实现与优化

哈密尔顿环问题:从NP难到C++回溯法实现与优化

1. 项目概述:从图论难题到代码实现哈密尔顿环问题,一个在图论和算法领域里既经典又迷人的存在。我第一次接触它,还是在大学的数据结构课上,当时就被它“看似简单,实则NP难”的特性给吸引住了。简单来说,在一…

2026/7/29 1:44:12阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/28 3:17:03阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →