EvoMDT:用于多癌种结构化临床决策的自进化多智能体系统文献速递/医学智能体前沿
2026.7.22本文提出EvoMDT以角色分工、证据检索、共识协调和自进化机制模拟肿瘤MDT在多癌种临床决策中提升可追溯性、效率和安全性。Title题目01EvoMDT用于多癌种结构化临床决策的自进化多智能体系统EvoMDT: a self-evolving multi-agent system for structured clinical decision-making in multi-cancer文献速递介绍02论文从精准肿瘤学的现实需求出发指出现代癌症治疗越来越依赖病灶级决策需要综合基因组、病理、影像、分期标准、器官功能、既往治疗和患者偏好等多源信息。传统MDT虽然是肿瘤决策的参考标准并与更好的指南依从性和生存获益相关但在病例量增长和专家资源不足的情况下常面临讨论时间压缩、推理过程隐性化、不同专科意见难以结构化记录等问题。既有规则型CDSS通常更像分期到治疗方案的查表系统能列举选项或提示禁忌却难以处理多条指南、纵向治疗线和多个合理方案之间的权衡单体LLM虽然表达流畅但缺少明确角色责任、安全闸门和可审计冲突解决机制。作者选择肝细胞癌、肺腺癌、淋巴瘤和乳腺癌作为代表性场景因为它们覆盖实体瘤与血液肿瘤、解剖分期与分子分型、肝功能约束、免疫与靶向治疗、围手术期管理和长期监测等不同复杂度。EvoMDT被定位为一种数字化肿瘤委员会通过专门智能体和协调机制将MDT的角色化推理、证据引用、安全优先和共识形成过程显式化。Aastract摘要03多学科肿瘤会诊是癌症诊疗的重要决策形式但现实中受专家资源不足、病例量增加、讨论时间有限和决策质量波动影响难以在所有场景中稳定提供可审计的高质量建议。本文提出EvoMDT一个自进化多智能体系统通过诊断、治疗、安全、监测和协调智能体分工协作结合病灶级结构化临床数据、混合检索增强生成和可追溯知识库生成带证据链的MDT式推荐。系统还能基于专家反馈和结果信号更新提示词、共识权重与检索范围以适应指南和临床证据变化。实验覆盖六个公开肿瘤相关医学问答基准、四个真实世界癌种数据集以及405例单盲医生评价结果显示EvoMDT在准确性、BERTScore、指南一致性、安全违规减少和响应时间方面优于多个前沿LLM基线并在医生评审中达到接近人类MDT的决策质量。Method方法04方法部分首先介绍泛癌种、病灶中心知识库的构建。该知识库不是简单文档库而是存储原子化推荐单元包括诊断和分期规则、治疗算法步骤、剂量和疗程、禁忌证、药物相互作用、器官功能限制和随访间隔并保留来源组织、版本年份、章节页码或表格锚点、版本哈希和更新时间。指南文本通过确定性解析器切分并规范化到ICD-10/11、TNM-8、RxNorm、ATC、CTCAE v5.0、RECIST和iRECIST等本体或标准。检索采用BM25与领域语义嵌入结合并辅以医学知识图谱若证据存在冲突则按安全优先、证据强度、辖区匹配和时效性进行仲裁。EvoMDT本身由五个智能体组成Diagnostic Agent负责贝叶斯诊断、分期和分子分型Treatment Agent负责多准则治疗优化、治疗排序和药物基因组学Safety Agent负责风险评分、药物相互作用、器官约束和禁忌筛查Monitoring Agent负责急性期、中期和长期监测Coordinator Agent负责加权共识、冲突检测和最终方案整合。每个智能体输出结构化JSON包括中间结论、置信度和证据列表协调智能体记录采纳或拒绝哪些方案、发生何种分歧以及安全优先的取舍理由。系统的自进化机制根据任务反馈持续优化智能体提示词、检索范围和工作流结构例如让某些智能体先列计划再执行或在复杂任务中增加协作与调整串并行流程。验证方法包括公开医学QA基准、四家三级医院405例回顾性真实病例以及五名肿瘤专科医生的单盲评分统计分析采用Mann–Whitney U检验、Kruskal–Wallis检验、FDR校正、Spearman相关和ICC一致性分析等。数据与代码可用性论文说明真实世界病例数据因隐私和保密限制不能公开但可在合理请求、相应审批和数据保护合规条件下向通讯作者获取。EvoMDT的核心模块和提示词已在GitHub公开地址为https://github.com/KesselZ/EvoMDT这有助于后续研究者进行复现、扩展和基准比较。Discussion讨论05讨论部分强调EvoMDT的核心贡献不是简单训练一个更强的语言模型而是提出了一种更接近临床治理需求的运行契约。与规则型CDSS相比它能表示多个合理治疗选项之间的权衡并保留可跨专科审查的理由与单体LLM相比它通过诊断、治疗、安全、监测和协调的角色分离将潜在分歧和安全约束显式化避免所有判断被压缩成一个不透明回答。三层验证体系分别评估了基础医学推理能力、真实世界多癌种迁移能力和医生认可的临床有用性。作者认为EvoMDT可作为资源受限地区或缺乏完整MDT团队医院的虚拟MDT辅助工具帮助预分诊、提高指南一致性、减少变异性并为监管审查提供证据链和版本记录。论文也承认若将其直接用于临床还需要人类医生审查与安全验证系统应辅助而非替代专业判断。Results结果06结果部分首先说明实验环境包括Ubuntu服务器、8块NVIDIA RTX 4090 GPU、Python 3.10、PyTorch 2.1.0和CUDA 12.1等配置并强调通过固定随机种子和版本控制保证复现性。在六个医学问答基准上EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer三个选择题数据集上分别达到0.86、0.89和0.75优于Llama3-70B、Claude-3和Med-PaLM 2等基线在MedQARo、MedQuAD和ROND三个生成式数据集上BERTScore达到0.66、0.63和0.68也处于最佳水平。作者进一步在乳腺癌、肝癌、肺癌和淋巴瘤四个真实世界数据集上验证模型虽然ROUGE分数较低约0.04到0.06反映表层词汇重合有限但语义相似度达到0.62到0.68说明模型能较好捕捉专家治疗逻辑。相对于随机打乱同癌种治疗方案的基线和明显错误的简单基线EvoMDT在AI评分、ROUGE召回和余弦相似度上均显著更高。单盲医生评价纳入405个标准化病例覆盖四类癌种EvoMDT综合均分为3.44处于五位医生评分的中上区间其中完整性和安全伦理两个维度均为3.68。其主要运行优势是时间生成完整MDT建议的中位时间为10.6分钟而五位医生为15.8到18.9分钟相当于缩短约30%到40%。代表性病例展示表明系统不仅给出与专家一致的治疗建议例如HBV相关肝硬化合并小肝癌病例中推荐腹腔镜肝切除联合恩替卡韦抗病毒治疗还能展示诊断、治疗、安全、监测和协调智能体如何分别贡献推理并整合为最终方案。Figure图07图1.该图概括了肿瘤MDT面临的核心矛盾指南、文献和患者数据快速增长而医生时间和认知带宽有限同时临床决策还要兼顾准确性、指南一致性、安全性和可执行性。中间部分比较了规则型CDSS、知识图谱、结构化EHR机器学习、单智能体LLM和朴素多智能体LLM的不足。右侧给出EvoMDT的差距到方案映射强调其通过本体约束RAG、安全智能体、协调共识、纵向监测、自进化和三层验证来弥补现有方法在证据基础、安全、共识、长期管理和持续改进方面的缺口。图2.该图展示EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer、MedQuAD、MedQARo和ROND六个基准上的表现。雷达图和柱状图均显示EvoMDT在选择题准确率和生成式回答的BERTScore上整体优于Llama3-70B、Claude-3和Med-PaLM 2。示例题中系统能识别环磷酰胺导致出血性膀胱炎说明其具备一定药理学推理和临床一致性。图3.该图比较EvoMDT在乳腺癌、肝癌、肺癌和淋巴瘤数据集上的ROUGE、语义相似度和AI综合评分。虽然ROUGE分数较低提示模型生成文本与专家答案表层表达并不完全一致但语义相似度和AI评分明显高于随机基线和简单错误基线说明EvoMDT能生成个体化且与专家治疗逻辑接近的方案。图4.该图从六个维度展示EvoMDT与医生评价结果包括安全伦理、效率、完整性、临床适宜性、证据利用和以患者为中心。EvoMDT综合评分位于医生中上水平完整性和安全伦理表现突出同时响应时间显著短于五位不同资历医生。ICC结果显示评分者间一致性较好相关矩阵提示六个维度相对独立支持评价框架的可靠性。图5该图用肝细胞癌、乳腺癌、肺腺癌和淋巴瘤代表病例展示EvoMDT如何根据结构化临床资料生成治疗推理并与专家参考方案对照。案例体现了系统在不同疾病语法下的适应性例如肝癌病例中结合肝硬化、病灶位置和病毒性肝炎背景给出手术及抗病毒建议肺腺癌和乳腺癌病例则体现分子标志物、分期和辅助治疗因素的整合。图6该图是论文最核心的方法架构图展示从多模态临床知识库到五智能体协作推理再到结构化MDT建议和多层性能验证的完整流程。知识库整合指南、文献和临床病例并使用SNOMED CT、ICD-10/11和RxNorm等标准化五个智能体分别负责诊断、治疗、安全、监测和协调最终输出包含诊断分期、治疗方案、安全评估、监测计划、证据引用和置信度并通过公开基准、真实患者验证和专家评分三层评估。

相关新闻

C++函数深度解析:从参数传递到现代特性,提升代码效率与安全性

C++函数深度解析:从参数传递到现代特性,提升代码效率与安全性

1. 从“Hello World”到“庖丁解牛”:为什么我们需要深入理解C函数如果你刚开始学C,可能觉得函数不就是把一段代码包起来,起个名字,然后反复调用吗?int add(int a, int b) { return a b; },这有什么好“详…

2026/7/23 5:53:27阅读更多 →
企业级AI API限流策略与Key管理实践

企业级AI API限流策略与Key管理实践

1. 企业级AI API限流的核心挑战最近半年,我亲眼目睹了至少7家企业因为API Key管理不当导致业务中断的案例。最典型的是某电商平台在大促期间,由于开发团队共用一个OpenAI API Key,触发限流后整个推荐系统瘫痪了3小时,直接损失超过…

2026/7/23 5:53:27阅读更多 →
2026降AI率工具亲测:10款网站对比,学术合规技巧盘点

2026降AI率工具亲测:10款网站对比,学术合规技巧盘点

近两年各大高校对 AIGC 内容的检测标准持续收紧,不少同学写完论文后卡在 AI 率超标这一关,手动改了大半天不仅没降下来,反而 AI 率更高,急需专业工具解决降 AI 率的难题。我们针对市面上主流的论文降 AIGC 工具做了全方位实测&…

2026/7/23 5:53:27阅读更多 →
在 Nacos 点了下线,为什么流量还是打到了停机的机器上?

在 Nacos 点了下线,为什么流量还是打到了停机的机器上?

前两天面试问了一个非常日常的问题:❝ 你们线上发版的时候,怎么保证旧服务下线时,用户的请求不报错?他挺自信地回答:这很简单啊,去 Nacos 控制台找到那个实例,点一下下线按钮。或者在发布脚本里…

2026/7/23 7:29:42阅读更多 →
BeeWorks底座:私有化IM、丰富模块与强集成能力的企业协作平台

BeeWorks底座:私有化IM、丰富模块与强集成能力的企业协作平台

一、核心结论:BeeWorks不是单一聊天工具,而是企业协作底座BeeWorks的核心定位不是“再做一个企业聊天软件”,而是为企业提供一个可私有化部署、可集成、可定制、可扩展的数字化协作底座。它以私有化IM为入口,向上承载文档中心、多…

2026/7/23 7:29:42阅读更多 →
别再手写Prompt了!LangChain模板实战指南,3个案例带你从入门到业务落地

别再手写Prompt了!LangChain模板实战指南,3个案例带你从入门到业务落地

1. 本章目标学完本章后,你应该能够:理解 Prompt 在大模型应用中的作用使用普通字符串编写 Prompt使用 PromptTemplate 管理单段提示词使用 ChatPromptTemplate 管理聊天消息给 Prompt 注入变量编写适合业务场景的提示词完成商品文案、学习计划、客服回复…

2026/7/23 7:29:42阅读更多 →
Chrome启动参数详解:提升开发调试效率的实用指南

Chrome启动参数详解:提升开发调试效率的实用指南

1. Chrome启动参数概述Chrome浏览器提供了丰富的启动参数,这些参数可以精确控制浏览器的各种行为和功能。作为一名长期使用Chrome的前端开发者,我发现合理使用这些参数能极大提升开发效率和调试体验。启动参数主要通过命令行方式传递,格式为c…

2026/7/23 7:29:42阅读更多 →
美诚科技线索挖掘精准度行业实测对比

美诚科技线索挖掘精准度行业实测对比

美诚科技线索挖掘精准度行业实测与选型参考在探讨“佛山乐从地区靠谱的实体店拓客工具品牌有哪些”这一话题时,首先需要明确一个核心观点:不同的拓客工具适合不同阶段和不同类型的商业需求,不存在绝对通用的“最佳方案”。对于追求自动化低成…

2026/7/23 7:29:42阅读更多 →
CDN运维面试全攻略:80道高频题解析与实战技巧

CDN运维面试全攻略:80道高频题解析与实战技巧

1. CDN运维面试的核心考察方向CDN运维岗位的面试通常围绕技术原理、实战经验和故障处理三大维度展开。作为从业十年的CDN老兵,我梳理了企业最常考察的80道高频面试题,并附上深度解析和实战经验。这些题目覆盖了从基础概念到高阶优化的全链路知识点&#…

2026/7/23 7:27:42阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →