论文笔记|LLM 的医学知识藏在哪?ICLR 2026 用四种可解释性方法画出大模型 Medical Knowledge Map
Medical Interpretability and Knowledge Maps of Large Language ModelsICLR 2026 24661 动机LLM 在医学任务上越来越常用但我们并不清楚模型内部到底如何表示医学知识比如患者年龄、症状、疾病、疾病进展、药物、剂量等信息分别在哪些层被处理如果一个模型在医学场景里存在偏差例如对年龄、疾病阶段、药物类别的理解有问题仅看最终回答很难定位问题来源所以作者想做一件事不是只问“模型答得对不对”而是问“模型内部在哪些层表示了哪些医学概念”。这对于后续医学 LLM 的 fine-tuning、unlearning、de-biasing、causal intervention 都有指导价值比如如果年龄偏差主要在某几层出现就没必要全模型微调可以只干预相关层2 现有方法的不足现有医学可解释性工作主要有几个问题。第一很多工作只是让模型解释自己的诊断过程也就是 self-explanation这种解释不一定忠实于模型真实内部机制容易变成“事后合理化”。第二已有 mechanistic interpretability 工作大多研究通用知识、语法、事实召回、attention head、induction head 等很少系统研究医学领域知识。第三少数医学解释性工作通常只用一种技术比如只看 t-SNE/UMAP或者只看 sparse dictionary或者只看某个模型单一方法很容易有解释偏差因为不同解释方法有不同假设。UMAP 全称是Uniform Manifold Approximation and Projection把高维 embedding 压到低维同时尽量保留原来空间里的邻近关系第四医学知识不是一种单一概念年龄是连续变量症状和疾病是类别变量疾病进展是阶段性/轨迹性变量药物既可以按作用机制分类也可以按医学专科分类剂量还涉及安全/危险边界。因此只用一个统一指标很难覆盖这些结构3 论文的研究假设或直觉核心直觉是LLM 内部并不是在所有层均匀处理医学知识而是不同医学概念会在不同层形成可检测的表示结构如果多种解释性方法都指向相似层区间那么这些层很可能就是该类医学知识的关键处理区域。4 论文novelty4.1 Novelty 1医学知识地图 LLM Map【创新点解决的问题是什么】以往很难知道医学知识在 LLM 的哪些层被表示且单一解释方法不可靠如果多个机制解释方法在不同假设下都指向相似层那么这些层更可能是真正负责该概念的层——作者把 UMAP 表示聚类、gradient-based weight saliency、layer lesioning、activation patching 四种方法统一起来对 age、symptoms、diseases、drugs、dosage 分别提取高响应层区间最终画成 LLM Medical Map显示每类医学知识在模型深度上的分布4.2 Novelty 2把医学概念分成不同几何类型来解释【创新点解决的问题是什么】医学知识不是普通分类标签年龄、疾病进展、药物分类、剂量风险的结构完全不同用同一种解释指标会过于粗糙同知识类型应该对应不同 representation geometry年龄应接近一维连续流形症状/疾病/药物应有类别聚类疾病进展应有阶段轨迹——对年龄使用 local anisotropy 和线性回归 R²——对症状、疾病、药物使用 Silhouette Score——对疾病进展设计 closest-stage-to-first 和 closest-stage-to-last 之类的 circularity proxy——对剂量使用 activation patching effect4.3 Novelty 3发现年龄表示存在非线性和 18 岁断点【创新点解决的问题是什么】年龄看似是简单连续变量但模型可能并没有把年龄表示成平滑、可编辑、可去偏的线性方向——作者用不同年龄 prompt 提取中间层 activation然后用 UMAP 可视化和 age discontinuity heatmap 分析年龄流形发现 Llama3.3-70B 在部分中间层存在明显非线性并在 17/18 岁附近出现表示断点4.4 Novelty 4发现疾病进展表示可能是 circular / non-monotonic医学上的疾病进展通常被认为从健康到严重阶段逐步变化但 LLM 内部是否这样表示并不清楚。如果模型真的理解 disease progression那么健康、早期、中期、晚期、死亡阶段在表示空间里应具有某种单调轨迹——作者构造 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 progression prompts分析每层 UMAP 空间中不同阶段的相对距离发现晚期阶段有时反而靠近早期阶段因此表示呈现环形或非单调结构4.5 Novelty 5发现药物更按医学专科而不是作用机制聚类药物知识可以按药理机制组织也可以按临床使用场景组织不知道 LLM 内部偏向哪一种——作者分别按 mechanism of action 和 medical specialty 给药物上色比较 UMAP 聚类和 Silhouette Score发现尤其在 Llama3.3-70B 中药物按医学专科聚类通常比按作用机制更明显4.6 Novelty 6发现 Gemma/MedGemma 中间层 activation collapse模型中间层可能存在表示坍缩但这类现象在医学知识表示中很少被系统观察如果 UMAP 投影中大量不同医学概念在某些层坍缩成少数 blob说明这些层可能暂时丢失了区分性表示——作者对 Gemma3-27B 和 MedGemma-27B 的中间层 activation 做 UMAP发现部分中间层表示会坍缩但在后续层又恢复提示这些层可能存在 representational inefficiency5 方法5.1 整体pipeline第一步构造医学 prompt 集合作者围绕五类医学知识构造 prompt年龄、症状、疾病、药物、药物剂量每类 prompt 又服务于不同解释方法第二步对每个模型跑 forward保存每一层 activation模型输入一个医学 prompt 后每层 transformer block 都会产生 hidden state把每层中间表示拿出来分析。这样可以回答“某个医学概念在哪些层逐渐形成”第三步跑 UMAP 表示分析对于年龄、症状、疾病、药物等 prompt作者把每层 activation 降维到低维空间可视化时用 2D UMAP定量计算 Silhouette Score 时用 30D UMAP以保留更多信息对于类别型概念Silhouette Score 衡量同类样本是否更靠近、异类样本是否更分开Silhouette Score 的意义很简单如果同一类点彼此很近不同类点彼此很远那么分数高对于年龄这种连续变量作者不用 Silhouette而是用 local anisotropy 衡量年龄点是否接近一维流形并用线性回归 R² 衡量年龄是否线性可读Local anisotropy 衡量的是一堆点是否像一条线UMAP 模块回答的是“这些医学概念在 hidden space 里有没有形成结构可视化能力强但不一定证明因果作用。第四步跑 gradient-based weight saliency作者对目标答案的 loss 关于模型权重求梯度即看某层权重对医学答案的敏感程度如果某层权重梯度大说明模型回答该医学问题时更依赖这一层作者把 attention heads 和 MLP 的权重 saliency 按层平均再跨多个 prompt 平均得到每一层的 saliency 曲线。Saliency 模块回答的是“哪些层的参数对医学答案的 loss 更敏感”它能定位权重层面的重要性但梯度大不一定代表真实因果。第五步跑 layer lesioning。Layer lesioning 的做法是把某一层 transformer block 替换成 identity function相当于让这一层“不工作”然后观察模型回答退化多少退化程度由 GPT-4o 作为 judge 打分1/10 表示几乎没退化10/10 表示严重退化某层被移除后如果医学回答明显变差说明该层对该类医学知识重要Lesioning 模块回答的是“去掉某层后模型医学能力会不会明显下降它比 UMAP 更接近功能性分析但层之间可能有冗余因此某层不退化不代表没用第六步跑 activation patchingActivation patching 是最接近因果干预的方法最基本的设定是三次 forward passclean run、corrupted run、patched runpatching effect 怎么衡量通常不是只看最终生成文本因为文本生成有随机性也不好比较。更常用的是看目标答案 token 的 logitpatching effect (patched 的 logit 差值 - corrupted 的 logit 差值)/(clean 的 logit 差值 - corrupted 的 logit 差值)最后一步汇总成 LLM Medical Map5.2 使用的数据第一年龄 prompt。年龄从 1 到 100模板包括 “He is X years old.”、“She is X years old.”、“Someone is X years old.” 等用来分析年龄表示是否连续、线性、有无断点。第二症状 prompt症状被分为 pain、neurological、respiratory、digestive、cardiovascular、dermatological、musculoskeletal、psychological、genitourinary、ENT/ocular 等组别用于分析症状类别聚类第三疾病 prompt疾病按医学专科分类包括 cardiology、orthopedics、oncology、neurology、obstetrics gynecology、dermatology、gastroenterology、pulmonology、urology 等第四疾病进展 prompt作者为 Alzheimer’s disease、COVID-19、COPD、Parkinson’s disease 各构造 9 个阶段从健康、轻微症状、中重度症状到最终严重结局用来分析 progression geometry第五药物 prompt第六药物剂量 prompt作者构造不同剂量场景例如安全剂量和高风险剂量用 activation patching 或 saliency 分析模型如何处理 dosage 信息6 主要结论Llama3.3-70B 中年龄主要在 0–5 层附近被处理症状在 0–9 层以及 15–40 层有信号疾病在 0–5 或 27–37 层药物主要在 15–45 层药物剂量大致在前半部分层但结论更不稳定不同年龄 prompt 在 Llama3.3-70B 不同层的 UMAP 分布年龄不是一条简单直线而是在中间层形成弯曲、转向甚至断裂尤其在 17/18 岁附近出现明显 discontinuity说明模型可能把未成年人和成年人分成两个表示区域用 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 prompt 做 UMAP理想情况下疾病应从健康到严重阶段逐步远离健康状态但图中显示某些晚期阶段反而靠近早期阶段形成 circular / non-monotonic pattern。也就是说模型内部对疾病进展的表示不一定符合医学上的单调恶化逻辑Gemma3-27B 某些中间层的 UMAP 点坍缩成少数几个 blob但后面层又恢复分散。作者认为这可能表示中间层出现了表示能力浪费或者模型内部有某种压缩-恢复过程。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

为什么选择weweChat替代官方微信客户端:8个理由让你彻底爱上它

为什么选择weweChat替代官方微信客户端:8个理由让你彻底爱上它

为什么选择weweChat替代官方微信客户端:8个理由让你彻底爱上它 【免费下载链接】weweChat 💬 Unofficial WeChat client built with React, MobX and Electron. 项目地址: https://gitcode.com/gh_mirrors/we/weweChat 你是否经常需要在电脑和手机…

2026/7/31 18:17:38阅读更多 →
内网穿透的应用-服务器日志出现异常怎么办?Python监控、钉钉告警与远程处理教程

内网穿透的应用-服务器日志出现异常怎么办?Python监控、钉钉告警与远程处理教程

前言 服务器运行过程中,磁盘空间不足、程序连接失败或者服务异常,通常都会在系统日志或应用日志中留下记录。但如果没有专门的监控工具,这些信息往往要等到人工登录服务器检查时才会被发现。 对于家庭服务器、测试主机和数量不多的小型服务…

2026/7/31 18:15:38阅读更多 →
Linux Optimizer常见问题解答:解决安装与使用中的10大难题

Linux Optimizer常见问题解答:解决安装与使用中的10大难题

Linux Optimizer常见问题解答:解决安装与使用中的10大难题 【免费下载链接】Linux-Optimizer Linux Optimizer 项目地址: https://gitcode.com/gh_mirrors/li/Linux-Optimizer Linux Optimizer是一款专为Linux服务器设计的自动化优化工具,支持Ubu…

2026/7/31 18:15:38阅读更多 →
大模型在企业落地的7月进展:从概念验证到生产环境的跨越与阻碍

大模型在企业落地的7月进展:从概念验证到生产环境的跨越与阻碍

大模型在企业落地的7月进展:从概念验证到生产环境的跨越与阻碍 一、7月的分水岭——概念验证结束,生产落地开始 如果说上半年的主题是"看看大模型能做什么",那7月可以看作一个明确的分水岭:越来越多的企业从概念验证阶…

2026/7/31 19:28:18阅读更多 →
别再手动装依赖!Hermes Windows 一键包省去繁琐环境配置流程

别再手动装依赖!Hermes Windows 一键包省去繁琐环境配置流程

🔍前言 对于希望体验 Hermes Agent 强大办公能力的 AI 工具用户来说,复杂繁琐的环境配置往往构成了较高的上手门槛。从手动安装依赖、调整系统路径,到处理命令行报错、修复权限异常、补全缺失的核心文件……这一系列技术难题,使得…

2026/7/31 19:28:18阅读更多 →
Gateway 离线、杀毒拦截一文解决,OpenClaw 2.7.9 双系统落地指南

Gateway 离线、杀毒拦截一文解决,OpenClaw 2.7.9 双系统落地指南

核心亮点:提供全程可视化的图形操作界面,自动补齐全套运行依赖,数据独立存储于本地设备,兼容多款主流大模型,并采用轻量化的 45.7MB 整合压缩包。 教程适配:OpenClaw | 适配 Windows 10/11 与 macOS 双系统…

2026/7/31 19:28:18阅读更多 →
打通多模型路由!OpenClaw 2.7.9 环境搭建与技能扩展实操教程

打通多模型路由!OpenClaw 2.7.9 环境搭建与技能扩展实操教程

如今,各类对话式 AI 工具层出不穷,但大多仅支持文本交互,难以直接操控本地文件、浏览器及办公软件。OpenClaw 主打本地部署 自动化执行,能够接收自然语言指令,自主完成各类电脑操作,深受职场人士与技术爱好…

2026/7/31 19:28:18阅读更多 →
实测 OpenClaw 2.7.9 轻量化客户端,45.7MB 资源包安装教程

实测 OpenClaw 2.7.9 轻量化客户端,45.7MB 资源包安装教程

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具。它凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通的在线对话AI工具不同,OpenClaw是一款能够直接操控本机软硬件的智能数字员…

2026/7/31 19:28:18阅读更多 →
磁悬浮鼓风机配啥变频器?四方电气 DX500 表示:这活儿我熟

磁悬浮鼓风机配啥变频器?四方电气 DX500 表示:这活儿我熟

直接说结论:给磁悬浮鼓风机挑变频器,四方电气 DX500 属于那种 “上手就知道可靠” 的选手,不是花哨的,但相对是干活儿很稳的那一档。 一、先唠唠:鼓风机这玩意儿为啥这么费电? 各位厂长、工程师朋友们&…

2026/7/31 19:26:18阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/30 15:03:16阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/31 17:41:43阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/30 15:13:02阅读更多 →
物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:40阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:41阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:41阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/31 0:49:33阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/31 5:08:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/31 16:02:17阅读更多 →