【论文学习】MICCAI 2024 || SGSeg:通过自引导机制实现胸部X光片语言引导分割的无文本推理
SGSegEnabling Text-free Inference in Language-guided Segmentation of Chest X-rays via Self-guidanceMICCAI 2024SGSeg通过自引导机制实现胸部X光片语言引导分割的无文本推理LViT、LanGuideMedSeg等视觉—语言分割模型同时输入胸部X光图像对应的医学文本描述。文本可以告诉模型病灶大致位于左肺、右肺、上部、中部或下部因此能够帮助模型定位感染区域。但是存在一个临床流程问题患者拍摄X光片 ↓ 医生观察图像 ↓ 医生撰写报告当医生还没有完成诊断报告时模型就没有文本可以使用。因此要求测试阶段输入报告会限制模型在临床辅助诊断中的应用。SGSeg提出的解决办法是训练阶段图像真实文本 → 学习图文引导分割 测试阶段只有图像 → 自动生成文本 → 文本再引导分割所以它称为“Self-Guidance”即模型用自己生成的报告指导自己进行分割。SGSeg的整体流程SGSeg由两个主要部分组成Language-guided U-Net语言引导的分割网络LERG位置增强报告生成模块。训练阶段训练时输入胸片和真实文本例如双侧肺部感染共有4个感染区域位于左肺上、中、下部以及右肺下部。真实文本有两个用途输入BERT生成文本特征指导病灶分割从文本中提取病灶位置伪标签监督报告生成模块。此时模型同时学习如何根据图像和文本分割病灶如何仅根据图像预测病灶位置并生成报告。推理阶段测试时不输入真实报告只有图像胸片 ↓ LERG预测病灶位置 ↓ 自动生成结构化报告 ↓ BERT提取生成文本的特征 ↓ 语言引导分割网络 ↓ 病灶分割结果因此“无文本推理”的准确含义是不需要从外部提供真实文本但模型内部仍然会生成文本并使用生成文本完成分割。Language-guided U-Net 这个部分负责最终的病灶分割图像编码器作者使用预训练的ConvNeXt-T把输入的(224x224)胸片逐层编码成多尺度视觉特征文本编码器使用医学领域预训练的BERT将报告转化为文本特征。语言引导解码器作者采用LanGuideMedSeg中的Guided Decoder通过跨模态注意力将文本特征与视觉特征融合。作者对词语注意力进行了可视化发现位置词获得了很高的注意力。因此他们认为在QaTa-COV19上文本帮助分割的主要原因之一是文本提供了明确的病灶位置。LERG位置增强报告生成模块它不是生成完整、自由形式的放射学报告而是重点生成病灶位置描述。六个位置区域作者把两侧肺部划分成六个区域左肺上部左肺中部左肺下部右肺上部右肺中部右肺下部。模型对每个区域输出True或False判断该区域是否存在感染。然后将预测结果转换成固定格式的文本例如双侧肺部感染共有4个感染区域位于左肺上、中、下部和右肺下部。位置伪标签提取QaTa-COV19没有为每个肺区提供单独的位置分类标签只有文本报告。因此作者使用医学BERT编码报告HDBSCAN聚类从报告中提取位置相关的伪标签。这些伪标签作为弱监督信号训练LERG判断六个肺区是否存在感染。目标解码器LERG参考RT-DETR结构包含ResNet-50视觉骨干跨尺度特征融合模块Object Decoder。它从图像中产生一组目标查询尝试定位感染区域。位置注意力聚合器目标解码器会生成很多预测但其中大部分可能是“无目标”只有少量预测真正包含病灶位置。因此作者设计位置注意力聚合器为每个位置建立一个查询向量计算该位置与所有目标预测的相关性对相关预测进行加权聚合得到六个位置的预测结果。这一步的作用是从大量稀疏目标查询中提取真正有用的病灶位置特征。论文只使用了QaTa-COV19数据集训练集5716张验证集1429张测试集2113张。作者还修正了约4%的错误文本、拼写错误和模糊描述。方法推理输入AccuracyDiceJaccardU-Net图像0.9450.8190.692U-Net图像0.9470.8230.706Swin U-Net图像0.9500.8320.724SGSeg只需图像0.9710.8740.778LViT图像真实文本0.9620.8370.751LanGuideMedSeg图像真实文本0.9750.8980.815设置DiceJaccard不使用文本0.8460.725CLIP视觉—语言预训练0.8500.740简单报告生成0.8610.759弱监督LERG0.8740.778使用真实文本0.8900.797摘要胸部X光图像中的感染区域分割对于准确勾画肺部结构和病理异常区域具有重要意义。近年来多模态语言引导的图像分割方法逐渐成为胸部X光图像分析中一种具有潜力的解决方案。这类方法将描述图像诊断结果的临床文本报告作为辅助信息用于指导图像分割。然而现有的语言引导方法要求在推理时同时输入图像和对应的临床报告。因此它们并不适合应用于临床决策支持场景下的图像分割而主要局限于医生完成临床报告后的回顾性图像分析。在本研究中我们提出了一种自引导分割框架SGSeg。该框架在训练阶段利用语言信息进行多模态训练同时在推理阶段实现不需要外部文本输入的单模态推理。据作者所述这是首个能够在语言引导分割中实现无文本推理的方法。我们利用文本报告中包含的肺部结构和病理区域的重要位置信息提出了一种新的位置增强报告生成模块即LERG用于自动生成临床报告并以生成的报告作为模型的自引导信息。LERG由以下部分组成目标检测器基于位置的注意力聚合器位置感知伪标签提取模块。其中位置感知伪标签提取模块为LERG提供弱监督信号。在具有代表性的QaTa-COV19数据集上进行的大量实验表明SGSeg的性能优于现有的单模态分割方法并且接近当前先进的多模态语言引导分割方法。图一图1. 所提出的SGSeg框架的神经网络架构蓝色部分代表语言引导型U-Net粉色部分表示增强定位功能的报告生成流程。训练时使用真实医学文本测试时只输入胸片由模型自己生成文本再指导病灶分割。整个框架分为两部分蓝色语言引导型U-Net负责输出病灶分割掩码粉色位置增强报告生成模块LERG负责根据图像生成位置描述。训练阶段 训练时同时输入胸部X光图像真实文本报告。真实文本在训练阶段有两个用途。用途1指导病灶分割真实文本经过Text Embedding文本编码器转换成文本特征。与此同时图像进入蓝色图像编码器提取从L1到L5的多尺度视觉特征L1、L2较浅层的边缘和纹理L3、L4病灶形状和局部结构L5高级病理语义。解码器逐层恢复图像分辨率并通过跳跃连接使用L1—L4视觉特征。文本特征则为解码过程提供病灶位置指导最后输出Predicted Mask即预测的感染区域掩码。蓝色分支可以概括为胸片 → 图像编码器 → 多尺度视觉特征 ↓ 真实文本 → 文本编码器 → 语言引导解码器 ↓ 病灶掩码用途2监督报告生成模块真实文本还会进入Pseudo Label Extraction即伪标签提取模块。作者利用HDBSCAN从报告中提取六个位置标签肺部区域是否存在感染左肺上部True/False左肺中部True/False左肺下部True/False右肺上部True/False右肺中部True/False右肺下部True/False这些标签并不是人工单独标注的而是从文本报告中自动提取的所以称为“伪标签”。伪标签用来弱监督粉色报告生成分支学习如何仅根据胸片判断病灶位于哪些肺部区域。粉色部分从右向左处理。Image Encoder输入胸片首先经过独立的图像编码器提取视觉特征。Object Decoder参考目标检测模型从视觉特征中产生一组Object Queries。每个小方框可以理解为一个候选目标特征但其中一部分可能对应真实病灶大部分可能是背景或无效候选Attention Aggregator注意力聚合器从大量候选目标中筛选和汇总与肺部位置相关的特征。它针对左、右肺的上、中、下六个区域分别聚合最相关的目标信息避免无效候选影响位置判断。六个位置预测聚合后的特征用于预测六个区域的True/False左肺上部、中部、下部 右肺上部、中部、下部训练时这些预测由前面从真实报告中提取的伪标签监督。因此图中用“Weakly Supervise”表示弱监督。Text Generation把六个位置预测转换成固定格式的报告。例如预测结果为左肺上部True 左肺中部True 左肺下部True 右肺下部True就可以生成双侧肺部感染共有4个感染区域分别位于左肺上、中、下部和右肺下部。推理阶段测试时没有真实医学报告只有胸片。处理过程变成胸片 ↓ 粉色LERG模块 ↓ 预测六个肺部区域是否感染 ↓ 自动生成位置文本 ↓ 文本编码器 ↓ 生成的文本指导蓝色U-Net ↓ 病灶分割掩码因此推理阶段蓝色分割网络接收的不是医生写的真实报告而是粉色模块生成的Predicted Text。图二图 2. 词语重要性示意图展示了报告中每个词元的注意力权重分布在图像与文本进行跨模态融合时模型对报告中每个词元分配了多大的注意力。这说明在QaTa-COV19的语言引导分割中模型重点利用的是文本中的病灶位置描述而不是“肺部感染”等一般诊断词。作者通过这张图得出医学报告对分割的主要帮助之一是提供了病灶的位置语义。因此SGSeg没有尝试生成复杂完整的临床报告而是设计LERG模块重点预测六个位置左肺上、中、下部右肺上、中、下部。再将位置预测组合成结构化文本用它指导分割。位置词具有较高注意力 ↓ 位置描述对分割很重要 ↓ 根据图像预测六个肺区是否感染 ↓ 生成位置型报告 ↓ 用生成报告指导病灶分割表一表1. 我们的SGSeg与现有单模态及多模态分割方法在QaTa-COV19数据集上的性能比较。单模态与多模态方法的最佳结果已用下划线标出我们的SGSeg结果以粗体显示。比较了三种不同使用方式的分割模型训练和测试都只使用图像训练使用图像文本测试只使用图像训练和测试都使用图像文本。类型训练阶段推理阶段Uni-Modal图像图像SGSeg图像真实文本只有图像Multi-Modal图像真实文本图像真实文本SGSeg在不需要外部文本输入的条件下明显优于所有纯图像模型并接近使用真实文本的最佳多模态模型。图三图 3. 分割结果的比较分析单模态方法与多模态方法表二表2. 关于SGSeg中各组件影响的消融研究无文本——单模态分割视觉-语言预训练——使用CLIP进行预训练并通过单模态分割微调自引导——在推理过程中使用生成文本作为输入全文——在推理过程中使用真实文本作为输入。图四图 4. 生成文本与分割结果之间关系的对比分析SGSeg生成的文本是否准确会直接影响最终的病灶分割结果。上方病例生成文本错误下方病例生成文本正确证明两个观点LERG生成的位置文本确实能够指导分割生成文本的错误会传递到最终分割结果。图五图5. 模型注意力分布在输入图像上的可视化结果按以下顺序排列图像、真实分割结果、注意力图以及投影到图像上的注意力图。

相关新闻

医院/学校时钟同步系统从零搭建实战:架构设计与设备选型

医院/学校时钟同步系统从零搭建实战:架构设计与设备选型

去年接手了一个三甲医院新院区的弱电集成项目,其中时钟同步系统这块踩了不少坑。网上搜了一圈,要么是厂家软文,要么是纯 NTP 配置教程——从系统集成工程师视角出发的完整方案几乎为零。趁着项目收尾,把架构设计、技术决策、供应商…

2026/7/29 11:49:48阅读更多 →
幻兽帕鲁存档编辑终极指南:palworld-save-tools完全解析与实战应用

幻兽帕鲁存档编辑终极指南:palworld-save-tools完全解析与实战应用

幻兽帕鲁存档编辑终极指南:palworld-save-tools完全解析与实战应用 【免费下载链接】palworld-save-tools Tools for converting Palworld .sav files to JSON and back 项目地址: https://gitcode.com/gh_mirrors/pa/palworld-save-tools 你是否曾面对《幻兽…

2026/7/29 11:47:48阅读更多 →
2026年3款荣耀mp3转文字哪个好,付费成本实测后给出靠谱选购结论

2026年3款荣耀mp3转文字哪个好,付费成本实测后给出靠谱选购结论

先说明白核心判断 针对2026年可在荣耀设备上使用的3款主流mp3转文字工具,我从自媒体内容创作的转写、字幕制作、内容整理场景出发,完成了付费成本和功能实测,三款工具定位差异明显:仅需基础转写可选择录音转文字助手,…

2026/7/29 11:47:48阅读更多 →
MetaboAnalystR 4.0:从原始LC-MS数据到生物学洞察的完整R包解决方案

MetaboAnalystR 4.0:从原始LC-MS数据到生物学洞察的完整R包解决方案

MetaboAnalystR 4.0:从原始LC-MS数据到生物学洞察的完整R包解决方案 【免费下载链接】MetaboAnalystR R package for MetaboAnalyst 项目地址: https://gitcode.com/gh_mirrors/me/MetaboAnalystR MetaboAnalystR 4.0是一个功能强大的开源R包,专门…

2026/7/29 12:56:38阅读更多 →
Arduino开源硬件发展史:从社区协作到商业纷争的技术生态演变

Arduino开源硬件发展史:从社区协作到商业纷争的技术生态演变

1. 从开源明星到“分家”风波:Arduino的AB面 如果你在2010年前后接触过电子制作或创客教育,那么Arduino这个名字几乎等同于“开源硬件”的代名词。一块蓝色的小板子,一个简单的集成开发环境(IDE),让无数学生…

2026/7/29 12:56:38阅读更多 →
企业绩效管理软件的技术演进与实施优化

企业绩效管理软件的技术演进与实施优化

1. 企业绩效管理软件的演进之路 2000年初的财务部门还在与Excel表格鏖战时,一家名为Hyperion Solutions的软件公司已经开始重新定义企业绩效管理(EPM)的方式。作为最早将OLAP技术商业化的先驱,他们推出的Essbase多维数据库引擎彻底改变了财务分析的游戏规…

2026/7/29 12:56:38阅读更多 →
Loop:5个技巧让你彻底告别Mac窗口混乱,体验优雅的径向菜单窗口管理

Loop:5个技巧让你彻底告别Mac窗口混乱,体验优雅的径向菜单窗口管理

Loop:5个技巧让你彻底告别Mac窗口混乱,体验优雅的径向菜单窗口管理 【免费下载链接】Loop Window management made elegant. 项目地址: https://gitcode.com/GitHub_Trending/lo/Loop Loop是一款创新的macOS窗口管理工具,通过直观的径…

2026/7/29 12:56:38阅读更多 →
基于Arduino的自动喂鱼器DIY指南:从硬件选型到智能程序设计

基于Arduino的自动喂鱼器DIY指南:从硬件选型到智能程序设计

1. 从“养鱼焦虑”到“动手解决”:为什么你需要一个自动喂鱼器 养鱼的朋友大概都经历过这种时刻:出差几天,或者只是周末想出门玩一趟,心里就开始惦记家里的鱼缸——鱼食谁来喂?喂多了怕坏水,喂少了怕饿着。…

2026/7/29 12:56:38阅读更多 →
如何安全访问个人加密数据?合规信息归档方案解析

如何安全访问个人加密数据?合规信息归档方案解析

如何安全访问个人加密数据?合规信息归档方案解析 【免费下载链接】PyWxDump 删库 项目地址: https://gitcode.com/GitHub_Trending/py/PyWxDump 在数字时代,个人数据安全访问已成为技术爱好者和普通用户的共同需求。当重要信息被加密存储在本地设…

2026/7/29 12:54:38阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →