ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

Nature子刊 IF=15.1 | AI辅助ICD编码的真实世界部署与评估:基于大模型与临床文档标准化

Nature子刊 IF=15.1 | AI辅助ICD编码的真实世界部署与评估:基于大模型与临床文档标准化 引言国际疾病分类ICD编码是医院运营的基石但手动编码过程耗时费力且易出错已成为全球医疗机构的沉重负担。尽管人工智能AI技术为自动化编码带来了希望但现有模型往往难以适应真实世界中复杂多变的临床文档结构其实际工作流程中的性能和用户接受度更是鲜有验证。近日一项发表在《npj Digital Medicine》上的研究带来了突破。来自台湾多所大学和医院的研究团队开发并部署了一套模块化、基于临床实际的人工智能编码系统。该系统不仅通过创新的模型选择框架确定了高性能的基础大语言模型还利用HL7临床文档架构CDA标准化的章节信息进行训练并在为期13周的随机对照试验RCT中证明该AI辅助工作流能显著提升编码效率同时揭示了不同背景的编码专家对AI工具的接受度差异为AI在真实临床环境中的落地提供了关键证据。基本信息•文章标题Evaluating real-world deployment of an HL7-CDA-aligned LLM for ICD-10-CM coding•期刊npj Digital Medicine•影响因子15.1•发表时间2026年3月3日•研究单位台湾高雄医学大学及其附设医院联合岛内多所高校、研究院与医疗机构并协同越南高校组成的跨地域、跨学科医疗科研合作网络•论文地址https://doi.org/10.1038/s41746-026-02541-5研究内容与方法数据集构建与预处理数据来源选取两家合作医院的HL7-CDAR2标准格式匿名临床数据集包含5个与ICD编码高度相关的核心章节出院诊断DischgDiag、病史MedHist、手术记录OpNote、病理报告PathRep、治疗过程TreatCous数据清洗执行统一清洗流程包括重复记录移除、ICD标签一致性检查、文本标准化数据集划分采用多标签分层采样8:1:1策略在训练、验证、测试集中保留ICD-10标签的原始分布文本截断策略受模型2048-token输入限制依据编码专家推荐的章节优先级优先截断低优先级章节内容确保诊断关键信息被保留【模块化ICD-10-CM编码系统框架与传统流程对比】注图(a)展示本文提出的结构化工作流涵盖数据采集、冗余感知采样、LLM-as-judge评估、分段微调与临床部署图(b)展示传统非结构化开发流程缺乏原则性模型选择导致资源浪费与低效。冗余感知采样策略语义冗余识别使用预训练的all-MiniLM-L6-v2句子编码器将每条出院小结编码为语义向量构建FAISS索引实现近似最近邻搜索计算向量间L2距离作为语义相似度指标当两条记录的ICD-10-CM代码完全一致且语义相似度超过阈值τ\tauτ默认设为0.9时标记为语义冗余样本对冗余样本保留规则计算冗余样本对的困惑度PPL公式如下PPLe−1N∑i1Nlog⁡p(xi∣xi,θ) PPL e^{-\frac{1}{N}\sum_{i1}^N \log p(x_i | x_{i}, \theta)}PPLe−N1​∑i1N​logp(xi​∣xi​,θ)其中NNN为文本序列长度p(xi∣xi,θ)p(x_i | x_{i}, \theta)p(xi​∣xi​,θ)为基础模型在参数θ\thetaθ下对第iii个token的预测概率保留PPL差异≥5%的样本中PPL更高的样本若PPL差异5%保留长度更长的样本以保留更多上下文信息【冗余感知采样前后ICD-10-CM章节分布对比】注展示高雄医学大学医院训练集在冗余移除前后各ICD-10-CM章节的样本数量分布变化。预训练基础模型选择方法候选模型范围筛选5个参数规模≤70亿的Decoder-only LLM包括PubMedGPT-2、Llama2-7B、Mistral-7B instruct及其领域适配变体MedLlama2、BioMistral-7BLLM-as-judge pairwise评估针对训练集中Top50高频ICD-10-CM代码让候选模型生成对应的临床定义文本采用Atla Selene Mini作为自动化评判模型对每对候选模型的输出进行语义保真度与临床适用性比较无明确偏好的案例标记为平局Plackett-Luce模型全局偏好排序基于pairwise比较结果构建有向对比图节点代表候选模型有向边表示模型间的胜负关系无向边表示平局依据Luce选择公理通过迭代Luce谱排序算法估算模型的全局偏好权重计算每个模型的选择概率P(Mk)αk∑j1mαj P(M_k) \frac{\alpha_k}{\sum_{j1}^m \alpha_j}P(Mk​)∑j1m​αj​αk​​其中αk\alpha_kαk​为模型MkM_kMk​的偏好权重mmm为候选模型总数选择概率最高的模型作为下游微调的基础模型【基于LLM-as-judge的基础模型选择结果可视化】注(a)为模型间胜负关系混合有向图有向边表示模型偏好无向边表示平局(b)为胜率矩阵热力图展示候选模型相对各对手的胜率。分段指令调优方法分段指令模板设计采用HL7-CDAR2对齐的指令式模板每个临床章节以“###”章节名作为前缀内容填充对应临床文本缺失章节显式标记为“Nil”统一输入输出结构两类模型训练策略通用分段感知模型使用完整模板训练支持处理异质文档结构训练与推理阶段均对缺失章节标记“Nil”固定分段组合模型针对特定章节组合如仅DischgDiag、DischgDiagMedHist等训练仅处理与训练时结构匹配的输入微调目标采用监督参数级微调以自回归训练损失更新模型参数学习ICD-10-CM编码任务输出区分主诊断与其他诊断的结构化代码【基于HL7-CDAR2的ICD-10-CM编码指令调优模板】注展示包含各核心临床章节的指令调优模板花括号为章节内容占位符。人类在环的RCT研究设计方法研究对象招募认证编码专家CCSs作为研究参与者随机化与工作流分配采用每周轮换的随机调度方案将每个CCSs分配到4种工作流无AI辅助对照组、3种AI辅助工作流HAN、PubMedGPT-2、BioMistral所有参与者需轮换所有工作流数据采集方法自动记录从AI编码界面激活到任务完成点击保存按钮的编码时间随机触发5点Likert满意度调查调查与对应工作流关联采用匿名方式收集统计分析方法编码时间分析剔除上下2.5%的异常值采用Welch’s ANOVA与Games–Howell事后检验比较不同工作流的编码时间差异满意度分析采用多项逻辑回归分析模型类型与编码专家背景特征从业年限、认证等级、教育背景、世代 cohort对满意度的影响显著性阈值设为p0.05p0.05p0.05实验结果分析模块化ICD-10-CM编码系统开发流程本研究提出的用于开发ICD-10-CM编码系统的模块化框架强调一种基于数据驱动的原则性方法以替代传统的、依赖直觉的流程。其核心步骤包括数据采集、冗余感知采样、基于LLM-as-Judge的成对模型评估与Plackett-Luce排名、基于HL7-CDA章节的指令微调以及最终的临床部署。该流程旨在通过系统性的模型筛选和训练实现资源高效且可扩展的编码系统开发为后续的真实世界评估奠定了基础。基于内在语义评估的模型选择研究评估了五个参数量在70亿以下的解码器模型对ICD-10-CM代码定义的理解能力。BioMistral在与其他模型的成对比较中获得了最高的总体胜率。通过Plackett-Luce模型聚合所有比较结果后BioMistral获得了44.1%的选择概率被确定为最适合进行下游微调的基础模型。这一内在评估作为一种低成本的启发式方法有效缩小了候选模型范围其得出的排名与下游微调后的编码性能排名保持一致验证了该筛选策略的实用性。真实世界部署效果编码效率与用户满意度上图展示了在为期13周的人机协同随机对照试验中不同工作流程下的平均编码时间。结果验证了AI辅助工作流程能显著提升效率。与完全手动编码相比所有三种AI辅助工作流程HAN、PubMedGPT-2、BioMistral都显著减少了单份病历的编码时间。其中PubMedGPT-2带来的时间减少幅度最大其次是BioMistral和HAN。上图进一步分析了认证编码专家对不同AI模型及工作流程的满意度揭示了用户接受的异质性。在模型类型上技术性能更优的BioMistral获得了最高比例的正面满意度评价。用户满意度显著受到编码员背景特征的影响拥有医疗管理背景、高级认证、10-24年工作经验以及属于X世代的编码员满意度更高而具有医学相关学术背景、工作经验少于10年以及属于Y世代的编码员满意度相对较低。这表明AI在真实工作流程中的成功整合不仅取决于模型准确性还深刻依赖于工作流程适配性和个体用户的接受度。优势与局限优势•模块化与可扩展性强提出包含数据去冗余、基于LLM-as-judge的模型选择、HL7-CDA对齐的章节感知微调在内的完整、模块化流水线支持在异构文档环境中进行可扩展的ICD-10-CM编码。•真实世界验证充分通过为期13周、涉及10名认证编码专家的随机对照试验在真实临床工作流中验证了AI辅助编码能显著减少编码时间并系统评估了用户满意度与接受度。•模型选择方法高效结合成对LLM-as-judge评估与Plackett-Luce排序提供了一种资源高效的基础模型筛选启发式方法避免了对所有候选模型进行穷举微调。局限•模型选择依赖自动化评判基础模型筛选依赖于LLM-as-judge评判模型本身可能存在偏见且内在定义生成能力与下游编码性能的关联性仅在有限候选模型集中得到验证。•真实世界部署面临动态挑战研究因全国性ICD-10-CM版本更新而提前终止凸显了临床AI系统需适应不断演变的编码标准与政策这在受控基准研究中很少被考虑。•用户接受度存在异质性编码专家的满意度因经验、认证、代际 cohort 等因素存在显著差异表明成功的人机协同不仅取决于模型性能还需考虑角色敏感性的工作流设计。参考文献Dong, H., Suárez-Paniagua, V., Whiteley, W. Wu, H.Explainable automated coding of clinical notes usinghierarchical label-wise attention networks (HAN)and label embedding initialisation.Journal of biomedical informatics116, 103728 (2021). 该论文提出了用于临床笔记自动编码的分层标签注意力网络HAN是本研究用于对比的经典深度学习方法之一为评估大语言模型在ICD编码任务上的性能提供了重要基准。Ji, S., Hölttä, M. Marttinen, P.Does the magic of BERT apply to medical code assignment? A quantitative study.Computers in biology and medicine139, 104998 (2021). 本文系统评估了BERT等编码器模型在医疗编码任务上的表现指出了其在处理长文档和全编码集时的局限性为本研究选择解码器架构的大语言模型提供了关键背景和对比依据。Zheng, L. et al.Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems36, 46595-46623 (2023). 该研究提出了LLM-as-a-Judge的评估框架为本研究采用成对LLM比较和Plackett-Luce模型进行基础模型筛选提供了核心方法论支持。Labrak, Y. et al.BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains. In Proceedings of the62nd Annual Meeting of the Association for Computational Linguistics (ACL’24). 本文介绍了在生物医学领域预训练的大语言模型BioMistral该模型在本研究中被筛选为最优基础模型并在后续微调和真实世界部署中展现出最一致的性能。Venkatesh, K. P., Raza, M. M. Kvedar, J. C.Automating the overburdened clinical coding system: challenges and next steps.npj Digital Medicine6, 16 (2023). 该综述探讨了自动化临床编码系统面临的挑战与未来方向强调了模型准确性之外的工作流适配和用户接受度问题为本研究设计包含人机交互的随机对照试验和评估多层面采纳指标提供了理论框架。
返回列表