面向真实世界的知识挖掘与知识图谱补全研究(四):真实世界数据标注平台搭建及基于预训练语言模型的自动化抽取方法探索
阎思宇1
谭杰骏2
朱海锋2
黄桥1
王诗淳3
马文昊3
石涵予4
王永博1
任相颖1
胡文斌2
靳英辉1
1.武汉大学中南医院循证与转化医学中心(武汉 430071)2.武汉大学计算机学院(武汉 430072)3.武汉大学中南医院循证与转化医学中心(武汉 430071);武汉大学第二临床学院(武汉 430071)4.武汉大学弘毅学堂(武汉 430072)
摘要:目的 探索搭建真实世界数据标注平台,并比较检索增强生成式技术(retrieval augmented generation,RAG)结合大语言模型,及预训练语言模型的预训练-微调方法的真实世界数据提取效果.方法 以真实世界电子病历数据中的膀胱癌病理记录为例,搭建真实世界数据标注平台,并基于平台标注数据比较RAG结合GPT-3.5,及基于BERT、RoBERTa模型的预训练-微调方法自动化抽取膀胱癌癌症分型、分期的效果.结果 全训练集微调的预训练-微调模型抽取效果优于RAG结合大模型的方法与小样本微调的预训练-微调模型,RoBERTa模型效果总体优于BRET模型,但这些方法的抽取效果均有待提升.在测试集中,使用全训练集微调的RoBERTa模型抽取膀胱癌分型、T分期、N分期的F1值分别为71.06%、50.18%,73.65%.结论 预训练语言模型在处理临床非结构化数据方面具有应用潜力,但现有方法在信息抽取效果上仍有提升空间.未来工作需进一步优化模型或训练策略,以加速数据赋能.
关键词:真实世界数据电子病历标注平台预训练语言模型检索增强生成大语言模型病理记录膀胱癌
分类号:TP181(自动化基础理论)R737.14(泌尿生殖器肿瘤)
资助基金:国家自然科学基金(82174230)武汉大学中南医院青年交叉学科专项基金(ZNQNTC2023006)
论文发表日期:2024-11-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 1276-1283 )
英文信息
