基于预训练语言模型的 2 型糖尿病古今辨证知识相似度判别方法研究
田思玮1
牛琪锴2
刘泊宁3
曾子玲4
贾紫涵4
张凤霞2
张华敏2
李兵4
1.中国信息通信研究院,北京 1000832.中国中医科学院中药研究所,北京 1007003.中国中医科学院中药研究所,北京 100700;中国中医科学院中医药数据中心,北京 1007004.中国中医科学院中医基础理论研究所,北京 100700
摘要:目的 构建古今辨证知识相似度计算与判别方法,实现古今辨证知识融合,提升典籍知识的临床应用水平.方法 以2 型糖尿病为例,构建古今辨证文献数据集和临床模拟数据集.应用预训练语言模型进行古今辨证知识相似度计算,并评估其在古籍文本处理方面的性能,选定性能最优的模型计算临床模拟数据与古籍原文的相似度,制定相似度判别规则,筛选与临床模拟数据相关性较高的古籍原文.结果 研究确定了 36 个 2 型糖尿病的古代病名检索词,纳入古籍原文 3 850 条,主要为疾病相关的语句或段落,包含疾病的病名、症状、病因病机、治则治法等内容;现代诊疗指南包含58个证型和7个兼夹证;基于20条临床模拟数据进行模型评估,选择性能较优的TCMLLM-PR计算临床模拟数据与古籍原文的相似度,按照短文本阈值≥0.7和长文本阈值≥0.6 最终筛选出与临床模拟数据相关性较高的2 908 条古籍原文.结论 本研究构建了基于预训练语言模型的相似度计算与判别方法,有效筛选与临床表现相关的 2 型糖尿病古籍原文,为古今辨证知识融合和临床数智化应用提供了方法.
关键词:古今辨证知识融合相似度2 型糖尿病
分类号:R319(医用一般科学)R241(中医临床学)
资助基金:国家重点研发计划(2023YFC3502900)中国中医科学院青年科技人才培养专项(ZZ13-YO-129)科技部结余经费立项课题(JY202401-2005CB523504)
论文发表日期:2025-12-28
在线出版日期:2026-01-07(本平台首次上网日期,不代表文献的发表时间)
页数:7( 2103-2109 )
英文信息
