基于机器学习算法的心力衰竭10年患病风险可解释预测建模分析
蔡佳音1
陈海涛2
王增武1
1.102308 北京市,中国医学科学院北京协和医学院,阜外医院,国家心血管病中心社区防治部2.中山大学公共卫生学院系(深圳)
摘要:目的 建立基于机器学习算法的心力衰竭10年患病风险预测模型,并通过SHAP方法提升模型的可解释性,以提高心力衰竭风险评估的准确性和临床应用价值.方法 采用英国生物银行(UK Biobank,UKB)数据库数据,涵盖了 40~70岁之间的502349名英国成年人,基于2006~2010年间的基线数据.选取487572例未发生心力衰竭和10374例发生心力衰竭的病例,随访时间为10年,以ICD-10编码定义心力衰竭事件.使用LightGBM、XGBoost、CatBoost三种机器学习算法构建预测模型,在Python和RStudio环境中完成数据预处理、特征选择及模型效能评估,利用SHAP方法可视化解释模型预测结果.结果 经过随机欠采样平衡样本后,本研究建立的模型有效预测了 10年内心力衰竭的发病情况.LightGBM模型展现出最佳的预测性能,其次是CatBoost和XGBoost.SHAP值分析揭示年龄、胱抑素C、接受治疗或服用药物次数、曾诊断患有心血管疾病、心血管疾病相关多基因风险分数是心力衰竭风险预测的重要影响因素.结论 本研究证实了机器学习模型在心力衰竭风险预测中的有效性,特别是LightGBM模型在所有比较的模型中表现最佳.SHAP值的分析为理解模型预测的驱动因素提供了新的视角,有助于临床决策支持和风险管理.
关键词:心力衰竭风险预测机器学习LightGBMSHAP值
分类号:R541.6(心脏、血管(循环系)疾病)
论文发表日期:2024-04-10
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 323-330 )
英文信息
