大语言模型在职业卫生领域的评估
王绮婷1
曹博宇2
林浩云2
张浩彬3
程伟彬3
黄永顺1
1.广东药科大学公共卫生学院(广东 广州 510310)2.暨南大学伯明翰大学联合学院(广东 广州 511443)3.广东省第二人民医院人工智能医疗应用研究所(广东 广州 510320)
摘要:目的 评估中国主流大语言模型在职业卫生领域的知识问答与案例推理能力,探讨其作为劳动者职业健康信息获取工具的应用潜力.方法 选取DeepSeek-R1、DeepSeek-v3.2、Doubao-Seed-1.6、Doubao-Seed-1.6-Thinking、GPT-4o、Kimi-k2和Qwen3-Max共7个模型,构建包含法律法规、职业健康监护、职业卫生基础知识、职业病诊断及综合练习的842道客观题题库,以及涵盖20个真实案例、46个问题的职业卫生案例集.每个模型独立测试3轮,计算平均正确率及标准差;采用Pearson x2检验比较不同题型间的表现差异,配对t检验评估思维链推理的效能,案例问答由专业人员评分并统计平均得分.结果 除GPT-4o(48.58±7.12)%外,其余模型客观题平均正确率均超过70%,其中DeepSeek-R1表现最优(75.79±5.82)%.所有模型在不同题型间的正确率差异均有统计学意义(P<0.05),总体呈现单选题>判断题>多选题的规律.思维链模型整体表现显著优于非思维链模型(t=10.69,P<0.001).在案例推理任务中,Kimi-k2(80.28±15.81)%和Doubao-Seed-1.6(78.82±14.54)%表现较优,各模型在职业病诊断问题上的准确率普遍高于职业法律问题.结论 中国主流大语言模型在职业卫生知识问答和真实案例推理中具备一定准确性,为缓解劳动者职业健康信息获取困难提供了技术可行性.大语言模型有望成为提升劳动者职业卫生素养和降低信息壁垒的智能化工具.
关键词:大语言模型职业卫生职业病防治
分类号:TP18(自动化基础理论)R135(劳动卫生)
资助基金:广东省医学科学技术研究基金项目(C2025042)
论文发表日期:2025-11-15
在线出版日期:2026-01-06(本平台首次上网日期,不代表文献的发表时间)
页数:6( 1628-1633 )
英文信息
