藏医药抽取式机器阅读理解数据集研究
旦增罗布1
拉巴次仁2
王浩畅3
小次仁1
1.国网西藏电力有限公司山南供电公司,山南 8560002.西藏藏医药大学,拉萨 8500003.东北石油大学计算机与信息技术学院,大庆 163318
摘要:藏文机器阅读理解领域尚处于起步阶段,构建一份高质量的语料库成为推动该领域发展的当务之急.本研究采用众包方式,对藏医经典著作《四部医典》中的藏医植物药材与名词解释部分进行精细标注.结合藏文掩码数据扩充策略,有效扩充了数据集的规模,最终整理出13k条有效问答对.基于该数据集,通过优化传统的注意力机制,提出了一个高效的藏文机器阅读理解模型.文章的研究不仅对于推动藏文信息处理技术的深入发展具有重要意义,更有助于提升机器对藏文文本的理解能力,从而为藏文化的传承和保护提供有力支持.
关键词:藏文机器阅读理解四部医典藏文语料库注意力机制
资助基金:中藏药博士点培育科研资助计划项目(BSDJS-23-15)国家自然科学基金(61402099)
论文发表日期:2024-09-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 73-80 )
英文信息
