融合多模态大模型的固体充填采煤井下分选煤矸下落瞬态图像识别方法
张云1
杨一璇1
来兴平1
童亮1
曹胜根2
刘永孜1
张龙1
白立丞1
叶昊1
1.西安科技大学能源与矿业工程学院,陕西 西安 7100542.中国矿业大学煤炭精细勘探与智能开发全国重点实验室,江苏 徐州 221116
摘要:固体充填采煤作为一种兼顾资源回收与生态保护的绿色开采方法,其核心环节煤矸分选是井下采选充一体化技术高效运行的前提,而煤矸识别作为实现煤矸精准分选的关键技术,面临着井下复杂工况中特征提取困难、边界定位模糊等挑战.为此,以固体充填采煤井下煤矸分选为研究背景,提出一种融合多模态大模型(Multimodal Large Language Model,MLLM)的固体充填采煤井下分选煤矸下落瞬态图像识别方法.首先,自主设计并搭建固体充填采煤井下分选煤矸下落瞬态图像采集实验平台,以模拟井下低照度、高粉尘的复杂工况,利用高速相机采集不同工况下的煤矸下落瞬态图像;对采集的煤矸图像进行预处理,运用优化算法提升低照度图像亮度并改善粉尘环境图像质量,同时进行标注和数据扩充,构建用于煤矸识别模型训练和测试的数据集;其次,针对传统Seg-Former模型在煤矸图像边界识别中的缺陷,引入高效通道注意力机制(ECA)并优化损失函数,构建ECSegFormer模型;进一步提出将MLLM融合到ECSegFormer模型,形成MLLM-ECSegFormer煤矸识别模型融合架构,利用多模态大模型Qwen-VL(7B)提取煤矸目标中心坐标,通过高斯热图生成空间注意力掩膜,分阶段融入ECSegFormer编码器,实现多模态先验知识与图像特征的动态交互.试验结果表明,融合多模态大模型后,各经典图像识别模型性能均显著提升.其中,MLLM-ECSeg-Former的MIoU提升至 95.50%、MPA提升至 98.92%、准确率提升至 98.87%,在识别精度、模型复杂程度和识别效率方面均显著优于经典图像识别模型,且与其他图像识别模型相比,MLLM-ECSeg-Former在复杂工况下的边缘识别连续性更强,尤其在粉尘干扰、煤矸形态不规则场景中,对目标区域的分割精度显著优于传统模型.研究成果为煤矸精准识别提供了新方法,提升了固体充填采煤技术的智能化水平,对煤炭资源的绿色智能开采具有重要意义.
关键词:煤矸识别多模态大模型固体充填采煤井下复杂工况井下图像增强
分类号:TD823.7(矿山开采)
资助基金:国家自然科学基金(52474148)国家自然科学基金(52274143)
论文发表日期:2025-11-30
在线出版日期:2025-12-15(本平台首次上网日期,不代表文献的发表时间)
页数:20( 128-147 )
英文信息
