基于多模态大模型的井下视频语义提取与描述生成技术
付翔1
王主丰2
秦一凡2
闫明2
张智星2
王然风2
贾一帆2
1.太原理工大学矿业工程学院,山西 太原 030024;智能采矿装备技术全国重点实验室,山西 太原 030024;山西焦煤集团有限责任公司博士后工作站,山西 太原 0300242.太原理工大学矿业工程学院,山西 太原 030024
摘要:随着煤矿智能化建设的推进,井下作业视频数据量突增,目前视频信息处理与保存方法大多采用单场景视频分析和视频原格式存储技术,存在视频场景模型单一导致信息描述不全面、存储空间受限导致信息保存时间短等应用难题.针对井下视频全信息、低成本语义分析的实际需求,提出一种基于工况复杂度指标赋值的关键帧自适应提取方法与多模态语义建模的煤矿井下视频描述生成方法,实现对井下视频的最优计算解析与自然语言描述.首先根据井下工况特点设计复杂度指标赋值方法,提出基于工况复杂度的视频动态抽帧频度计算方法,实现最低计算成本的视频关键信息捕获;然后设计了基于MLLMs的井下视频描述生成技术框架,开发了关键帧自适应提取、大模型视觉语义特征提取、Prompt设计与文本编码、多模态融合与文本解码等关键技术模块,实现高效低成本化的井下视频全场景信息自然语言描述生成;最后将本文视频描述方法以及抽帧策略与传统方法进行了对比试验,试验结果表明:本文方法在确保高达 95.4%的关键信息捕获率的同时,将计算资源消耗降低至传统密集抽帧方法的1.5%,为井下视频全信息、低成本语义分析提供了可行的技术路径.
关键词:井下视频描述工况复杂度评估自适应关键帧提取多模态大模型语义融合
分类号:TD76(矿山安全与劳动保护)
资助基金:国家自然科学基金(52274157)国家自然科学基金(52574199)山西省基础研究计划联合资助项目(202403011241002)
论文发表日期:2025-11-30
在线出版日期:2025-12-15(本平台首次上网日期,不代表文献的发表时间)
页数:13( 216-228 )
英文信息展开
煤炭科学技术

煤炭科学技术

CSTPCD北大核心EICSCD
ISSN:0253-2336
年,卷(期):2025,53(11)
所属栏目:"矿井图像智能处理"专题