基于强化学习的自动驾驶车辆路上突发障碍物换道避障控制算法
姚恩建
陈卓利
郝赫
陈荣升
杨扬
北京交通大学 交通运输学院,北京 100044
摘要:针对路上突发障碍物下自动驾驶车辆换道避障问题,提出基于深度强化学习(Deep Rein-forcement Learning,DRL)的车辆控制算法SafeLC-DelayDDPG.首先,将该问题建模为马尔可夫决策过程(Markov Decision Process,MDP),构建了结构化混合状态空间,融合局部观测、车道语义信息和自车全局状态,提高环境感知与风险敏感性.动作空间采用连续的前轮转向角与纵向加速度.奖励函数以二维碰撞时间(Two-dimensional time-to-collision,2D-TTC)指标为核心,兼顾安全、效率、舒适和规则,并采用条件化动态权重机制,引导策略在高风险时优先安全、在低风险时提升效率.然后,引入延迟策略更新与目标策略平滑机制,改进Critic网络损失函数,缓解深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法训练不稳定及Q值过估计问题.最后,通过不同场景下的交通仿真验证了所提方法的有效性.仿真结果表明:与多个基线算法相比,该算法安全性与效率更优,训练期首次和连续避障成功率分别最多提升约17.9%和60.5%,安全性指标值最多提升约7.6%,平均速度最多提升约2.1%;在不同场景测试中,首次和连续避障成功率分别最多提升约25.9%和44.1%,安全性指标值最多提升约9.8%,平均速度最多提升约0.6%.
关键词:自动驾驶车辆路上突发障碍物深度强化学习2D-TTC换道避障控制
分类号:U461.6(汽车工程)
论文发表日期:2025-10-30
在线出版日期:2025-11-06(本平台首次上网日期,不代表文献的发表时间)
页数:12( 82-93 )
英文信息展开
北京交通大学学报

北京交通大学学报

CSTPCD北大核心CSCD
ISSN:1673-0291
年,卷(期):2025,49(5)
所属栏目:自主运行与控制核心技术