改进双延迟深度确定性策略梯度的多船协调避碰决策

引用

摘要：

目前,多数海上避碰模型都是将船舶作为单智能体进行避碰决策,未考虑船舶间的协调避让,在多船会遇场景下仅靠单船进行避碰操作会导致避让效果不佳.为此,提出了一种改进双延迟深度确定性策略梯度算法(TD3)的Softmax深层双确定性策略梯度(SD3)多船协调避碰模型.从考虑船舶航行安全的时空因素出发构建时间碰撞模型、空间碰撞模型,对船舶碰撞风险进行定量分析,在此基础上采用根据会遇态势和船速矢量动态变化的船域模型对船舶碰撞风险进行定性分析.综合船舶目标导向、航向角改变、航向保持、碰撞风险和《国际海上避碰规则》(COLREGS)的约束设计奖励函数,结合COLREGS中的典型相遇情况构造对遇、追越和交叉相遇多局面共存的会遇场景进行避碰模拟仿真.消融实验显示softmax运算符提升了SD3算法的性能,使其在船舶协调避碰中拥有更好的决策效果,并与其他强化学习算法进行学习效率和学习效果的比较.实验结果表明,SD3算法在多局面共存的复杂场景下能高效做出准确的避碰决策,并且性能优于其他强化学习算法.

关键词：多船会遇、协调避碰、智能决策、双延迟深度确定性策略梯度(TD3)、Softmax深层双确定性策略梯度(SD3)、强化学习

所属期刊栏目：50

分类号：TP391.9(计算技术、计算机技术)

在线出版日期：2023-11-17（万方平台首次上网日期，不代表论文的发表时间）

页数：共13页

页码：269-281

英文信息展示

期刊专题