DOI：10.3969/j.issn.1003-3114.2023.03.022

基于平均场内生奖励的多智能体强化学习算法

全文直达

下载全文

在线阅读

引用

摘要：

针对复杂的多智能体应用场景中只依靠根据最终目标设计的简单奖励函数无法对智能体学习策略做出有效引导的问题,提出了一种基于平均场内生奖励的多智能体强化学习(Model-based Multi-agent Mean-field Intrinsic Reward Upper Confidence Reinforcement Learning,M3IR-UCRL)算法.该算法在奖励函数中增加了内生奖励模块,用生成的内生奖励与定义任务的外部奖励一起帮助代表智能体在用平均场控制(Mean-Field Control,MFC)化简的多智能体系统中学习策略.智能体学习时首先按照期望累积内外奖励加权和的梯度方向更新策略参数,然后按照期望累积外部奖励的梯度方向更新内生奖励参数.仿真结果表明,相比于只用简单外部奖励引导智能体学习的(Model-based Multi-agent Mean-field Intrinsic Reward Upper Confidence Reinforcement Learning,M3-UCRL)算法,所提算法可以有效提高智能体在复杂的多智能体场景中的任务完成率,降低与周围环境的碰撞率,从而使算法的整体性能得到提升.

关键词：多智能体系统、平均场控制、基于模型的强化学习、内生奖励

所属期刊栏目：49

分类号：TP181(自动化基础理论)

资助基金：国家重点研发计划2021ZD0140405

在线出版日期：2023-06-08（万方平台首次上网日期，不代表论文的发表时间）

页数：共10页

页码：556-565

英文信息展示

期刊专题