基本信息来源于合作网站,原文需代理用户跳转至来源网站获取       
摘要:
针对多智能体系统中联合动作空间随智能体数量的增加而产生的指数爆炸的问题,采用"中心训练-分散执行"的框架来避免联合动作空间的维数灾难并降低算法的优化代价.针对在众多的多智能体强化学习场景下,环境仅给出所有智能体的联合行为所对应的全局奖励这一问题,提出一种新的全局信用分配机制——奖励高速路网络(RHWNet).通过在原有算法的奖励分配机制上引入奖励高速路连接,将每个智能体的值函数与全局奖励直接建立联系,进而使得每个智能体在进行策略选择时能够综合考虑全局的奖励信号与其自身实际分得的奖励值.首先,在训练过程中,通过中心化的值函数结构对每个智能体进行协调;同时,这一中心化的结构也能起到全局奖励分配的作用;然后,在中心值函数结构中引入奖励高速路链接来辅助进行全局奖励分配,从而构建出奖励高速路网络;之后,在执行阶段,每个智能体的策略仅仅依赖于其自身的值函数.在星际争霸多智能体挑战的微操作场景中的实验结果表明,相比当前较先进的反直觉的策略梯度(Coma)算法和单调Q值函数分解(QMIX)算法,该网络所提出的奖励高速路在4个复杂的地图上的测试胜率提升超过20%.更重要的是,在智能体数量较多且种类不同的3s5z和3s6z场景中,该网络在所需样本数量为QMIX和Coma等算法的30%的情况下便能取得更好的结果.
推荐文章
基于GAED-MADDPG多智能体强化学习的协作策略研究
强化学习
群体协作
深度学习
群体智慧
基于多智能体强化学习的多AGV路径规划方法
多智能体强化学习
AGV路径规划
独立强化学习
多智能体强化学习在城市交通网络信号控制方法中的应用综述
智能交通
交通控制
多智能体强化学习
闭环反馈
联动协调
数据驱动
基于强化学习的多智能体协作方法研究
多智能体
协作系统
强化学习
内容分析
关键词云
关键词热度
相关文献总数  
(/次)
(/年)
文献信息
篇名 基于奖励高速路网络的多智能体强化学习中的全局信用分配算法
来源期刊 计算机应用 学科 工学
关键词 深度学习 深度强化学习 多智能体强化学习 多智能体系统 全局信用分配
年,卷(期) 2021,(1) 所属期刊栏目 第八届中国数据挖掘会议(CCDM 2020)
研究方向 页码范围 1-7
页数 7页 分类号 TP181
字数 语种 中文
DOI 10.11772/j.issn.1001-9081.2020061009
五维指标
传播情况
(/次)
(/年)
引文网络
引文网络
二级参考文献  (83)
共引文献  (104)
参考文献  (9)
节点文献
引证文献  (0)
同被引文献  (0)
二级引证文献  (0)
1981(1)
  • 参考文献(0)
  • 二级参考文献(1)
1992(2)
  • 参考文献(0)
  • 二级参考文献(2)
1994(1)
  • 参考文献(0)
  • 二级参考文献(1)
1995(2)
  • 参考文献(0)
  • 二级参考文献(2)
1997(2)
  • 参考文献(1)
  • 二级参考文献(1)
1999(2)
  • 参考文献(0)
  • 二级参考文献(2)
2000(3)
  • 参考文献(1)
  • 二级参考文献(2)
2002(1)
  • 参考文献(0)
  • 二级参考文献(1)
2003(3)
  • 参考文献(0)
  • 二级参考文献(3)
2005(1)
  • 参考文献(0)
  • 二级参考文献(1)
2006(1)
  • 参考文献(0)
  • 二级参考文献(1)
2007(2)
  • 参考文献(0)
  • 二级参考文献(2)
2008(3)
  • 参考文献(0)
  • 二级参考文献(3)
2009(3)
  • 参考文献(0)
  • 二级参考文献(3)
2010(2)
  • 参考文献(0)
  • 二级参考文献(2)
2011(4)
  • 参考文献(2)
  • 二级参考文献(2)
2012(3)
  • 参考文献(0)
  • 二级参考文献(3)
2013(3)
  • 参考文献(0)
  • 二级参考文献(3)
2014(4)
  • 参考文献(0)
  • 二级参考文献(4)
2015(10)
  • 参考文献(1)
  • 二级参考文献(9)
2016(8)
  • 参考文献(0)
  • 二级参考文献(8)
2017(13)
  • 参考文献(0)
  • 二级参考文献(13)
2018(7)
  • 参考文献(1)
  • 二级参考文献(6)
2019(9)
  • 参考文献(1)
  • 二级参考文献(8)
2020(2)
  • 参考文献(2)
  • 二级参考文献(0)
2021(0)
  • 参考文献(0)
  • 二级参考文献(0)
  • 引证文献(0)
  • 二级引证文献(0)
研究主题发展历程
节点文献
深度学习
深度强化学习
多智能体强化学习
多智能体系统
全局信用分配
研究起点
研究来源
研究分支
研究去脉
引文网络交叉学科
相关学者/机构
期刊影响力
计算机应用
月刊
1001-9081
51-1307/TP
大16开
成都237信箱
62-110
1981
chi
出版文献量(篇)
20189
总下载数(次)
40
论文1v1指导