基于不确定度的多智能体信用分配方法

	基于不确定度的多智能体信用分配方法
	杨光开 2,3; 陈皓 2,3; 张茗奕 3; 尹奇跃 2,3; 黄凯奇 1,2,3
刊名	中国科学院大学学报
	2022-05
页码	0
英文摘要	近年来，部分可观测条件下多智能体协同受到广泛关注。中心化训练分布式执行作为处理这类任务的通用范式面临信用分配这一核心问题。值分解是该范式中的代表性方法，通过混合网络将联合状态动作值函数分解为多个局部观察动作值函数以实现信用分配，在很多问题中表现很好。然而这些方法维持对混合网络参数的单一点估计，因缺乏不确定度表示而难以有效应对环境中的随机因素导致只能收敛到次优策略。为了缓解这一问题，本文对混合网络进行贝叶斯分析，提出了一种基于不确定度的多智能体信用分配方法，通过显式地量化参数的不确定度来指导信用分配。考虑到智能体之间复杂的交互，本文利用贝叶斯超网络隐式地建模参数任意复杂的后验分布，以避免先验地指定分布类型而陷于局部最优解。本文在星际争霸微操环境中的多个地图上与代表性算法的性能进行对比与分析，验证了算法的有效性。
资助项目	National Natural Science Foundation of China[61876181]
语种	中文
内容类型	期刊论文
源URL	[http://ir.ia.ac.cn/handle/173211/48976]
专题	智能系统与工程
通讯作者	黄凯奇
作者单位	1.中国科学院脑科学与智能技术卓越创新中心 2.中国科学院大学人工智能学院 3.中科院自动化所
推荐引用方式 GB/T 7714	杨光开,陈皓,张茗奕,等. 基于不确定度的多智能体信用分配方法[J]. 中国科学院大学学报,2022:0.
APA	杨光开,陈皓,张茗奕,尹奇跃,&黄凯奇.(2022).基于不确定度的多智能体信用分配方法.中国科学院大学学报,0.
MLA	杨光开,et al."基于不确定度的多智能体信用分配方法".中国科学院大学学报 (2022):0.