Skip to content
AI情报2026年8月18日AI情报
文章

何时通信:多智能体强化学习中基于信念分布与KL散度的原则性门控

公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅决定通信什么,还要决定何时通信。现有方法要么在每个时间步进行通信,要么通过REINFORCE策略梯度\cite{singh2019}学习二值门控,这是一种高方差信号,会产生不稳定且不可解释的门控行为。我提出了一种

Frontier 编辑部来源: arXiv
01

来源简报

何时通信:多智能体强化学习中基于信念分布与KL散度的原则性门控: 公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅决定通信什么,还要决定何时通信。现有方法要么在每个时间步进行通信,要么通过REINFORCE策略梯度\cite{singh2019}学习二值门控,这是一种高方差信号,会产生不稳定且不可解释的门控行为。我提出了一种