AI情报2026年8月18日AI情报
文章
何时通信:多智能体强化学习中基于信念分布与KL散度的原则性门控
公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅决定通信什么,还要决定何时通信。现有方法要么在每个时间步进行通信,要么通过REINFORCE策略梯度\cite{singh2019}学习二值门控,这是一种高方差信号,会产生不稳定且不可解释的门控行为。我提出了一种
Frontier 编辑部来源: arXiv
公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅决定通信什么,还要决定何时通信。现有方法要么在每个时间步进行通信,要么通过REINFORCE策略梯度\cite{singh2019}学习二值门控,这是一种高方差信号,会产生不稳定且不可解释的门控行为。我提出了一种