强化学习

发布日期: 2023-07-08

2023-07-08 更新

Beyond Conservatism: Diffusion Policies in Offline Multi-agent Reinforcement Learning

Authors:Zhuoran Li, Ling Pan, Longbo Huang

We present a novel Diffusion Offline Multi-agent Model (DOM2) for offline Multi-Agent Reinforcement Learning (MARL). Different from existing algorithms that rely mainly on conservatism in policy design, DOM2 enhances policy expressiveness and diversity based on diffusion. Specifically, we incorporate a diffusion model into the policy network and propose a trajectory-based data-augmentation scheme in training. These key ingredients make our algorithm more robust to environment changes and achieve significant improvements in performance, generalization and data-efficiency. Our extensive experimental results demonstrate that DOM2 outperforms existing state-of-the-art methods in multi-agent particle and multi-agent MuJoCo environments, and generalizes significantly better in shifted environments thanks to its high expressiveness and diversity. Furthermore, DOM2 shows superior data efficiency and can achieve state-of-the-art performance with $20+$ times less data compared to existing algorithms.
PDF

点此查看论文截图

木子已

https://ipaper.today/2023/07/08/2023-07-08-qiang-hua-xue-xi/

本博客所有文章除特別声明外，均采用 CC BY 4.0 许可协议。转载请注明来源木子已 !

强化学习

Few-Shot

2023-07-08 Few-Shot

Few-Shot

Open-Set

2023-07-08 Open-Set

Open-Set

强化学习

2023-07-08 更新

Beyond Conservatism: Diffusion Policies in Offline Multi-agent Reinforcement Learning

打赏用于支持本站流量费