22、构建多智能体环境:从对抗到个性化奖励
2026/9/12 18:55:07 网站建设 项目流程

构建多智能体环境:从对抗到个性化奖励

1. 对抗性自我博弈

在多智能体训练中,对抗性自我博弈是一种强大的方法。以 ML - Agents 的 Banana 环境为例,该环境中有多个智能体在场景中随机游走并收集香蕉,同时智能体还配备了激光指针,可使被击中的对手在数秒内失去行动能力。

操作步骤如下:
1. 从Assets | ML - Agents | Examples | BananaCollectors | Scenes文件夹中打开 Banana 场景。
2. 选择并禁用额外的训练区域RLArea(1)RLArea(3)
3. 选择RLArea中的五个智能体(Agent,Agent(1),Agent(2),Agent(3),Agent(4))。
4. 将Banana Agent | BrainBananaPlayer切换到BananaLearning
5. 选择Academy并将Banana Academy | Brains | Control属性设置为Enabled
6. 在编辑器中选择Banana Agent

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询