OpenAI 把在模拟器中强化学习学到的方案迁移到机械手上.docVIP

  • 17
  • 0
  • 约6.2千字
  • 约 16页
  • 2018-11-11 发布于江苏
  • 举报

OpenAI 把在模拟器中强化学习学到的方案迁移到机械手上.doc

OpenAI 把在模拟器中强化学习学到的方案迁移到机械手上

OpenAI 把在模拟器中强化学习学到的方案迁移到机械手上   这些具有一定难度的任务 OpenAI 自己也在研究,他们认为这是深度强化学习发展到新时代之后可以作为新标杆的算法测试任务,而且也欢迎其它机构与学校的研究人员一同研究这些任务,把深度强化学习的表现推上新的台阶。   OpenAI 已经就机械手任务之二的转方块出了自己答案,展示了一个异常灵活的转方块的机械手。而且更精彩的是,这个完全在模拟器中强化学习学到的方案还可以不需任何微调就直接迁移到真实的机械手上。   OpenAI 把这套系统称作 Dactyl。OpenAI 过去一年中研究强化学习系统的偏好思路再次得到了体现:在完全模拟的环境中训练,然后把训练结果迁移到现实世界的机械结构中。   得益于可以大规模高速并行训练的模拟环境以及 OpenAI 在过去的研究中积累的系统设计与变量选择经验,这样的做法已经可以得到很好的效果。强化学习算法方面,OpenAI 再次选择了之前在 DOTA2 5v5 AI 中使用的 PPO(近端策略优化),这当然也再次展示了 PPO 作为通用强化学习算法的优越性。当然,系统最大的亮点还是可以完全在虚拟环境中训练,不需要对真实世界有准确的物理模型也可以直接迁移到真实机械手、真实物体的控制上。   任务介绍   任务中使用的机械手模型是参照 Shadow Dexterous Hand 设计的。这是一个完

文档评论(0)

1亿VIP精品文档

相关文档