google强化学习中的好奇与拖延.PDF

google强化学习中的好奇与拖延.PDF

google 强化学习中的好奇与拖延 强化学习 (Reinforcement Learning, RL ) 是机器学习领域目前最热门的研 究技术之一。在学习过程中,如果人工智能体正确执行了指令,就会收到正面奖 励,反之则会收到负面奖励。这种 “胡萝 卜加大棒” 的方法简单通用,DeepMind 的研究人员曾用这种方法教 DQN 算法玩老式 Atari 游戏, 教 AlphaGoZero 下古代围棋。OpenAI 也曾用这种方法教其 OpenAI-Five 算法玩现代电子游戏 Dota,Google 在教机械臂抓取新物体时用的也是这种方 法。迄今,我们已在 RL 领域取得不少成功,但要将其发展成为一项有效的技术, 仍需克服诸多难题。 标准的 RL 算法在对智能体反馈稀疏的环境中表现不佳,更关键的是,这种环境 在现实世界中非常常见。举例来讲,假如您正在尝试学习如何在一个迷宫般的大 超市里找到您最喜欢的奶酪。您找来找去,但就是找不到奶酪区。如果每一步都 得不到 “胡萝 卜”,也得不到 “大棒”,您就无法知道自己走的方向是否正确。 在没有奖励的情况下,您要如何避免原地打转?除了利用您的好奇心以外,大概 别无他法。好奇心会促使您走进看似陌生的产品区,寻找喜欢的奶酪。 在 GoogleBrain 团队、DeepMind 和苏黎世联邦理工

文档评论(0)

1亿VIP精品文档

相关文档