google强化学习中的好奇与拖延.PDF
google 强化学习中的好奇与拖延
强化学习 (Reinforcement Learning, RL ) 是机器学习领域目前最热门的研
究技术之一。在学习过程中,如果人工智能体正确执行了指令,就会收到正面奖
励,反之则会收到负面奖励。这种 “胡萝 卜加大棒” 的方法简单通用,DeepMind
的研究人员曾用这种方法教 DQN 算法玩老式 Atari 游戏,
教 AlphaGoZero 下古代围棋。OpenAI 也曾用这种方法教其 OpenAI-Five
算法玩现代电子游戏 Dota,Google 在教机械臂抓取新物体时用的也是这种方
法。迄今,我们已在 RL 领域取得不少成功,但要将其发展成为一项有效的技术,
仍需克服诸多难题。
标准的 RL 算法在对智能体反馈稀疏的环境中表现不佳,更关键的是,这种环境
在现实世界中非常常见。举例来讲,假如您正在尝试学习如何在一个迷宫般的大
超市里找到您最喜欢的奶酪。您找来找去,但就是找不到奶酪区。如果每一步都
得不到 “胡萝 卜”,也得不到 “大棒”,您就无法知道自己走的方向是否正确。
在没有奖励的情况下,您要如何避免原地打转?除了利用您的好奇心以外,大概
别无他法。好奇心会促使您走进看似陌生的产品区,寻找喜欢的奶酪。
在 GoogleBrain 团队、DeepMind 和苏黎世联邦理工
原创力文档

文档评论(0)