现代深度学习教程 课件 第9章RLHF.pptx

《现代深度学习教程》第9章基础模型核心技术——RLHF主讲:XXX时间:2026/9/21

目录CONTENTS01近端策略优化03强化Transformer02RLHF04本章小结

AI9.1近端策略优化

9.1近端策略优化(PPO)是什么近端策略优化(PPO)是一种由OpenAI于2017年提出的深度强化学习算法,属于Actor-Critic方法的扩展范畴。为什么提出解决TRPO在实践中的限制:高计算成本、优化约束实现复杂、超参数敏感性强、不易并行。核心思想采用剪切代理目标(ClippedSurrogateObjective)函数,限制策略更新幅度,通过限制优势函数

文档评论(0)

1亿VIP精品文档

相关文档