《现代深度学习教程》第9章基础模型核心技术——RLHF主讲:XXX时间:2026/9/21
目录CONTENTS01近端策略优化03强化Transformer02RLHF04本章小结
AI9.1近端策略优化
9.1近端策略优化(PPO)是什么近端策略优化(PPO)是一种由OpenAI于2017年提出的深度强化学习算法,属于Actor-Critic方法的扩展范畴。为什么提出解决TRPO在实践中的限制:高计算成本、优化约束实现复杂、超参数敏感性强、不易并行。核心思想采用剪切代理目标(ClippedSurrogateObjective)函数,限制策略更新幅度,通过限制优势函数
您可能关注的文档
- Web前端开发- 课程标准 .docx
- Web前端开发 教案 .docx
- 第7章生成式学习网络1.pptx
- 现代深度学习教程 课件 第7章生成式学习网络2.pptx
- 现代深度学习教程 课件 第8章大模型.pptx
- 现代深度学习教程 课件 第10章提示学习.pptx
- 现代深度学习教程 课件 第11章基础模型进阶与应用.pptx
- Web前端开发 课件 1.1 网页设计相关的基础概念.pptx
- Web前端开发 课件 1.3 网页基本框架代码解读.pptx
- Web前端开发 课件 1.3 基本语法.pptx
- 专题党课:立德树人担使命+培根铸魂育新人.docx
- 新课改-高中物理-选修第3册(10讲)教师版06 B波粒二象性 中档版17.docx
- 新课改-高中物理-选修第3册(10讲)教师版09 A人工核反 基础版25.docx
- 2025-2026年部编版高一历史第8单元中国近代史测试卷.docx
- 2025-2026年部编版高中语文高二下册第7单元课后练习.docx
- 2026-2027年湖南省常德市中考物理高频错题专题卷(有解析).docx
- 2026-2027年湖南省常宁市中考物理易错点专题突破卷(有解析).docx
- 2026-2027年湖南省长沙市中考物理全真仿真测评卷(有解析).docx
- 2026-2027年湖南省株洲市中考物理能力提升模拟卷(有解析).docx
- 2026年中国水平压力叶片过滤器行业市场规模及投资前景预测分析报告.pdf
原创力文档

文档评论(0)