大模型微调与人类反馈强化学习在机器人应用中探索.pdfVIP

  • 1
  • 0
  • 约5.35千字
  • 约 7页
  • 2026-08-11 发布于北京
  • 举报

大模型微调与人类反馈强化学习在机器人应用中探索.pdf

SFT+RLHF

SFTSupervisedFine-TuningRLHFReinforcementLearningfrom

HumanFeedback

SFT“”

-—

-

“”→(→→)

-“”“”

RLHF“”

-

-PPODPO

-

-preferencemodel

-

-reward

RLHF

1.Language→Motion

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档