CN119849635A 奖励模型的训练方法、答案评价方法和装置 (科大讯飞股份有限公司).docxVIP

  • 1
  • 0
  • 约2.76万字
  • 约 39页
  • 2026-09-06 发布于山西
  • 举报

CN119849635A 奖励模型的训练方法、答案评价方法和装置 (科大讯飞股份有限公司).docx

(19)国家知识产权局

(12)发明专利申请

(10)申请公布号CN119849635A

(43)申请公布日2025.04.18

(21)申请号202411965448.7

(22)申请日2024.12.30

(71)申请人科大讯飞股份有限公司

地址230088安徽省合肥市高新开发区望

江西路666号

(72)发明人程光冉潘嘉刘迪源

(74)专利代理机构北京路浩知识产权代理有限

公司11002

专利代理师霍向果

(51)Int.Cl.

G06N5/04(2023.01)

G06F16/3329(2025.01)

权利要求书2页说明书15页附图3页

(54)发明名称

奖励模型的训练方法、答案评价方法和装置

(57)摘要

CN119849635A本发明提供一种奖励模型的训练方法、答案评价方法和装置,涉及人工智能技术领域。其中奖励模型的训练方法包括:将原始训练样本和提示文本输入至初始奖励模型,得到初始奖励模型输出的第一推理原理和第一评分;提示文本包括推理原理生成要求文本,推理原理生成要求文本包括推理原理的生成要求信息,推理原理用于指示初始奖励模型在进行评分时需遵循的推理逻辑;基于原始训练样本、第一推理原理和第一评分,微调初始奖励模型,以得到奖励模型;其中,初始奖励模型为预训练的大语言模型。本发明可以提高奖励模型的性能,最终提高

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档