2025年人工智能训练师(高级技师)职业技能鉴定参考题库(含答案).docx

2025年人工智能训练师(高级技师)职业技能鉴定参考题库(含答案).docx

2025年人工智能训练师(高级技师)职业技能鉴定参考题库(含答案)

1.单项选择题

1.1针对千亿参数生成式大模型的人类反馈强化学习(RLHF)第三阶段训练中,出现奖励模型对标注样本判别准确率超过98%但真实用户场景泛化性不足的过拟合现象,以下最优解决方案是

A.直接增大奖励模型参数量至原规模2倍以上

B.引入3~5个异构标注偏好训练的奖励模型集成机制,同时按照15%的采样比例动态纳入线上真实用户反馈的难例样本重新微调奖励模型

C.投入翻倍人力新增10万条以上人工标注偏好样本

D.直接降低后续RLHF训练阶段基础大模型的学习率至原数值的1/10

1.2依据《人工智能训练师国家职业

文档评论(0)

1亿VIP精品文档

相关文档