2026年人工智能训练师对齐训练实操考试题库.docxVIP

  • 2
  • 0
  • 约6.91千字
  • 约 17页
  • 2026-07-25 发布于四川
  • 举报

2026年人工智能训练师对齐训练实操考试题库.docx

2026年人工智能训练师对齐训练实操考试题库

2026年人工智能训练师对齐训练实操考试题库

1单选题(每题2分,共20分)

1.1在RLHF流程中,用于将人类偏好转化为可优化标量的核心组件是

A.策略梯度层?B.奖励模型?C.价值网络?D.对抗判别器

答案:B

1.2当使用Bradley-Terry模型对成对比较标注进行拟合时,若两条回复的奖励值分别为r?、r?,则P(回复1优于回复2)的表达式为

A.σ(r??r?)?B.σ(r??r?)?C.1/(1+e^{r??r?})?D.e^{r?}/(e^{r?}+e^{r?})

答案:A

1.3在ConstitutionalAI中,“自我批评”阶段的主要目的是

A.降低推理延迟?B.生成修正后的无害回复?C.蒸馏奖励模型?D.压缩模型体积

答案:B

1.4若人类标注员对同一问题的两条回复给出完全一致的概率分布,则InfoNCE损失在该条样本上的梯度为

A.0?B.1?C.?1?D.不确定

答案:A

1.5以下哪种采样策略在PPO中能有效缓解“奖励黑客”现象

A.高温采样?B.重复惩罚采样?C.多样性核采样?D.反事实裁剪采样

答案:D

1.6当使用LoRA对大模型进行对齐微调时,若秩r=16,则可训练参数量约为原模型参数量的

A.0.1%?B.0.5%?C.1%?D.5%

文档评论(0)

1亿VIP精品文档

相关文档