2026年人工智能训练师指令调优实操考核试题.docxVIP

  • 6
  • 0
  • 约4.51千字
  • 约 12页
  • 2026-04-10 发布于四川
  • 举报

2026年人工智能训练师指令调优实操考核试题.docx

2026年人工智能训练师指令调优实操考核试题

一、单项选择题(每题2分,共20分)

1.在指令调优过程中,若发现模型对“请用一句话总结”类指令频繁输出多句,最优先应调整的参数是

A.temperature

B.top_p

C.repetition_penalty

D.max_tokens

2.使用LoRA进行指令调优时,若rank=8、alpha=32,则LoRA权重在初始化时的缩放系数为

A.1

B.4

C.8

D.32

3.在构建指令数据集时,以下做法最可能引入“alignmenttax”的是

A.每条指令配一条拒绝回答的样本

B.对同一指令给出5条语义一致但风格不同的回答

C.将代码类指令全部替换成自然语言描述

D.用模型自动生成80%的指令并人工抽检10%

4.当使用DPO(DirectPreferenceOptimization)训练时,若偏好对中chosen与rejected长度差异过大,最先应检查

A.学习率

B.beta超参

C.数据采样策略

D.正则化系数

5.指令调优后,模型在“写古诗”任务上BLEU下降但在“写Python”任务上BLEU上升,这说明

A.发生了灾难性遗忘

B.学习率过高

C.训练步数不足

D.评估指标选取不当

6.在DeepSpeedZeRO-3环境下,若开启`--zero_stage3`,

文档评论(0)

1亿VIP精品文档

相关文档