2026年人工智能工程师模拟测试卷.docxVIP

  • 3
  • 0
  • 约7.69千字
  • 约 14页
  • 2026-03-17 发布于四川
  • 举报

2026年人工智能工程师模拟测试卷

1.(单选)在Transformer架构中,若将自注意力机制的查询矩阵Q、键矩阵K、值矩阵V的维度全部从d_k=64提升到d_k=128,且保持头数h=8不变,则理论上训练阶段显存占用约增加多少倍?

A.1.0?B.1.5?C.2.0?D.2.5

2.(单选)联邦学习场景下,客户端本地训练采用Adam优化器,服务器端聚合采用FedAvg。若本地学习率η_l=0.01,服务器学习率η_g=1.0,则下列关于收敛性的说法正确的是:

A.η_g=1.0必然导致不收敛?B.增大η_l可等效替代增大η_g?C.η_g1可能加速收敛但增加方差?D.η_g与η_l必须满足η_g·η_l1

3.(单选)在扩散模型DDPM中,若前向过程方差调度β_t从线性改为余弦,则对采样步数T的敏感性会:

A.显著升高?B.显著降低?C.不变?D.先升后降

4.(单选)使用混合精度训练时,LossScaling因子初始值设为2048,若在连续1000步内出现梯度NaN次数为3,则下一epoch建议的Scaling调整策略是:

A.直接减半?B.乘以0.5并向下取整到最接近的2的幂?C.保持不变?D.乘以2

5.(单选)在强化学习PPO算法中,若clip参数ε从0.2调到0.5,则下列最可能发生的是:

A.策略熵单调下降?B.优势估计方差减小?C.训练样本利用效率降低?D.策略

文档评论(0)

1亿VIP精品文档

相关文档