- 3
- 0
- 约7.69千字
- 约 14页
- 2026-03-17 发布于四川
- 举报
2026年人工智能工程师模拟测试卷
1.(单选)在Transformer架构中,若将自注意力机制的查询矩阵Q、键矩阵K、值矩阵V的维度全部从d_k=64提升到d_k=128,且保持头数h=8不变,则理论上训练阶段显存占用约增加多少倍?
A.1.0?B.1.5?C.2.0?D.2.5
2.(单选)联邦学习场景下,客户端本地训练采用Adam优化器,服务器端聚合采用FedAvg。若本地学习率η_l=0.01,服务器学习率η_g=1.0,则下列关于收敛性的说法正确的是:
A.η_g=1.0必然导致不收敛?B.增大η_l可等效替代增大η_g?C.η_g1可能加速收敛但增加方差?D.η_g与η_l必须满足η_g·η_l1
3.(单选)在扩散模型DDPM中,若前向过程方差调度β_t从线性改为余弦,则对采样步数T的敏感性会:
A.显著升高?B.显著降低?C.不变?D.先升后降
4.(单选)使用混合精度训练时,LossScaling因子初始值设为2048,若在连续1000步内出现梯度NaN次数为3,则下一epoch建议的Scaling调整策略是:
A.直接减半?B.乘以0.5并向下取整到最接近的2的幂?C.保持不变?D.乘以2
5.(单选)在强化学习PPO算法中,若clip参数ε从0.2调到0.5,则下列最可能发生的是:
A.策略熵单调下降?B.优势估计方差减小?C.训练样本利用效率降低?D.策略
您可能关注的文档
最近下载
- 英语国家概况_I_Unit_4.ppt VIP
- 河北师范大学《概率论与数理统计》2016-2017学年第一学期期末试卷.pdf VIP
- 河北师范大学《概率论与数理统计》2018-2019学年第一学期期末试卷0.doc VIP
- 河北师范大学《概率论与数理统计》2016-2017学年第一学期期末试卷.doc VIP
- T_GDNAS 061─2025(成人居家鼻饲喂养护理规范).pdf
- 太极拳的派别及种类.doc VIP
- 抗日战争的胜利PPT课件.pptx VIP
- 12SS508《混凝土模块式室外给水管道附属构筑物》.docx VIP
- 六年级上册数学人教版《圆》单元整体教学设计(课件).pptx VIP
- Hamlet 哈姆雷特 中英对照剧本.doc VIP
原创力文档

文档评论(0)