2026年人工智能岗位招聘笔试题与参考答案(某世界500强集团)
一、单项选择题(共10题,每题3分,总计30分)
1.在大语言模型对齐训练中,下列哪种技术核心是通过训练奖励模型对生成结果排序,再通过强化学习优化模型策略以匹配人类偏好?
A.监督微调(SFT)B.基于人类反馈的强化学习(RLHF)C.检索增强生成(RAG)D.低秩适配(LoRA)
参考答案:B。解析:SFT为人工标注数据上的监督学习阶段;RAG为外挂知识库的生成增强技术;LoRA为参数高效微调技术,仅RLHF通过奖励模型+PPO等强化学习算法实现人类偏好对齐。
2.某工业视觉缺陷检测场景中,正负样本比例为1:99
原创力文档

文档评论(0)