2026年人工智能岗位招聘笔试题与参考答案(某世界500强集团).docx

2026年人工智能岗位招聘笔试题与参考答案(某世界500强集团).docx

2026年人工智能岗位招聘笔试题与参考答案(某世界500强集团)

一、单项选择题(共10题,每题3分,总计30分)

1.在大语言模型对齐训练中,下列哪种技术核心是通过训练奖励模型对生成结果排序,再通过强化学习优化模型策略以匹配人类偏好?

A.监督微调(SFT)B.基于人类反馈的强化学习(RLHF)C.检索增强生成(RAG)D.低秩适配(LoRA)

参考答案:B。解析:SFT为人工标注数据上的监督学习阶段;RAG为外挂知识库的生成增强技术;LoRA为参数高效微调技术,仅RLHF通过奖励模型+PPO等强化学习算法实现人类偏好对齐。

2.某工业视觉缺陷检测场景中,正负样本比例为1:99

文档评论(0)

1亿VIP精品文档

相关文档