ai训练师笔试题及答案.docxVIP

  • 0
  • 0
  • 约6.07千字
  • 约 19页
  • 2026-08-21 发布于河南
  • 举报

ai训练师笔试题及答案

一、单项选择题(共20题,每题只有1个正确答案,答案后附考点解析)

1.大语言模型预训练阶段,以下哪类数据不属于该阶段常规的训练输入范畴?

A.大规模公开爬取的无标注纯文本数据

B.人类偏好排序类标注数据

C.公开开源的百科结构化知识数据

D.公开出版的古籍扫描转译文本数据

答案:B

解析:大模型预训练阶段采用自监督/无监督学习范式,核心目标是学习通用语言知识与语义逻辑,仅需原始无标注文本、结构化知识类数据即可完成训练。人类偏好排序标注数据属于RLHF(人类反馈强化学习)阶段的专属标注数据集,用于训练奖励模型,不属于预训练阶段的输入内容。

2.根据《生成式人工智能服务管理暂行办法》要求,以下哪类数据明确被禁止用于生成式AI模型训练?

A.公开出版且已过版权保护期的古籍文本数据

B.经过完全匿名化处理的城市公共区域监控影像数据

C.未获得当事人单独明确授权的生物识别类人脸影像数据

D.开源社区发布的标注有非商用协议的公开数据集

答案:C

解析:我国《个人信息保护法》《生成式人工智能服务管理暂行办法》明确规定,生物识别、医疗健康等敏感个人信息用于AI训练必须获得信息主体的单独明确授权,未获得授权的人脸影像类敏感数据严禁纳入训练数据集。其余选项在满足合规要求的前提下均可用于模型训练。

3.某标注员单日处理1000条用户意图分类标注任务,已知该

文档评论(0)

1亿VIP精品文档

相关文档