- 2
- 0
- 约7.86千字
- 约 22页
- 2026-07-25 发布于四川
- 举报
2026年人工智能训练师数据集构建实操考试题库
一、单项选择题(每题2分,共20分)
1.在构建图像分类数据集时,若原始图片尺寸差异极大,下列哪种预处理方式最能避免模型训练阶段出现显存溢出且保留有效信息?
A.统一缩放至最大边长为1024并保持宽高比
B.统一中心裁剪为512×512
C.先保持宽高比缩放到短边为512,再随机裁剪512×512
D.直接拉伸至1024×1024
答案:C
解析:保持宽高比缩放避免形变,短边对齐512后随机裁剪可保留多样上下文,同时控制显存峰值。
2.当使用主动学习策略迭代扩充数据集时,若模型对某样本预测熵最高,则该样本最可能处于:
A.决策边界附近
B.类别分布中心
C.噪声标签区域
D.冗余区域
答案:A
解析:高熵意味着模型“犹豫”,即位于决策边界附近,标注后可最大幅度提升边界清晰度。
3.在文本实体识别任务中,若原始语料出现大量“嵌套实体”,构建标签体系时应优先采用:
A.BIO
B.BIESO
C.嵌套层级的BIO→BIO2
D.IO
答案:C
解析:BIO2通过层级标签显式表达嵌套,避免扁平化造成的信息丢失。
4.对不平衡语料进行过采样时,以下哪种方法会引入最少的标签噪声?
A.随机复制少数类样本
B.SMOTE插值
C.基于k近邻的Safe-Level-SMOTE
D.随机欠采样多数类
答案:C
解析:S
原创力文档

文档评论(0)