2026年人工智能训练师多模态处理实操考试题库.docx

2026年人工智能训练师多模态处理实操考试题库.docx

2026年人工智能训练师多模态处理实操考试题库

1.单项选择题(每题2分,共20分)

1.1在CLIP模型中,图像与文本的相似度计算采用下列哪种距离度量?

A.欧氏距离

B.余弦相似度

C.曼哈顿距离

D.杰卡德系数

1.2当使用ViT-B/32作为视觉编码器时,输入图像默认被切分为多少块?

A.7×7

B.14×14

C.16×16

D.32×32

1.3在多模态融合中,Cross-modalTransformer与Co-attentionTransformer的根本差异在于:

A.是否共享参数

B.是否使用位置编码

C.是否允许模态间双向注意力

D.是否引

文档评论(0)

1亿VIP精品文档

相关文档