- 4
- 0
- 约1.31万字
- 约 13页
- 2026-04-20 发布于河南
- 举报
GB/TXXXXX.4—XXXX
附录A
(资料性)
多模态计算机视觉任务
A.1视觉表达任务
A.1.1.1图像描述
用于图像描述任务的计算机视觉大模型:
a)对给定图像或视频,输出词语或预先定义的标识,描述图像或视频的类型或特征;
b)输出自然语言描述的类型或特征;
c)推荐使用主观测评方法(见附录C.2)、CIDEr指标或BLEU指标(见GB/T45288.2—2025附录
A.1.5)衡量图像描述的效果。
A.1.1.2图文理解
用于图文理解任务的计算机视觉大模型:
a)理解图像及文字混合输入或包含文字的图像,输出对应的类型或特征;
b)推荐回答a)中包含的问题(如有);
c)推荐输出自然语言表达,描述图文输入的类型、特征或回答图文输入中的问题;
d)推荐使用准确率或Rouge-L指标(见GB/T45288.2—
您可能关注的文档
- 智能感知系统安全完整性评测文档、补充测试记录信息、评测报告通用要素及技术内容示例.pdf
- 组合驾驶辅助系统条款与场地试验、道路试验、文件检验对应表、仿真试验可信度评估、功能安全和预期功能安全、描述要求、安全保障、数据记录要求.pdf
- 港口岸电能量路由器典型结构.pdf
- 彩票系统安全级别技术要求、密码支持要.pdf
- 组织病理学全切片图像标注程序流程图、标注数据存储结构规范、作业指导书编制模板、数据安全责任承诺书模板.pdf
- 车载直流电驱动空调器的特殊要求.pdf
- 职业健康安全管理绩效评价示例.pdf
- PCB生产设备动力需求、常用能源及耗能工质折标准煤参考系数.pdf
- 英语教师课堂观察量表.pdf
- 樱桃标准化栽培技术模式图.pdf
原创力文档

文档评论(0)