- 6
- 0
- 约4.45万字
- 约 36页
- 2023-11-22 发布于四川
- 举报
本公开提供了一种视觉场景文本融合模型的预训练和图文检索方法及装置,涉及人工智能技术领域,具体涉及深度学习、图像处理和计算机视觉技术领域。具体实现方案为:获取样本图文对;提取样本图像中的样本场景文本;将样本文本输入文本编码网络,得到样本文本特征;将样本图像和初始的样本融合特征输入视觉编码子网络,以及将初始的样本融合特征和样本场景文本输入场景编码子网络,得到样本图像的全局图像特征和经学习的样本融合特征;根据样本文本特征、样本图像的全局图像特征和经学习的样本融合特征,对视觉场景文本融合模型进行预训练。
(19)国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 114942984 A
(43)申请公布日 2022.08.26
(21)申请号 202210590151.1 G06F 16/58 (2019.01)
您可能关注的文档
最近下载
- 普通话口语训练教程教学教案.doc VIP
- T∕CECS 801-2021 回弹法检测水泥基灌浆材料抗压强度技术规程.docx
- 2026青岛红蝶新材料有限公司招聘14人考试模拟试题及答案解析.docx VIP
- 14-2-3 轮胎起重机(最新版).doc VIP
- 供应链风险隐患排查自查报告.docx
- 数学画图方格纸-几何本.xls VIP
- METOLOSE 纤维素醚 METOLOSE METOLOSE SR 用户手册.pdf
- 食品雕刻荷花实训报告.docx VIP
- 食品雕刻教案:荷花.docx VIP
- 《普通高中英语课程标准(2025年版)》带星号词汇详解表+清单-2026届高三英语一轮复习专项.docx VIP
原创力文档

文档评论(0)