视觉场景文本融合模型的预训练和图文检索方法及装置.pdfVIP

  • 6
  • 0
  • 约4.45万字
  • 约 36页
  • 2023-11-22 发布于四川
  • 举报

视觉场景文本融合模型的预训练和图文检索方法及装置.pdf

本公开提供了一种视觉场景文本融合模型的预训练和图文检索方法及装置,涉及人工智能技术领域,具体涉及深度学习、图像处理和计算机视觉技术领域。具体实现方案为:获取样本图文对;提取样本图像中的样本场景文本;将样本文本输入文本编码网络,得到样本文本特征;将样本图像和初始的样本融合特征输入视觉编码子网络,以及将初始的样本融合特征和样本场景文本输入场景编码子网络,得到样本图像的全局图像特征和经学习的样本融合特征;根据样本文本特征、样本图像的全局图像特征和经学习的样本融合特征,对视觉场景文本融合模型进行预训练。

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 114942984 A (43)申请公布日 2022.08.26 (21)申请号 202210590151.1 G06F 16/58 (2019.01)

文档评论(0)

1亿VIP精品文档

相关文档