一种基于CLIP的端到端场景文本识别方法.pdfVIP

  • 5
  • 0
  • 约1.42万字
  • 约 11页
  • 2023-11-15 发布于四川
  • 举报

一种基于CLIP的端到端场景文本识别方法.pdf

本发明公开了一种基于CLIP的端到端场景文本识别方法:通过对大规模视觉语言预训练模型CLIP进行改进,利用CLIP预训练好的图像编码器和文本编码器,引入了语言提示生成器、视觉提示生成器以及文本实例与语言匹配模块。通过借助CLIP中的语言知识,FastTCM能够有效辅助下游文本检测和端到端文本识别任务,从而显著提升了现有场景文本检测器和端到端文本识别器的准确度。此外还能增强在小样本学习情景下的表现,并提升模型的泛化能力。极大地拓展了场景文本检测和端到端文本识别的应用领域,有望在诸如图像标注、文档分

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 117058667 A (43)申请公布日 2023.11.14 (21)申请号 202311154735.5 (22)申请日 2023.09.07 (71)申请人 华中科技大学 地址 430074

文档评论(0)

1亿VIP精品文档

相关文档