- 5
- 0
- 约1.42万字
- 约 11页
- 2023-11-15 发布于四川
- 举报
本发明公开了一种基于CLIP的端到端场景文本识别方法:通过对大规模视觉语言预训练模型CLIP进行改进,利用CLIP预训练好的图像编码器和文本编码器,引入了语言提示生成器、视觉提示生成器以及文本实例与语言匹配模块。通过借助CLIP中的语言知识,FastTCM能够有效辅助下游文本检测和端到端文本识别任务,从而显著提升了现有场景文本检测器和端到端文本识别器的准确度。此外还能增强在小样本学习情景下的表现,并提升模型的泛化能力。极大地拓展了场景文本检测和端到端文本识别的应用领域,有望在诸如图像标注、文档分
(19)国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 117058667 A
(43)申请公布日 2023.11.14
(21)申请号 202311154735.5
(22)申请日 2023.09.07
(71)申请人 华中科技大学
地址 430074
您可能关注的文档
最近下载
- 河北省生态功能区划报告(技术报告).doc VIP
- 深度解析(2026)《TBT 3532-2018 ZPW-2000轨道电路设备》.pptx VIP
- GBT 47801-2026 社会化陪同就医服务 基本要求标准立项发展报告.docx VIP
- (正式版)XJJ 108-2019 《现浇混凝土大模内置保温系统应用技术标准》.pdf VIP
- (正式版)XJJ 109-2019 《自保温砌块应用技术标准》.pdf VIP
- 景区托管运营方案 案例.docx VIP
- GBT-精细陶瓷(先进陶瓷、先进技术陶瓷) 陶瓷纤维束丝内部单丝室温拉伸强度和断裂应变分布的测定.pdf VIP
- MRDS门机系统安装调整指导.pdf VIP
- (正式版)XJJ 110-2019 《现浇混凝土复合外保温模板应用技术标准》.pdf VIP
- 提高手术后器械预处理正确率医院护理品管圈QCC成果汇报PPT(完整版本易修改)-[恢复].pptx VIP
原创力文档

文档评论(0)