CLIP模型转化为高效场景检测器方法研究.pdfVIP

  • 0
  • 0
  • 约12.24万字
  • 约 38页
  • 2026-08-03 发布于北京
  • 举报

CLIP模型转化为高效场景检测器方法研究.pdf

将CLIP模型转化为场景文本检测器

*1∗1122†1

于1,2,,,

伟,华技大学腾讯优图{wenwenyu,ylliu,whua

hust,xbai}@,{dqiangjiang,timren}@

3202raM62

(部分)文本图像图像

近期的大规模对比语言-图像预训练(CLIP)模型Text图像图像

在各种下游任务中展现了巨大的潜力,通过利用预训练

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档