一种基于多模态关系图的视频时刻定位方法及设备.pdfVIP

  • 1
  • 0
  • 约1.86万字
  • 约 16页
  • 2023-05-28 发布于四川
  • 举报

一种基于多模态关系图的视频时刻定位方法及设备.pdf

本发明涉及视频检索领域,特别涉及一种基于多模态关系图的视频时刻定位方法及设备,首先输入长视频V及查询语句q,然后构建文本关系图和视觉关系图的双通道关系图,通过文本关系图过滤视觉关系图中的无关对象,通过预训练任务增强对视觉关系图的语义推力和特征提取能力,然后根据查询语句q,利用跨模态检索在长视频V中预测得到备选视频,并补充预测备选视频的边界的时间偏置,直至得到对应查询语句q的视频时刻片段,通过上述方法,可以实现从未修剪的长视频V和输入的查询文本q中捕获对象之间的交互,并进一步通过跨模态检索返回更精

(19)中华人民共和国国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 112380385 A (43)申请公布日 2021.02.19 (21)申请号 202011292346.5 (22)申请日 2020.11.18 (71)申请人 湖南

文档评论(0)

1亿VIP精品文档

相关文档