一种基于多尺度语义网络的视听视频解析装置及方法.pdfVIP

  • 4
  • 0
  • 约1.52万字
  • 约 14页
  • 2023-05-10 发布于四川
  • 举报

一种基于多尺度语义网络的视听视频解析装置及方法.pdf

本发明提供一种基于多尺度语义网络的视听视频解析方法及装置,用于对目标音视频中所有单模态和多模态事件进行识别和定位,其特征在于,通过对目标音视频进行了预处理得到的视觉特征和音频特征,然后由基于多尺度语义网络构建的视听视频解析模型对视觉特征和音频特征进行识别和定位从而生成目标音视频的所有单模态事件类别、多模态事件类别以及起始时刻。其中,视听视频解析模型包含跨模态时序卷积注意力网络、自适应语义融合模块、分类模块以及基于注意力的多模态多实例学习池化模块,跨模态时序卷积注意力网络用于捕捉多尺度语义,自适应

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 114519809 A (43)申请公布日 2022.05.20 (21)申请号 202210134629.X G10L 25/27 (2013.01)

文档评论(0)

1亿VIP精品文档

相关文档