一种音视频多模态的关键词唤醒方法及装置.pdfVIP

  • 0
  • 0
  • 约1.42万字
  • 约 13页
  • 2023-08-23 发布于四川
  • 举报

一种音视频多模态的关键词唤醒方法及装置.pdf

本发明公开了一种音视频多模态的关键词唤醒方法及装置,该方法包括:获取图像序列和音频序列;对所述图像序列进行嘴唇检测处理并提取检测到的嘴唇部分图像,将提取出的嘴唇图像序列利用嘴唇特征提取神经网络进行处理,得到图像特征;对所述音频序列做音频特征提取,将提取到的音频特征利用音频特征处理神经网络进行处理,得到音频高维特征;对所述图像特征和所述音频高维特征进行特征融合;将融合得到的音视频特征利用多模特征处理神经网络进行处理,得到多模高维特征;将所述图像特征、音频高维特征和多模高维特征融合成一个混合高维特征

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 116631380 A (43)申请公布日 2023.08.22 (21)申请号 202310909532.6 G06V 40/20 (2022.01)

文档评论(0)

1亿VIP精品文档

相关文档