- 0
- 0
- 约1.42万字
- 约 13页
- 2023-08-23 发布于四川
- 举报
本发明公开了一种音视频多模态的关键词唤醒方法及装置,该方法包括:获取图像序列和音频序列;对所述图像序列进行嘴唇检测处理并提取检测到的嘴唇部分图像,将提取出的嘴唇图像序列利用嘴唇特征提取神经网络进行处理,得到图像特征;对所述音频序列做音频特征提取,将提取到的音频特征利用音频特征处理神经网络进行处理,得到音频高维特征;对所述图像特征和所述音频高维特征进行特征融合;将融合得到的音视频特征利用多模特征处理神经网络进行处理,得到多模高维特征;将所述图像特征、音频高维特征和多模高维特征融合成一个混合高维特征
(19)国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 116631380 A
(43)申请公布日 2023.08.22
(21)申请号 202310909532.6 G06V 40/20 (2022.01)
原创力文档

文档评论(0)