基于双模态模型的语音识别方法、装置、设备及存储介质.pdfVIP

  • 1
  • 0
  • 约2.63万字
  • 约 19页
  • 2023-05-10 发布于四川
  • 举报

基于双模态模型的语音识别方法、装置、设备及存储介质.pdf

本发明涉及一种人工智能技术领域,提供一种基于双模态模型的语音识别方法、装置、电子设备及计算机可读存储介质,其中方法包括:对将嘴部视频片段进行切分,切分后的数据包括视频流数据、音频流数据、以及文本数据;对视频流数据、音频流数据以及文本数据进行预处理,分别获取对应的图片序列数据、音频序列数据以及标准文本;通过构建的双模态模型对图片序列数据、音频序列数据进行特征提取,获取对应的图片序列特征向量、音频序列特征向量,并将图片序列特征向量与音频序列特征向量拼接在一起形成双模态特征向量;训练双模态模型;通过训

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 114519999 A (43)申请公布日 2022.05.20 (21)申请号 202210151202.0 G10L 15/26 (2006.01)

文档评论(0)

1亿VIP精品文档

相关文档