基于跨模态自监督学习的主动说话人识别方法.pdfVIP

  • 5
  • 0
  • 约1.31万字
  • 约 12页
  • 2023-05-10 发布于四川
  • 举报

基于跨模态自监督学习的主动说话人识别方法.pdf

本发明提供一种基于跨模态自监督学习的主动说话人识别方法,通过利用视频的同步性特征来自动划分正负样本对用于训练,使得模型能够在无需人工标注的情况下训练至合适的参数,进一步,采用光流法追踪像素点在时间维度上的运动轨迹,通过计算轨迹上的注意力值的平均值可以得到整合后的注意力图,在注意力图上寻找注意力峰值的同时对其周围的区域进行非极大值抑制,能够方便准确地获取单帧注意力图上的人脸位置,通过沿着光流的轨迹反向投影,可准确获得原图中每一帧图片的人脸位置,通过利用人脸特征可计算与音频信号的余弦相似度,用预定的

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 114519880 A (43)申请公布日 2022.05.20 (21)申请号 202210120706.6 (22)申请日 2022.02.09 (71)申请人 复旦大学 地址 200433 上海

文档评论(0)

1亿VIP精品文档

相关文档