基于自监督学习的语音预训练模型研究综述.docVIP

  • 0
  • 0
  • 约4.57千字
  • 约 5页
  • 2026-09-30 发布于江苏
  • 举报

基于自监督学习的语音预训练模型研究综述.doc

基于自监督学习的语音预训练模型研究综述

自监督语音预训练的核心范式演进

自监督学习在语音领域的落地,本质上是通过设计无标注数据上的pretext任务,让模型自动学习语音信号中蕴含的声学、语言学、说话人等多维度特征,从而降低下游任务对标注数据的依赖。早期的语音自监督探索主要围绕特征重构与对比学习两大方向展开,2018年提出的APC(AutoregressivePredictiveCoding)是生成式范式的典型代表,该模型通过autoregressive结构预测语音帧的未来序列,迫使模型捕捉语音的时序依赖关系,在语音识别任务上首次实现了与监督预训练相当的效果。同期,对比学习范式开始兴起,2019年的MoCo框架被快速迁移到语音领域,wav2vec2.0的出现正式确立了语音预训练的主流技术路线:通过对原始语音波形进行masking操作,让模型在隐层空间区分被mask区域的真实特征与负样本,这种掩码+对比的框架大幅降低了预训练的计算成本,同时学习到的特征在低资源语音识别任务上的表现远超传统监督模型。

随着研究的深入,预训练范式逐渐走向多任务融合与统一架构。2021年提出的HuBERT在wav2vec2.0的基础上引入了聚类生成伪标签的思路,将掩码预测任务从对比学习转化为分类任务,解决了对比学习中负样本采样效率低的问题,在100小时标注数据的LibriSpeech任务上,词

文档评论(0)

1亿VIP精品文档

相关文档