使用端到端模型的讲话者分割.pdfVIP

  • 3
  • 0
  • 约3.73万字
  • 约 27页
  • 2023-06-06 发布于四川
  • 举报
描述了用于训练和/或利用端到端讲话者分割模型的技术。在各种实施方式中,该模型是递归神经网络(RNN)模型,诸如包括至少一个诸如长短期记忆(LSTM)层的记忆层的RNN模型。音频数据的音频特征可以作为输入应用于根据本文公开的实施方式训练的端到端讲话者分割模型,并且该模型被利用以处理音频特征以通过模型生成讲话者分割结果作为直接输出。此外,端到端讲话者分割模型可以是序列到序列模型,其中序列可以具有可变长度。因此,该模型可以被利用以为各种长度的音频分段中的任何一个生成讲话者分割结果。

(19)中华人民共和国国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 112805780 A (43)申请公布日 2021.05.14 (21)申请号 201980033104.3 (74)专利代理机构 中原信达知识产权代理有限

文档评论(0)

1亿VIP精品文档

相关文档