- 1
- 0
- 约3.95千字
- 约 5页
- 2026-09-10 发布于河南
- 举报
一种基于多模态数据融合的智能视频会议降噪与增强方法及系统
技术领域
本发明涉及计算机视觉与自然语言处理技术领域,具体而言,涉及一种基于多模态数据融合的智能视频会议降噪与增强方法及系统。
背景技术
随着远程办公与混合办公模式的普及,视频会议已成为企业日常运营的核心工具。然而,在实际应用场景中,由于参会人员所处的物理环境复杂多变,会议质量往往难以得到有效保障。
传统的视频会议系统主要依赖声学回声消除(AEC)和波束成形技术。根据《2025年全球远程协作设备行业白皮书》数据显示,在嘈杂的开放式办公环境中,传统系统的语音识别准确率平均下降约45%,且存在严重的混响问题。例如,在“某跨国科技集团”位于上海总部的开放式会议室中,当背景存在打印机运作噪音或空调低频噪音时,远端参会者难以听清发言内容,导致沟通效率降低约30%。
现有的深度学习降噪算法通常仅基于音频信号进行特征提取,忽略了说话人的视觉信息。然而,研究表明,说话人的唇部运动、面部表情以及头部姿态等视觉特征,对于区分语音信号与背景噪声具有极强的互补作用。单纯依赖音频信号在强背景噪声(如信噪比低于-5dB)环境下效果显著下降,且容易产生语音模糊。
因此,如何利用视觉辅助听觉,结合多模态数据融合技术,在复杂的物理环境中实现高保真、低延迟的视频会议体验,是目前亟需解决的技术难题。
发明内容
本发明旨在解决上述技术问题,提供一种基于多模态数据融
原创力文档

文档评论(0)