语音增强系统的制作方法

    技术2026-06-27  14


    本实施例一般涉及信号处理,并且具体地涉及用于语音增强的信号处理技术。


    背景技术:

    1、免提通信设备可以包括被配置成将声波转换成多通道音频信号的麦克风阵列,该多通道音频信号可以通过通信通道传送到接收设备。多通道音频信号可以在时间-频率域中表示为帧序列,并且包括语音(例如,来自通信设备的用户)和噪声(例如,来自混响室(reverberant enclosure))。在多通道音频信号传送到接收设备之前,通信设备可以采用被称为语音增强的信号处理技术,该信号处理技术试图抑制多通道音频信号中的噪声,同时减小语音失真或使语音失真最小化。

    2、一些通信设备可以使用空间滤波器(例如,波束成形器)来进行语音增强。空间滤波器可以利用话音活动检测器(也被称为“vad”)来确定多通道音频信号的每一帧中的语音的存在或不存在。一些vad可以使用机器学习(诸如基于神经网络模型的神经网络)来实现。然而,由于用于训练和测试神经网络模型的数据之间的差异,或由于输入到神经网络的音频信号中的大量噪声,这样的vad的准确度可能受损害。一些通信设备还可以使用后置滤波器(诸如二进制掩码或wiener类增益)来抑制由空间滤波器产生的增强的语音信号中的残余噪声。然而,这样的后置滤波器未明确地对空间滤波器中的不确定性进行建模,并且因而要求被优化以避免使增强的语音信号失真的启发式调谐超参数。


    技术实现思路

    1、提供本
    技术实现要素:
    以按简化形式介绍在下文中在具体实施方式中进一步描述的概念的选择。本发明内容不旨在标识要求保护的主题的关键特征或必要特征,也不旨在限制要求保护的主题的范围。

    2、本公开的主题的一个创新性方面能够以一种抑制噪声的方法来实现。该方法可以包括接收表示多通道音频信号的音频帧序列。该方法还可以包括基于高斯混合模型来确定音频帧序列的第一音频帧中的语音似然性。该方法可以包括基于第一音频帧中的语音似然性和表示第二音频帧的第一语音分量的第二音频信号来生成第一音频信号。第二音频帧跟随音频帧序列中的第一音频帧。该方法还可以包括使用神经网络模型基于第一音频信号来确定第二音频帧中的语音似然性。该方法可以包括至少部分地基于第二音频帧中的语音似然性来对第二音频帧的噪声分量进行滤波。

    3、本公开的主题的另一创新性方面能够以一种包括处理系统和存储器的系统来实现。该存储器可以存储指令,所述指令在由处理系统执行时,使得该系统:接收表示多通道音频信号的音频帧序列;以及基于高斯混合模型来确定音频帧序列的第一音频帧中的语音似然性。指令的执行可以进一步使得该系统基于第一音频帧中的语音似然性和表示第二音频帧的第一语音分量的第二音频信号来生成第一音频信号。第二音频帧跟随音频帧序列中的第一音频帧。指令的执行可以进一步使得该系统:使用神经网络模型基于第一音频信号来确定第二音频帧中的语音似然性;以及至少部分地基于第二音频帧中的语音似然性来对第二音频帧的噪声分量进行滤波。



    技术特征:

    1.一种抑制噪声的方法,所述抑制噪声的方法包括:

    2.根据权利要求1所述的方法,所述方法还包括:

    3.根据权利要求2所述的方法,所述方法还包括:

    4.根据权利要求3所述的方法,所述方法还包括:

    5.根据权利要求4所述的方法,所述方法还包括:

    6.根据权利要求5所述的方法,其中所述第三音频信号使用单通道后置滤波器来确定。

    7.根据权利要求6所述的方法,其中所述单通道后置滤波器包括wiener滤波器。

    8.根据权利要求1所述的方法,所述方法还包括:

    9.根据权利要求1所述的方法,其中所述第二音频帧的所述噪声分量使用空间滤波器来滤波。

    10.根据权利要求9所述的方法,其中所述空间滤波器包括最小方差无失真响应波束成形器或独立分量分析。

    11.根据权利要求1所述的方法,其中所述神经网络模型包括深度神经网络模型。

    12.根据权利要求1所述的方法,其中所述高斯混合模型包括在线高斯混合模型。

    13.一种系统,所述系统包括:

    14.根据权利要求13所述的系统,其中所述指令的执行进一步使得所述系统:

    15.根据权利要求14所述的系统,其中所述指令的执行进一步使得所述系统:

    16.根据权利要求15所述的系统,其中所述指令的执行进一步使得所述系统:

    17.根据权利要求16所述的系统,其中所述指令的执行进一步使得所述系统:

    18.根据权利要求17所述的系统,其中所述第三音频信号使用单通道后置滤波器来确定。

    19.根据权利要求18所述的系统,其中所述单通道后置滤波器包括wiener滤波器。

    20.根据权利要求13所述的系统,其中所述指令的执行进一步使得所述系统:


    技术总结
    一种抑制噪声的方法可以包括接收表示多通道音频信号的音频帧序列。该方法可以包括基于高斯混合模型来确定音频帧序列的第一音频帧中的语音似然性。而且,该方法可以包括基于第一音频帧中的语音似然性和表示第二音频帧的第一语音分量的第二音频信号来生成第一音频信号。第二音频帧跟随音频帧序列中的第一音频帧。该方法还可以包括:使用神经网络模型基于第一音频信号来确定第二音频帧中的语音似然性;以及至少部分地基于第二音频帧中的语音似然性来对第二音频帧的噪声分量进行滤波。

    技术研发人员:S·莫萨耶布尔卡斯卡里,G·纳马尼
    受保护的技术使用者:辛纳普蒂克斯公司
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-44277.html

    最新回复(0)