本技术涉及终端,尤其涉及一种语音信号处理方法及相关设备。
背景技术:
1、利用终端设备远距离地采集语音信号(或者,远距离地采集语音信号,也可以称为采集或拾取远场语音信号)是非常有挑战性的。远距离或远场,可以理解为用于采集或拾取声音的麦克风与声源距离较远。一般而言,在声学领域麦克风与声源距离10m以上可以称为远距离,麦克风与声源距离20m或30m可以称为超远距离。
2、目前,主要基于麦克风阵列拾取远场语音信号,根据声学模型对拾取的远场语音信号进行增强,从而拾取目标方位的语音信号。
技术实现思路
1、本技术提供了一种语音信号处理方法及相关设备,可以使得采集的语音信号(特别是远场语音信号)的听感更加清晰饱满。
2、第一方面,提供一种语音信号处理方法,应用于电子设备,方法包括:获取待处理的第一语音信号;基于第一扩散模型对第一语音信号进行降噪处理,得到第二语音信号;基于第二扩散模型对第一语音信号和第二语音信号进行修复处理,得到目标语音信号,其中,第二扩散模型为条件扩散模型,修复处理包括:以第一语音信号作为第二扩散模型的条件,修复第二语音信号的高频成分。
3、上述方案,一方面进行降噪,能够使得目标语音信号在听感上更加清晰,另一方面修复高频成分,能够使得目标语音信号在听感上更加饱满。并且,相比于只对远场语音信号做降噪处理的方案,能够使得目标语音信号在听感上更加饱满。
4、并且,由于衰减后的高频成分可能淹没在噪声中,降噪处理可能会对第一语音信号衰减后的高频成分噪声干扰,从而可能影响修复效果。在进行修复处理时,还将降噪前的语音信号作为条件扩散模型的条件一起进行修复处理,作为修复高频成分的参考信息,以减少降噪处理对修复处理可能造成的干扰,提升修复效果。
5、并且,将对第一语音信号的处理分解为两大步骤,分别用两个扩散模型来进行处理,相比于用一个模型对远场语音信号进行处理,在达到相同的效果的情况下,能够降低算法的复杂程度并节省算力。也就是说,用一个模型处理第一语音信号,这个模型需要更复杂的算法才能实现这两个模型才能实现的效果,对终端设备的功耗和算力等要求都更高。
6、在一种可能的实施例中,第一语音信号为远场语音信号,或者,电子设备的麦克风与第一语音信号的声源的距离大于或等于预设距离阈值。
7、本技术实施例对于远场语音信号的拾取,语音处理的效果尤为显著。
8、在一种可能的实施例中,基于第一扩散模型对第一语音信号进行降噪处理,得到第二语音信号,包括:计算第一语音信号的梯度,梯度用于表征第二语音信号的概率分布,第二语音信号的概率分布与第二语音信号的语谱图中的时频点的分布对应;对第一语音信号的梯度进行采样处理,得到第二语音信号。
9、可理解,上述考虑第二语音信号的概率分布,也就是考虑第二语音信号的时频点的分布的整体性,整体性包括时频点与时频点之间的关系。
10、还可理解,对于不考虑整体性,而逐个时频点进行分析的情况,即使降噪处理后的信号的时频点与理想的干净信号(理想情况下第一语音信号除去所有噪声后的信号)对应的时频点的总的误差(例如第一误差值)非常小,也很有可能出现少部分时频点与理想的干净信号的对应时频点的误差很大,大部分时频点误差很小的情况,从而误差很大的少部分时频点,从原理上使得降噪后的语音存在一定程度的损伤,频谱连续性不好,听感也会较差。
11、相比于不考虑时频点的分布整体性的方案,本技术在考虑时频点的分布整体性的基础上,如果将总的误差控制在同样小的数值(例如第一误差值),则会使得几乎所有的点的误差较为均衡也都较小,从而能在原理上减少降噪处理对语音信号的损伤。
12、在一种可能的实施例中,计算第一语音信号的梯度,包括:将第一语音信号输入第一神经网络,得到第一语音信号的降噪待采样梯度,降噪待采样梯度用于表征第二语音信号的概率分布;对第一语音信号的梯度进行采样处理,包括:根据降噪待采样梯度,预测降噪采样信号;计算第一语音信号的梯度,还包括:将降噪采样信号输入第一神经网络,得到降噪采样信号的降噪待校正梯度,降噪待校正梯度用于表征第二语音信号的概率分布;对第一语音信号的梯度进行采样处理,还包括:根据降噪待校正梯度,对降噪采样信号进行校正,得到降噪校正信号;根据降噪校正信号生成第二语音信号。
13、上述方案,通过对基于降噪待采样梯度预测得到的降噪采样信号继续计算降噪待校正梯度,并基于降噪待校正梯度对降噪采样信号进行校正,相比于只计算一次梯度的扩散模型,或者,相比于只预测不校正的扩散模型,降噪效果更好。
14、也就是说,根据梯度进行采样,包括预测和校正两个子步骤。示例性的,预测步骤采用祖先采样;校正步骤采用朗之万动力学采样或退火朗之万动力学采样,校正步骤用于校正预测步骤的预测结果。本技术中的预测和采样步骤均可以参照这里的示例,在此进行统一说明,下不赘述。
15、在一种可能的实施例中,根据降噪待采样梯度,预测降噪采样信号,包括:基于第一扩散模型的随机微分方程,根据第一语音信号计算降噪漂移系数;根据降噪漂移系数和降噪待采样梯度,计算降噪逆漂移系数;根据降噪逆漂移系数、第一语音信号以及第四高斯噪声值,预测得到降噪采样信号,其中,第四高斯噪声值是基于第三随机种子生成的。
16、可理解,逆漂移系数可以用于描述采样过程中,带噪的语音信号趋向于干净语音信号的路径。基于逆漂移系数进行采样得到梯度,能够实现降噪。
17、在一种可能的实施例中,第一神经网络是基于第一输入数据和第一目标数据得到的,其中,第一输入数据包括样本带噪语音信号和样本降噪采样信号,样本带噪语音信号是由第一样本噪声信号和第一样本语音信号生成的,样本降噪采样信号是基于样本带噪语音信号生成的,第一目标数据用于表征第一样本语音信号的概率分布。
18、上述方案,通过目标数据表征包含于样本带噪语音信号的样本语音信号的概率分布,来训练神经网络模型,以使得训练好的神经网络模型输出的梯度能够表征第二语音信号的概率分布。
19、在一种可能的实施例中,样本降噪采样信号是第五高斯噪声值,第五高斯噪声值是根据样本带噪语音信号、样本语音信号以及服从标准正态分布的第六高斯噪声值生成的,第一目标数据是基于第五高斯噪声值的标准差和第六高斯噪声值生成的,第六高斯噪声值是基于第四随机种子生成的。
20、可理解,由于随机种子在不同的时间生成的随机数不同,因此本技术提供的语音信号处理方法在不同的时间针对同一段待处理的语音信号进行降噪处理,分别输出的第二语音信号不同或不完全相同,从而最终分别输出的目标语音信号不同或不完全相同。
21、在一种可能的实施例中,基于第二扩散模型对第一语音信号和第二语音信号进行修复处理,得到目标语音信号,包括:根据第一语音信号和第二语音信号,计算第二语音信号的梯度,梯度用于表征目标语音信号的概率分布,目标语音信号的概率分布与目标语音信号的语谱图中的时频点的分布对应;基于第一高斯噪声值对第二语音信号的梯度进行采样处理,得到目标语音信号,第一高斯噪声值是基于第一随机种子生成的。
22、上述方案,由于在采样步骤中根据梯度叠加了高斯噪声,如果高斯噪声符合梯度或符合目标语音信号的概率分布,会使得衰减后的高频成分得到增强,从而修复高频成分。
23、可理解,传统的判别式的神经网络不能像生成式的神经网络,基于概率分布叠加高斯噪声而实现对高频成分的修复。
24、在一种可能的实施例中,根据第一语音信号和第二语音信号,计算第二语音信号的梯度,包括:将第一语音信号和第二语音信号输入第二神经网络,得到第二语音信号的修复待采样梯度,修复待采样梯度用于表征目标语音信号的概率分布;基于第一高斯噪声值对第二语音信号的梯度进行采样处理,包括:根据修复待采样梯度和第一高斯噪声值,预测修复采样信号;根据第一语音信号和第二语音信号,计算第二语音信号的梯度,还包括:将修复采样信号输入第二神经网络,得到修复采样信号的修复待校正梯度,修复待校正梯度用于表征目标语音信号的概率分布;对第二语音信号的梯度进行采样处理,还包括:根据修复待校正梯度,对修复采样信号进行校正,得到修复校正信号;根据修复校正信号生成目标语音信号。
25、上述方案,通过对基于修复待采样梯度预测得到的修复采样信号继续计算修复待校正梯度,并基于修复待校正梯度对修复采样信号进行校正,相比于只计算一次梯度的扩散模型,或者,相比于只预测不校正的扩散模型,修复高频成分的效果更好。
26、在一种可能的实施例中,根据修复待采样梯度和第一高斯噪声值,预测修复采样信号,包括:基于第二扩散模型的随机微分方程,根据第二语音信号计算修复漂移系数;根据修复漂移系数和修复待采样梯度,计算修复逆漂移系数;根据修复逆漂移系数、第二语音信号以及第一高斯噪声值,预测得到修复采样信号。
27、可理解,逆漂移系数可以用于描述采样过程中,带噪的语音信号趋向于干净语音信号的路径。即,减少不服从目标语音信号的概率分布的时频点,借助于第一高斯噪声生成服从目标语音信号的概率分布的时频点的路径。
28、在一种可能的实施例中,第二神经网络是基于第二输入数据和第二目标数据训练得到的,其中,第二输入数据包括样本带噪语音信号、样本衰减语音信号以及样本修复采样信号,样本带噪语音信号是由第二样本噪声信号和第二样本语音信号生成的,样本衰减语音信号是由样本带噪语音信号与预设距离房间脉冲响应卷积得到的,样本修复采样信号是基于样本衰减语音信号和第二样本语音信号生成的,第二目标数据用于表征第二样本语音信号的概率分布,预设距离房间脉冲响应用于模拟声源与电子设备的麦克风的距离大于或等于预设距离阈值时,声音由声源发出后传播到麦克风的过程。
29、上述方案,通过目标据表征用于生成样本衰减语音信号的样本语音信号的概率分布,来训练神经网络模型,以使得训练好的神经网络模型输出的梯度能够表征目标语音信号的概率分布。
30、在一种可能的实施例中,样本修复采样信号是第二高斯噪声值,第二高斯噪声值是根据样本衰减语音信号、第二样本语音信号以及服从标准正态分布的第三高斯噪声值生成的,第二目标数据是基于第二高斯噪声值的标准差和第三高斯噪声值生成的,第三高斯噪声值是基于第二随机种子生成的。
31、可理解,由于随机种子在不同的时间生成的随机数不同,因此本技术提供的语音信号处理方法在不同的时间针对同一段待处理的语音信号进行修复处理,分别输出的目标语音信号不同或不完全相同。
32、在一种可能的实施例中,将第一语音信号输入第一神经网络,得到第一语音信号的降噪待采样梯度,包括:将第一语音信号输入第一神经网络,得到第一语音信号的第1个降噪待采样梯度;基于第一扩散模型的随机微分方程,根据第一语音信号计算降噪漂移系数,包括:基于第一扩散模型的随机微分方程,根据第一语音信号计算第1个降噪漂移系数;根据降噪漂移系数和降噪待采样梯度,计算降噪逆漂移系数,包括:根据第1个降噪漂移系数和第1个降噪待采样梯度,计算第1个降噪逆漂移系数;根据降噪逆漂移系数、第一语音信号以及第四高斯噪声值,预测得到降噪采样信号,包括:根据第1个降噪逆漂移系数、第一语音信号以及第1个第四高斯噪声值,预测得到第1个降噪采样信号;将降噪采样信号输入第一神经网络,得到降噪采样信号的降噪待校正梯度,包括:将第1个降噪采样信号输入第一神经网络,得到第1个降噪采样信号的第1个降噪待校正梯度;根据降噪待校正梯度,对降噪采样信号进行校正,得到降噪校正信号,包括:根据第1个降噪待校正梯度,对第1个降噪采样信号进行校正,得到第1个降噪校正信号。
33、或者,将第一语音信号输入第一神经网络,得到第一语音信号的降噪待采样梯度,包括:将第n-1个降噪校正信号以及第一语音信号输入第一神经网络,得到第一语音信号的第n个降噪待采样梯度;基于第一扩散模型的随机微分方程,根据第一语音信号计算降噪漂移系数,包括:基于第一扩散模型的随机微分方程,根据第n-1个降噪校正信号以及第一语音信号计算第n个降噪漂移系数;根据降噪漂移系数和降噪待采样梯度,计算降噪逆漂移系数,包括:根据第n个降噪漂移系数和第n个降噪待采样梯度,计算第n个降噪逆漂移系数;根据降噪逆漂移系数、第一语音信号以及第四高斯噪声值,预测得到降噪采样信号,包括:根据第n个降噪逆漂移系数、第n-1个降噪校正信号以及第n个第四高斯噪声值,预测得到第n个降噪采样信号;将降噪采样信号输入第一神经网络,得到降噪采样信号的降噪待校正梯度,包括:将第n个降噪采样信号以及第一语音信号输入第一神经网络,得到第n个降噪采样信号的第n个降噪待校正梯度;根据降噪待校正梯度,对降噪采样信号进行校正,得到降噪校正信号,包括:根据第n个降噪待校正梯度,对第n个降噪采样信号进行校正,得到第n个降噪校正信号,2≤n≤n,n和n均为正整数,其中,在n=n的情况下,将第n个降噪校正信号作为第二语音信号。
34、上述方案,将计算梯度、预测和校正的步骤迭代n次,以达到更好的降噪效果。
35、在一种可能的实施例中,将第一语音信号和第二语音信号输入第二神经网络,得到第二语音信号的修复待采样梯度,包括:将第一语音信号和第二语音信号输入第二神经网络,得到第二语音信号的第1个修复待采样梯度;基于第二扩散模型的随机微分方程,根据第二语音信号计算修复漂移系数,包括:基于第二扩散模型的随机微分方程,根据第二语音信号计算第1个修复漂移系数;根据修复漂移系数和修复待采样梯度,计算修复逆漂移系数,包括:根据第1个修复漂移系数和第1个修复待采样梯度,计算第1个修复逆漂移系数;根据修复逆漂移系数、第二语音信号以及第一高斯噪声值,预测得到修复采样信号,包括:根据第1个修复逆漂移系数、第二语音信号以及第一高斯噪声值,预测得到第1个修复采样信号;将修复采样信号输入第二神经网络,得到修复采样信号的修复待校正梯度,包括:将第1个修复采样信号输入第二神经网络,得到第1个修复采样信号的第1个修复待校正梯度;根据修复待校正梯度,对修复采样信号进行校正,得到修复校正信号,包括:根据第1个修复待校正梯度,对第1个修复采样信号进行校正,得到第1个修复校正信号。
36、或者,将第一语音信号和第二语音信号输入第二神经网络,得到第二语音信号的修复待采样梯度,包括:将第一语音信号、第二语音信号以及第m-1个修复校正信号输入第二神经网络,得到第二语音信号的第m个修复待采样梯度;基于第二扩散模型的随机微分方程,根据第二语音信号计算修复漂移系数,包括:基于第二扩散模型的随机微分方程,根据第二语音信号以及第m-1个修复校正信号计算第m个修复漂移系数;根据修复漂移系数和修复待采样梯度,计算修复逆漂移系数,包括:根据第m个修复漂移系数和第m个修复待采样梯度,计算第m个修复逆漂移系数;根据修复逆漂移系数、第二语音信号以及第一高斯噪声值,预测得到修复采样信号,包括:根据第m个修复逆漂移系数、第m-1个修复校正信号以及第一高斯噪声值,预测得到第m个修复采样信号;将修复采样信号输入第二神经网络,得到修复采样信号的修复待校正梯度,包括:将第一语音信号、第二语音信号以及第m个修复采样信号输入第二神经网络,得到第m个修复采样信号的第m个修复待校正梯度;根据修复待校正梯度,对修复采样信号进行校正,得到修复校正信号,包括:根据第m个修复待校正梯度,对第m个修复采样信号进行校正,得到第m个修复校正信号,2≤m≤m,m和m均为正整数,其中,在m=m的情况下,将第m个修复校正信号作为目标语音信号。
37、上述方案,将计算梯度、预测和校正的步骤迭代m次,以达到更好的修复高频成分效果。
38、第二方面,本技术提供了一种电子设备,该电子设备包括一个或多个处理器和一个或多个存储器;其中,一个或多个存储器与一个或多个处理器耦合,一个或多个存储器用于存储计算机程序代码,计算机程序代码包括计算机指令,当一个或多个处理器执行计算机指令时,使得电子设备执行如第一方面以及第一方面中任一可能的实现方式描述的方法。
39、第三方面,本技术实施例提供了一种芯片系统,该芯片系统应用于电子设备,该芯片系统包括一个或多个处理器,该处理器用于调用计算机指令以使得该电子设备执行如第一方面以及第一方面中任一可能的实现方式描述的方法。
40、第四方面,本技术提供一种计算机可读存储介质,包括指令,当上述指令在电子设备上运行时,使得上述电子设备执行如第一方面以及第一方面中任一可能的实现方式描述的方法。
41、第五方面,本技术提供一种包含指令的计算机程序产品,当上述计算机程序产品在电子设备上运行时,使得上述电子设备执行如第一方面以及第一方面中任一可能的实现方式描述的方法。
42、可以理解地,上述第二方面提供的电子设备、第三方面提供的芯片系统、第四方面提供的计算机存储介质、第五方面提供的计算机程序产品均用于执行本技术所提供的方法。因此,其所能达到的有益效果可参考对应方法中的有益效果,此处不再赘述。
1.一种语音信号处理方法,应用于电子设备,其特征在于,所述方法包括:
2.如权利要求1所述的方法,其特征在于,所述第一语音信号为远场语音信号,或者,所述电子设备的麦克风与所述第一语音信号的声源的距离大于或等于预设距离阈值。
3.如权利要求1所述的方法,其特征在于,所述基于第二扩散模型对所述第一语音信号和所述第二语音信号进行修复处理,得到目标语音信号,包括:
4.如权利要求3所述的方法,其特征在于,
5.如权利要求4所述的方法,其特征在于,所述根据所述修复待采样梯度和所述第一高斯噪声值,预测修复采样信号,包括:
6.如权利要求4所述的方法,其特征在于,所述第二神经网络是基于第二输入数据和第二目标数据训练得到的,其中,所述第二输入数据包括样本带噪语音信号、样本衰减语音信号以及样本修复采样信号,样本带噪语音信号是由第二样本噪声信号和第二样本语音信号生成的,样本衰减语音信号是由所述样本带噪语音信号与预设距离房间脉冲响应卷积得到的,所述样本修复采样信号是基于所述样本衰减语音信号和所述第二样本语音信号生成的,所述第二目标数据用于表征所述第二样本语音信号的概率分布,所述预设距离房间脉冲响应用于模拟声源与所述电子设备的麦克风的距离大于或等于预设距离阈值时,声音由声源发出后传播到所述麦克风的过程。
7.如权利要求6所述的方法,其特征在于,所述样本修复采样信号是第二高斯噪声值,所述第二高斯噪声值是根据所述样本衰减语音信号、所述第二样本语音信号以及服从标准正态分布的第三高斯噪声值生成的,所述第二目标数据是基于所述第二高斯噪声值的标准差和第三高斯噪声值生成的,所述第三高斯噪声值是基于第二随机种子生成的。
8.如权利要求1所述的方法,其特征在于,所述基于第一扩散模型对所述第一语音信号进行降噪处理,得到第二语音信号,包括:
9.如权利要求8所述的方法,其特征在于,
10.如权利要求9所述的方法,其特征在于,所述根据所述降噪待采样梯度,预测降噪采样信号,包括:
11.如权利要求9所述的方法,其特征在于,所述第一神经网络是基于第一输入数据和第一目标数据训练得到的,其中,所述第一输入数据包括样本带噪语音信号和样本降噪采样信号,所述样本带噪语音信号是由第一样本噪声信号和第一样本语音信号生成的,所述样本降噪采样信号是基于所述样本带噪语音信号生成的,所述第一目标数据用于表征所述第一样本语音信号的概率分布。
12.如权利要求11所述的方法,其特征在于,所述样本降噪采样信号是第五高斯噪声值,所述第五高斯噪声值是根据所述样本带噪语音信号、所述样本语音信号以及服从标准正态分布的第六高斯噪声值生成的,所述第一目标数据是基于所述第五高斯噪声值的标准差和第六高斯噪声值生成的,第六高斯噪声值是基于第四随机种子生成的。
13.一种电子设备,其特征在于,所述电子设备包括:一个或多个处理器,以及存储器;
14.一种芯片系统,其特征在于,所述芯片系统应用于电子设备,所述芯片系统包括一个或多个处理器,所述一个或多个处理器用于调用计算机指令以使得所述电子设备执行如权利要求1至12中任一项所述的方法。
15.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括指令,当所述指令在电子设备上运行时,使得所述电子设备执行如权利要求1至12中任一项所述的方法。
