本发明涉及语音信号处理,尤其涉及一医多患的语音分离方法和电子设备。
背景技术:
1、在对医生和患者的交流音频进行语音识别以及自然语言处理时,区别医生和患者的音频内容有着至关重要的作用。例如,患者由于缺乏专业的医学知识,其对疾病的描述不够准确,而最终的治疗方案,一定是由医生制定的。通过声纹分割聚类区分医生与患者的声音,能够帮助我们更好的生成结构化信息,以完善电子病历或进行自动诊断分析等。
2、另外,语音数据包含可以被机器学习模型识别的声学和语言特征,以衡量说话人的行为健康状况。而且语音数据的收集对于患者来说相对简单方便以及便宜,只需要一个麦克风、一个安静的地方和一个采集音频样本的设备。因此,基于语音的生物标记物可以对疾病进行预先筛查,监测病情进展和对治疗的反应,并在知情同意的情况下成为临床研究的有用替代标记物,但这一过程的前提同样是在采集音频样本时需要将医生和患者的音频进行区分。在实际情况中,大部分医生与患者的语音并不是单独采集的,而是混合在一起的。现有技术中,通常将说话人的日志用于分离时域上的声音,然而,该分离方法无法根据时序标签获取语音样本,并且也无法确定说话人的身份信息。
技术实现思路
1、有鉴于此,本发明提供了一医多患的语音分离方法和电子设备,用以在实现对医患的交流音频进行分离的同时,能够根据时序标签实现获取语音样本,并且确定说话者的身份信息。
2、第一方面,本发明提供了一医多患的语音分离方法,所述方法包括:
3、步骤一、将同一医生对应的不同患者的多个问诊源音频输入到声纹分割聚类模型,得到每个问诊源音频对应的rttm文件;
4、步骤二、根据所述rttm文件将对应的问诊原始音频进行裁剪拼接,得到每个问诊原始音频对应的子分离音频;
5、步骤三、对每个问诊原始音频对应的所述子分离音频进行声纹识别,确定出现多次的为医生音频,出现一次的为患者音频;将所述医生音频进行拼接,得到不同患者与医生的多个分离音频,并将每个所述分离音频以身份和说话者标签的命名。
6、可选地,所述步骤一包括:
7、步骤s11、通过语音活动检测模型,将每个问诊源音频帧逐帧分为语音信号音频和非语音信号音频两个类别;
8、步骤s12、根据步骤s11中分类的两个类别,将语音信号音频分割成n个片段,并对语音信号音频中说话者转换检测,获得说话者发生转换的时间点,其中,n为正整数;
9、步骤s13、根据步骤s12中分割的n个片段,计算n个片段对应的声纹嵌入码;
10、步骤s14、对步骤s13中的每个声纹嵌入码进行聚类分析,将每个声纹嵌入码归入一个类别中,得到声纹分割聚类的初步数据,其中一个类别对应一个说话者;
11、步骤s15、将步骤s14中的初步数据作为训练数据,得到训练后的分类器模型;对语音信号音频进行二次分割,得到m个片段;将所述分类器模型应用到所述m个片段上,得到声纹分割聚类的分类数据,其中,m为正整数且m>n;
12、步骤s16、将步骤s15中m个片段对应的开始时间、截止时间与说话者标签保存至rttm文件中,获得rttm文件。
13、可选地,所述步骤二包括:
14、步骤s21、根据rttm文件中的开始时间、截止时间以及说话者标签,在循环体内保存单次开始时间与截至时间;
15、步骤s22、根据步骤s21中的开始时间与截至时间将对应的问诊原始音频进行裁剪,保存临时分割文件;
16、步骤s23、判断保存目录中是否存在以步骤s21中说话者标签命名的音频文件;
17、步骤s24、若判断出保存目录中不存在以所述说话者标签命名的音频文件,则将步骤s22中临时分割文件按说话者标签进行命名并保存;
18、步骤s25、若判断出保存目录中存在以所述说话者标签命名的音频文件,则在存在的以所述说话者标签命名的音频文件之后,拼接步骤s22中临时分割文件;继续执行步骤s21,遍历完成rttm文件中的开始时间、截止时间以及说话者标签后,得到两个以说话者标签命名的子音频文件。
19、可选地,所述步骤三包括:
20、步骤s31、将每个问诊原始音频对应的所述子分离音频提取出任意3秒的连续片段;
21、步骤s32、提取步骤s31中任意3秒的连续片段中的声纹嵌入码,并对所述声纹嵌入码进行聚类分析,得到各个时间片段的身份识别序号;
22、步骤s33、将身份重复出现的子音频文件进行拼接,并以医生和身份识别序号命名文件,身份只出现一次的子音频文件,以患者和身份识别序号命名文件。
23、可选地,所述步骤s11中的语音活动检测模型采用高斯混合模型(gmm-vad);
24、高斯混合模型进行语音活动检测的公式为:
25、
26、其中,w1为语音信号的权重;w2为非语音信号的权重;μ1为语音信号的均值;为语音信号的方差;μ2为非语音信号的均值;为非语音信号的方差。
27、可选地,所述步骤s12说话者转换检测采用左右窗比较,其中所述左右窗比较包括:
28、步骤s121、对每个问诊源音频帧选取大小相同的左右两个窗口,计算左右两个窗口的声纹嵌入码以及左右两个声纹嵌入码的余弦相似度,以获得一个以音频帧的时间为x轴,以所述余弦相似度为y轴的二维曲线;
29、步骤s122、对步骤s121中的二维曲线进行峰值检测,选取所有的局部极小值点,并判断局部极小值点对应的余弦相似度是否小于特定阈值;
30、步骤s123、若判断处局部极小值点对应的余弦相似度小于特定阈值,则说话者发生转换。
31、可选地,所述步骤s13声纹嵌入码的计算采用基于身份向量i-vector因子分析,给定说话者语音片段,与其对应的高斯均值超矢量定义为:
32、s=m+t w;
33、其中,s为给定说话者语音片段的高斯均值超矢量;m为与说话者和信道均无关的超向量;t为全局差异空间矩阵;w为一个服从标准多元正态分布的随机向量{xi},维度通常选取在400到600之间。
34、可选地,所述步骤s14中聚类分析采用k-均值聚类;所述k-均值聚类包括:
35、步骤s141、将n则随机向量w{xi}划分为k个子集s={s1,···,sk},使得类内平方和最小,选取初始的k个类的中心,其中1≤i≤n;
36、步骤s142、计算每一个数据与步骤s141中k个类的中心的余弦相似度,将其分配至余弦相似度最高的类;
37、步骤s143、根据步骤s142分配到每个类的数据,计算数据的均值向量,将其作为类的中心,继续执行步骤s142,直至满足收敛准则,类内平方和的变化小于阈值。
38、第二方面,本发明提供一种计算机可读存储介质,所述计算机可读存储介质包括存储的程序,其中,在所述程序运行时控制所述计算机可读存储介质所在电子设备执行第一方面或第一方面任一可能的实现方式中的一医多患的语音分离方法。
39、第三方面,本发明提供一种电子设备,包括:一个或多个处理器;存储器;以及一个或多个计算机程序,其中所述一个或多个计算机程序被存储在所述存储器中,所述一个或多个计算机程序包括指令,当所述指令被所述电子设备执行时,使得所述电子设备执行第一方面或第一方面任一可能的实现方式中的一医多患的语音分离方法。
40、本发明提供的技术方案中,该方法包括将同一医生对应的不同患者的多个问诊源音频输入到声纹分割聚类模型,得到每个问诊源音频对应的rttm文件;根据rttm文件将对应的问诊原始音频进行裁剪拼接,得到每个问诊原始音频对应的子分离音频;对每个问诊原始音频对应的子分离音频进行声纹识别,确定出现多次的为医生音频,出现一次的为患者音频;将医生音频进行拼接,得到不同患者与医生的多个分离音频,并将每个分离音频以身份和说话者标签的命名,该方法在实现对医患的交流音频进行分离的同时,能够根据时序标签实现获取语音样本,并且确定说话者的身份信息。
1.一种一医多患的语音分离方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述步骤一包括:
3.根据权利要求1所述的方法,其特征在于,所述步骤二包括:
4.根据权利要求1所述的方法,其特征在于,所述步骤三包括:
5.根据权利要求2所述的方法,其特征在于,所述步骤s11中的语音活动检测模型采用高斯混合模型(gmm-vad);
6.根据权利要求2所述的方法,其特征在于,所述步骤s12说话者转换检测采用左右窗比较,其中所述左右窗比较包括:
7.根据权利要求2所述的方法,其特征在于,所述步骤s13声纹嵌入码的计算采用基于身份向量i-vector因子分析,给定说话者语音片段,与其对应的高斯均值超矢量定义为:
8.根据权利要求2所述的方法,其特征在于,所述步骤s14中聚类分析采用k-均值聚类;所述k-均值聚类包括:
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括存储的程序,其中,在所述程序运行时控制所述计算机可读存储介质所在电子设备执行权利要求1至8中任一项所述的一医多患的语音分离方法。
10.一种电子设备,其特征在于,包括:一个或多个处理器;存储器;以及一个或多个计算机程序,其中所述一个或多个计算机程序被存储在所述存储器中,所述一个或多个计算机程序包括指令,当所述指令被所述电子设备执行时,使得所述电子设备执行权利要求1至8中任一项所述的一医多患的语音分离方法。
