本技术涉及模型训练,尤其涉及一种模型训练方法、装置、设备及介质。
背景技术:
1、多模态模型作为监督模型,需要大量的标注数据进行模型开发,目前存在开源的可用于多模态模型学习所需的图像文本对数据量较少,同时开源的图像文本对通常是生活常用场景,缺乏行业知识,因此在开发具体行业的多模态模型时,可用的图像文本对是一个巨大的限制。进行某一行业的文本标注往往需要大量的人力物力。
技术实现思路
1、本技术提供了一种模型训练方法、装置、设备及介质,用以提供大量的训练样本用于多模态模型的训练。
2、第一方面,提供了一种模型训练方法,包括:
3、获取第一图像和所述第一图像对应的第一标签文本,其中,所述第一标签文本是用户从预先保存的多个标签中为所述第一图像选择的;
4、将所述第一图像输入至第一图像-文本生成器模型,获得所述第一图像对应的第一标注文本,其中,所述第一图像-文本生成器模型用于生成图像对应的标注文本,所述第一图像-文本生成器模型是基于样本图像和所述样本图像的标注文本训练得到的,其中,所述样本图像的标注文本是用户标注的;
5、确定所述第一标注文本与所述第一图像的第一匹配度,确定所述第一标签文本与所述第一图像的第二匹配度;
6、从所述第一匹配度和所述第二匹配度中选择匹配度高的文本,作为所述第一图像的目标文本;
7、将所述第一图像和所述目标文本作为所述第一图像-文本生成器模型的样本集,训练所述第一图像—文本生成器模型至第二图像-文本生成器模型。
8、在一种可能的实现方式中,确定所述第一标注文本与所述第一图像的第一匹配度包括:
9、将所述第一标注文本和所述第一图像输入至判别器模型,获得所述第一标注文本与所述第一图像的第一匹配度;
10、确定所述第一标签文本与所述第一图像的第二匹配度包括:
11、将所述第一标签文本和所述第一图像输入至判别器模型,获得所述第一标签文本与所述第一图像的第二匹配度;
12、其中,所述判别器模型用于确定文本与图像的匹配度。
13、在一种可能的实现方式中,通过文本与图像的向量空间距离确定文本与图像的匹配度。
14、在一种可能的实现方式中,在将所述第一标注文本、所述第一标签文本和所述第一图像输入至判别器模型之前,还包括:
15、将所述第一标注文本、所述第一标签文本和所述第一图像分别输入至基座模型,获得所述第一标注文本对应的第一标注文本向量、所述第一标签文本对应的第一标签文本向量和所述第一图像对应的第一图像向量;
16、将所述第一标注文本和所述第一图像输入至判别器模型,包括:
17、将所述第一标注文本向量和所述第一图像向量输入至所述判别器模型;
18、将所述第一标签文本和所述第一图像输入至判别器模型,包括:
19、将所述第一标签文本向量和所述第一图像向量输入至所述判别器模型。
20、在一种可能的实现方式中,将所述第一图像输入至第一图像-文本生成器模型之前,包括:
21、将所述第一图像输入至基座模型,获得所述第一图像对应的第一图像向量;
22、将所述第一图像输入至第一图像-文本生成器模型,包括:
23、将所述第一图像向量输入至所述第一图像-文本生成器模型。
24、第二方面,提供了一种模型训练装置,包括:
25、获取模块,用于获取第一图像和所述第一图像对应的第一标签文本,其中,所述第一标签文本是用户从预先保存的多个标签中为所述第一图像选择的;将所述第一图像输入至第一图像-文本生成器模型,获得所述第一图像对应的第一标注文本,其中,所述第一图像-文本生成器模型用于生成图像对应的标注文本,所述第一图像-文本生成器模型是基于样本图像和所述样本图像的标注文本训练得到的,其中,所述样本图像的标注文本是用户标注的;
26、匹配模块,用于确定所述第一标注文本与所述第一图像的第一匹配度,确定所述第一标签文本与所述第一图像的第二匹配度;从所述第一匹配度和所述第二匹配度中选择匹配度高的文本,作为所述第一图像的目标文本;
27、训练模块,用于将所述第一图像和所述目标文本作为所述第一图像-文本生成器模型的样本集,训练所述第一图像—文本生成器模型至第二图像-文本生成器模型。
28、在一种可能的实现方式中,所述匹配模块,具体用于将所述第一标注文本和所述第一图像输入至判别器模型,获得所述第一标注文本与所述第一图像的第一匹配度;将所述第一标签文本和所述第一图像输入至判别器模型,获得所述第一标签文本与所述第一图像的第二匹配度;其中,所述判别器模型用于确定文本与图像的匹配度。
29、在一种可能的实现方式中,所述匹配模块,用于将所述第一标注文本、所述第一标签文本和所述第一图像分别输入至基座模型,获得所述第一标注文本对应的第一标注文本向量、所述第一标签文本对应的第一标签文本向量和所述第一图像对应的第一图像向量;将所述第一标注文本向量和所述第一图像向量输入至所述判别器模型;将所述第一标签文本向量和所述第一图像向量输入至所述判别器模型。
30、在一种可能的实现方式中,所述获取模块,用于将所述第一图像输入至基座模型,获得所述第一图像对应的第一图像向量;将所述第一图像向量输入至所述第一图像-文本生成器模型。
31、第三方面,本技术提供了一种电子设备,包括:处理器,可选的,还包括存储器;所述处理器和所述存储器耦合;所述存储器,用于存储计算机程序或指令;所述处理器,用于执行所述存储器中的部分或者全部计算机程序或指令,当所述部分或者全部计算机程序或指令被执行时,用于实现上述任一项方法中的功能。
32、在一种可能的实现中,所述装置还可以包括收发器,所述收发器,用于发送所述处理器处理后的信号,或者接收输入给所述处理器的信号。所述收发器可以执行任一项方法的发送动作或接收动作。
33、第四方面,提供了一种计算机可读存储介质,用于存储计算机程序,所述计算机程序包括用于实现任一项的功能的指令。
34、或者,一种计算机可读存储介质,用于存储计算机程序,所述计算机程序被计算机执行时,可以使得所述计算机执行上述任一项的方法。
35、第五方面,提供了一种计算机程序产品,所述计算机程序产品包括:计算机程序代码,当所述计算机程序代码在计算机上运行时,使得计算机执行上述任一项的方法。
36、本技术实施例中先采用少量的标注文本对图像-文本生成模型进行训练,训练得到第一图像-文本生成模型,然后再利用选择出的目标文本和对第一图像-文本生成模型进行训练,得到第二图像-文本生成模型。目标文本是从标签文本和标注文本中选择出来的,则目标文本中既有标签文本也有标注文本,采用多个目标文本对第一图像-文本生成模型进行训练,训练得到的第二图像-文本生成模型相比于第一图像-文本生成模型的专业性高且语言逻辑性强,后续再使用该第二图像-文本生成模型来生成图像对应的文本用于多模态模型的训练,这样无需人为标注可以就提供大量的高质量训练样本。
1.一种模型训练方法,其特征在于,包括:
2.如权利要求1所述的方法,其特征在于,确定所述第一标注文本与所述第一图像的第一匹配度包括:
3.如权利要求2所述的方法,其特征在于,通过文本与图像的向量空间距离确定文本与图像的匹配度。
4.如权利要求2或3所述的方法,其特征在于,在将所述第一标注文本、所述第一标签文本和所述第一图像输入至判别器模型之前,还包括:
5.如权利要求1所述的方法,其特征在于,将所述第一图像输入至第一图像-文本生成器模型之前,包括:
6.一种模型训练装置,其特征在于,包括:
7.如权利要求6所述的装置,其特征在于,所述匹配模块,具体用于将所述第一标注文本和所述第一图像输入至判别器模型,获得所述第一标注文本与所述第一图像的第一匹配度;将所述第一标签文本和所述第一图像输入至判别器模型,获得所述第一标签文本与所述第一图像的第二匹配度;其中,所述判别器模型用于确定文本与图像的匹配度。
8.一种电子设备,其特征在于,包括:处理器和存储器;
9.一种计算机可读存储介质,其特征在于,用于存储计算机程序,所述计算机程序包括用于实现权利要求1-5任一项所述的方法的指令。
10.一种计算机程序产品,其特征在于,所述计算机程序产品包括:计算机指令,当所述计算机指令在计算机上运行时,使得如权利要求1-5任一项所述的方法被实现。
