图像处理方法及电子设备与流程

专利检索2026-06-30  14


本技术涉及图像处理领域,并且更具体地,涉及一种图像处理方法及电子设备。


背景技术:

1、自然界总处于运动之中。运动是最引人注目的视觉信号之一,人类对于运动非常敏感。根据图像生成动图,能够提高用户体验。

2、同时自然界中存在各种各样的声音,为动图匹配音频,从而可以在显示动图的同时播放音频,从而增强情感表达,使得展示的内容可以更具互动性和吸引力。但是,为动图匹配的声音与显示的动图中图像的内容可能不协调,影响用户体验。


技术实现思路

1、本技术提供了一种图像处理方法及电子设备,能够提高播放的声音与显示的图像的内容协调性,提高用户体验。

2、第一方面,提供一种图像处理方法,包括:获取待处理图像;根据所述待处理图像,生成目标视频中的n个目标图像,以及所述目标视频中的n目标音频,所述n个目标图像与所述n个目标音频一一对应,n为大于1的整数,每个目标音频用于在所述目标音频对应的目标图像被显示的情况下播放。

3、本技术提供的方法,根据待处理图像生成多个目标图像,并且生成每个目标图像对应的音频,使得播放的目标音频与显示的目标图像的内容的协调性更高,提高用户体验。

4、在一些可能的实现方式中,所述根据所述待处理图像,生成目标视频中的n个目标图像,以及所述目标视频中的n个目标音频,包括:利用图像处理系统依次对多个第一图像进行处理,以得到每个第一图像对应的至少一个第二图像和每个第二图像对应的所述目标音频,所述多个目标图像包括每个第一图像对应的所述至少一个第二图像,每个第一图像对应的所述至少一个第二图像均为所述目标视频中所述第一图像之后的图像,所述图像处理系统处理的第一个所述第一图像为所述待处理图像,所述图像处理系统处理的第i个所述第一图像为所述图像处理系统处理的第i-1个所述第一图像对应的至少一个第二图像中的图像,i为大于1的正整数,所述图像处理系统包括训练得到的神经网络模型。

5、通过将上一次处理得到的第二图像作为图像处理系统下一次进行处理的第一图像,在目标视频的时长较长的情况下,可以避免生成的图像存在偏移或发散,使得目标视频中的目标图像具有良好的图像质量,提高用户体验。

6、在一些可能的实现方式中,所述方法还包括:获取所述待处理图像中用户指示的目标主体;在所述图像处理系统处理的所述第一图像为所述待处理图像的情况下,所述图像处理系统用于对所述第一图像和目标主体区域信息进行处理,以得到所述第一图像对应的至少一个第二图像,以及每个第二图像对应的所述目标音频,所述目标主体区域信息表示目标主体区域,在所述第一图像中的所述目标主体区域记录有所述目标主体,每个第二图像中所述目标主体区域之外的其他区域记录的内容与所述第一图像中所述其他区域记录的内容相同。

7、与第一图像相比,目标主体所在的目标主体区域之外的部分在第二图像中不发生变化。从而,目标视频中记录的运动是根据用户的指示进行的,提高用户对视频生成的参与感,提高用户体验。

8、在一些可能的实现方式中,在所述图像处理系统处理的所述第一图像为所述待处理图像的情况下,所述图像处理系统用于对所述第一图像和目标主体区域信息进行处理,以得到所述第一图像对应的至少一个第二图像,以及每个第二图像对应的所述目标音频。

9、在第一图像为第一图像的情况下,图像处理系统对第一图像和目标主体区域信息进行处理;而在图像处理系统处理的第一图像不是第一图像的情况下,图像处理系统可以对第一图像进行处理,目标主体区域信息可以不再作为图像处理系统的输入。从而,目标视频中可以反映出目标主体的运动以及其他主体受目标主体影响而进行的运动,使得目标视频中记录的运动更加合理,提高用户体验。

10、在一些可能的实现方式中,所述方法还包括:获取所述用户指示的所述目标主体的目标运动趋势;在所述图像处理系统处理的所述第一图像为所述待处理图像的情况下,所述图像处理系统用于对所述第一图像、目标主体区域信息和运动信息进行处理,以得到所述至少一个第二时刻中每个第二时刻对应的所述目标图像,以及每个第二时刻对应的所述目标音频,在所述至少一个第二时刻对应的至少一个所述目标图像中所述目标主体是按照所述运动信息表示的所述目标运动趋势进行运动的。

11、图像处理系统根据用户指示的目标主体和目标主体的目标运动趋势,生成目标视频,目标视频中的目标主体的运动是按照目标运动趋势进行的,提高用户对视频生成的参与感,提高用户体验。

12、在一些可能的实现方式中,所述图像处理系统包括特征预测模型、图像生成模型和音频生成模型;所述特征预测模型用于,对第一图像进行处理,以得到至少一个预测特征,不同的预测特征对应的第二时刻不同,每个第二时刻均是所述目标视频中所述第一图像对应的第一时刻之后的时刻;所述图像生成模型用于,分别对所述至少一个所述预测特征进行处理,以得到每个第二时刻对应的第二图像;所述音频生成模型用于,分别对所述至少一个所述预测特征进行处理,以得到每个第二时刻对应的目标音频。

13、图像处理系统对第一图像进行处理得到第二时刻对应的预测特征,根据第二时刻对应的预测特征生成第二时刻对应的目标音频和第二时刻对应的第二图像,使得对应于相同时刻的目标音频与目标图像的内容的协调性更高,提高用户体验。

14、在一些可能的实现方式中,所述特征预测模型包括运动位移场预测模型、运动特征提取模型、图像特征提取模型和调整模型;所述运动位移场预测模型用于,对所述第一图像进行处理,以得到每个第二时刻对应的运动位移场,每个第二时刻对应的所述运动位移场表示所述第一图像中的多个像素在所述第二时刻相对所述第一时刻的位移;所述运动特征提取模型用于,分别对所述至少一个运动位移场进行特征提取,以得到每个第二时刻对应的运动特征;所述图像特征提取模型用于,对所述第一图像进行特征提取,以得到图像特征;所述调整模型用于,根据每个第二时刻对应的所述运动特征,对所述图像特征进行调整,以得到所述第二时刻对应的所述预测特征。

15、通过预测用于表示第一图像中多个像素在第一时刻至第二时刻之间的位移的运动位移场,并根据运动位移场的运动特征,对第一图像的图像特征进行调整,使得预测特征更加准确。

16、在一些可能的实现方式中,所述方法还包括:获取所述待处理图像中用户指示的目标主体;所述运动位移场预测模型用于对所述第一图像和目标主体区域信息进行处理,以得到每个第二时刻对应的所述运动位移场,所述目标主体区域信息表示目标主体区域,在所述待处理图像中的所述目标主体区域记录有所述目标主体;每个第二时刻对应的所述运动位移场表示区域外像素的位移为0,所述区域外像素在所述第一图像中位于所述目标主体区域之外。

17、在一些可能的实现方式中,所述方法还包括:获取用户指示的所述目标主体的目标运动趋势;在所述图像处理系统处理的所述第一图像为所述待处理图像的情况下,所述运动位移场预测模型用于对所述第一图像、所述目标主体区域信息和运动信息进行处理,以得到每个第二时刻对应的所述运动位移场,每个第二时刻对应的所述运动位移场表示的目标主体像素在所述第二时刻相对所述第一时刻的目标位移符合所述运动信息表示的所述目标运动趋势,所述目标主体像素为所述第一图像中位于所述目标主体上的像素。

18、第二方面,提供一种图像处理系统的训练方法,该方法包括:获取训练样本和标签图像、标签音频,训练样本包括训练视频中的样本图像,标签图像是训练视频中样本图像之后的图像,标签音频是显示训练视频中标签图像时训练视频中的音频;利用初始图像处理系统对训练样本进行处理,以得到训练图像和训练音频;根据训练图像和标签图像的第一差异,以及训练音频和标签音频的第二差异,调整初始图像处理系统的参数,调整后的初始图像处理系统为训练得到的图像处理系统。

19、在一些可能的实现方式中,训练样本还可以包括训练主体区域信息,训练主体区域信息表示训练主体区域,在样本图像中的训练主体区域记录有训练目标主体,标签图像中在训练主体区域之外的其他区域记录的内容与所述样本图像中该其他区域记录的内容相同。

20、在一些可能的实现方式中,在样本图像是训练视频中的第一帧图像的情况下,训练样本包括训练主体区域信息。

21、在一些可能的实现方式中,训练样本包括训练运动信息。相比于样本图像,在标签图像的训练目标主体是按照训练运动信息表示的训练运动趋势运动的。

22、示例性地,在样本图像是训练视频中的第一帧图像的情况下,训练样本可以包括训练运动信息。

23、在一些可能的实现方式中,初始图像处理系统包括初始特征预测模型、初始图像生成模型和初始音频生成模型。初始特征预测模型用于,对训练样本进行处理,以得到训练预测特征。初始图像生成模型用于,对训练预测特征进行处理,以得到训练图像。初始音频生成模型用于,对预测特征进行处理,以得到训练音频。参数调整后的初始特征预测模型为图像处理系统中的特征预测模型,参数调整后的初始图像生成模型为图像处理系统中的图像生成模型,参数调整后的初始音频生成模型为图像处理系统中的音频生成模型。

24、在一些可能的实现方式中,初始特征预测模型包括运动位移场预测模型、初始运动特征提取模型、初始图像特征提取模型和调整模型。运动位移场预测模型用于,对训练样本进行处理,以得到训练运动位移场,训练运动位移场表示样本图像中的多个训练像素在标签图像对应的第二训练时刻相对样本图像对应的第一训练时刻的位移。标签图像对应的第二训练时刻、样本图像对应的第一训练时刻可以分别理解为标签图像和样本图像在训练视频中的时刻。初始运动特征提取模型用于,对运动位移场进行特征提取,以得到训练运动特征。初始图像特征提取模型用于,对样本图像进行特征提取,以得到训练图像特征。调整模型用于,根据训练运动特征,对训练图像特征进行调整,以得到训练预测特征。参数调整后的初始运动特征提取模型为图像处理系统中的运动特征提取模型,参数调整后的初始图像特征提取模型为图像处理系统中的图像特征提取模型。

25、第三方面,提供了一种图像处理装置,包括用于执行第一方面和/或第二方面的方法的单元。该装置可以是终端设备,也可以是终端设备内的芯片。

26、第四方面,提供了一种电子设备,包括一个或多个处理器,以及存储器;所述存储器与所述一个或多个处理器耦合,所述存储器用于存储计算机程序代码,所述计算机程序代码包括计算机指令,所述一个或多个处理器调用所述计算机指令以使得所述电子设备执行第一方面和/或第二方面的方法。

27、第五方面,提供了一种芯片系统,所述芯片系统应用于电子设备,所述芯片系统包括一个或多个处理器,所述一个或多个处理器用于调用计算机指令以使得所述电子设备执行第一方面和/或第二方面的方法。

28、第六方面,提供了一种计算机可读存储介质,所述计算机可读存储介质包括指令,当所述指令在电子设备上运行时,使得所述电子设备执行第一方面和/或第二方面的方法。

29、第七方面,提供了一种计算机程序产品,当所述计算机程序产品在电子设备上运行时,使得所述电子设备执行第一方面和/或第二方面的方法。


技术特征:

1.一种图像处理方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述根据所述待处理图像,生成目标视频中的n个目标图像,以及所述目标视频中的n个目标音频,包括:

3.根据权利要求2所述的方法,其特征在于,所述方法还包括:获取所述待处理图像中用户指示的目标主体;

4.根据权利要求3所述的方法,其特征在于,在所述图像处理系统处理的所述第一图像为所述待处理图像的情况下,所述图像处理系统用于对所述第一图像和目标主体区域信息进行处理,以得到所述第一图像对应的至少一个第二图像,以及每个第二图像对应的所述目标音频。

5.根据权利要求3或4所述的方法,其特征在于,所述方法还包括:获取所述用户指示的所述目标主体的目标运动趋势;

6.根据权利要求2所述的方法,其特征在于,所述图像处理系统包括特征预测模型、图像生成模型和音频生成模型;

7.根据权利要求6所述的方法,其特征在于,所述特征预测模型包括运动位移场预测模型、运动特征提取模型、图像特征提取模型和调整模型;

8.根据权利要求7所述的方法,其特征在于,所述方法还包括:获取所述待处理图像中用户指示的目标主体;

9.根据权利要求8所述的方法,其特征在于,所述方法还包括:获取用户指示的所述目标主体的目标运动趋势;

10.一种电子设备,其特征在于,所述电子设备包括:一个或多个处理器,以及存储器;

11.一种芯片系统,其特征在于,所述芯片系统应用于电子设备,所述芯片系统包括一个或多个处理器,所述一个或多个处理器用于调用计算机指令以使得所述电子设备执行如权利要求1至9中任一项所述的方法。

12.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括指令,当所述指令在电子设备上运行时,使得所述电子设备执行如权利要求1至9中任一项所述的方法。


技术总结
本申请实施例应用于图像处理领域,提供了一种图像处理方法及电子设备。该方法包括:获取待处理图像;根据待处理图像,生成目标视频中的N个目标图像,以及目标视频中的N目标音频,N个目标图像与N个目标音频一一对应,N为大于1的整数,每个目标音频用于在目标音频对应的目标图像被显示的情况下播放。基于本申请的技术方法,能够使得播放的目标音频的内容与显示的目标图像的内容的协调性更高,提高用户体验。

技术研发人员:范凯波
受保护的技术使用者:荣耀终端有限公司
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1164507.html

最新回复(0)