本发明涉及图像处理,特别是一种基于扩散模型的视频上色方法、系统及存储介质。
背景技术:
1、现代视频的生动感很大程度上来源于色彩,色彩能带给人们带来视觉上的绝佳动感体验。然而在彩色摄像机发明之前,视频和电影通常以黑白灰度的形式呈现,让人感觉乏味单调。为了重现旧时代的生动场景,人们通常利用ps软件手动逐帧着色或者单帧上色算法对黑白电影或视频进行上色,赋予黑白视频以彩色生命,在老电影修复领域有着巨大的意义。
2、目前,视频上色方法通常有三类方法:(1)传统的视频处理方法:如色彩传递算法,该类方法虽然可以上色,但上色后色彩暗淡;(2)基于cnn的处理方法:该类方法虽然可以通过大数据驱动的方法提高上色鲜艳程度,但上色后其帧间的颜色跳变较大,整体效果不佳;(3)基于gan的方法:该类方法虽然可以较稳定生成上色的视频帧,但色彩真实性有待提高,难以满足用户需求。
3、因此,现有的视频上色方法存在上色效果不佳的问题。
技术实现思路
1、本发明的主要目的在于提供了一种基于扩散模型的视频上色方法、系统及存储介质,旨在解决现有的基于扩散模型的视频上色方法上色效果不佳的技术问题。
2、为实现上述目的,本发明提供了一种基于扩散模型的视频上色方法,其包括以下步骤:基于扩散模型进行训练得到视频上色模型,所述视频上色模型包括视频编码器、迭代去噪器、文本编码器、色彩控制器、纹理控制器及视频解码器;获取一系列灰度视频帧并输入至视频编码器中,得到灰度视频帧对应的潜码;获取描述文本数据并输入至文本编码器中,得到文本特征,用于对迭代去噪器的文本控制;选取颜色参考视频帧并输入至色彩控制器中,得到色彩特征,用于对迭代去噪器进行色彩控制;将灰度视频帧输入至纹理控制器中,得到纹理特征,用于对迭代去噪器进行纹理结构控制;将潜码输入至迭代去噪器中,进行迭代扩散去噪,得到去噪潜码;将去噪潜码和灰度视频帧进行融合后输入至视频解码器中,以输出一系列上色视频帧。
3、可选的,视频上色模型的训练阶段根据以下步骤得到用于训练的配对数据:获取视频数据并沿时间轴进行逐帧切割,得到一系列的原始彩色视频帧;对原始彩色视频帧进行灰度化处理,得到原始彩色视频帧对应的原始灰度视频帧;基于blip模型获取原始彩色视频帧对应的原始描述文本;将原始彩色视频帧、原始灰度视频帧与原始描述文本作为配对数据。
4、可选的,选取颜色参考视频帧具体包括以下步骤:根据一系列灰度视频帧的时间序列,选取位于时间轴正中间的灰度视频帧作为中间帧;基于中间帧,利用图像检索算法进行图像检索,得到与中间帧纹理结构最为相似的彩色图像,作为颜色参考视频帧。
5、可选的,视频上色模型的训练阶段根据预设噪声损失函数、预设l1损失函数与预设潜空间损失函数进行训练;预设噪声损失函数用于计算迭代去噪器的预测噪声与预设噪声之间的l2损失;预设l1损失函数用于计算原始彩色视频帧与上色视频帧间的l1损失;预设潜空间损失函数用于计算原始灰度视频帧对应的潜码与去噪潜码间的l2损失。
6、可选的,预设噪声损失函数lnoise的计算公式具体为:其中,t表示时间步长,∈表示预设噪声,∈θ(·)表示迭代去噪器的预测噪声,zt表示在时间步长t时通过迭代去噪后得到的去噪潜码,text表示原始描述文本,vgray表示原始灰度视频帧,vref表示颜色参考视频帧;
7、预设l1损失函数的计算公式具体为:其中,vcolor表示原始彩色视频帧,表示上色视频帧;
8、预设潜空间损失函数llatent的计算公式具体为:其中,zgray表示原始灰度视频帧对应的潜码,z0表示迭代扩散去噪过程结束后得到的时间步长0时对应的去噪潜码。
9、可选的,视频编码器基于vqvae的编码器结构,并使用3d卷积层构建得到;迭代去噪器基于u-net进行构建得到;文本编码器基于clip模型进行构建得到;色彩控制器基于u-net的编码器结构构建得到;纹理控制器基于control-net构建得到;视频解码器基于vqvae的解码器结构,并使用3d卷积层构建得到。
10、可选的,色彩控制器与纹理控制器与迭代去噪器并行。
11、可选的,色彩控制器保留u-net的编码器结构中除了交叉注意力层以外的其他结构,以用于提取颜色参考视频帧的色彩特征,其公式具体表述为:其中,表示对于第i帧视频帧色彩控制器得到的色彩特征,vi表示迭代去噪器内部提取第i帧视频帧的3d特征,conv1*1表示权值和偏置初始化都为零的1×1卷积层,fcolor表示色彩控制器内部的色彩提取层,e表示编码器,vref表示颜色参考视频帧。
12、与所述基于扩散模型的视频上色方法相对应的,本发明提供一种基于扩散模型的视频上色系统,基于扩散模型进行训练得到视频上色模型,所述视频上色模型包括视频编码器、迭代去噪器、文本编码器、色彩控制器、纹理控制器及视频解码器;视频编码器,用于获取一系列灰度视频帧,输出灰度视频帧对应的潜码并输入至迭代去噪器中;文本编码器,用于获取描述文本数据,输出文本特征,以对迭代去噪器进行文本控制;色彩控制器,用于获取颜色参考视频帧,输出色彩特征,以对迭代去噪器进行色彩控制;纹理控制器,用于获取灰度视频帧,输出纹理特征,以对迭代去噪器进行纹理结构控制;迭代去噪器,用于获取潜码,进行迭代扩散去噪,输出去噪潜码;视频解码器,用于对去噪潜码和灰度视频帧进行融合,输出一系列上色视频帧。
13、此外,为实现上述目的,本发明还提供一种计算机可读存储介质,所述计算机可读存储介质上存储有基于扩散模型的视频上色程序,所述基于扩散模型的视频上色程序被处理器执行时实现如上文所述的基于扩散模型的视频上色方法的步骤。
14、本发明的有益效果是:
15、(1)与现有技术相比,本发明基于扩散模型构建包括视频编码器,文本编码器,迭代去噪器,色彩控制器,纹理控制器和视频解码器的视频上色模型,实现视频上色,其扩散模型内部使用3d的空时卷积层(也称作3d卷积层)构建,能够从视频数据中提取空间和时间特征。基于强大的扩散先验、文本控制、纹理控制与色彩控制,融合了多种模态特征,利用连续的视频帧纹理和参考帧色彩的联合控制进行参考上色;能够得到真实鲜艳且帧间稳定的视频上色效果,输出上色效果较佳的上色视频帧;
16、(2)与现有技术相比,本发明通过将原始彩色视频帧、原始灰度视频帧与原始描述文本作为配对数据,为训练视频上色模型打下基础;
17、(3)与现有技术相比,本发明通过选取中间帧,并基于中间帧,利用图像检索算法进行图像检索,得到颜色参考视频帧,用于对迭代去噪器进行色彩控制,能够提高上色效果;
18、(4)与现有技术相比,本发明通过在扩散模型噪声损失函数的基础上,还设计加入了图像空间的l1损失函数和潜空间的潜空间损失函数,用于提升视频生成的纹理颜色细节,同时维持帧间色彩的稳定性,大幅提升了上色视频的真实感和现代感。
1.一种基于扩散模型的视频上色方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于扩散模型的视频上色方法,其特征在于:视频上色模型的训练阶段根据以下步骤得到用于训练的配对数据:
3.根据权利要求2所述的基于扩散模型的视频上色方法,其特征在于:选取颜色参考视频帧具体包括以下步骤:
4.根据权利要求2所述的基于扩散模型的视频上色方法,其特征在于:视频上色模型的训练阶段根据预设噪声损失函数、预设l1损失函数与预设潜空间损失函数进行训练;
5.根据权利要求4所述的基于扩散模型的视频上色方法,其特征在于:预设噪声损失函数lnoise的计算公式具体为:其中,t表示时间步长,∈表示预设噪声,∈θ(·)表示迭代去噪器的预测噪声,zt表示在时间步长t时通过迭代去噪后得到的去噪潜码,text表示原始描述文本,vhray表示原始灰度视频帧,vref表示颜色参考视频帧;
6.根据权利要求1所述的基于扩散模型的视频上色方法,其特征在于:视频编码器基于vqvae的编码器结构,并使用3d卷积层构建得到;迭代去噪器基于u-net进行构建得到;文本编码器基于clip模型进行构建得到;色彩控制器基于u-net的编码器结构构建得到;纹理控制器基于control-net构建得到;视频解码器基于vqvae的解码器结构,并使用3d卷积层构建得到。
7.根据权利要求6所述的基于扩散模型的视频上色方法,其特征在于:色彩控制器与纹理控制器与迭代去噪器并行。
8.根据权利要求6所述的基于扩散模型的视频上色方法,其特征在于:色彩控制器保留u-net的编码器结构中除了交叉注意力层以外的其他结构,以用于提取颜色参考视频帧的色彩特征,其公式具体表述为:
9.一种基于扩散模型的视频上色系统,其特征在于,基于扩散模型进行训练得到视频上色模型,所述视频上色模型包括视频编码器、迭代去噪器、文本编码器、色彩控制器、纹理控制器及视频解码器;
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有基于扩散模型的视频上色程序,所述基于扩散模型的视频上色程序被处理器执行时实现如权利要求1至8任一项所述的基于扩散模型的视频上色方法的步骤。
