本发明涉及计算机视觉领域,具体而言,涉及一种掩码矫正的半监督视频目标分割方法及系统。
背景技术:
1、视频目标分割的主要任务是从视频序列中持续地分割出感兴趣目标对象。本文方法聚焦半监督视频目标分割,其中目标实例由给定的第一帧精确分割掩码定义,并在剩余视频帧中预测目标实例的分割结果。视频目标分割是计算机视觉中最具有挑战性的任务之一,具有广泛的应用价值,可用于交互式视频编辑、增强现实和自动驾驶等领域。
2、近年来,随着深度学习和卷积网络的快速发展,出现了越来越多基于卷积网络的视频目标分割方法。研究者们更加青睐基于时空记忆网络的视频目标分割方法,其不仅在分割速度上占据了优势,而且还取得了不错的精度。2019年,seoung wug oh等首次提出了时空记忆网络(seoung wug oh,joon-young lee,ning xu,seon joo kim.video objectsegmentation using space-time memory networks.iccv 2019:9225-9234.),该方法将当前待分割视频帧作为查询帧,将先前已分割视频帧及其分割掩码作为记忆帧,通过在两者之间进行稠密匹配以获取像素级的记忆内容。在基于时空记忆网络的思想下,ho keicheng等提出了stcn方法(ho kei cheng,yu-wing tai,chi-keung tang.rethinkingspace-time networks with improved memory coverage for efficient video objectsegmentation.neurips 2021:11781-11794),与时空记忆网络不同的是该方法直接在帧之间建立对应关系,而无需对每个对象的掩码特征进行重新编码,从而形成高效且鲁棒的框架。
3、然而,目标边界的准确分割也是影响半监督视频目标分割性能的关键因素。基于时空记忆网络的方法仅适用于单目标分割,因此在多目标场景下,视频目标分割模型必须分别匹配和分割每个目标,这忽略了多目标分割时不同目标之间的竞争关系,导致目标边界分割模糊。另一方面,时空记忆网络采用编码器-解码器分割目标掩码,上采样低分辨率目标掩码将导致模糊的目标边界,产生质量较差的分割掩码结果。当这些错误分割信息作为记忆帧,并且用于指导当前视频帧的分割时,将导致严重的误差积累,影响当前视频帧的精确分割。
技术实现思路
1、针对上述现有技术存在的不足,本发明提供了一种掩码矫正的半监督视频目标分割方法及系统,接受记忆帧序列和当前帧的输入,通过时空记忆网络编码器提取特征信息,其中包括key编码器和value编码器;时空记忆读取模块获得当前查询帧的value特征;开发一个细节感知解码器,通过融合key编码器深层特征重构解码器的输入特征,建立全局特征与局部特征的关联,获得细节增强的解码特征,并通过逐步上采样得到粗糙预测掩码;开发一个掩码矫正模块,该模块根据粗略预测结果估计掩码的不确定区域,并且采用掩码优化机制对不确定区域进行矫正,最后通过最小化交叉熵分割损失和不确定区域置信度损失优化整个网络。
2、为了实现上述目的,本发明提供了一种掩码矫正的半监督视频目标分割方法及系统,包括以下步骤;
3、s1、获取数据集与分割标签:
4、获取视频目标分割数据集和静态图像数据集及这两个数据集所对应的分割标签,将数据集中的每一张图像及对应的分割标签组成一个图像对;
5、s2、数据扩充与处理,具体包括以下步骤:
6、s21、对步骤s1获取的静态图像数据集及对应的分割标签组成的每一个图像对进行归一化处理后,重复以下流程,得到每一个图像对对应的合成视频训练样本,合成视频训练样本的集合组成合成视频训练集:
7、s211、将图像对的短边缩小至w像素,长边则按与短边等比例缩小,将得到的图像对随机裁剪为h×w像素大小,其中w为裁剪后图像的宽,h为裁剪后图像的高,w、h都为正整数;
8、s212、对裁剪后的图像对依次应用随机缩放、随机水平翻转、随机颜色抖动和随机灰度转换,得到该图像对对应的增强图像对;
9、s213、重复步骤s212三次,得到该图像对对应的三个增强图像对,这三个增强图像对组成一个合成视频训练样本;
10、s22、对步骤s1获取的视频目标分割数据集中的每一个视频及对应的分割标签进行归一化处理后,重复以下流程,得到每一个视频对应的真实视频训练样本,真实视频训练样本的集合组成真实视频训练集:
11、s221、从视频及对应的分割标签中随机抽取三个图像对;
12、s222、将这三个图像对的短边缩小至w像素,长边则按等比例缩小,将得到的三个图像对随机裁剪为h×w像素大小,w、h的含义和取值与步骤s21相同;
13、s223、对这三个图像对依次应用随机裁剪、颜色抖动和随机灰度转换,得到增强的三个图像对,这三个增强图像对组成一个真实视频训练样本;
14、s3、构建分割模型,该分割模型由记忆池、编码器、全局上下文感知模块、时空记忆读取模块、细节感知解码器以及掩码矫正模块组成,具体包括如下步骤:
15、s31、构建记忆池,将视频序列中的第1帧、第τ+1帧、第2τ+1帧、……、第nτ+1帧及其对应的分割标签放入存储池中,其中τ为正整数,取值范围为[1,100],τc为当前帧的相对位置,符号表示向下取整;
16、s32、构建key编码器,使用卷积神经网络作为key编码器,包括记忆帧和当前帧依次经过该编码器的前四层,其中第一层输出为fq1和fm1,第二层输出为fq2和fm2,第三层的输出为fq3和fm3,第四层的输出为fq4和fm4,并通过映射卷积分别处理fq4和fm4最后分别得到kq和km;
17、s33、构建value编码器,value编码器由卷积神经网络和特征复用器组成,其中特征复用器由一个cbam块和两个残差块组成,记忆池中的所有记忆帧及其分割掩码经过卷积神经网络的前四层,得到第四层输出fv4,fv4与经key编码器输出的fm4级联后经过特征复用器处理作为最后的value特征输出vm;
18、s34、构建时空记忆读取模块,以非局部注意力的方式计算当前待分割视频帧中与记忆池中视频帧的两两相似性,获取当前帧value特征的时空信息vq;
19、s35、构建细节感知解码器(detail-aware decoding,dad),dad由特征输入处理部分和特征输出处理部分组成,其中,特征输入处理部分由一个cbam块和两个残差模块组成,残差模块由三个卷积层和两个relu激活层组成,特征输出处理部分由两个上采样模块和一个预测卷积模块组成,第一个上采样模块由四个卷积层、两个relu激活层和一个双线性插值组成,第二个上采样模块由三个卷积层、两个relu激活层和一个双线性插值组成,预测卷积模块由一个卷积层、一个relu激活层和一个双线性插值组成;
20、将步骤s32得到的fq4和步骤s34得到的vq级联后输入细节感知解码器中的特征输入处理部分中,得到f01;将f01与步骤s32得到的fq3输入到细节感知解码器中的第一个上采样模块,得到f02;将f02与步骤s32得到的fq2输入到细节感知解码器的第二个上采样模块,得到f03;将f03输入到细节感知解码器的预测卷积模块,得到粗糙预测分割标签minit;
21、s36、构建掩码矫正模块(mask correction module,mcm),mcm不确定区域估计模块、一个平均池化层、一个最大池化层、一个映射卷积层、一个残差模块以及一个预测卷积层组成;
22、s361、为了度量每个像素的分类不确定性,由步骤s35输出的粗糙概率图minit,计算其对应的不确定区域估计图u,该结果将作为衡量像素点分割是否可靠的置信度;
23、s362、由步骤s35得到粗糙概率图minit和步骤s32得到fq1,对于目标i,首先利用平均池化层和最大池化层处理minit和fq1并计算得到任一像素(特征)位置p的具有目标先验的局部参考特征yi(p):
24、
25、同理,对于每个目标和背景的粗糙概率图,对其中每个像素进行相同操作,即可得到局部参考特征图y。
26、s363、比较由步骤s32得到局部特征fq1和步骤s362得到的局部参考特征y之间的相似性,即级联y和fq1后通过映射卷积层处理后再利用一个残差网络模块学习预测局部特征相似度,得到特征图f(y,fq1):
27、f(r1,y)=conv2(resblock(conv1(concat(r1,y)))),
28、s364、利用最大池化层结合像素p邻域内的最大概率值,计算局部优化的概率图m如下:
29、
30、m=score*f(r1,y),
31、s365、将步骤s364得到的局部优化概率图m加到步骤s35得到的粗糙概率图minit上;同时通过步骤s361得到的不确定性概率图u对步骤s364得到局部优化概率图m加权,使其更加关注于不确定区域的矫正;由此,最终得到精确的视频目标分割预测m如下:
32、m=minit+u*m,
33、最后,将分割结果m双线性上采样2倍,得到网络输出掩码结果图,完成分割模型的构建;
34、s4、构建损失函数,其中总损失函数ltotal使用交叉熵损失函数l和不确定区域置信度损失函数lconf之和,定义如下:
35、ltotal=α*l+β*lconf,
36、s41、构建交叉熵损失函数l,定义如下:
37、
38、其中y是真实标签,是预测分割标签,hy和wy分别为真实分割标签的高和宽,yij是y中第i行第j列的像素值,是中第i行第j列的像素值,i=1,2,…,hy,j=1,2,…,wy,log(.)表示求自然对数;
39、s42、构建不确定区域置信度损失函数,定义如下:
40、lconf=||u||2,
41、其中u是步骤s371得到的不确定区域概率图,||.||2表示求欧几里得范数;
42、s5、训练分割模型,利用s21得到的静态图像合成视频训练集训练s3构建的分割模型,根据s4构建的损失函数得到损失值,并使用随机梯度下降法更新分割模型内的参数,得到预训练模型;利用s22得到的真实视频训练集训练该预训练模型,根据s4构建的损失函数得到损失值,并使用随机梯度下降法更新模型内的参数,得到训练好的分割模型;
43、s6、视频目标分割,获取待分割视频及其第一帧对应的分割标签,从待分割视频的第二帧开始依次将其输入到s5训练得到的分割模型中,输出分割标签;
44、本发明与现有技术相比,具备以下有益效果:
45、(1)本发明提出的细节感知解码器模块,通过捉特征空间结构间的依赖关系,自适应选择需要关注的空间信息,并关注特征的目标通道增强特征的细节信息,并且去除特征中与目标不相关的信息。
46、(2)本发明提出的掩码矫正模块,根据粗略预测结果估计掩码的不确定区域,利用局部细节特征对目标边界及其他不确定区域进行矫正,能够有效地提升模型分割精度,解决具有挑战的分割误差累积问题。
1.一种掩码矫正的半监督视频目标分割方法,其特征在于,所述方法由计算机行,包括以下步骤:
2.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s1的具体实现过程如下:
3.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s2的具体实现过程如下:
4.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s3的具体实现过程如下:
5.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s4的具体实现过程如下:
6.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s5的具体实现过程如下:
7.如权利要求1所述的一种掩码矫正的半监督视频目标分割方法,其特征在于,步骤s6的具体实现过程如下:
8.一种掩码矫正的半监督视频目标分割系统,其特征在于,包含以下几个单元:
