本发明涉及的是一种图像压缩领域的技术,具体是一种允许单独编解码图像中某一实例对应信息的图像-语义联合压缩编解码系统及方法。
背景技术:
1、现有的图像编码技术以及语义信息编码技术大多是对图像或语义信息各自进行独立的压缩编码,而图像以及其语义信息之间存在冗余,二者的联合压缩编码有利于去除这种冗余,提高编码的压缩率,并在蒙版弹幕等应用中节省掉从图像中重复提取语义的计算开销;另一方面,一些现实应用如虚拟合照等只需要获取图像中的某个实例对应的信息,而现有的图像编码技术只能将图像和语义完全解码后才能得到对应实例的信息。如果能够实现图像中不同实例分别编解码,就能节省掉不需要的信息的存储、解码和传输开销。
技术实现思路
1、本发明针对现有技术未能充分利用信息之间的冗余,语义与图像均需要传输的场景下率失真性能较差,也不支持实例可分离编解码的不足,提出一种端到端实例可分离的语义-图像联合压缩编解码系统及方法,能够充分利用图像、实例分割图和实例语义信息(如实例包围框、实例类别和实例之间关系等)之间的冗余,大大提升率失真性能。同时,允许实例可分离编解码,即解码端可以单独解码某一实例自身的语义信息、分割图和图像。
2、本发明是通过以下技术方案实现的:
3、本发明涉及一种端到端实例可分离的语义-图像联合压缩编解码系统,包括:图像编解码器、分割图编解码器、联合编解码器、语义嵌入提取模块、语义图谱编解码器、熵编解码模块、图像表征熵估计模块、分割表征熵估计模块和联合表征熵估计模块,其中:图像编解码器以实例图像为输入,使用空间下采样16倍的神经网络,得到图像表征;分割图编解码器以实例分割图为输入,使用空间下采样16倍的神经网络,得到分割表征;联合编解码器以图像表征和分割表征为输入,使用空间下采样4倍的神经网络,得到联合表征;语义嵌入提取模块以联合表征为输入,使用通道降维128倍的神经网络,得到图像和分割联合的语义嵌入,并将语义嵌入量化得到语义图谱;语义图谱编解码器对语义图谱进行编解码;联合表征熵估计模块以语义嵌入为输入,使用通道升维128倍的神经网络,估计该实例的联合表征的概率;分割表征熵估计模块以联合表征为输入,使用空间升维4倍的神经网络,估计分割表征的概率;图像表征熵估计模块以实例类别、分割表征和联合表征为输入,估计图像表征的概率;熵编码模块根据上述熵估计模块估计出的概率,对相应表征各自进行熵编码,得到各自的码流。
4、所述的语义图谱由节点和边组成,其中:节点代表图像中的实例,包含实例包围框、实例类别和实例的语义嵌入,边包含实例之间的关系。
5、本发明涉及一种基于上述系统的联合压缩编码方法,包括以下步骤:
6、步骤1)从输入图像中提取语义信息,根据提取过程中得到的包围框和实例分割得到输入图像中各个实例的图像和对应分割后,分别通过图像编码器和分割编码器提取得到图像与分割各自的表征信息并输入联合编码器,得到语义-图像联合表征信息;通过语义嵌入提取模块下采样并量化后生成语义图谱;
7、所述的图像与分割各自的表征信息,通过以下方式得到:yi=ie(xi),ym=me(xm),其中:xi与xm分别为实例图像和分割,ie为图像编码器,me为分割编码器,yi与ym分别为图像与分割的表征。
8、所述的联合编码是指:z=ue(cat(yi,ym)),其中:cat(·)表示通道上的串联,ue(·)为联合编码器,z为联合表征。
9、所述的语义嵌入是指:e=q(se(z)),其中:se(·)为语义嵌入提取模块,q(·)为量化,e为语义嵌入。
10、步骤2)将图像与分割嵌入语义图谱,具体包括:
11、①将语义图谱输入语义图谱编解码器进行无损压缩编码得到语义图谱码流;
12、②从语义图谱中抽出实例语义嵌入,输入联合表征熵估计模块,估计得到联合表征的概率,从而对量化后的联合表征进行熵编码得到联合表征码流;
13、③将量化后的联合表征输入分割表征熵估计模块,将语义图谱中的实例类别、量化后的分割表征和量化后的联合表征输入图像表征熵估计模块,估计得到分割与图像各自表征的概率,从而对量化后的图像与分割表征信息进行熵编码得到图像与分割表征码流,实现有损图像压缩与分割图压缩。
14、当需要分割图无损,还需将分割表征输入分割解码器,得到分割图本身的概率估计,并对分割图本身进行熵编码得到分割残差码流。
15、所述的联合表征熵估计是指:其中:e为实例的语义嵌入,为量化后的联合表征,entropyestimate2为联合表征熵估计模块,输出的μ2,σ2为高斯分布的参数,基于该参数构建的高斯分布可以估计量化后的联合表征的概率,即
16、所述的分割表征熵估计是指:对于分割图:其中:为量化后的分割表征,为分割表征熵估计模块,输出的为高斯分布的参数,基于该参数构建的高斯分布可以估计量化后的分割表征的概率,即
17、无损传输分割图时,将量化后的分割表征输入分割解码器,得到对分割图本身的概率估计:其中:md为分割解码器,和分别为分割图每个像素点值为0和1的概率估计。
18、所述的图像表征熵估计是指:对于图像:其中:c为实例类别,为图像表征熵估计模块,输出的为高斯分布的参数,基于该参数构建的高斯分布可以估计量化后的图像表征的概率,即
19、本发明涉及一种基于上述压缩编码方法的解码方法,包括以下步骤:
20、步骤i)使用语义图谱解码器对语义图谱码流进行解码,无损恢复出语义图谱并将其中的语义嵌入输入联合表征熵估计模块,联合表征熵估计模块根据联合表征码流进行熵解码,得到量化后的联合表征并输入分割表征熵估计模块,分割表征熵估计模块根据分割表征码流进行熵解码得到分割量化后的表征;将语义图谱中的实例类别、量化后的联合表征和分割表征输入图像表征熵估计模块,图像表征熵估计模块根据图像表征码流进行熵解码得到图像量化后的表征。
21、步骤ii)通过图像解码器将图像对应的表征信息解码得到实例的图像,将不同实例的图像拼接到正确位置从而恢复出原始图像;通过分割解码器将分割对应的表征信息解码得到实例分割的概率估计,依据该概率估计对分割残差码流熵解码得到无损实例分割图。
22、所述的拼接,具体为:将重建实例图像与实例分割图相乘,即将重建出的图像放回它裁剪出的位置,具体为:其中:图像中共n个实例,分别为图像中第1个实例、第2个实例、…、第n个实例对应的重建的实例图像与分割图,bboxi为第i个实例的包围框,wi,hi分别为第i个实例的包围框在图像中左上顶点的横坐标、纵坐标、包围框的宽和高,为像素级相乘,初始时为一张全零图,拼接操作完成后即为重建的原始图像。
23、所述的神经网络,通过包含图像重建损失、分割残差码流大小、图像码流大小、分割码流大小、联合码流大小和语义图谱码流大小的损失函数进行训练,具体为:其中:λ为常数系数,用于平衡码率和图像重建质量。损失函数中第一项是图像重建损失,第二项是分割残差码流大小,第三项是图像码流大小,第四项是分割码流大小,第五项是联合码流大小,最后一项是语义图谱码流大小。
24、所述的提取,采用但不限于maskr-cnn的图像分割算法对输入图片提取实例分割图,或者使用人工标注的实例分割图;根据实例分割图得到各个目标物体的检测框,作为语义图谱的节点的一个属性;然后采用但不限于《基于有偏训练的无偏场景图生成》(kaihuatang et al'unbiased scene graph generation from biased training'2020ieee/cvfconference on computer vision and pattern recognition)中记载的方式提取节点间的关系。
25、所述的图像编、解码器,采用但不限于《variational image compression with ascale hyperprior》中的网络结构;分割编码器与分割解码器,采用但不限于《learnedimage compression with discretized gaussian mixture likelihoods and attentionmodules》中的图像编解码网络结构;
26、所述的语义图谱编、解码器,采用专利文献号cn114095033a《基于上下文的图卷积的目标交互关系语义无损压缩系统及方法》中记载的方法实现。
27、技术效果
28、本发明通过端到端训练的实例可分离的语义-图像联合压缩编码,充分利用图像、实例分割图和实例语义信息之间的冗余,相比于图像与语义单独编解码的方法,大大提升率失真性能。同时,允许实例可分离编解码,即解码端可以单独解码某一实例自身的语义信息、分割图和图像。
1.一种端到端实例可分离的语义-图像联合压缩编解码系统,其特征在于,包括:图像编解码器、分割图编解码器、联合编解码器、语义嵌入提取模块、语义图谱编解码器、熵编解码模块、图像表征熵估计模块、分割表征熵估计模块和联合表征熵估计模块,其中:图像编解码器以实例图像为输入,使用空间下采样16倍的神经网络,得到图像表征;分割图编解码器以实例分割图为输入,使用空间下采样16倍的神经网络,得到分割表征;联合编解码器以图像表征和分割表征为输入,使用空间下采样4倍的神经网络,得到联合表征;语义嵌入提取模块以联合表征为输入,使用通道降维128倍的神经网络,得到图像和分割联合的语义嵌入,并将语义嵌入量化得到语义图谱;语义图谱编解码器对语义图谱进行编解码;联合表征熵估计模块以语义嵌入为输入,使用通道升维128倍的神经网络,估计该实例的联合表征的概率;分割表征熵估计模块以联合表征为输入,使用空间升维4倍的神经网络,估计分割表征的概率;图像表征熵估计模块以实例类别、分割表征和联合表征为输入,估计图像表征的概率;熵编码模块根据上述熵估计模块估计出的概率,对相应表征各自进行熵编码,得到各自的码流。
2.根据权利要求1所述系统的端到端实例可分离的语义-图像联合压缩编码方法,其特征在于,包括以下步骤:
3.根据权利要求2所述的根据权利要求1所述系统的端到端实例可分离的语义-图像联合压缩编码方法,其特征是,所述的图像与分割各自的表征信息,通过以下方式得到:yi=ie(xi),ym=me(xm),其中:xi与xm分别为实例图像和分割,ie为图像编码器,me为分割编码器,yi与ym分别为图像与分割的表征;xi∈r3×h×w,xm∈r1×h×w,
4.根据权利要求2所述的根据权利要求1所述系统的端到端实例可分离的语义-图像联合压缩编码方法,其特征是,当需要分割图无损,还需将分割表征输入分割解码器,得到分割图本身的概率估计,并对分割图本身进行熵编码得到分割残差码流。
5.根据权利要求2或3或4所述的根据权利要求1所述系统的端到端实例可分离的语义-图像联合压缩编码方法,其特征是,所述的联合表征熵估计是指:其中:e为实例的语义嵌入,为量化后的联合表征,entropyestimate2为联合表征熵估计模块,输出的μ2,σ2为高斯分布的参数,基于该参数构建的高斯分布估计量化后的联合表征的概率,即
6.根据权利要求5所述的根据权利要求1所述系统的端到端实例可分离的语义-图像联合压缩编码方法,其特征是,无损传输分割图时,将量化后的分割表征输入分割解码器,得到对分割图本身的概率估计:其中:md为分割解码器,和分别为分割图每个像素点值为0和1的概率估计。
7.根据权利要求2-6中任一所述编码方法的解码方法,其特征在于,包括以下步骤:
8.根据权利要求7所述的解码方法,其特征是,所述的拼接,具体为:将重建实例图像与实例分割图相乘,即将重建出的图像放回它裁剪出的位置,具体为:其中:图像中共n个实例,分别为图像中第1个实例、第2个实例、...、第n个实例对应的重建的实例图像与分割图,bboxi为第i个实例的包围框,wi,hi分别为第i个实例的包围框在图像中左上顶点的横坐标、纵坐标、包围框的宽和高,为像素级相乘,初始时为一张全零图,拼接操作完成后即为重建的原始图像。
9.根据权利要求2-8中任一所述的方法,其特征是,所述的神经网络,通过包含图像重建损失、分割残差码流大小、图像码流大小、分割码流大小、联合码流大小和语义图谱码流大小的损失函数进行训练,具体为:其中:λ为常数系数,用于平衡码率和图像重建质量。
