本发明涉及视频编码领域,特别涉及一种基于感兴趣区域的vvc码率控制方法及装置。
背景技术:
1、随着通信互联网技术的快速发展,视频应用越来越多。尤其随着4k、8k等超高清视频的普及,在带来更好的视觉体验的同时,也带来了数据传输和处理的负担。视频流量激增与网络带宽不足问题凸显,因此需要不断推出新的编码标准以提高压缩效率。为了统一视频压缩标准和码流格式,国际视频组织制定了一系列视频编码标准。2020年7月,itu和mpeg组织联合制定了新一代视频编码标准vvc(versatile video coding)。在视频质量相同的情况下,vvc比hevc节省了50%的码率,显著提升了编码性能,但在实际中仍然需要进行码率控制。当本地带宽小的时候,观看高码率的视频会造成卡顿,当降低码率时便能流畅观看。因此实际应用中要根据信道带宽设置编码器的输出码率,然后采用码率控制技术使编码视频的码率近似等于目标码率。
2、码率控制主要建立设置的编码码率和量化参数之间的数学关系模型,根据目标码率确定编码参数,使编码后的码率能够适应当前视频传输带宽的要求,以免造成传输过程中带宽资源的浪费。视频会议、视频监控等应用对roi的需求增长,码率控制需要进行roi优化,因此进行基于roi的码率控制方法研究十分必要。
技术实现思路
1、本发明的主要目的在于克服现有技术中的上述缺陷,提出一种基于感兴趣区域的vvc码率控制方法及装置,将提取的感兴趣区域与人眼视觉系统感知特性相结合,提高编码质量及率失真性能。
2、本发明采用如下技术方案:
3、一方面,一种基于感兴趣区域的vvc码率控制方法,包括:
4、s101,对待编码的图像进行人脸检测,将检测到的人脸区域作为感兴趣区域roi,其他区域作为非感兴趣区域nroi;
5、s102,使用斯塔克尔伯格模型对roi和nroi的失真进行建模,并采用二分法求解roi和nroi的比特数;
6、s103,计算编码图像的jnd图作为空域视觉敏感度,对8x8互不重叠的子块进行运动估计得到ctu的时域视觉敏感度,基于空域视觉敏感度和时域视觉敏感度获得感知权重;基于感知权重和ctu的失真,获得ctu的感知失真;
7、s104,对roi和nroi,基于感知失真分别将有约束问题转化为无约束问题,并采用kkt条件进行最优化求解,得到用于进行比特分配的最优拉格朗日乘子;
8、s105,基于感兴趣区域的最优拉格朗日乘子和非感兴趣区域的最优拉格朗日乘子,对ctu进行编码。
9、优选的,vvc中采用码率控制模型,根据模型,第个ctu的失真、拉格朗日乘子、每像素比特数之间的关系满足下式:
10、
11、其中,和表示与视频内容相关的码率控制模型参数。
12、优选的,所述s102,具体包括:
13、使用斯塔克尔伯格模型对roi和nroi的失真进行建模,如下:
14、
15、其中,表示roi的失真;表示nroi的失真;是衡量整体质量重要性的权重;表示roi的像素数;表示nroi的像素数;表示roi的ctu的失真;表示nroi的ctu的失真;
16、对求导并使其为0,如下:
17、
18、其中,表示比特权重;表示帧级目标比特;表示roi的比特;
19、使用二分法对上式求解,得到roi的比特数,以及nroi的比特数。
20、优选的,所述s103,具体包括:
21、jnd值计算为:
22、
23、其中,表示空域掩蔽;表示最大梯度函数;表示亮度对比度;表示滤波函数;表示像素点横坐标;表示像素点纵坐标;
24、空域掩蔽定义为:
25、
26、其中:
27、
28、亮度对比度定义为:
29、
30、和的计算方式如下:
31、
32、
33、其中,表示距离像素点水平方向的偏移;表示距离像素点垂直方向的偏移;表示像素;表示滤波器模板;表示为0°、45°、90°和135°四个方向的高通滤波器;
34、对8x8互不重叠的子块进行运动估计得到ctu的时域视觉敏感度,因此空时域感知敏感度定义为:
35、
36、其中,为感知敏感度权重,因此第个ctu的感知失真表示为;表示roi的感知敏感度权重。
37、优选的,所述s104,具体包括:
38、对于roi,比特分配的有约束问题表达为:
39、
40、其中,表示roi的失真,表示roi的拉格朗日乘子;表示roi像素数;表示roi中每像素比特数;表示roi的比特;表示roi的感知敏感度权重;和表示与视频内容相关的码率控制模型参数;
41、根据kkt条件,得到:
42、
43、使用牛顿迭代法对上边的式子进行求解,得到每个roi进行比特分配的;对于nroi,比特分配的有约束问题表达为:
44、
45、其中,表示nroi的失真,表示nroi的拉格朗日乘子;表示nroi像素数;表示nroi中每像素比特数;表示nroi的感知敏感度权重;和表示与视频内容相关码率控制参数;
46、根据kkt条件,得到:
47、
48、使用牛顿迭代法对上边的式子进行求解,得到每个nroi进行比特分配的。
49、优选的,所述s101中,使用基于残差ssd网络训练的人脸检测模型检测图像中的人脸区域作为roi。
50、另一方面,一种基于感兴趣区域的vvc码率控制装置,包括:
51、感兴趣区域获取模块,用于对待编码的图像进行人脸检测,将检测到的人脸区域作为感兴趣区域roi,其他区域作为非感兴趣区域nroi;
52、比特数获取模块,用于使用斯塔克尔伯格模型对roi和nroi的失真进行建模,并采用二分法求解roi和nroi的比特数;
53、感知失真获取模块,用于计算编码图像的jnd图作为空域视觉敏感度,对8x8互不重叠的子块进行运动估计得到ctu的时域视觉敏感度,基于空域视觉敏感度和时域视觉敏感度获得感知权重;基于感知权重和ctu的失真,获得ctu的感知失真;
54、最优拉格朗日乘子获取模块,用于对roi和nroi,基于感知失真分别将有约束问题转化为无约束问题,并采用kkt条件进行最优化求解,得到用于进行比特分配的最优拉格朗日乘子;
55、编码模块,用于基于感兴趣区域的最优拉格朗日乘子和非感兴趣区域的最优拉格朗日乘子,对ctu进行编码。
56、与现有技术相比,本发明的有益效果如下:
57、(1)本发明计算编码图像的jnd图为空域视觉敏感度,对8x8互不重叠的子块进行运动估计得到时域视觉敏感度,对roi和nroi的比特分配分别进行建模求解,合理进行比特分配;
58、(2)本发明考虑人眼对roi区域重点关注,提取空时域视觉敏感度,对roi和nroi的比特分配问题分别建模并进行最优化求解,改善编码后视频序列的质量和率失真性能。
1.一种基于感兴趣区域的vvc码率控制方法,其特征在于,包括:
2.根据权利要求1所述的基于感兴趣区域的vvc码率控制方法,其特征在于,vvc中采用码率控制模型,根据模型,第个ctu的失真、拉格朗日乘子、每像素比特数之间的关系满足下式:
3.根据权利要求1所述的基于感兴趣区域的vvc码率控制方法,其特征在于,所述s102,具体包括:
4.根据权利要求1所述的基于感兴趣区域的vvc码率控制方法,其特征在于,所述s103,具体包括:
5.根据权利要求1所述的基于感兴趣区域的vvc码率控制方法,其特征在于,所述s104,具体包括:
6.根据权利要求1所述的基于感兴趣区域的vvc码率控制方法,其特征在于,所述s101中,使用基于残差ssd网络训练的人脸检测模型检测图像中的人脸区域作为roi。
7.一种基于感兴趣区域的vvc码率控制装置,其特征在于,包括:
