本发明涉及视觉跟踪领域,特别涉及一种目标物标注方法及数据处理设备。
背景技术:
1、随着虚拟现实(virtual reality简称vr)技术的迅速发展,虚拟现实一体机(即vr眼镜)使用计算机视觉算法实现虚拟现实技术。对目标的实时跟踪是虚拟现实技术中的重要部分,跟踪过程即给同一个视频中不同帧的跟踪目标分配相一致的标签。
2、检测模型常用于各种跟踪目标的定位,包括2d定位以及3d定位,传统的检测模型利用二值化图或者图像显著性提取跟踪目标的轮廓特征,传统方法存在耗时较多,精度较低且对图像本身的质量依赖性较强的问题。随着深度学习的发展,传统的图像检测定位逐渐被视觉网络取代,尤其随着anchor-based,anchor-freed各个方法的突飞猛进,检测技术逐步成熟,但深度学习的方案需要大量的数据,不断迭代更新模型解决或者缓解各种检测问题,数据的采集以及标注变得越来越繁重和重要。
3、现有的检测模型结合各种先进的损失函数用于解决小目标,漏检,误检等问题,尤其ciouloss是最新的针对框体定位的loss但并没有将检测框的框体大小结合进损失,以及focalloss未将检测框定位的准确度结合起来,使得检测框预测准确但置信度较低,或者框体定位不准确但是置信度较高,导致了漏检,误检的问题。
4、现有的检测模型大都普遍适用于各种定制的物体定位,比如人体,人手等,但定制化存在数据缺失的问题,大部分初始的检测标注数据是通过人工标注获取,即耗时也耗费人力,不利于模型的快速迭代。
技术实现思路
1、本发明提供了一种目标物标注方法及数据处理设备,解决现有技术的跟踪算法中目标物定位精确度不足的技术问题。
2、为了解决上述问题,本发明提供了一种目标物标注方法,所述目标物标注方法具体包括如下步骤:数据采集步骤,通过多目相机实时采集环境图像,所述环境图像能够包括目标物图像;图像标注步骤,获取所述环境图像,并计算所述目标物图像的3d位姿,并对所述目标物图像的位姿进行预测,以获取所述目标物图像的第一预测检测框;模型对齐步骤,将所述第一预测检测框作为训练数据置入一个检测模型large_detector中,并使用所述检测模型large_detector对所述第一预测检测框再次进行标注,以获取所述目标物图像的第二预测检测框;通过对所述目标物图像进行分类,并通过对所述第一预测检测框的坐标以及所述第一预测检测框的置信度作为依据,对所述检测模型large_detector进行迭代更新。
3、进一步地,所述图像标注步骤具体包括如下步骤:检测框获取步骤,将所述环境图像置入基于深度学习的检测模型det,以获取检测框boxp,boxp能够包含所述目标物图像;boxp的计算公式如下:
4、boxp=detector(imagei)
5、其中,p为目标物类别标识,表示目标物被分为第p类;detector为检测模型;imagei为第i目相机获取的环境图像;骨骼点预测步骤,基于所述检测框boxp,描绘图像中包含手部的区域imagecropi,将imagecropi置入骨骼点预测模型,以获取所述目标物中骨骼点的坐标;骨骼点坐标的计算公式如下:
6、handskei,j,scorei=ske(imagecropi)
7、其中,handskei,j为第i目相机中第j个骨骼点坐标;scorei为骨骼点对应的置信度;ske为骨骼点预测模型;3d位姿计算步骤,获取handskei,j,使用inverse kinematics算法以计算所述目标物的3d位姿,inverse kinematics算法的优化误差e的计算公式如下:
8、e=σ∨insi*ti*pose3d-handskei∨2
9、其中,insi记为第i目相机的内参;ti记为第i目相机的外参;pose3d为所述目标物的3d位姿;threshold为骨骼点置信度阈值,当一个骨骼点对应的置信度scorei>threshold时,该骨骼点才进行计算;3d位姿预测步骤,使用t-1时刻以及t-2时刻所述目标物的3d位姿,预测t时刻所述目标物的3d位姿,在t时刻所述目标物的3d位姿的计算公式如下:
10、pose3d,t=2*pose3d,t-2-pose3d,t-1
11、其中,pose3d,t为t时刻所述目标物的3d位姿;pose3d,t-1为t-1时刻所述目标物的3d位姿;pose3d,t-2为t-2时刻所述目标物的3d位姿;重投影步骤,将pose3d,t重投影至多目相机,计算pose3d,t所对应的目标物的骨骼点坐标handprojskei,j,handprojskei,j的计算公式如下:
12、handprojskei,j=proj(ri*pose3d,t+ti)
13、其中,proj为重投影函数;ri以及ti均别为第i目相机的外参;第一预测检测框计算步骤,获取handprojskei,j,以max(handprojskei,j)作为所述第一预测检测框的左上角坐标点,以min(handprojskei,j)作为所述第一预测检测框的右下角坐标点,使用box函数获得所述第一预测检测框,所述第一预测检测框的计算公式如下:
14、projboxi=box(min(handprojskei,j),max(handprojskei,j))
15、其中,projboxi为所述第一预测检测框。
16、进一步地,在所述第一预测检测框计算步骤之后,还包括第一预测检测框筛选步骤,当一个handprojskei,j中存在任意一个骨骼点的坐标位于所述环境图像之外,则去除该handprojskei,j所计算得出的projboxi;当一个handprojskei,j中存在任意一个骨骼点的坐标位于其他骨骼点坐标构成的集群之外,则去除该handprojskei,j所计算得出的projboxi;经过筛选后保留剩余的projboxi作为ground truth数据。
17、进一步地,在所述模型对齐步骤中,所述检测模型large_detector能够包括第一损失函数lsiou,通过优化减少所述第一损失函数lsiou的数值,能够迭代并更新所述检测模型large_detector,lsiou能够根据所述第一预测检测框的大小,自适应地调整自身的权重;
18、当所述第一预测预测框较大时,此时lsiou使得网络模型将更注重于所述第一预测框与所述第二预测框之间的交并比、中心点距离以及矩形框的相对比例;当所述第一预测预测框较小时,此时lsiou将更注重于所述第一预测预测框和所述第二预测预测框的长度与宽度。
19、进一步地,所述第一损失函数lsiou的计算公式如下:
20、lsiou=1-iou+ρ2(bpre,bgt)+αv+(2-wgthgt)((wpre-wgt)2+(hpre-hgt)2)
21、
22、
23、其中,iou表示所述第一预测预测框和所述第二预测预测框的交并比;bpre以及bgt分别代表所述第一预测预测框和所述第二预测预测框的中心点,ρ表示为bpre和bgt之间的欧式距离;v用来衡量所述第一预测预测框和所述第二预测预测框之间相对比例的一致性;α为权重系数;wpre和wgt分别代表所述第一预测预测框和所述第二预测预测框的宽度;hpre和hgt分别代表所述第一预测预测框和所述第二预测预测框的高度。
24、进一步地,在所述模型对齐步骤中,所述检测模型large_detector能够包括第二损失函数losstotal,通过优化减少所述第二损失函数losstotal的数值,能够迭代并更新所述检测模型large_detector,losstotal能够根据所述第一预测预测框和所述第二预测预测框之间的距离,自适应地调整所述第一预测预测框的分类标签信息;当所述第二预测预测框偏离所述第一预测框时,调节所述第一预测框分类标签的数值,从而降低检测发生错误时large_detector对所述目标物分类的预测的置信度。
25、进一步地,所述第二预测框还包括一种新的权重分配策略,在large_detector训练初期,所述第一预测预测框和所述第二预测预测框差异较大,此时应当赋予losstotal更大的权重,从而加快large_detector的收敛速度;而在large_detector训练后期,所述第一预测预测框和所述第二预测预测框差异较小,此时应当赋予losstotal较小的权重,从而提高large_detector的稳定性,使得large_detector能够进一步收敛,避免large_detector出现梯度爆炸的问题。
26、进一步地,所述第二损失函数losstotal的计算公式如下:
27、
28、
29、losstotal=weight*crossentropyloss
30、其中,c和cgt分别表示所述第二预测预测框和所述第一预测预测框的中心点坐标;labelgt代表所述第一预测预测框的分类标签;crossentropyloss为交叉熵损失函数。
31、进一步地,所述模型对齐步骤包括如下步骤:第二预测检测框计算步骤,将所述第一预测检测框作为训练数据置入一个检测模型large_detector中,并使用large_detector对所述第一预测检测框再次进行标注,以获取所述目标物图像的第二预测检测框;并计算所述第二预测检测框的坐标、所述第二预测检测框的置信度以及所述第二预测预测框的分类标签;计算公式如下:
32、boxp,scorep=large_detector(gt_imagei)
33、cls_outp=cls_model(gt_imagei)
34、其中,gt_imagei为第i目相机的第一预测检测框,p为目标物类别标识,表示目标物被分为第p类;boxp为所述第二预测检测框的坐标;scorep为所述第二预测检测框的置信度;cls_model为针对所述目标物的分类模型;cls_outp为所述第二预测预测框的分类标签。
35、进一步地,在所述模型对齐步骤中,在所述第二预测检测框计算步骤之后,还包括如下步骤:训练数据筛选步骤,根据所述第二预测检测框的坐标、置信度以及分类标签,筛选用于更新迭代large_detector的训练数据;当一个第二预测检测框的scorep>0.7时,将该第二预测检测框所对应的第一预测检测框的分类标签与cls_outp进行比较,若不一致,则将该第一预测检测框添加至训练数据中;获取所述第一预测检测框以及所述第二预测检测框之间的交并比iou,当iou>0.8时且该第二预测检测框的scorep>0.7时,将该第一预测检测框添加至训练数据中;当iou>0.75且该第二预测检测框的scorep<0.7时,对该第一预测检测框进行人工标注,并将该第一预测检测框添加至训练数据中;检测模型更新步骤,使用所述训练数据筛选步骤获得的训练数据对large_detector进行迭代更新。
36、进一步地,在所述训练数据筛选步骤中,若一个第二预测检测框的scorep>0.6,将该第二预测检测框所对应的第一预测检测框加入第一训练数据中;若一个第二预测检测框的scorep>0.3且scorep<0.6,将该第二预测检测框所对应的第一预测检测框加入第二训练数据中;若一个第二预测检测框的scorep<0.3,将该第二预测检测框所对应的第一预测检测框加入第三训练数据中;在所述检测模型更新步骤中,优先使用所述第一训练数据,再使用所述第二训练数据,最后使用第三训练数据。
37、进一步地,在所述训练数据筛选步骤中,为了减少训练数据之间的相似性,对多个连续帧的环境图像所生成的第一预测检测框进行抽帧处理,在每n帧环境图像中,抽取一帧环境图像所生成的第一预测检测框作为训练数据,用于对large_detector进行迭代更新。
38、进一步地,在所述模型对齐步骤之后,还包括如下步骤:模型优化步骤,使用半监督学习的方法优化large_detector,使用一个损失函数loss优化训练large_detector,当公式中loss越低代表未标注数据的预测信息越接近于已标注数据的标注信息。loss的计算公式如下:
39、
40、其中,lcls和lreg分别表示分类损失函数以及回归损失函数,t()和t'()分别表示不同的数据增强方式,detector表示large_detector;n代表已标注数据总数,m代表未标注数据总数;代表已标注数据中的第i张图片,代表已标注数据中的第i张图片所对应的第i个标注信息;代表未标注数据中第j张图片,代表未标注数据第j张图片所对应的第j个预测信息。
41、进一步地,在所述图像标注步骤中,通过将所述图像标注步骤中的卷积神经网络中的卷积核应用于所述环境图像中得到特征图;构建一个辅助网络,所述辅助网络的输入是所述特征图,所述辅助网络的输出是所述目标物旋转角度的分类信息;在所述模型优化步骤中,使用所述辅助网络监督学习优化large_detector。
42、进一步地,对于所述辅助网络的输出结果,所述目标物旋转角度的范围为0度至360度,将所述目标物旋转角度具体分为均匀的36个类别,每一类别的长度为10度。
43、本发明还提供一种数据处理设备,所述数据处理设备包括存储器以及处理器,所述存储器用以存储可执行程序代码;所述处理器用以读取所述可执行程序代码,以运行与所述可执行程序代码对应的计算机程序,以执行上述目标物标注方法中的至少一步骤。
44、本发明的优点在于,本发明通过优化检测模型的损失函数,提升检测模型对目标物的定位准确度,提升对小型目标物的召回率,同时极大的减少了检测模型误检,漏检的概率。本发明引入辅助网络以及半监督学习的优化方法,提升了预测检测框的准确度以及精度。本发明提出了数据采集的半自动化方案以及半监督学习与预标注结合的方案,快速获取训练数据,加快了模型迭代速度。
45、本发明方法结合了半自动化数据采集、优化检测模型的损失函数以及引入辅助网络与半监督学习的优化方法,形成了一整套完整的目标物标注方法,从数据、损失函数、网络结构三端优化提升了物体获取标注的效率,并且缓解了现有的深度学习检测模型存在的部分弱点。
46、本发明方法具备普适性,可拓展到各种物体目标的检测模型优化以及数据标注。
1.一种目标物标注方法,其特征在于,具体包括如下步骤:
2.如权利要求1所述的目标物标注方法,其特征在于,
3.如权利要求2所述的目标物标注方法,其特征在于,
4.如权利要求1所述的目标物标注方法,其特征在于,
5.如权利要求4所述的目标物标注方法,其特征在于,
6.如权利要求1所述的目标物标注方法,其特征在于,
7.如权利要求6所述的目标物标注方法,其特征在于,
8.如权利要求6所述目标物标注方法,其特征在于,
9.如权利要求1所述目标物标注方法,其特征在于,
10.如权利要求9所述目标物标注方法,其特征在于,
11.如权利要求10所述目标物标注方法,其特征在于,
12.如权利要求10所述目标物标注方法,其特征在于,
13.如权利要求1所述目标物标注方法,其特征在于,
14.如权利要求13所述目标物标注方法,其特征在于,
15.如权利要求14所述目标物标注方法,其特征在于,
16.一种数据处理设备,其特征在于,包括:
