本技术涉及行为识别,特别涉及一种基于多模态的员工行为识别方法、装置、设备及介质。
背景技术:
1、近些年来,生产安全受到了越来越多的关注,越来越多的行为识别技术被应用于生产中以便对员工的行为进行识别,进而对安全生产情况进行监控。
2、行为识别研究的是视频中目标的动作,比如判断一个人是在走路,跳跃还是挥手。在视频监督,视频推荐和人机交互中有重要的应用。近几十年来,随着神经网络的兴起,发展出了很多处理行为识别问题的方法,如3d卷积网络,循环神经网络(lstm,longshortterm memory),图卷积网络(gcn,graph convolutional networks)等,但应用这些方法识别员工的行为时,通常仅对员工单一的信息进行处理,未考虑其他方面的信息,导致存在员工行为识别的精确度低的问题。
技术实现思路
1、本技术实施例提供了一种基于多模态的员工行为识别方法、装置、设备及介质,可以解决员工行为识别的精确度低的问题。
2、第一方面,本技术实施例提供了一种基于多模态的员工行为识别方法,该员工行为识别方法包括:
3、获取多位目标员工的当前rgb图像、当前姿势信息,以及t个时刻的定位信息;第t个时刻为当前时刻;
4、利用图像特征提取模型对每位目标员工的当前rgb图像进行特征提取,得到目标员工的图像特征;
5、根据每位目标员工的当前姿势信息,利用姿势信息处理模型获取目标员工的姿势邻接矩阵;当前姿势信息中每两个关键点构成一关键点组,姿势邻接矩阵中的多个元素与当前姿势信息中的多个关键点组一一对应,每个元素用于描述对应的两个关键点之间的相关关系;
6、利用定位特征提取模型对每位目标员工在t个时刻的定位信息进行特征提取,得到用于描述目标员工的位置信息的定位特征;
7、根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对图像特征提取模型、姿势信息处理模型和定位特征提取模型进行优化,得到优化后的图像特征提取模型、优化后的姿势信息处理模型和优化后的定位特征提取模型;
8、利用优化后的图像特征提取模型获取待识别员工的最终图像特征,利用优化后的姿势信息处理模型获取待识别员工的最终姿势邻接矩阵,利用优化后的定位特征提取模型获取待识别员工的最终定位特征;
9、将待识别员工的最终图像特征和最终定位特征进行融合,得到待识别员工的图像定位特征,并将待识别员工的最终姿势邻接矩阵和图像定位特征进行融合,得到待识别员工的融合特征;
10、利用目标检测算法对待识别员工的融合特征进行识别,得到待识别员工的行为识别结果。
11、可选的,根据每位目标员工的当前姿势信息,利用姿势信息处理模型获取目标员工的姿势邻接矩阵,包括:
12、通过公式:
13、gcn=relu(a2(softmax(a1posew1)w2))
14、t2=agcn(pose)
15、计算目标员工的姿势邻接矩阵t2;
16、其中,agcn()表示取图卷积运算的结果中所有邻接矩阵的加权平均和,gcn表示图卷积运算的结果,a2表示将第一层邻接矩阵加权处理后得到的第二层邻接矩阵,a1表示由当前姿势信息的拓扑结构构建而成的第一层邻接矩阵,w1和w2均表示权阵,pose表示目标员工的当前姿势信息。
17、可选的,利用定位特征提取模型对每位目标员工在t个时刻的定位信息进行特征提取,得到用于描述目标员工的位置信息的定位特征,包括:
18、通过公式:
19、t3=transformer(position)
20、计算目标员工的定位特征t3;
21、其中,position表示目标员工在t个时刻的定位信息。
22、可选的,根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对图像特征提取模型、姿势信息处理模型和定位特征提取模型进行优化,得到优化后的图像特征提取模型、优化后的姿势信息处理模型和优化后的定位特征提取模型,包括:
23、将姿势信息处理模型和定位特征提取模型的参数冻结,并根据所有目标员工的图像特征对图像特征提取模型进行优化,得到优化后的图像特征提取模型;
24、将优化后的图像特征提取模型和定位特征提取模型的参数冻结,并根据所有目标员工图像的姿势邻接矩阵对姿势信息处理模型进行优化,得到优化后的姿势信息处理模型;
25、将优化后的图像特征提取模型和优化后的姿势信息处理模型的参数冻结,并根据所有目标员工的定位特征对定位特征提取模型进行优化,得到优化后的姿势信息处理模型。
26、可选的,将待识别员工的最终图像特征和最终定位特征进行融合,得到待识别员工的图像定位特征,包括:
27、通过公式:
28、tp=f1→3(t’1)☉t’3
29、
30、
31、计算待识别员工的图像定位特征tp;
32、其中,t'1表示待识别员工的最终图像特征,t'3表示待识别员工的最终定位特征,表示对最终图像特征进行下采样得到的下采样图像特征,poolmax()表示最大池化,poolavg()表示平均池化,w表示表示调节图像全局特征及边缘特征的可学习权重,⊙表示矩阵hadamard乘积运算,表示矩阵对应元素相加,表示调节图像全局特征及边缘特征的函数。
33、可选的,将待识别员工的最终姿势邻接矩阵和图像定位特征进行融合,得到待识别员工的融合特征,包括:
34、通过公式:
35、t=c(tp+tc)
36、
37、计算待识别员工的融合特征t;
38、其中,c()表示卷积操作,tc表示待识别员工的姿势特征,表示对待识别员工的最终姿势邻接矩阵进行上采样得到的上采样姿势特征,c1×1()表示1×1卷积操作。
39、第二方面,本技术实施例提供了一种基于多模态的员工行为识别装置,包括:
40、第一获取模块,获取多位目标员工的当前rgb图像、当前姿势信息,以及t个时刻的定位信息;第t个时刻为当前时刻;
41、图像特征提取模块,利用图像特征提取模型对每位目标员工的当前rgb图像进行特征提取,得到目标员工的图像特征;
42、姿势信息处理模块,根据每位目标员工的当前姿势信息,利用姿势信息处理模型获取目标员工的姿势邻接矩阵;当前姿势信息中每两个关键点构成一关键点组,姿势邻接矩阵中的多个元素与当前姿势信息中的多个关键点组一一对应,每个元素用于描述对应的两个关键点之间的相关关系;
43、定位特征提取模块,利用定位特征提取模型对每位目标员工在t个时刻的定位信息进行特征提取,得到用于描述目标员工的位置信息的定位特征;
44、优化模块,根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对图像特征提取模型、姿势信息处理模型和定位特征提取模型进行优化,得到优化后的图像特征提取模型、优化后的姿势信息处理模型和优化后的定位特征提取模型;
45、第二获取模块,利用优化后的图像特征提取模型获取待识别员工的最终图像特征,利用优化后的姿势信息处理模型获取待识别员工的最终姿势邻接矩阵,利用优化后的定位特征提取模型获取待识别员工的最终定位特征;
46、融合模块,将待识别员工的最终图像特征和最终定位特征进行融合,得到待识别员工的图像定位特征,并将待识别员工的最终姿势邻接矩阵和图像定位特征进行融合,得到待识别员工的融合特征;
47、识别模块,利用目标检测算法对待识别员工的融合特征进行识别,得到待识别员工的行为识别结果。
48、第三方面,本技术实施例提供了一种终端设备,包括存储器、处理器以及存储在存储器中并可在处理器上运行的计算机程序,该处理器执行上述计算机程序时实现上述的基于多模态的员工行为识别方法。
49、第四方面,本技术实施例提供了一种计算机可读存储介质,该计算机可读存储介质存储有计算机程序,该计算机程序被处理器执行时实现上述的基于多模态的员工行为识别方法。
50、本技术的上述方案有如下的有益效果:
51、在本技术的实施例中,通过获取多位目标员工的当前rgb图像、当前姿势信息,以及t个时刻的定位信息,然后利用图像特征提取模型对每位目标员工的当前rgb图像进行特征提取,得到目标员工的图像特征,再根据每位目标员工的当前姿势信息,利用姿势信息处理模型获取目标员工的姿势邻接矩阵,然后利用定位特征提取模型对每位目标员工在t个时刻的定位信息进行特征提取,得到用于描述目标员工的位置信息的定位特征,再根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对图像特征提取模型、姿势信息处理模型和定位特征提取模型进行优化,得到优化后的图像特征提取模型、优化后的姿势信息处理模型和优化后的定位特征提取模型,然后利用优化后的图像特征提取模型获取待识别员工的最终图像特征,利用优化后的姿势信息处理模型获取待识别员工的最终姿势邻接矩阵,利用优化后的定位特征提取模型获取待识别员工的最终定位特征,再将待识别员工的最终图像特征和最终定位特征进行融合,得到待识别员工的图像定位特征,并将待识别员工的最终姿势邻接矩阵和图像定位特征进行融合,得到待识别员工的融合特征,最后利用目标检测算法对待识别员工的融合特征进行识别,得到待识别员工的行为识别结果。其中,根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对图像特征提取模型、姿势信息处理模型和定位特征提取模型进行优化,能够提高图像特征提取模型、姿势信息处理模型和定位特征提取模型的性能,将最终图像特征、最终姿势邻接矩阵和最终定位特征进行融合得到的融合特征中包含员工的多种模态的信息,因此融合特征的信息全面性高,根据信息全面性高的融合特征得到行为识别结果,能够有效提高行为识别结果的精确度。
52、本技术的其它有益效果将在随后的具体实施方式部分予以详细说明。
1.一种基于多模态的员工行为识别方法,其特征在于,包括:
2.根据权利要求1所述的员工行为识别方法,其特征在于,所述根据每位所述目标员工的当前姿势信息,利用姿势信息处理模型获取所述目标员工的姿势邻接矩阵,包括:
3.根据权利要求1所述的员工行为识别方法,其特征在于,所述利用定位特征提取模型对每位所述目标员工在t个时刻的定位信息进行特征提取,得到用于描述所述目标员工的位置信息的定位特征,包括:
4.根据权利要求1所述的员工行为识别方法,其特征在于,所述根据所有目标员工的图像特征、姿势邻接矩阵和定位特征对所述图像特征提取模型、所述姿势信息处理模型和所述定位特征提取模型进行优化,得到优化后的图像特征提取模型、优化后的姿势信息处理模型和优化后的定位特征提取模型,包括:
5.根据权利要求1所述的员工行为识别方法,其特征在于,所述将所述待识别员工的最终图像特征和所述最终定位特征进行融合,得到所述待识别员工的图像定位特征,包括:
6.根据权利要求5所述的员工行为识别方法,其特征在于,所述将所述待识别员工的最终姿势邻接矩阵和所述图像定位特征进行融合,得到所述待识别员工的融合特征,包括:
7.一种基于多模态的员工行为识别装置,其特征在于,包括:
8.一种终端设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至6任一项所述的基于多模态的员工行为识别方法。
9.一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至6任一项所述的基于多模态的员工行为识别方法。
