一种基于改进ViT的车辆分类方法及系统

专利检索2026-08-04  22


本发明涉及车辆分类识别,尤其涉及一种基于改进vit的车辆分类方法及系统。


背景技术:

1、随着科学和技术的不断发展,自动驾驶技术取得了巨大的推动力。而环境感知技术作为自动驾驶汽车的眼睛也扮演着越来越重要的作用。车辆分类是自动驾驶感知系统中的一个基本步骤,旨在将不同种类的车辆进行区分和识别,从而帮助车辆在道路上做出正确的决策和规划。vision transformer(vit)通过注意力机制可以在处理图像时将注意力集中在感兴趣的区域,从而提高车辆图像理解和识别的性能,但缺少局部特征信息,对此,现有技术提出了如中国专利cn116434152a公开的一种基于图像识别的车辆分类方法,使用相机采集图像,进行预处理并提取对应特征参数,制作训练集和验证集进行训练验证,输入完整的车辆图像识别神经网络中,得到分类结果,具有良好的鲁棒性,但其针对的目标图像有所限制,缺少全局感知能力,对于远距离小目标和复杂环境下的目标难以得到准确的结果。


技术实现思路

1、有鉴于此,本发明的目的在于提出一种基于改进vit的车辆分类方法及系统,以解决vit由于直接分块导致的细节信息缺失问题和复杂环境下的远距离小目标难以准确分类的问题。

2、基于上述目的,本发明提供了一种基于改进vit的车辆分类方法,包括以下步骤:

3、s1、获取车辆图像数据;

4、s2、将车辆图像数据分别输入到两个分支处理,其中一个分支输入到卷积神经网络inception d模块中,获得图像的局部特征,另一个分支对车辆图像进行分块处理,之后将图像块线性映射为序列化嵌入向量并加入可学习的分类向量和位置编码信息;

5、s3、将嵌入向量输入到vision transformer编码器中进行特征提取,visiontransformer编码器包括多个堆叠的编码模块,在最后一层编码模块前,使用稀疏注意力模块寻找图像中的区分性像素块、辨识性区域和对应的隐含特征;

6、s4、将vision transformer编码器提取到的信息和inception d提取的局部特征输入一个全局平均池化层进行降维,同时加入对比损失函数使不同标签对应的分类特征相似度最小,相同标签的分类特征相似度最大;

7、s5、基于降维后的信息,使用softmax函数对图像进行识别分类,得到车辆的类别信息。

8、优选地,步骤s2中,所述inception d模块包括四个部分,第一部分为卷积层,卷积核大小为1×1,第二部分为非对称卷积核卷积核大小为1×3、3×1,第三部分是非对称卷积核,卷积核大小为1×5、5×1,其中第二、第三部分在非对称卷积层前还存在一个1×1卷积层,第四部分包括平均池化层和卷积层,其中平均池化层的池化核大小为3×3,卷积层的卷积核大小为1×1。

9、优选地,步骤s2中,通过将车辆图像数据输入到6个堆叠的inception d模块中,获得图像的局部特征。

10、优选地,步骤s2中,将车辆图像进行分块处理包括:输入图像的尺寸为h×w×c、图像块大小为p,vision transformer模型将图像划分成大小为p×p且互不重叠的n个图像块;

11、将图像块线性映射为序列化嵌入向量包括:图像划分完成后,将2-d图像块转化为1-d的序列向量,首先将图像块展平为一组向量xp,然后通过线性变换将其映射到d的维度大小,嵌入向量中加入一个特殊的可学习位置编码和可学习的分类向量作为最终的输出特征用于图像分类,嵌入向量的序列z0如下式:

12、

13、其中,e为投影矩阵,epos为位置编码,xclass为分类向量,代表每个图像块的向量。

14、优选地,vision transformer编码器由l个结构相同的编码模块堆叠而成,编码模块包括多头自注意力模块和多层感知机,多头自注意力模块包括nh个单头自注意单元;

15、单头自注意单元将输入经过线性变换得到查询矩阵q、键矩阵k、值矩阵v,线性变换如下式:

16、

17、

18、

19、其中zp表示嵌入向量,得到q、k、v后,注意力权重矩阵a的计算公式如下:

20、

21、矩阵a中的元素aij表示第i个特征与第j个特征之间的相关性,值越大则相关性越强,是缩放因子,注意力权重a矩阵点乘值矩阵v得到单头自注意单元的输出z′:

22、

23、多头自注意力模块对单头自注意单元输出的结果进行拼接,再经过线性变换得到该模块的输出,拼接的公式为:

24、

25、其中为权重,为偏置,表示每个单头自注意单元提取的特征,将拼接得到的输出与zp进行残差连接,经过层标准化作为下一个多层感知机的输入。

26、优选地,多层感知机使用两个全连接层,第一个全连接层使用relu激活函数,第二个不使用激活函数,计算公式如下:

27、mlp(x)=relu(x·w1+b1)·w2+b2

28、其中x表示多层感知机的输入,mlp(x)表示多层感知机的输出,w1,w2表示权重,b1,b2表示偏置,若zp-1为第p个编码模块的输入,则编码模块的输出如下式所示:

29、z′p=ln(msa(zp-1)+zp-1)

30、zp=ln(mlp(z′p)+z′p)。

31、优选地,所述使用稀疏注意力模块寻找图像中的区分性像素块、辨识性区域和对应的隐含特征包括:

32、稀疏注意力模块利用前l-1个编码层学习到的权重对最后编码层输入的隐含特征进行筛选,前l-1个编码层学习到的权重图如下式所示:

33、

34、

35、其中,al表示注意力权重,nh表示单头自注意单元数,表示每个单头自注意单元权重。

36、将所有编码模块的注意力图信息结合压缩激发模块自主学习每个注意力图的权重,包括:

37、将注意力图全局平均池化为一个描述符;

38、使用两个全连接层建模注意力图之间的相关性,得到每个注意力图的权重值α;

39、将权重值归一化后与注意力图加权求和得到最终的注意力权重aattn,如下式所示:

40、

41、使用aattn中分类向量对应的权重在nh个自注意头中筛选出最大权重所对应的隐含特征;

42、将隐含特征与分类向量进行拼接得到作为最后一层编码模块的输入:

43、

44、优选地,所述对比损失函数包括交叉熵损失lcross与对比损失lcon,如下式所示:

45、l=lcross(y,y′)+lcon(z)

46、其中

47、

48、tcon为相似度阈值。

49、本发明还提供一种基于改进vit的车辆分类系统,包括:

50、局部细节特征提取模块,用于对实时输入的车辆图像数据进行处理,使用局部细节特征提取模块inception d提取图像的局部信息,获得局部特征;

51、全局信息特征提取模块,用于首先对图像进行分块处理,之后将图像块线性映射为序列化嵌入向量并加入可学习的分类向量和位置编码信息,然后嵌入向量被输入到多个堆叠的编码模块中进行特征提取,在最后一层编码模块前,使用稀疏注意力模块来寻找图像中的区分性像素块、辨识性区域和它对应的隐含特征,全局信息特征提取模块中的辨识性区域识别模块包括:利用先前所有编码模块的注意力图信息结合压缩激发模块来自主学习每个注意力图的权重,然后通入自注意力层筛选出最大权重所对应的隐含特征和辨识性区域;

52、目标分类模块,用于将局部细节特征提取模块和全局信息特征提取模块提取的局部细节特征和全局信息特征一起输入分类层,首先使用一个全局平均池化层进行降维,再使用softmax函数对图像进行识别分类,得到车辆的类别信息。

53、本发明的有益效果:

54、1.利用单目相机获得图像数据,通过局部特征提取模块和全局特征提取模块分别提取车辆图像局部和全局特征,然后输入到目标分类器中进行车辆分类,输出车辆类别信息,来弥补vision transformer直接对图像进行分块操作丢失的局部细节特征,提高模型的感知能力,保证车辆分类的准确性;

55、2.本发明充分利用2d图像信息,针对一些车辆具有较大相似度而导致错检问题,我们基于注意力机制提出了一种稀疏注意力模块,综合利用了所有编码层的注意力权重信息,捕捉到图像中的辨识性区域,进一步提升了模型的细粒度特征表达能力;

56、3.本发明还采用对比损失函数进一步增加了网络学习特征的类内一致性和类间差异性,解决远距离小目标和复杂环境下的车辆分类准确性不高的问题。


技术特征:

1.一种基于改进vit的车辆分类方法,其特征在于,所述方法包括以下步骤:

2.根据权利要求1所述的基于改进vit的车辆分类方法,其特征在于,步骤s2中,所述inception d模块包括四个部分,第一部分为卷积层,卷积核大小为1×1,第二部分为非对称卷积层,卷积核大小为1×3、3×1,第三部分是非对称卷积层,卷积核大小为1×5、5×1,其中第二、第三部分在非对称卷积层前还存在一个1×1卷积层,第四部分包括平均池化层和卷积层,其中平均池化层的池化核大小为3×3,卷积层的卷积核大小为1×1。

3.根据权利要求1所述的基于改进vit的车辆分类方法,其特征在于,步骤s2中,通过将车辆图像数据输入到6个堆叠的inception d模块中,获得图像的局部特征。

4.根据权利要求1所述的基于改进vit的车辆分类方法,其特征在于,步骤s2中,将车辆图像进行分块处理包括:输入图像的尺寸为h×w×c、图像块大小为p,vision transformer模型将图像划分成大小为p×p且互不重叠的n个图像块;

5.根据权利要求4所述的基于改进vit的车辆分类方法,其特征在于,visiontransformer编码器由l个结构相同的编码模块堆叠而成,编码模块包括多头自注意力模块和多层感知机,多头自注意力模块包括nh个单头自注意单元;

6.根据权利要求5所述的基于改进vit的车辆分类方法,其特征在于,多层感知机使用两个全连接层,第一个全连接层使用relu激活函数,第二个不使用激活函数,计算公式如下:

7.根据权利要求6所述的基于改进vit的车辆分类方法,其特征在于,所述使用稀疏注意力模块寻找图像中的区分性像素块、辨识性区域和对应的隐含特征包括:

8.根据权利要求1所述的基于改进vit的车辆分类方法,其特征在于,所述对比损失函数包括交叉熵损失lcross与对比损失lcon,如下式所示:

9.一种基于改进vit的车辆分类系统,其特征在于,包括:


技术总结
本发明涉及车辆分类识别技术领域,尤其涉及一种基于改进ViT的车辆分类方法及系统,设计了一个局部特征提取模块,弥补Vision Transformer分块操作丢失的细节信息;并利用一种稀疏注意力模块,筛选出车辆图像中的辨识性区域,进一步提升模型的细节特征表达能力;同时采用一种对比损失函数,进一步增加分类特征的类内一致性和类间差异性;再使用分类器对图像进行识别分类,得到车辆的类别信息;本发明解决了Vision Transformer局部信息的缺失问题,提高模型的感知能力和分类准确度,同时也满足一定的实时性,达到了准确度和实时性的权衡。

技术研发人员:时培成,董心龙,梁涛年,蒋爱强,周梦如,武新世,王文冲,张荣芸,戈润帅,王建平,潘道远,张秀琴
受保护的技术使用者:安徽工程大学
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1166114.html

最新回复(0)