视频文本分类方法、装置、计算机设备和存储介质与流程

专利检索2026-08-24  20


本申请涉及计算机,特别是涉及一种视频文本分类方法、装置、计算机设备、存储介质和计算机程序产品。


背景技术:

1、随着计算机技术的发展,每天会产生海量的视频数据,掌握视频中的文本信息是视频应用和分析中必不可少的工作,嵌入在视频中的文本,通常带有对视频内容丰富的语义描述,可用于视频索引、检索、分类等。根据文本信息的作用,可以将文本信息大概总结为标题、字幕、人物信息等类别。

2、传统技术,视频文本信息的获取方式为,先对视频文本区域进行定位,再对定位出的视频文本区域进行分类。然而,在对视频文本区域进行分类时,通常采用的是纯文本信息分类的方式,存在分类不准确的问题。


技术实现思路

1、基于此,有必要针对上述技术问题,提供一种能够提高分类准确率的视频文本分类方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。

2、第一方面,本申请提供了一种视频文本分类方法。所述方法包括:

3、从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域;

4、分别对各视频文本区域中文本进行文本特征提取,获得各视频文本区域各自相应的文本特征向量,并分别对各视频文本区域相应的目标关键帧进行图像特征提取,获得各视频文本区域各自相应的第一图像特征向量;

5、基于各视频文本区域的位置信息,分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量;

6、分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量;

7、基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。

8、第二方面,本申请还提供了一种视频文本分类装置。所述装置包括:

9、数据获取模块,用于从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域;

10、第一特征提取模块,用于分别对各视频文本区域中文本进行文本特征提取,获得各视频文本区域各自相应的文本特征向量,并分别对各视频文本区域相应的目标关键帧进行图像特征提取,获得各视频文本区域各自相应的第一图像特征向量;

11、第二特征提取模块,用于基于各视频文本区域的位置信息,分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量;

12、特征融合模块,用于分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量;

13、分类模块,用于基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。

14、第三方面,本申请还提供了一种计算机设备。所述计算机设备包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现以下步骤:

15、从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域;

16、分别对各视频文本区域中文本进行文本特征提取,获得各视频文本区域各自相应的文本特征向量,并分别对各视频文本区域相应的目标关键帧进行图像特征提取,获得各视频文本区域各自相应的第一图像特征向量;

17、基于各视频文本区域的位置信息,分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量;

18、分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量;

19、基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。

20、第四方面,本申请还提供了一种计算机可读存储介质。所述计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现以下步骤:

21、从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域;

22、分别对各视频文本区域中文本进行文本特征提取,获得各视频文本区域各自相应的文本特征向量,并分别对各视频文本区域相应的目标关键帧进行图像特征提取,获得各视频文本区域各自相应的第一图像特征向量;

23、基于各视频文本区域的位置信息,分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量;

24、分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量;

25、基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。

26、第五方面,本申请还提供了一种计算机程序产品。所述计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现以下步骤:

27、从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域;

28、分别对各视频文本区域中文本进行文本特征提取,获得各视频文本区域各自相应的文本特征向量,并分别对各视频文本区域相应的目标关键帧进行图像特征提取,获得各视频文本区域各自相应的第一图像特征向量;

29、基于各视频文本区域的位置信息,分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量;

30、分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量;

31、基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。

32、上述视频文本分类方法、装置、计算机设备、存储介质和计算机程序产品,在从视频数据中获取至少一帧目标关键帧的基础上,通过分别对各视频文本区域中文本进行文本特征提取,能够获得各视频文本区域各自相应的文本特征向量,通过分别对各视频文本区域相应的目标关键帧进行图像特征提取,能够获得各视频文本区域各自相应的第一图像特征向量,基于各视频文本区域的位置信息,能够分别从相应的第一图像特征向量中提取出各视频文本区域各自相应的第二图像特征向量,从而可以通过分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量,进而可以基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果,整个过程,在对视频文本区域进行分类时,通过融合文本、位置信息、目标关键帧等多个模态信息获得多模态向量,将多模态向量作为分类依据进行分类,能够提高分类准确率。



技术特征:

1.一种视频文本分类方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述分别融合各所述视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各所述视频文本区域各自相应的多模态向量包括:

3.根据权利要求1所述的方法,其特征在于,所述从视频数据中获取至少一帧目标关键帧包括:

4.根据权利要求3所述的方法,其特征在于,所述基于各所述关键帧各自相应的文本框信息,对各所述关键帧进行文本框过滤,获得至少一帧目标关键帧包括:

5.根据权利要求4所述的方法,其特征在于,所述若通过相邻帧特征匹配确定存在文本滚动区域,则从各所述关键帧的各文本框中过滤掉所述文本滚动区域之前,还包括:

6.根据权利要求1至5任意一项所述的方法,其特征在于,所述基于各所述视频文本区域各自相应的多模态向量,分别对各所述视频文本区域进行分类,获得视频文本分类结果包括:

7.根据权利要求1至5任意一项所述的方法,其特征在于,所述基于各所述视频文本区域各自相应的多模态向量,分别对各所述视频文本区域进行分类,获得视频文本分类结果包括:

8.根据权利要求1至5任意一项所述的方法,其特征在于,所述基于各所述视频文本区域各自相应的多模态向量,分别对各所述视频文本区域进行分类,获得视频文本分类结果包括:

9.一种视频文本分类装置,其特征在于,所述装置包括:

10.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至8中任一项所述的方法的步骤。

11.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至8中任一项所述的方法的步骤。

12.一种计算机程序产品,包括计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1至8中任一项所述的方法的步骤。


技术总结
本申请实施例可应用于云技术、人工智能、智慧交通、辅助驾驶等各种场景,涉及一种视频文本分类方法、装置、计算机设备、存储介质和计算机程序产品。所述方法包括:从视频数据中获取至少一帧目标关键帧,目标关键帧包括至少一个视频文本区域,分别获得各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,分别融合各视频文本区域各自相应的文本特征向量、第一图像特征向量以及第二图像特征向量,获得各视频文本区域各自相应的多模态向量,基于各视频文本区域各自相应的多模态向量,分别对各视频文本区域进行分类,获得视频文本分类结果。采用本方法将多模态向量作为分类依据进行分类,能够提高分类准确率。

技术研发人员:卢昶充,刘烨
受保护的技术使用者:腾讯科技(深圳)有限公司
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1167089.html

最新回复(0)