本技术涉及视频检测,特别是涉及一种视频语义转场点检测方法、装置、电子设备及介质。
背景技术:
1、视频语义转场点,又称场景转场点,是指视频中前后画面内容不同的视频帧,即视频语义转场点前的视频帧中的内容与视频语义转场点后的视频帧中的内容不同,视频帧的内容不同表示视频帧属于不同的场景。例如,视频中视频语义转场点前的视频帧包括角色1吃饭的画面,视频语义转场点后的视频帧包括角色2开车的画面,这两种画面分别属于不同的场景。
2、对视频进行视频语义转场点检测,能够对视频包括的每个场景进行切分,以便后续能够筛选出实际业务所需的场景,或者为每个场景生成简介,提高了视频剪辑等视频处理任务的效率。目前,常规的视频语义转场点检测方式中,需要依次计算视频包括的每两个相邻的视频帧之间的图像画面相似度,在相似度较低时,确定这两个相邻的视频帧为视频语义转场点,否则确定这两个相邻的视频帧不为视频语义转场点。但由于同一个场景内的视频帧画面可能存在较大的变化,例如,一个视频包括从正面拍摄场景a得到的视频片段1,以及从侧面拍摄场景a得到的视频片段2,由于不同角度拍摄的视频帧的画面可能存在较大的差别,因此该检测方式可能错误地确定视频片段1的最后一个视频帧以及视频片段2的第一个视频帧为视频语义转场点。可见该方式检测视频语义转场点的准确度较低。
技术实现思路
1、本技术实施例的目的在于提供一种视频语义转场点检测方法、装置、电子设备及介质,以实现提高对视频中视频语义转场点的检测准确度。具体技术方案如下:
2、在本技术实施例的第一方面,提供了一种视频语义转场点检测方法,所述方法包括:
3、将待检测视频切分为多个时间连续的镜头区间;
4、针对每个镜头区间,获取所述镜头区间中的第一预设时间位置的图像参考帧,并对所述图像参考帧进行特征提取,得到图像特征;
5、获取所述镜头区间中第二预设时间位置的音频信息,并对所述音频信息进行特征提取,得到音频特征;
6、基于各镜头区间的图像特征和音频特征,确定每个镜头区间的端点视频帧是否为视频语义转场点。
7、可选的,所述将待检测视频切分为多个时间连续的镜头区间,包括:
8、确定待检测视频中的各视觉转场点,所述视觉转场点之前的视频帧与所述视觉转场点之后的视频帧不属于同一个镜头;
9、基于各视觉转场点,对所述待检测视频进行切分,得到多个时间连续的镜头区间。
10、可选的,所述获取所述镜头区间中的第一预设时间位置的图像参考帧,包括:
11、按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧。
12、可选的,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
13、从所述镜头区间中抽取第一个视频帧、中间视频帧和最后一个视频帧,作为图像参考帧。
14、可选的,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
15、从所述镜头区间中随机抽取多个视频帧作为图像参考帧。
16、可选的,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
17、按照预设间隔,从所述镜头区间中抽取多个视频帧作为图像参考帧。
18、可选的,所述获取所述镜头区间中第二预设时间位置的音频信息,包括:
19、将所述镜头区间的最后一个视频帧之前的预设时间段内的音频,以及所述最后一个视频帧之后的预设时间段内的音频,组成所述镜头区间的音频信息;或者,
20、将所述镜头区间的第一个视频帧之前的预设时间段内的音频,以及所述第一个视频帧之后的预设时间段内的音频,组成所述镜头区间的音频信息。
21、可选的,所述基于各镜头区间的图像特征和音频特征,确定每个镜头区间的端点视频帧是否为视频语义转场点,包括:
22、针对每个镜头区间,对所述镜头区间的图像特征和音频特征进行拼接,得到多模态特征;
23、按照各镜头区间在所述待检测视频中的排列顺序,将各镜头区间的多模态特征组成特征序列;
24、将所述特征序列输入预先训练的分类模型,得到所述分类模型输出的所述待检测视频的每个视觉转场点为视频语义转场点的概率;
25、针对每个视觉转场点,判断所述视觉转场点为视频语义转场点的概率是否大于预设概率阈值;
26、若是,则确定所述视觉转场点为视频语义转场点;
27、若否,则确定所述视觉转场点不为视频语义转场点。
28、在本技术实施例的第二方面,提供了一种视频语义转场点检测装置,所述装置包括:
29、切分模块,用于将待检测视频切分为多个时间连续的镜头区间;
30、图像特征提取模块,用于针对所述切分模块切分的每个镜头区间,获取所述镜头区间中的第一预设时间位置的图像参考帧,并对所述图像参考帧进行特征提取,得到图像特征;
31、音频特征提取模块,用于获取所述镜头区间中第二预设时间位置的音频信息,并对所述音频信息进行特征提取,得到音频特征;
32、确定模块,用于基于各镜头区间的图像特征和音频特征,确定每个镜头区间的端点视频帧是否为视频语义转场点。
33、可选的,所述切分模块,具体用于:
34、确定待检测视频中的各视觉转场点,所述视觉转场点之前的视频帧与所述视觉转场点之后的视频帧不属于同一个镜头;
35、基于各视觉转场点,对所述待检测视频进行切分,得到多个时间连续的镜头区间。
36、可选的,所述图像特征提取模块,具体用于:
37、按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧。
38、可选的,所述图像特征提取模块,具体用于:
39、从所述镜头区间中抽取第一个视频帧、中间视频帧和最后一个视频帧,作为图像参考帧。
40、可选的,所述图像特征提取模块,具体用于:
41、从所述镜头区间中随机抽取多个视频帧作为图像参考帧。
42、可选的,所述图像特征提取模块,具体用于:
43、按照预设间隔,从所述镜头区间中抽取多个视频帧作为图像参考帧。
44、可选的,所述音频特征提取模块,具体用于:
45、将所述镜头区间的最后一个视频帧之前的预设时间段内的音频,以及所述最后一个视频帧之后的预设时间段内的音频,组成所述镜头区间的音频信息;或者,
46、将所述镜头区间的第一个视频帧之前的预设时间段内的音频,以及所述第一个视频帧之后的预设时间段内的音频,组成所述镜头区间的音频信息。
47、可选的,所述确定模块,具体用于:
48、针对每个镜头区间,对所述镜头区间的图像特征和音频特征进行拼接,得到多模态特征;
49、按照各镜头区间在所述待检测视频中的排列顺序,将各镜头区间的多模态特征组成特征序列;
50、将所述特征序列输入预先训练的分类模型,得到所述分类模型输出的所述待检测视频的每个视觉转场点为视频语义转场点的概率;
51、针对每个视觉转场点,判断所述视觉转场点为视频语义转场点的概率是否大于预设概率阈值;
52、若是,则确定所述视觉转场点为视频语义转场点;
53、若否,则确定所述视觉转场点不为视频语义转场点。
54、在本技术实施例的第三方面,提供了一种电子设备,包括处理器、通信接口、存储器和通信总线,其中,处理器,通信接口,存储器通过通信总线完成相互间的通信;
55、存储器,用于存放计算机程序;
56、处理器,用于执行存储器上所存放的程序时,实现第一方面任一项所述的视频语义转场点检测方法。
57、在本技术实施的又一方面,还提供了一种计算机可读存储介质,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现上述任一所述的视频语义转场点检测方法。
58、在本技术实施的又一方面,还提供了一种包含指令的计算机程序产品,当其在计算机上运行时,使得计算机执行上述任一所述的视频语义转场点检测方法。
59、本技术实施例提供的视频语义转场点检测方法、装置、电子设备及介质,将待检测视频切分为多个时间连续的镜头区间,由于每个镜头区间内的视频帧不属于同一镜头,因此不同的镜头区间可能不属于同一个场景,实现了对视频语义转场点的初步检测。之后,结合各镜头区间的图像特征以及音频特征,确定每个镜头区间的端点视频帧是否为视频语义转场点,即实现了从音频和视频两个角度,确定视频语义转场点,相比于仅考虑视频画面的方式,本技术实施例考虑的角度更全面,因此确定的视频语义转场点更准确。
1.一种视频语义转场点检测方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述将待检测视频切分为多个时间连续的镜头区间,包括:
3.根据权利要求1所述的方法,其特征在于,所述获取所述镜头区间中的第一预设时间位置的图像参考帧,包括:
4.根据权利要求3所述的方法,其特征在于,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
5.根据权利要求3所述的方法,其特征在于,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
6.根据权利要求3所述的方法,其特征在于,所述按照预设的抽取规则,从所述镜头区间中抽取至少一个视频帧作为图像参考帧,包括:
7.根据权利要求1所述的方法,其特征在于,所述获取所述镜头区间中第二预设时间位置的音频信息,包括:
8.根据权利要求2所述的方法,其特征在于,所述基于各镜头区间的图像特征和音频特征,确定每个镜头区间的端点视频帧是否为视频语义转场点,包括:
9.一种视频语义转场点检测装置,其特征在于,所述装置包括:
10.一种电子设备,其特征在于,包括处理器、通信接口、存储器和通信总线,其中,处理器,通信接口,存储器通过通信总线完成相互间的通信;
11.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质内存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-8任一项所述的方法。
