一种基于特征融合与图文一致性的多模态假新闻检测方法

专利检索2026-07-10  15


本发明涉及计算机科学和人工智能领域,特别涉及一种基于特征融合与图文一致性的多模态假新闻检测方法。


背景技术:

1、随着互联网技术的普及,越来越多的人通过新浪微博、知乎等社交媒体平台发表自己的看法和建议。这些社交媒体平台在给我们生活带来便利的同时,也成为虚假新闻恣意传播的渠道,这给人们带来误导和不良影响,甚至对社会稳定和公共利益造成威胁。因此,探索准确高效的假新闻检测技术具有很高的理论价值和现实意义。

2、传统基于机器学习的方法,往往严重依赖特征工程,需要通过专家知识来手动地提取假新闻的特征,并且可能无法充分捕捉新闻内容中潜在的特征。随着人工智能的发展,深度学习方法能够自动地学习相关的特征,使其被广泛地应用在假新闻检测上。

3、早期的假新闻检测往往使用rnn(循环神经网络),cnn(卷积神经网络),gcn(图卷积神经网络)等深度学习方法来学习新闻内容中的文本特征或者图像特征。随着互联网技术发展,目前社交网络平台上的新闻,往往包含文本和图像信息。以前单模态的方法不能充分地挖掘新闻内容的信息,因此探索利用多种模态的信息来提高假新闻检测识别能力成为了研究热点。但目前多模态的假新闻方法面临着一下几点问题:

4、1)、现有的方法没有充分地利用新闻图像的语义信息与频域信息。

5、2)、特征融合和跨模态一致性建模是有效利用多种模态信息的方法。然而,当前的方法往往只关注其中一种方法,而无法有效地将两者结合起来;因此,如何有效地把两者结合起来是目前面临的一个问题。

6、3)、特征融合对于模型更好地结合不同模态的信息具有积极作用。然而,现有的多模态假新闻检测方法往往只考虑融合后的特征,而忽视了融合之前的独立特征;因此,如何有效地利用融合前后的特征仍是一个需要进一步研究的问题。


技术实现思路

1、为了解决上述技术问题,本发明设计了一种基于特征融合与图文一致性的多模态假新闻检测方法。

2、为了达到上述技术效果,本发明是通过以下技术方案实现的:1、一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于,包括以下步骤:

3、s1、数据的预处理:在数据集过滤出同时包含图像和文本信息的新闻记录,并对新闻内容进行清洗、转换,使其适用于模型的训练;

4、s2、模型的构建:构建一种新颖的多模态假新闻检测模型;

5、s3、训练模型:把训练集的数据输入到s2中构建的检测模型中进行训练,并在每个epoch后,使用校验集对模型的性能进行评估;如果评估的结果比之前epoch的准确度都高,则保存当前epoch的模型参数;最后输出最优的模型,并保存;在训练的过程中,还使用了早停策略;

6、s4、测试与评估:加载s3中所保存的最优模型,并把测试数据输入到最优模型中进行推理,并计算准确度、精确度、召回率、和f1分数;将得到结果与多个有竞争力的多模态假新闻检测基线模型得出结果进行对比。

7、进一步,s1中,所述预处理具体为:

8、s1.1、先删除文本数据里面无效的数据;

9、s1.2、然后通过分词器,将新闻的文本内容切分成离散的词语;

10、s1.3、然后对于文字信息,使用berttokenizer进行token化;对于图像信息,使用torchvision.transforms机器学习包,把图片信息编码成224x224的二维tensor张量。

11、进一步,s2中,所述构建一种新颖的多模态假新闻检测模型包括以下步骤:

12、s2.1、构建文本特征提取模块:将新闻的中连续的文本分词后输入到bert中;在bert中的嵌入层,输入的单词被转换成词嵌入,并通过12层双向的transformer编码器,最总获取文本的上下文表示:

13、tc=bert(text)

14、bert在预训练阶段通过双向上下文建模,能够更好地捕捉词语的上下文信息,包括长距离的依赖关系。

15、s2.2、构建图像特征提取模块:把新闻的图像同时输入预训练的vgg和dct中,预训练的vgg来提取图像的语义信息,预训练的dct用来捕捉图像的频域信息,如下所示:

16、pvgg=vgg(image)

17、pdct=dct(image);

18、然后使用交叉注意力机制与残差连接,实现利用新闻图像的频域信息来对图像的语义信息进行补充与强化,获取图像的上下文表示;具体的计算过程如下所示:

19、q=pvgg;k=pvgg;v=pdct

20、

21、pc=pvgg+pdct,

22、通过上述的操作,获取了图像特征提取模块的最终表示pc。

23、s2.3、构建图文一致性捕获模块:首先我们先计算图文两种模态的相似度s,并把(1-s)当作此模块下的预测任务的假新闻的置信度;文本模态的上下文向量tc与图像模态的上下文向量pc、相似度s的计算方式的如下所示:

24、

25、通过上述计算得到一个(0,1)之间的值,并把(1-s)当前新闻为假新闻的置信度;当s越大的时候,我们假设它是假新闻的置信度就越小;通过这个模块,会使得假新闻的文本模态与模态在特征空间的距离越来越远,反而真实新闻的文本模态与图像模态在特征空间的距离越来越近。

26、s2.4、构建特征融合模块,利用图文模态的相似度来聚合单一模态特征与使用mvae融合后的共享特征,如下所示:

27、首先将文本模态的特征向量tc与图像模态的特征表示pc进行拼接,输入到全连接层以形成两种模态的共享表示;然后通过将共享表示输入到2个不同连接层,得到μ和σ两个向量,可分别视为共享表示分布的均值和方差;通过从潜在空间的高斯分布中采样一个随机向量∈,然后再通过下面的方式生成潜在变量z:

28、z=μ+σ*∈;

29、然后将文本模态与图像模态的特征向量的权重表示为s,共享模态的特征向量的权重表示的(1-s);因为真实新闻文本模态与图像模态的在特征空间距离更近,所以当s接近1的时候,就认为每种单一模态的特征向量包含更多准确的特征,应该适当地增加单一模态的特征向量的权重,而减少通过mvae融合后的共享模态特征向量的权重。在这个模块获取新闻的最终表示r:

30、r=s*tc+s*pc+(1-s)*z

31、s2.5、构建分类器;将新闻融合后的上下文向量r输入到mlp后,将新闻的上下文向量的映射成维度为1x2的向量,并使用softmax进行归一化,来获取得到最终虚假新闻检测结果,如下所示:

32、

33、进一步的,s2中,构建一种新颖的多模态假新闻检测模型过程中存在损失,具体包括图文一致性捕获模块的损失loss1、mvae模型的训练损失loss2、分类器的损失loss3;其中图文一致性捕获模块的损失loss1,

34、

35、mvae模型的训练损失loss2由重构损失和kl散度损失组成;在文本重构损失我们使用交叉熵损失作为衡量指标;而在图像特征重构损失则使用均方误差;kl散度衡量了两个概率

36、分布之间的偏离程度,我们使用losskl表示kl散度的损失。

37、mvae模型的训练损失loss2的最终损失表示为:

38、

39、分类器的损失为:

40、

41、整个模型的训练的总的损失为:

42、loss=loss1+loss2+loss3。

43、进一步,s3中,所述训练模型中文本的编码器的使用的是bert-base-chinese,图像的编码器使用的是vgg,模型训练的学习率为0.0001,文本与的图像被编码后的特征向量的维度为256。

44、进一步,s3中,训练模型的训练过程为:

45、s3.1、使用adabelief优化器来更新模型的参数;设定训练的最大的周期数为30,并使用早停策略进行模型的训练;

46、s3.2、在每个epoch训练完,就评估模型在验证集上的准确度;如果模型的性能在验证集上连续8次没有提升,就触发早停策略;

47、s3.3、在触发早停策略后,选择验证集上准确度最好的模型参数作为最终模型。

48、进一步,s4中,所述对比的多模态假新闻检测基线模型有eann、mcnn、carmn、mvae、safe、cafe。

49、本发明的有益效果是:

50、本发明对图像特征进行编码时候,综合考虑了图像的语义信息与频域信息;这有利于捕获真实图像和虚假图像之间存在的差异;其次,本发明把多模态的特征融合方法与多模态的一致性结合在一起,这有利于捕获新闻中图文模态之间复杂的相关性,另外,本发明提供了一种利用图文模态的相似度来聚合融合前的单一模态特征与融合后的共享特征的思路;在真实的数据集上实验的结果显示,本发明显著优于所有基线模型。


技术特征:

1.一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于,包括以下步骤:

2.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s1中,所述预处理具体为:

3.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s2中,所述构建一种新颖的多模态假新闻检测模型包括以下步骤:

4.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s2中,构建一种新颖的多模态假新闻检测模型过程中存在损失,具体包括图文一致性捕获模块的损失loss1、mvae模型的训练损失loss2、分类器的损失loss3;其中图文一致性捕获模块的损失loss1,

5.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s3中,所述训练模型中文本的编码器的使用的是bert-base-chinese,图像的编码器使用的是vgg,模型训练的学习率为0.0001,文本与的图像被编码后的特征向量的维度为256。

6.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s3中,训练模型的训练过程为:

7.根据权利要求1所述的一种基于特征融合与图文一致性的多模态假新闻检测方法,其特征在于:s4中,所述对比的多模态假新闻检测基线模型有eann、mcnn、carmn、mvae、safe、cafe。


技术总结
本发明公开了一种基于特征融合与图文一致性的多模态假新闻检测方法;通过预训练的模型分别对新闻的文本与的图像信息进行编码,然后在此基础上,充分利用图像的时域信息来增强图像的语义信息,以解决现有方法对图像的特征的学习不充分的问题;其次,本发明综合考虑了图文特征融合与一致性,以强化模型对图像特征与文本特征的之间复杂的相关性的捕获;此外,本发明还提供了一种利用图文一致性来聚合图像模态、文本模态与共享模态的信息的方法。在公开的数据集上的实验结果表明,本发明优于所有的基线模型;因此本发明对自动、及时地阻断假新闻的传播具有重大意义。

技术研发人员:张伟生,苗圣法,于倩,姚绍文,郑鸿峰,吴昊洋,黄越,马冶达,王庆,木永康,王若舒,田羽凌,马世超,闫科杉,陈涛,龙兆科,蔡双凤,彭浩,吕涛,鲍庆达
受保护的技术使用者:云南大学
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1165006.html

最新回复(0)