同义词确定方法、数据推荐方法、相应装置及电子设备与流程

专利检索2026-08-24  21


本技术涉及人工智能、云技术及计算机,尤其涉及一种同义词确定方法、数据推荐方法、相应装置、电子设备、计算机可读存储介质和计算机程序产品。


背景技术:

1、随着计算机技术的发展,人工智能方向的机器学习技术越来越多地应用于自然语言分析场景中,例如识别同义词。

2、在相关技术中,通常会基于两个词之间的相似度,在这两个词之间的相似度大于或等于预设值时,确定这两个词为同义词;在这两个词之间的相似度小于预设值时,确定这两个词为非同义词。

3、但在上述相关技术中,往往部分近义词的相似度较高,在通过阈值判断时,无法区分近义词和同义词,导致同义词的识别准确性较低。


技术实现思路

1、本技术实施例提供了一种同义词确定方法,以解决相关技术中,同义词的识别准确性较低的问题。

2、相应的,本技术实施例还提供了一种同义词确定装置、一种数据推荐方法及装置、电子设备、计算机可读存储介质和计算机程序产品,用以保证上述方法的实现及应用。

3、一方面,本技术实施例提供一种同义词确定方法,该方法包括:

4、确定文本列表;该文本列表包括至少一条文本;每条文本包括第一词和第二词中的至少一个;

5、基于上述文本列表,确定第一词和第二词中每个词对应的融合信息;

6、基于第一词和第二词中每个词对应的融合信息,确定第一词和第二词的语义相似度;

7、确定第一词和第二词在第一文本中被识别为同义词的概率;第一文本为文本列表中包括第一词和第二词的文本;

8、基于语义相似度和上述概率,确定第一词和第二词是否为同义词。

9、另一方面,本技术实施例提供了一种同义词确定装置,该装置包括:

10、确定文本列表;该文本列表包括至少一条文本;每条文本包括第一词和第二词中的至少一个;

11、基于上述文本列表,确定第一词和第二词中每个词对应的融合信息;

12、基于第一词和第二词中每个词对应的融合信息,确定第一词和第二词的语义相似度;

13、确定第一词和第二词在第一文本中被识别为同义词的概率;第一文本为文本列表中包括第一词和第二词的文本;

14、基于语义相似度和上述概率,确定第一词和第二词是否为同义词。

15、可选地,上述融合信息确定模块在基于上述文本列表,确定第一词和第二词中每个词对应的融合信息时,可以具体用于:

16、确定至少一个语义匹配值;其中,每个语义匹配值表示一个第二文本和一个第三文本的相似度;第二文本为文本列表中包括第一词的文本;第三文本为文本列表中包括第二词的文本;每个第二文本和每个第三文本为不同的文本;

17、对于第一词和第二词中的每个词,基于该词对应的语义匹配值,确定该词对应的融合信息。

18、可选地,上述融合信息确定模块在确定至少一个语义匹配值时,可以具体用于:

19、对于对每个第二文本和每个第三文本进行分词处理后的每个词,基于该词在对应文本中的上下文特征,确定该词的语义特征;

20、对于每个第二文本,对该第二文本中每个词的语义特征进行融合,得到该第二文本对应的文本特征;

21、对于每个第三文本,对该第三文本中每个词的语义特征进行融合,得到该第三文本对应的文本特征;

22、对于一个第二文本和一个第三文本,基于该第二文本对应的文本特征和该第三文本对应的文本特征,确定该第二文本和该第三文本的语义匹配值。

23、可选地,对于对每个第二文本和每个第三文本进行分词处理后的每个词,上述融合信息确定模块在基于该词在对应文本中的上下文特征,确定该词的语义特征时,可以具体用于:

24、若该词对应的文本为第二文本,基于该词在对应文本中的上下文特征以及第一词对应的注意力分布,确定该词的语义特征;

25、若该词对应的文本为第三文本,基于该词在对应文本中的上下文特征以及第二词对应的注意力分布,确定该词的语义特征。

26、可选地,对于一个第二文本和一个第三文本,上述融合信息确定模块在基于该第二文本对应的文本特征和该第三文本对应的文本特征,确定该第二文本和该第三文本的语义匹配值时,可以具体用于:

27、确定相似度修正参数;

28、基于相似度修正参数、第二文本对应的文本特征和第三文本对应的文本特征,确定第一文本和第二文本的修正后的语义匹配值。

29、可选地,对于每个第一文本,上述同义词识别模块在确定第一词和第二词在第一文本中被识别为同义词的概率时,可以具体用于:

30、基于对第一文本进行分词处理后的每个词在该第一文本中的上下文特征以及第三注意力分布,确定该第一文本对应的文本特征;其中,第三注意力分布为对应于第一词和第二词的注意力分布;

31、基于第一文本对应的文本特征、第一词的词特征和第二次的词特征,确定第一词和第二词在该第一文本中被识别为同义词对的概率。

32、可选地,上述装置还可以包括同义词库更新模块,用于:

33、若确定第一词和第二词为同义词,基于该第一词和该第二词构建目标同义词对;

34、基于目标同义词对,对文本列表所属的目标领域的同义词库进行更新。

35、另一方面,本技术实施例中还提供了一种数据推荐方法,该方法包括:

36、接收到的搜索请求对应的搜索领域;

37、基于上述同义词确定装置构建的该搜索领域的同义词库,确定该搜索请求对应的搜索内容中目标词对应的目标同义词对;

38、基于目标同义词对,确定该目标词对应的目标同义词,并将搜索内容中的目标词转换为目标同义词,得到转换后的搜索内容;

39、将转换后的搜索内容对应的搜索结果确定为该搜索请求对应的搜索结果。

40、另一方面,本技术实施例中还提供了一种数据推荐装置,该装置包括:

41、搜索领域确定模块,用于确定接收到的搜索请求对应的搜索领域;

42、同义词对确定模块,用于基于上述同义词确定装置构建的该搜索领域的同义词库,确定该搜索请求对应的搜索内容中目标词对应的目标同义词对;

43、同义词转换模块,用于基于目标同义词对,确定该目标词对应的目标同义词,并将搜索内容中的目标词转换为目标同义词,得到转换后的搜索内容;

44、搜索结果确定模块,用于将转换后的搜索内容对应的搜索结果确定为该搜索请求对应的搜索结果。

45、另一方面,本技术实施例提供了一种电子设备,包括处理器和存储器,该处理器和存储器相互连接;

46、上述存储器用于存储计算机程序;

47、上述处理器被配置用于在调用上述计算机程序时,执行本技术实施例提供的同义词确定方法或数据推荐方法。

48、另一方面,本技术实施例提供了一种计算机可读存储介质,该计算机可读存储介质存储有计算机程序,该计算机程序被处理器执行以实现本技术实施例提供的同义词确定方法或数据推荐方法。

49、另一方面,本技术实施例提供了一种计算机程序产品,该计算机程序产品包括计算机程序,上述计算机程序被处理器执行时实现本技术实施例提供的同义词确定方法或数据推荐方法。

50、在本技术实施例中,通过基于第一词和第二词中的至少一个词的文本列表,可以实现通过第一词和第二词中每个词所在文本的语境,确定第一词和第二词中每个词对应的融合信息,进而基于第一词和第二词中每个词对应的融合信息,确定第一词和第二词的语义相似度,可以精确的结合第一词和第二词所在文本的语境确定二者的相似度。并确定第一词和第二词在同一文本中被识别为同义词的概率,进一步基于该概率与第一词和第二词的语义相似度,确定第一词和第二词是否为同义词,可以充分考虑第一词和第二词在文本中的替换性(即第一词和第二词在语境中的语义相似度)和可识别性(即第一词和第二词在同一文本中被识别的概率),精确地确定出互为同义词的第一词和第二词,为进一步基于所确定的同义词进行后续数据处理做铺垫。


技术特征:

1.一种同义词对确定方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述基于所述文本列表,确定所述第一词和所述第二词中每个词对应的融合信息,包括:

3.根据权利要求2所述的方法,其特征在于,所述确定至少一个语义匹配值,包括:

4.根据权利要求3所述的方法,其特征在于,对于对每个所述第二文本和每个所述第三文本进行分词处理后的每个词,所述基于所述词在对应文本中的上下文特征,确定所述词的语义特征,包括:

5.根据权利要求3所述的方法,其特征在于,对于一个所述第二文本和一个所述第三文本,所述基于所述第二文本对应的文本特征和所述第三文本对应的文本特征,确定所述第一文本和所述第二文本的语义匹配值,包括:

6.根据权利要求1或3所述的方法,其特征在于,对于每个所述第一文本,所述确定所述第一词和所述第二词在第一文本中被识别为同义词的概率,包括:

7.根据权利要求1至6中任一项所述的方法,其特征在于,所述方法还包括:

8.一种数据推荐方法,其特征在于,所述方法包括:

9.一种同义词确定装置,其特征在于,所述装置包括:

10.一种数据推荐装置,其特征在于,所述装置包括:

11.一种电子设备,其特征在于,包括处理器和存储器,所述处理器和存储器相互连接;

12.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1至7任一项或权利要求8所述的方法。

13.一种计算机程序产品,其特征在于,所述计算机程序产品包括计算机程序,所述计算机程序被处理器执行时实现权利要求1至7任一项或权利要求8所述的方法。


技术总结
本申请实施例公开了一种同义词确定方法、数据推荐方法、相应装置及电子设备,涉及人工智能、云技术及计算机技术领域。该方法包括:确定文本列表;该文本列表包括至少一条文本;每条文本包括第一词和第二词中的至少一个;基于上述文本列表,确定第一词和第二词中每个词对应的融合信息;基于第一词和第二词中每个词对应的融合信息,确定第一词和第二词的语义相似度;确定第一词和第二词在第一文本中被识别为同义词的概率;第一文本为文本列表中包括第一词和第二词的文本;基于语义相似度和上述概率,确定第一词和第二词是否为同义词。采用本申请实施例,可以精确地确定出互为同义词的第一词和第二词,可适用性高。

技术研发人员:何福铿,吴崇正,柯学,刘飚,杨浩宇,姚纯然,何由之,鲍青云
受保护的技术使用者:腾讯科技(深圳)有限公司
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1167096.html

最新回复(0)