背景技术:
1、文档储存库可以包括持久存储系统中的大量文档。这些文档可以包括结构化和非结构化的数据,并且可以符合许多不同的模式类型。例如,表示知识库的文档储存库可以包括faq、白皮书、网页、电子邮件和/或可以用于解决操作环境中的各种问题的其它信息。虽然文档储存库可以存储大量信息,但有效地搜索这个信息也非常困难,因为文档储存库可以包括难以统一分析的许多不同的文档类型。
2、识别可能与源文档相关的文档的现有方法是生成相似性分数(similarityscore)。相似性分数是由储存库的搜索接口计算的度量,该度量表示两个文档在语法上的相似程度的度量。可以将源文档与文档储存库中的每个单独文档进行比较,以生成储存库中的每个文档的相似性分数。然后这些分数可以用于识别最有可能与源文档相似的文档。
技术实现思路
1、本文描述的实施例允许搜索由具有许多不同模式的文档组成的文档储存库并将其与输入文档进行比较以生成相似性分数。相似性分数可以用于识别文档储存库中的与输入文档最相似的文档。输入文档的模式可以被识别并用于检索特定于该模式的配置。配置可以包括信息,该信息定义可以如何自动生成查询并将其提交到文档储存库使得可以在具有不同模式的文档中的不同字段之间执行搜索。这些查询可以级联起来并被提交到文档储存库。可以将为结果文档生成的加权分数聚合在一起以生成每个文档的最终相似性分数。
2、代替仅仅搜索文档的语法相似性,该配置允许提交到文档储存库的查询更有可能生成语义相似性,使得文档中表达的含义或概念更有可能是相似的。可以定制配置以将特定源字段中的高频n-gram专门映射到文档储存库中的具有指定模式的文档中的特定目标字段。
3、文档储存库可以被设计为包括允许文档建索引的接口。可以对现有文档储存库进行爬取和/或可以提交被索引到倒排索引中的文档。数据清理处理可以在建索引发生之前移除与文档的语义含义不相关的无关信息或元数据。系统还可以包括用于倒排索引的搜索接口以及可以用于检索特定单词的文档频率的文档频率api。这个文档频率可以用于生成各个单词的频率分数。这个频率分数可以用于选择目标字段中的哪些单词用于生成搜索查询。
4、配置本身可以包括用于可以被用作搜索查询的源的每个模式的单独部分。目标文档中的搜索字段可以用于提供源字段中的各个n-gram或其它字段值以生成指定数量的查询,这些查询可以级联在一起以形成单个查询。可以根据存储在配置中的值对所得的相似性分数进行加权。源字段与目标字段之间-以及知识储存库中的不同模式之间的各种映射-可以聚合在一起以形成每个文档的最终相似性分数。然后,这些相似性分数可以用于对结果进行排序或将结果呈现给发出请求的用户或设备。
1.一种包括指令的非暂态计算机可读介质,所述指令在由一个或多个处理器执行时,使得所述一个或多个处理器执行包括以下的操作:
2.如权利要求1所述的非暂态计算机可读介质,其中第一模式与第二模式不同。
3.如权利要求1所述的非暂态计算机可读介质,其中第一模式定义服务请求,所述文档集合是知识库的一部分,并且第二模式定义包括针对所述服务请求的解决方案的文本文档。
4.如权利要求1所述的非暂态计算机可读介质,其中所述配置定义如何从第一文档生成对具有多个不同模式的多个文档集合的查询。
5.如权利要求1所述的非暂态计算机可读介质,其中所述多个查询被提交到搜索接口以及应用编程接口(api),该搜索接口包括接受布尔查询和短语查询的倒排索引,该api接收单词并返回文档集合中的在其中使用该单词的文档的数量。
6.如权利要求1所述的非暂态计算机可读介质,其中第一模式定义多个字段-值对。
7.如权利要求1所述的非暂态计算机可读介质,其中对于第一文档中的第一字段,所述配置包括定义所述多个查询的第一子集的n-gram级别的查询类型。
8.如权利要求7所述的非暂态计算机可读介质,其中对于查询类型,所述配置还包括要针对该查询类型生成的查询的数量n。
9.如权利要求8所述的非暂态计算机可读介质,其中针对查询类型生成数量为n的查询包括:
10.如权利要求9所述的非暂态计算机可读介质,其中频率分数是基于单词在第一文档中出现的次数以及文档集合中该单词在其中出现的文档的数量来确定的。
11.如权利要求7所述的非暂态计算机可读介质,其中对于查询类型,所述配置还包括第二模式中的一个或多个目标字段。
12.如权利要求11所述的非暂态计算机可读介质,其中对于所述一个或多个目标字段中的第一目标字段,所述配置还包括要应用于从第一目标字段生成的查询的相似性分数的权重。
13.如权利要求12所述的非暂态计算机可读介质,其中权重是通过机器学习模型在所述配置中设置的。
14.如权利要求1所述的非暂态计算机可读介质,其中所述配置是多个配置中的一个配置,并且所述多个配置与多个不同模式对应。
15.如权利要求1所述的非暂态计算机可读介质,其中第一文档被接收作为搜索请求的一部分,以识别文档集合中的与第一文档相似的文档。
16.如权利要求1所述的非暂态计算机可读介质,其中所述操作还包括对文档集合执行所述多个查询。
17.如权利要求16所述的非暂态计算机可读介质,其中所述多个查询的结果包括文档集合中的第二文档的分数,并且第二文档的分数是响应于所述多个查询而生成的。
18.如权利要求17所述的非暂态计算机可读介质,其中将所述多个查询的结果组合成所述相似性分数包括生成第二文档的分数的加权组合。
19.一种系统,包括:
20.一种计算文档的相似性分数的方法,所述方法包括:
