本发明涉及一种以文找文系统及方法,尤指一种纯文字分析运算的以文找文系统及方法。
背景技术:
1、「以文找文」是指根据一段具有完整语意的文字语句在目标数据库中找到相似文字数据的功能。现有的以文找文的技术大多是从该段语句中提取关键词,并以关键词进行目标数据库的检索,以寻找包含有相同关键词的文字数据,并根据结果的命中状态来决定哪些文字数据符合条件。
2、其中,在常用的西方语文例如英文中,其语句中的「字」本身就是一
3、「词」(例如:circuit),通常具有特定的词意,故可以直接提取语句中具有特性的「字」当作关键词,在检索中用于寻找包含有相同字/词的文字数据。
4、然而,以中文而言,中文的「字」具有「有限文字无限组合」的特性,单一「字」(例如:电)难以代表其在原语句中所表示的完整词意(例如:电路板),故在一段语句中,必须先进行断词、断字,或进行语意分析等步骤才能提取出可用的关键词,以进一步用于关键词检索。若初步「提取关键词」的结果有失准确,没有提取到该段语句中重要的关键词,则检索的结果也不会准确,即难以找到与该段语句具有相似内容的有效文字数据。此外,中文的文字表达方法千变万化,单一关键词可能有许多表述方法或近义字词,用于判断是否为关键词的目标数据库难以搜集完全。再者,即使正确提取出语句中的一词,也未必是该语句中真正具有关键意义的关键词。以不具关键意义的关键词进行检索也难以找到真正具有相关内容的文字数据,或者往往找到许多相关度不足的内容。
5、综上所述,现有的以文找文的技术势必须进一步改进。
技术实现思路
1、有鉴于现有的以文找文分析技术具有中文关键词提取不易、检索精确度不足的问题,本发明提供一种纯文字分析运算的以文找文系统,连接一目标数据库,该目标数据库包含多笔文字数据,该系统包含:
2、一使用者装置,接收一段待分析文字,该段待分析文字包含具有顺序性的多个特征字;
3、一服务器,通讯连接该目标数据库及该使用者装置,以从该使用者装置接收该段待分析文字,并由所述特征字中依序提取多个特征字组;其中,每一特征字组包含连续的第一数量个特征字,所述特征字组涵盖全部的特征字,且相邻的两特征字组具有第二数量个头尾重叠的特征字;
4、该服务器分别针对各该特征字组,判断该目标数据库中的各笔文字数据的内容是否符合一特征字组邻近群聚条件,以产生每一特征字组的一命中数据结果清单,再根据各该特征字组的命中数据结果清单计算出各笔文字数据的一命中分数;
5、该服务器从该目标数据库读取并输出命中分数高于一预设分数门槛的至少一笔文字数据作为至少一分析命中数据。
6、本发明还提供一种纯文字分析运算的以文找文方法,由一服务器执行,该服务器连接一目标数据库及一使用者装置,该目标数据库包含多笔文字数据服务器,该方法包含以下步骤:
7、从该使用者装置接收一段待分析文字,该段待分析文字包含具有顺序性的多个特征字;
8、由所述特征字中依序提取多个特征字组;其中,每一特征字组包含连续的第一数量个特征字,所述特征字组涵盖全部的特征字,且相邻的两特征字组具有第二数量个头尾重叠的特征字;
9、分别针对各该特征字组,判断该目标数据库中的各笔文字数据的内容是否符合一特征字组邻近群聚条件,以产生每一特征字组的一命中数据结果清单;
10、根据各该特征字组的命中数据结果清单计算出各笔文字数据的一命中分数;及
11、从该目标数据库读取并输出命中分数高于一预设分数门槛的至少一笔文字数据作为至少一分析命中数据。
12、从该目标数据库读取并输出命中分数高于一预设分数门槛的至少一笔文字数据作为至少一分析命中数据。以中文而言,一段用以描述一特定内容的文字可能涉及结构、材料、形状等特性的叙述,且不同人其写法、用词、用字亦不同。但以「字」之间的组合来说,有其人眼看不出的相似性。简言之,一段文字中若将个别「字」切割开来,以不具顺序的「字组」的方式看待,以人眼、人脑判断可能几乎没有特殊或明确意义,但就文字的组合性而言,可以在某种程度上代表对特定内容的描述方式。
13、根据上述原理,本发明的纯文字分析运算的以文找文方法通过由待分析文字的特征字中直接提取多个特征字组,判断目标数据库中的文字数据是否有各该特征字组邻近群聚的情形以取得各该特征字组的命中数据结果清单,并进一步统合所有特征字组的命中数据结果清单以计算各笔文字数据对应的命中分数,从而判断各笔文字数据与原始待分析文字数据的相关性是否足够高。当同一笔文字数据出现在其中一特征字组的命中数据结果清单中时,则代表该命中数据中具有与该待分析文字使用了相似的「文字组合」。进一步而言,所述特征字组除了包含待分析文字全部的特征字,且相邻的特征字组分别包含互相重叠的特征字,故所述特征字组之间两两互有直接关联,或者有间隔的两特征字组之间有间接关联的链条结构。
14、当一笔文字数据出现于多个特征字组的命中数据结果清单中时,代表该笔文字数据的内容与该待分析文字具有高的相似性。故当该命中分数越高,则代表该笔文字数据的内容与该待分析文字所使用的文字组合的相似度越高,该笔文字数据与该待分析文字具有相似内容的可能性也越高,从而找出该目标数据库中与待分析文字具有高相似内容的文字数据。
15、本发明纯文字分析运算的以文找文方法利用由待分析文字中依预设规则直接提取的特征字组,以判断特征字组在文字数据中是否有邻近群聚的方式对该笔文字数据与待分析文字的内容相似度进行评分,从而找出与待分析文字具有高相似内容的文字数据。避免需要由待分析文字中撷取关键字的步骤,从而避免提取关键字的步骤中关键词近义词目标数据库不完整、文意判断不正确、关键词提取错误等问题,提高以文找文的准确性。
1.一种纯文字分析运算的以文找文系统,其特征在于,连接一目标数据库,该目标数据库包含多笔文字数据,该系统包含:
2.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,该服务器进一步根据一预存的数据库字频统计结果,移除该段待分析文字中的至少一高频字,以保留该段待分析文字中的该多个特征字。
3.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,该服务器进一步判断该段待分析文字的一总字数是否高于一字数门槛;若是,则根据一预存的数据库字频统计结果,移除该段待分析文字中的至少一高频字,以保留该段待分析文字中的该多个特征字。
4.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,该特征字组邻近群聚条件包含有:该特征字组中的所述特征字出现在文字数据的内容中的一预设字数距离范围内。
5.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,当该服务器针对各该特征字组,判断该目标数据库中的各笔文字数据的内容是否符合一特征字组邻近群聚条件,以产生每一特征字组的一命中数据结果清单时,进一步包含:
6.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,当该服务器根据各该特征字组的命中数据结果清单计算出各笔文字数据的一命中分数时,进一步包含:
7.如权利要求1所述的纯文字分析运算的以文找文系统,其特征在于,该预设分数门槛是根据所述特征字组的数量以及一预设命中分数比率计算产生。
8.一种纯文字分析运算的以文找文方法,其特征在于,由一服务器执行,该服务器连接一目标数据库及一使用者装置,该目标数据库包含多笔文字数据,该方法包含以下步骤:
9.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,进一步包含:
10.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,进一步包含:
11.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,
12.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,所述针对各该特征字组,判断该目标数据库中的各笔文字数据的内容是否符合一特征字组邻近群聚条件,以产生每一特征字组的一命中数据结果清单的步骤中,是分别针对每一特征字组对每一笔文字数据进行以下步骤:
13.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,所述根据各该特征字组的命中数据结果清单计算出各笔文字数据的一命中分数的步骤中,包含以下子步骤:
14.如权利要求8所述的纯文字分析运算的以文找文方法,其特征在于,该预设分数门槛是根据所述特征字组的数量以及一预设命中分数比率计算产生。
