一种数据元匹配方法、电子设备及计算机可读存储介质与流程

专利检索2026-09-02  2


本申请涉及自然语言处理,特别是涉及一种数据元匹配方法、电子设备及计算机可读存储介质。


背景技术:

1、在自然语言处理领域,数据元提供了标准化的数据定义和描述,通过统一的数据元定义,可以减少数据集成和数据交换的复杂性,提高数据的可理解性和可用性。因此如何精准快速地确定待匹配数据对应的数据元,实现准确高效的标准化治理是数据管理中的关键。

2、目前,在进行数据元匹配时主要是对数据中的字段进行处理,以字段这一单维度信息进行数据元的匹配处理,没有充分挖掘待匹配数据的各维度数据属性,降低了数据元匹配的准确性。


技术实现思路

1、本申请至少提供一种数据元匹配方法、电子设备及计算机可读存储介质,能够提高数据元匹配的准确性。

2、本申请第一方面提供了一种数据元匹配方法,包括:获取待匹配数据的多维度数据属性;对所述待匹配数据的各维度数据属性进行向量化处理,得到所述待匹配数据的目标向量化表示,所述待匹配数据的目标向量化表示包括向量化后的各维度数据属性;将所述待匹配数据的向量化表示与预设数据元库中各数据元的向量化表示进行匹配处理,得到匹配结果;响应于所述匹配结果表征匹配成功,则将与所述待匹配数据的目标向量化表示匹配的数据元确定为所述待匹配数据的数据元。

3、在一实施例中,所述多维度数据属性包括语义信息和统计信息;所述对所述待匹配数据的各维度数据属性进行向量化处理,得到所述待匹配数据的目标向量化表示的步骤,包括:对所述待匹配数据的语义信息进行向量化处理,得到语义向量表示;对所述待匹配数据的统计信息进行向量化处理,得到统计向量表示;基于所述语义向量表示和所述统计向量表示确定所述待匹配数据的目标向量化表示。

4、在一实施例中,所述语义信息包括名称和注释,所述对所述待匹配数据的语义信息进行向量化处理,得到语义向量表示的步骤,包括:基于中文文本向量技术对所述待匹配数据的注释进行向量化处理,得到注释向量表示;基于训练好的名称向量化模型对所述待匹配数据的名称进行向量化处理,得到所述名称向量化模型输出的名称向量表示;基于所述注释向量表示和所述名称向量表示确定所述语义向量表示。

5、在一实施例中,所述方法还包括:采集待训练数据以及各待训练数据的名称信息;将所述待训练数据以及各待训练数据的名称信息输入初始名称向量化模型中,得到所述初始名称向量化模型输出的名称向量表示;计算所述初始名称向量化模型输出的名称向量表示与所述名称信息之间损失函数的损失值;基于所述损失值训练所述初始名称向量化模型,得到所述训练好的名称向量化模型。

6、在一实施例中,所述对所述待匹配数据的统计信息进行向量化处理,得到统计向量表示的步骤,包括:获取所述统计信息的信息类型;响应于所述统计信息的信息类型为除数值类型以外的其它类型,则将所述其它类型的统计信息转化为所述数值类型的统计信息;对所述数值类型的统计信息进行数值计算,得到目标数值;对所述目标数值进行向量化处理,得到所述统计向量表示。

7、在一实施例中,所述对所述数值类型的统计信息进行数值计算,得到目标数值的步骤,包括:获取所述统计信息中目标字段的当前数值以及所述目标字段的历史数值;计算所述当前数值和所述历史数值之间的平均值;将所述平均值作为所述目标数值。

8、在一实施例中,所述将所述待匹配数据的目标向量化表示与预设数据元库中各数据元的向量化表示进行匹配处理,得到匹配结果的步骤,包括:计算所述待匹配数据的目标向量化表示与所述预设数据元库中各数据元的向量化表示之间的余弦相似度;响应于所述余弦相似度大于相似度阈值,则所述匹配结果表征匹配成功。

9、在一实施例中,所述计算所述待匹配数据的向量化表示与所述预设数据元库中各数据元的向量化表示之间的余弦相似度的步骤,包括:计算所述目标向量化表示与所述预设数据元库中各数据元的向量化表示之间的第一乘积;计算所述目标向量化表示的模与所述预设数据元库中各数据元的向量化表示的模之间的第二乘积;计算所述第一乘积与所述第二乘积之间的比值,得到所述待匹配数据的向量化表示与所述预设数据元库中各数据元的向量化表示之间的余弦相似度。

10、本申请第二方面提供了一种电子设备,包括存储器和处理器,处理器用于执行存储器中存储的程序指令,以实现上述数据元匹配方法。

11、本申请第三方面提供了一种计算机可读存储介质,其上存储有程序指令,程序指令被处理器执行时实现上述数据元匹配方法。

12、上述方案,获取待匹配数据的多维度数据属性;对待匹配数据的各维度数据属性进行向量化处理,得到待匹配数据的目标向量化表示,待匹配数据的目标向量化表示包括向量化后的各维度数据属性;将待匹配数据的目标向量化表示与预设数据元库中各数据元的向量化表示进行匹配处理,得到匹配结果;响应于匹配结果表征匹配成功,则将与待匹配数据的目标向量化表示匹配的数据元确定为待匹配数据的数据元。由此将待匹配数据的多维度数据属性进行向量化处理,充分挖掘了待匹配数据的数据属性信息,以向量形式进行匹配处理保证了数据形式的一致性,从而提高了数据元匹配的准确性。

13、应当理解的是,以上的一般描述和后文的细节描述仅是示例性和解释性的,而非限制本申请。



技术特征:

1.一种数据元匹配方法,其特征在于,所述方法包括:

2.根据权利要求1所述的数据元匹配方法,其特征在于,所述多维度数据属性包括语义信息和统计信息;所述对所述待匹配数据的各维度数据属性进行向量化处理,得到所述待匹配数据的目标向量化表示的步骤,包括:

3.根据权利要求2所述的数据元匹配方法,其特征在于,所述语义信息包括名称和注释,所述对所述待匹配数据的语义信息进行向量化处理,得到语义向量表示的步骤,包括:

4.根据权利要求3所述的数据元匹配方法,其特征在于,所述方法还包括:

5.根据权利要求2所述的数据元匹配方法,其特征在于,所述对所述待匹配数据的统计信息进行向量化处理,得到统计向量表示的步骤,包括:

6.根据权利要求5所述的数据元匹配方法,其特征在于,所述对所述数值类型的统计信息进行数值计算,得到目标数值的步骤,包括:

7.根据权利要求1所述的数据元匹配方法,其特征在于,所述将所述待匹配数据的目标向量化表示与预设数据元库中各数据元的向量化表示进行匹配处理,得到匹配结果的步骤,包括:

8.根据权利要求7所述的数据元匹配方法,其特征在于,所述计算所述待匹配数据的向量化表示与所述预设数据元库中各数据元的向量化表示之间的余弦相似度的步骤,包括:

9.一种电子设备,其特征在于,包括存储器和处理器,所述处理器用于执行所述存储器中存储的程序指令,以实现权利要求1至8任一项所述的数据元匹配方法。

10.一种计算机可读存储介质,其上存储有程序指令,其特征在于,所述程序指令被处理器执行时实现权利要求1至8任一项所述的数据元匹配方法。


技术总结
本申请公开了一种数据元匹配方法、电子设备及计算机可读存储介质,该方法包括:获取待匹配数据的多维度数据属性;对待匹配数据的各维度数据属性进行向量化处理,得到待匹配数据的目标向量化表示,待匹配数据的目标向量化表示包括向量化后的各维度数据属性;将待匹配数据的目标向量化表示与预设数据元库中各数据元的向量化表示进行匹配处理,得到匹配结果;响应于匹配结果表征匹配成功,则将与待匹配数据的目标向量化表示匹配的数据元确定为待匹配数据的数据元。上述方案,能够提高数据元匹配的准确性。

技术研发人员:朱明浩,操涛涛,熊巍
受保护的技术使用者:浙江大华技术股份有限公司
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1167513.html

最新回复(0)