本发明涉及因果效应估计,尤其涉及一种基于双机器学习的因果效应估计方法、系统、设备及介质。
背景技术:
1、推断因果效应在医疗、金融、营销等领域都至关重要,它有助于解答人们常见的反事实推断,也就是评估干预或控制后的结果相较于另一种潜在结果的差异有多大;此处提到的两种潜在结果分别为干预后的结果和控制后的结果,但确定对对象进行干预或控制后,只能观测到一种潜在结果;例如确定进行干预后,另一种潜在结果即为控制后的结果,是无法进行观测的。
2、但是现有主流因果效应推断方法缺乏统计性能保障,在复杂或高维问题中表现较差,因此,有必要研究新的方案以提升因果效应估计性能,以便于更好的解答人们常见的反事实推断。
技术实现思路
1、本发明的目的是提供一种基于双机器学习的因果效应估计方法、系统、设备及介质,可以提升因果效应估计性能,从而更好的解答人们常见的反事实推断。
2、本发明的目的是通过以下技术方案实现的:
3、一种基于双机器学习的因果效应估计方法,包括:
4、收集所属领域的观测数据,所述观测数据包括:观测对象的信息、作用于观测对象的事物类型、以及事物类型作用于观测对象后的结果;
5、对所有观测数据,根据观测对象的信息进行k-均值聚类,将所有观测数据划分为k个类别;
6、对于每一类别的观测数据,随机划分为k折,每一次取出其中k-1折数据结合双机器学习模型来获得回归函数估计量和倾向得分估计量,利用回归函数估计量和倾向得分估计量在剩余一折数据上估计因果效应,重复k次后,综合获得的k个因果效应估计量获得相应类别的观测数据的因果效应估计结果。
7、一种基于双机器学习的因果效应估计系统,包括:
8、数据收集单元,用于收集所属领域的观测数据,所述观测数据包括:观测对象的信息、作用于观测对象的事物类型、以及事物类型作用于观测对象后的结果;
9、聚类单元,用于对所有观测数据,根据观测对象的信息进行k-均值聚类,将所有观测数据划分为k个类别;
10、因果效应估计单元,用于对于每一类别的观测数据,随机划分为k折,每一次取出其中k-1折数据结合双机器学习模型来获得回归函数估计量和倾向得分估计量,利用回归函数估计量和倾向得分估计量在剩余一折数据上估计因果效应,重复k次后,综合获得的k个因果效应估计量获得相应类别的观测数据的因果效应估计结果。
11、一种处理设备,包括:一个或多个处理器;存储器,用于存储一个或多个程序;
12、其中,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器实现前述的方法。
13、一种可读存储介质,存储有计算机程序,当计算机程序被处理器执行时实现前述的方法。
14、由上述本发明提供的技术方案可以看出,基于双机器学习,可以灵活地选取回归函数和倾向得分的估计方法,且在均方根误差意义下,即使回归函数和倾向得分的估计的收敛速率仅为n-1/4,因果效应仍然是渐进正态的;基于双机器学习,提高了模型的鲁棒性,可以有效地处理高维特征;基于聚类,可以通过大量控制样本的信息来解决干预样本不足带来的问题;总体来说,通过本发明提供的方案可以提升因果效应估计性能,获得更为准确的因果效应估计结果,从而更好的解答人们常见的反事实推断。
1.一种基于双机器学习的因果效应估计方法,其特征在于,包括:
2.根据权利要求1所述的一种基于双机器学习的因果效应估计方法,其特征在于,所述对所有观测数据,根据观测对象的信息进行k-均值聚类,将所有观测数据划分为k个类别包括:
3.根据权利要求1所述的一种基于双机器学习的因果效应估计方法,其特征在于,对于每一类别的观测数据,随机划分为k折,每一次取出其中k-1折数据结合双机器学习模型来获得回归函数估计量和倾向得分估计量包括:
4.根据权利要求3所述的一种基于双机器学习的因果效应估计方法,其特征在于,所述利用回归函数估计量和倾向得分估计量在剩余一折数据上估计因果效应包括:
5.根据权利要求1或4所述的一种基于双机器学习的因果效应估计方法,其特征在于,所述综合获得的k个因果效应估计量获得相应类别的观测数据的因果效应估计结果包括:
6.根据权利要求1所述的一种基于双机器学习的因果效应估计方法,其特征在于,还包括:对于给定的观测对象的信息x,预测因果效应,即根据给定的观测对象的信息x,通过聚类获得对应类别h(x),将类别h(x)上的因果效应估计结果作为因果效应估计结果
7.一种基于双机器学习的因果效应估计系统,其特征在于,包括:
8.一种处理设备,其特征在于,包括:一个或多个处理器;存储器,用于存储一个或多个程序;
9.一种可读存储介质,存储有计算机程序,其特征在于,当计算机程序被处理器执行时实现如权利要求1~6任一项所述的方法。
