本发明涉及用户行为分析,具体而言,涉及一种基于核密度估计的事件发生时间概率预测方法及系统。
背景技术:
1、对于电子商务平台,能够准确地预测用户的交互事件(例如:发送消息、点赞、点击、购买等)的发生时间,对于提高用户体验和满意度具有至关重要的作用。
2、现有的自回归预测或深度学习神经网络等模型主要针对用户的交互行为或网络拓扑进行预测,尽管能够在特定领域显示出一定的有效性,但高度的数据依赖性意味着不准确或不完整的历史交互数据可能会削弱预测效果。特别是深度学习神经网络等模型,还需要大量的计算资源和计算时间,此外,深度学习神经网络等模型的复杂性也导致其难以向用户和服务提供者清晰地解释其预测逻辑和决策依据,再加上其潜在的过拟合风险和应用局限性,使得现有技术在实际应用中面临诸多考验。
技术实现思路
1、本发明提供一种基于核密度估计的事件发生时间概率预测方法及系统,用于解决现有技术对用户行为预测时存在的问题。
2、在第一方面,本发明实施例中提供一种基于核密度估计的事件发生时间概率预测方法,所述方法流程如下:
3、获取历史交互数据,并且对历史交互数据进行数据清洗和数据预处理,以得到样本数据集;
4、基于样本数据集中的历史交互数据构建关于所有用户的一级核密度估计函数;
5、基于权重机制对一级核密度估计函数进行重建,以得到关于特定用户的二级核密度估计函数;
6、基于二级核密度估计函数预测特定用户交互行为发生的时间概率。
7、于上述实施例中,本发明采用核密度估计作为主要的分析工具,能够提供一个非参数化的方式来估计连续随机变量的概率密度函数,从而更好地捕获用户行为的细节;同时,采用的非机器学习模型的方式,使得预测模型的可解释性强,计算速度快,资源消耗少,可以根据业务规则需要随时灵活调整。与此同时,不仅对单一用户的行为进行周期性分析,而且还与所有用户的平均行为进行对比,更有助于更准确地描绘出特定用户的行为模式,由于关于所有用户的预测模型的存在,使得对于新用户或者数据稀疏的用户,也有一定的处理能力。
8、作为本申请一些可选实施方式,对历史交互数据进行数据清洗包括对历史交互数据的异常情况进行错误修正、缺失补充以及重复删除处理。
9、于上述实施例中,本发明通过对历史数据进行数据清洗能够确保数据的准确性和完整性。
10、作为本申请一些可选实施方式,所述历史交互数据包括用户编号、时间戳、交互行为。
11、作为本申请一些可选实施方式,对历史交互数据进行数据预处理包括对历史交互数据的时间戳进行日期舍弃、时间分类以及时间转化处理。
12、于上述实施例中,本发明通过对历史交互数据进行预处理,能够简化预测模型复杂度,降低数据的季节性和偶然性影响并便于识别通用模式。
13、作为本申请一些可选实施方式,基于样本数据集中的历史交互数据构建关于所有用户的一级核密度估计函数的流程如下:
14、选择核密度估计的核函数以及带宽;
15、对样本数据集中的历史交互数据进行边界扩展处理,以得到连续的历史交互数据;
16、基于核函数、带宽以及连续的历史交互数据执行核密度估计以及规范化处理,以得到关于所有用户的一级核密度估计函数。
17、于上述实施例中,本发明通过选择合适的核函数和带宽,能够捕获多模态的数据密度关系,并且呈现平滑的关系曲线;并且通过对历史交互数据进行边界扩充处理,能够确保在整个日内周期内估计的连续性和平滑性,有效地处理了周期性数据边界问题,提高了预测模型在处理时间数据时的准确性和连续性。
18、作为本申请一些可选实施方式,基于权重机制对一级核密度估计函数进行重建,以得到关于特定用户的二级核密度估计函数的流程如下:
19、计算样本数据集中的历史交互数据关于特定用户的权重值以及非特定用户的权重值;
20、将特定用户的权重值以及非特定用户的权重值代入一级核密度估计函数重新进行核密度估计,以得到关于特定用户的二级核密度估计函数。
21、于上述实施例中,本发明利用特定用户的历史数据对一级核密度估计函数进行微调,生成一个为特定用户量身定制的周期性模型,能够更加准确捕捉特定用户的行为习惯。
22、作为本申请一些可选实施方式,基于二级核密度估计函数预测特定用户交互行为发生的时间概率的流程如下:
23、基于关于特定用户的二级核密度估计函数计算特定用户在特定时刻发生交互行为的概率;
24、基于关于特定用户的二级核密度估计函数计算特定用户在特定时间段内发生交互行为的概率。
25、于上述实施例中,本发明通过二级核密度估计函数对单一时刻的一种行为进行预测,还能对一段时间内的一种行为、多种行为进行概率估计,增加了实用性。
26、在第二方面,本发明提供一种基于核密度估计的事件发生时间概率预测系统,所述系统包括:
27、交互数据采集单元,所述交互数据采集单元用于获取历史交互数据,并且对历史交互数据进行数据清洗和数据预处理,以得到样本数据集;
28、核密度估计函数单元,所述核密度估计函数单元基于样本数据集中的历史交互数据构建关于所有用户的一级核密度估计函数;并且基于权重机制对一级核密度估计函数进行重建,以得到关于特定用户的二级核密度估计函数;
29、时间概率预测单元,所述时间概率预测单元基于二级核密度估计函数预测特定用户交互行为发生的时间概率。
30、在第三方面,本发明提供一种计算机设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的算机程序,所述处理器执行计算机程序时实现所述一种基于核密度估计的事件发生时间概率预测方法。
31、在第四方面,本发明提供一种计算机可读存储介质,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现所述一种基于核密度估计的事件发生时间概率预测方法。
32、本发明的有益效果如下:
33、1.本发明采用核密度估计作为主要的分析工具,能够提供一个非参数化的方式来估计连续随机变量的概率密度函数,从而更好地捕获用户行为的细节;同时,采用的非机器学习模型的方式,使得预测模型的可解释性强,计算速度快,资源消耗少,可以根据业务规则需要随时灵活调整。
34、2.本发明不仅对单一用户的行为进行周期性分析,而且还与所有用户的平均行为进行对比,更有助于更准确地描绘出特定用户的行为模式,由于关于所有用户的预测模型的存在,使得对于新用户或者数据稀疏的用户,也有一定的处理能力,同时通过对一级核密度估计函数和二级核密度估计函数曲线图的叠加,可以理解和比较特定用户与平均用户的行为模式,从而更加直观地洞察用户行为。
1.一种基于核密度估计的事件发生时间概率预测方法,其特征在于,所述方法流程如下:
2.根据权利要求1所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,对历史交互数据进行数据清洗包括对历史交互数据的异常情况进行错误修正、缺失补充以及重复删除处理。
3.根据权利要求1所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,所述历史交互数据包括用户编号、时间戳、交互行为。
4.根据权利要求3所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,对历史交互数据进行数据预处理包括对历史交互数据的时间戳进行日期舍弃、时间分类以及时间转化处理。
5.根据权利要求1所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,基于样本数据集中的历史交互数据构建关于所有用户的一级核密度估计函数的流程如下:
6.根据权利要求1所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,基于权重机制对一级核密度估计函数进行重建,以得到关于特定用户的二级核密度估计函数的流程如下:
7.根据权利要求1所述的一种基于核密度估计的事件发生时间概率预测方法,其特征在于,基于二级核密度估计函数预测特定用户交互行为发生的时间概率的流程如下:
8.一种基于核密度估计的事件发生时间概率预测系统,其特征在于,所述系统包括:
9.一种计算机设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机程序,其特征在于:所述处理器执行计算机程序时实现权利要求1-7中任一项所述一种基于核密度估计的事件发生时间概率预测方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-7中任一项所述一种基于核密度估计的事件发生时间概率预测方法。
