本发明涉及数据处理,尤其涉及一种客户反应热点问题的挖掘办法。
背景技术:
1、在客服场景下,客户通过im或者电话的形式反馈产品或者服务中的问题。但在大型企业内部,产品功能复杂:如产品的服务涉及到很多的第三方供应商,其中涉及到的问题更加复杂多变,无法及时发现。或者产品存在比较隐秘的缺陷,需要在特定的条件下才会触发。
2、企业往往针对各式各样的问题,会建立一个具有三层的标签树,为每一个问题打上一到多个标签。标签树需要随着业务的发展不断进行更新,成本非常的高。另外就是标签树调整的时间周期比较长。在激烈竞争的市场中,产品供应商都希望自己的产品中的问题能够被快速发现,尽快系统性的解决问题。标签树中的上层节点,即第一层和第二层相对固定,底层,即第三层节点因上述业务的变化调整的比较快,但现有的方法无法适应实际业务的需要。
3、为了解决上述问题,本发明提出一种客户反应热点问题的挖掘办法。
技术实现思路
1、本发明的目的在于提出一种客户反应热点问题的挖掘办法以解决背景技术中所提出的问题:
2、现有问题标签树更新成本高,调整的时间周期比较长,无法适应实际业务的需要。
3、为了实现上述目的,本发明采用了如下技术方案:
4、一种客户反应热点问题的挖掘办法,包括如下步骤:
5、s1:建立三层企业问题标签树分;
6、s2:采集客户与客服对话数据并对客户问题在企业问题标签树中进行第一层、第二层节点的划分;
7、s3:将划分后的客户与客服对话数据按照对话角色进行拆分,分别获取客户说话的全部内容与客服说话的全部内容;
8、s4:将s3中获取的客户说话的全部内容与客服说话的全部内容输入至sccl聚类算法中进行聚类分析,根据聚类结果进行热点问题的挖掘。
9、优选地,所述s3中,将一个含有m个对话样本的minibatch:中的xi按照对话角色拆分为和再形成一个新的minibatch,得到其中,表示一个minibatch中,第i个对话中,客服的全部说话内容;表示当前minibatch中,第i个对话中,客户的全部说话内容。
10、优选地,所述s4中,获取s3中的客户说话的全部内容与客服说话的全部内容后,基于单词嵌入的方式进行对话内容数据向量的提取,并将提取的对话内容数据向量输入至sccl聚类算法中进行聚类分析。
11、优选地,s4中所述sccl聚类算法具体如下:
12、令其中,g为基于个体的对比学习头,ψ为特征编码器,对于得到损失函数如下:
13、
14、
15、
16、其中,表示指示函数;τ表示温度参数;sim(·)为归一化的点积输出;t为向量的转置;||·||为向量的模长;
17、ba中所有客服的对话样本的平均损失值如下:
18、
19、聚类共有k个类别,一个minibatch:b中每一个对话样本xi在聚类的表征空间中被表示为:ψ(xi),k个聚类,每一类在聚类的表征空间中的重心为:μk,{k=1,…,k},令ej=ψ(xj),ej为对话样本在原始集合b中的表示,使用t分布计算将xj分配到第k个聚类的第th簇的概率qjk:
20、
21、其中,α为t分布的自由度;
22、引入一个辅助的概率分布pjk:
23、
24、
25、其中,fk表示聚类k中占有本批minibatch中的对话样本的频率;
26、基于kl散度计算高置信的点在pjk以及qjk具有更加接近的分布
27、
28、聚类部分的损失函数表示如下lcluster:
29、
30、总的目标函数l如下:
31、
32、其中,η为损失对比因子。
33、与现有技术相比,本发明提供了一种客户反应热点问题的挖掘办法,具备以下有益效果:
34、本发明基于聚类算法对标签树底层节点进行更新,大大缩短了节点更新时长和更新步骤,降低了标签树的更新成本。通过按照对话角色对对话样本拆分进行对比学习,可以大幅度提升对话场景数据聚类效果;根据聚类结果进行客户对话数据的深层挖掘,获取客户问题中的热点问题,便于商家及时止损,提升产品效益。
1.一种客户反应热点问题的挖掘办法,其特征在于,包括如下步骤:
2.根据权利要求1所述的一种客户反应热点问题的挖掘办法,其特征在于,所述s3中,将一个含有m个对话样本的minibatch:中的xi按照对话角色拆分为和再形成一个新的minibatch,得到其中,表示一个minibatch中,第i个对话中,客服的全部说话内容;表示当前minibatch中,第i个对话中,客户的全部说话内容。
3.根据权利要求2所述的一种客户反应热点问题的挖掘办法,其特征在于,所述s4中,获取s3中的客户说话的全部内容与客服说话的全部内容后,基于单词嵌入的方式进行对话内容数据向量的提取,并将提取的对话内容数据向量输入至sccl聚类算法中进行聚类分析。
4.根据权利要求3所述的一种客户反应热点问题的挖掘办法,其特征在于,s4中所述sccl聚类算法具体如下:
