本申请涉及深度学习,具体而言,涉及一种大语言模型的测评方法、装置、电子设备及存储介质。
背景技术:
1、大语言模型(large language model,llm)是基于海量文本数据训练的深度学习模型。与普通模型相比,大语言模型的参数数量非常多,通常在百万甚至数亿级别,而普通模型的参数数量只有几千或几万。这意味着大语言模型能够处理更复杂、更全面的数据,并从中学习到更多的模式和规律。
2、大语言模型在近年来得到了迅速发展,但其本身的不确定性较高,导致大语言模型在迭代后整体的效果难以预估,每次基于大语言模型的正式服务迭代修改上线时都需要十分谨慎。
技术实现思路
1、本申请实施例的目的在于提供一种大语言模型的测评方法、装置、电子设备及存储介质,用以实现自动测评大语言模型的技术效果。
2、本申请实施例第一方面提供了一种大语言模型的测评方法,所述方法应用于测评系统,所述测评系统包括代理agent模块;所述方法包括:
3、调用待测评的应答大语言模型对场景问题进行应答,得到测试对话;
4、将目标测评任务与所述测试对话输入至目标agent模块;
5、通过所述目标agent模块基于所述目标测评任务对所述测试对话进行测评,得到对所述应答大语言模型的测评结果。
6、在上述实现过程中,利用了包括agent模块的测评系统对待测评的应答大语言模型进行测评。通过将应答大语言模型对场景问题进行应答后生成的测试对话、以及目标测评任务输入目标agent模块,使得目标agent模块可以对测试对话进行测评,从而可以得到应答大语言模型的整体效果,整个过程可以自动化执行,无需人工对模型进行审核,从而节约了人力成本。
7、进一步地,所述agent模块包括事实性agent模块、简洁性agent模块、与口语性agent模块;测评任务包括与所述事实性agent模块对应的事实性测评任务、与所述简洁性agent模块对应的简洁性测评任务、以及与所述口语性agent模块对应的口语性测评任务。
8、在上述实现过程中,从事实性、简洁性、与口语性三个维度分别对应答大语言模型进行测评,可以较全面地评价模型效果,为模型迭代提供了一定的指导意义。
9、进一步地,所述场景问题是通过模拟大语言模型根据设定的对话场景生成的。
10、在上述实现过程中,利用模拟大语言模型生成在设定的对话场景中的场景问题,使得模拟大语言模型与应答大语言模型之间可以进行模拟对话。整个过程无需人为参与,大大提高了模型测评的自主性与智能性。
11、进一步地,所述将目标测评任务与所述测试对话输入至目标agent模块,包括:
12、将所述目标测评任务与所述测试对话输入所述目标agent模块的提示prompt模板中;
13、将所述prompt模板输入至所述目标agent模块。
14、在上述实现过程中,利用prompt模板将目标测评任务与测试对话输入至目标agent模块,目标agent模块可以对测试对话进行测评,从而可以得到应答大语言模型的整体效果,整个过程可以自动化执行,无需人工对模型进行审核,从而节约了人力成本。
15、进一步地,所述测评结果包括目标agent模块输出的评分。
16、在上述实现过程中,利用评分来量化应答大语言模型的效果,使得应答大语言模型的整体效果更加直观。同时也有利于不同应答大语言模型之间,或者不同迭代次数的应答大语言模型之间的优劣对比。
17、进一步地,所述方法还包括:
18、若所述测试对话包括预设的黑名单内容,对所述评分进行减分处理。
19、在上述实现过程中,通过设定黑名单内容扣分机制,确保应答大语言模型不会主动生成违法违规内容、或应当对方提出的违法违规问题,保证了应答大语言模型的正确使用。
20、进一步地,所述方法应用于销售场景;所述应答大语言模型为销售大语言模型;所述场景问题包括所述销售场景中消费者提问的问题。
21、在上述实现过程中,在大语言模型上线之前通过所述测评方法对销售大语言模型进行测评,可以得到销售大语言模型的整体效果,整个过程可以自动化执行,无需人工对模型进行审核,从而节约了人力成本。
22、本申请实施例第二方面提供了一种大语言模型的测评装置,所述装置应用于测评系统,所述测评系统包括代理agent模块;所述装置包括:
23、调用模块,用于调用待测评的应答大语言模型对场景问题进行应答,得到测试对话;
24、输入模块,用于将目标测评任务与所述测试对话输入至目标agent模块;
25、测评模块,用于通过所述目标agent模块基于所述目标测评任务对所述测试对话进行测评,得到对所述应答大语言模型的测评结果。
26、本申请实施例第三方面提供了一种电子设备,所述电子设备包括:
27、处理器;
28、用于存储处理器可执行指令的存储器;
29、其中,所述处理器调用所述可执行指令时第一方面任一所述方法的操作。
30、本申请实施例第四方面提供了一种计算机可读存储介质,其上存储有计算机指令,所述计算机指令被处理器执行时实现第一方面任一所述方法的步骤。
1.一种大语言模型的测评方法,其特征在于,所述方法应用于测评系统,所述测评系统包括代理agent模块;所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述agent模块包括事实性agent模块、简洁性agent模块、与口语性agent模块;测评任务包括与所述事实性agent模块对应的事实性测评任务、与所述简洁性agent模块对应的简洁性测评任务、以及与所述口语性agent模块对应的口语性测评任务。
3.根据权利要求1所述的方法,其特征在于,所述场景问题是通过模拟大语言模型根据设定的对话场景生成的。
4.根据权利要求1所述的方法,其特征在于,所述将目标测评任务与所述测试对话输入至目标agent模块,包括:
5.根据权利要求1所述的方法,其特征在于,所述测评结果包括目标agent模块输出的评分。
6.根据权利要求5所述的方法,其特征在于,所述方法还包括:
7.根据权利要求1-6任一所述的方法,其特征在于,所述方法应用于销售场景;所述应答大语言模型为销售大语言模型;所述场景问题包括所述销售场景中消费者提问的问题。
8.一种大语言模型的测评装置,其特征在于,所述装置应用于测评系统,所述测评系统包括代理agent模块;所述装置包括:
9.一种电子设备,其特征在于,所述电子设备包括:
10.一种计算机可读存储介质,其特征在于,其上存储有计算机指令,所述计算机指令被处理器执行时实现权利要求1-7任一所述方法的步骤。
