本发明涉及数字人领域,尤其涉及一种数字人与数字空间云端交互方法。
背景技术:
1、数字人是通过计算机模拟人类的技术创造出来的;数字空间是一个虚拟的环境,其中存在着数字世界和计算能力;数字人与数字空间之间的云端交互方法包括以下几种;首先,数字人可以通过云计算技术将自己的数据存储在云端;云计算可以提供高速的数据存储和处理能力,让数字人能够随时随地访问和管理自己的数据,实现云端存储和云端计算;其次,数字人可以通过云服务获取各种资源和功能;云服务可以提供虚拟化的资源,如计算资源、存储资源和网络资源,使数字人能够在数字空间中获得所需的计算能力和存储空间;此外,云服务还可以提供各种功能服务,如人工智能算法和大数据分析,帮助数字人更好地实现自己的任务和目标;再次,数字人可以通过网络与其他数字人进行互动和协作;数字人可以通过互联网连接到数字空间,与其他数字人进行沟通、交流和协作;这种互动和协作可以通过各种方式实现,如即时通讯、社交媒体和虚拟会议等;最后,数字人还可以通过云端应用程序来扩展自己的功能和能力;云端应用程序可以提供各种应用和工具,如在线办公套件、音视频编辑软件和游戏等,帮助数字人更好地实现自己的任务和娱乐需求;总之,数字人与数字空间之间的云端交互方法包括数据存储与计算、云服务获取资源和功能、网络互动与协作,以及云端应用程序扩展功能和能力等;这些方法可以帮助数字人更好地利用数字空间的资源和能力,实现各种任务和目标;采用数字人终端作为信息接受的终端,当数字人终端采集到信息后,直接发送至数字空间,并不对采集到的信息进行处理和简化,数字人终端采集的信息包括文本信息、语音信息和图像信息,信息内容复杂繁多,因此数字人终端与数字空间的信息交互量大,对网络的要求高,因此相应的延迟大。
技术实现思路
1、为了克服采用数字人终端作为信息接受的终端,当数字人终端采集到信息后,直接发送至数字空间,并不对采集到的信息进行处理和简化,数字人终端采集的信息包括文本信息、语音信息和图像信息,信息内容复杂繁多,因此数字人终端与数字空间的信息交互量大,对网络的要求高,因此相应的延迟大的问题。
2、本发明的技术方案为:一种数字人与数字空间云端交互方法,包括有以下步骤:
3、s11:利用数字人终端中的语音采集设备、图像采集设备和文本采集设备中的一种或者多种采集用户的指令;其中,用户的指令包括语音指令、图像指令和文本指令中的一种或者多种;
4、s12:利用数字人终端对用户的指令进行初步处理,将用户的指令转换为可识别的且无多余信息的可识别文本指令,再利用数字人终端将初步处理之后得到的可识别文本指令发送至数字空间;
5、s13:将可识别文本指令在数字空间内进行再次处理,将可识别文本指令转换为标准化文本指令;
6、s14:将标准化文本指令根据数字空间内的预设信息进行分类;其中,数字空间内的预设信息的分类包括有交互指令、搜寻指令、问答指令、操控指令和功能指令;
7、s15:将分类之后的标准化文本指令在相应的分类内进行检索,检索完成之后发送相应的交互信息至数字人终端;
8、s16:数字人终端接收到交互信息后,根据交互信息的内容,进行视频播放操作、文本显示操作、语音播放操作和其他操作中的一种或者多种操作。
9、优选的,相对于现有技术采用数字人终端作为信息接受的终端,当数字人终端采集到信息后,直接发送至数字空间,并不对采集到的信息进行处理和简化,数字人终端采集的信息包括文本信息、语音信息和图像信息,信息内容复杂繁多,因此数字人终端与数字空间的信息交互量大,对网络的要求高,因此相应的延迟大,本方法通过利用数字人终端对采集到的信息进行初步处理和简单,将多余的信息进行剔除,再进行数字人终端和数字空间的交互,信息传输量较小,对网络的要求较低,且因为信息传输的量较小,数字人终端的响应延迟相应也会降低。
10、作为优选,在利用数字人终端中的语音采集设备对用户语音指令进行采集时,包括以下步骤:
11、s21:根据用户的指令或者出厂时预设的信息确定唤醒指令,并将唤醒指令转换为声音语谱图;
12、s22:采集用户的语音,并将用户的语音转换为声音语谱图,再利用加窗处理的方式将唤醒指令的声音语谱图与用户的语音的声音语谱图进行对比识别;
13、s23:当唤醒指令的声音语谱图与用户的语音的声音语谱图对比识别相似度达到70%或70%以上后,对用户的语音进行采集,当采集到的语音的分贝小于30分贝,且持续一秒之后,关闭语音采集设备,停止对语音的采集;
14、s24:等待语音采集停止三秒之后,重新启动语音采集设备,对用户的语音信息进行采集,并循环进行步骤s21-s24。
15、优选的,通过采用加窗处理的方式对在用户的语音信息中对唤醒指令进行识别,可以有效减少对储存空间的利用,且不需要数字人终端对用户的语音信息进行处理,减少数字人终端的工作量,节省资源,且通过语音采集后停止三秒再重新启动语音采集设备,一方面可以防止语音采集和唤醒指令识别对语音处理的影响,另一方面可以防止干扰噪音干扰唤醒指令识别,导致语音指令发生冲突。
16、作为优选,在利用数字人终端中的图像采集设备对用户的图像指令进行采集时,包括以下步骤:
17、s31:在启动后进入休眠状态,进行间隔式图像采集;其中,间隔式图像采集的时间间隔为1s,即每隔1s进行一次图像采集;
18、s32:采用基于阈值的分割方法对人像轮廓进行分割,并对人像的轮廓形状与预定的唤醒指令进行比对;
19、s33:当相似度大于76%时,启动数字人终端中的像采集设备,通过视频采集的方式对用户的视频图像进行采集;
20、s34:当视频图像的长度达到设定的阈值后,停止图像采集,关闭数字人终端中的像采集设备,等待5s之后,重新启动,循环进行步骤s31-s34。
21、作为优选,在利用数字人终端对用户的语音指令进行初步处理时,包括以下步骤:
22、s41:将采集到的语音指令利用声卡转换为数字化语音模拟信号,其中,采样频率大于信号中最高频率的两倍,表达公式为:fs max≥2*fmax;其中,fmax为用户语音频率的最大值,fmax设置为4000赫兹,采样频率设置为8000赫兹;
23、s42:对数字化语音模拟信号进行预处理,剔除数字化语音模拟信号中的高频部分,并采用半帧交叠的方式将数字化语音模拟信号进行分帧;
24、s43:对预处理后的数字化语音模拟信号进行特征提取;
25、s44:利用隐马尔可夫模型模板匹配法对提取出来的数字化语音模拟信号的特征进行匹配,从而实现将语音指令信息转换为文本指令。
26、作为优选,在利用数字人终端对用户的图像指令进行初步处理时,包括以下步骤:
27、s51:利用基于反卷积-升采样的setnet模型对每一帧图像中的人像轮廓图像与背景图像进行分割,并将背景图像剔除;
28、s52:利用基于fasterrcnn的人物目标检测模型对人像轮廓中的关键点进行检测;
29、s53:将统一关键点在不同帧的图像的位置进行连接,形成人体所有关键点的运动轨迹;
30、s54:根据关键点的运动情况,与预先录入的动作行为数据进行比对,生成图像的文本指令;其中,图像的文本指令包括有向左挥手、向右挥手、向上挥手、向下挥手、摆手、点头、摇头和眨眼等。
31、优选的,通过对语音指令进行识别,将语音指令转换为文本指令,可以有效减少语音指令的占用空间,因此可以大大减少信息传输的量,对网络的要求较低,且数字人终端的响应延迟相应也会降低,通过对图像指令进行初步识别,可以大大减少图像指令的占用空间,因此可以大大减少信息传输的量,对网络的要求较低,且数字人终端的响应延迟相应也会降低。
32、作为优选,在将可识别文本指令在数字空间内进行再次处理,将可识别文本指令转换为标准化文本指令时,包括以下步骤:
33、s61:对得到的可识别文本指令进行文本分割,根据从网络或者相关自定义数据中的词语信息和语句信息,将可识别文本指令的文本分割成多个单独存在的词语,形成文本词语集;
34、s62:去除文本词语集中的非必要词语;其中,非必要词语包括有停用词和结巴分词;
35、s63:将文本词语集中的词语标准化;其中,包括扩写缩写词、将具有近似示的词语转换为统一的词语以及对将未知词语利用网络进行搜索,并将其转换为已经记载的词语或者短语;
36、s64:将标准化后的文本词语集重新组成语句,并根据语句的句法判定语句中的关键词,形成标准化文本指令。
37、作为优选,在将标准化文本指令根据数字空间内的预设信息进行分类时,包括有以下步骤:
38、s71:根据步骤s64中所判定得到的语句的关键词进行分析,其中,分析时根据句法对关键词的权重占比进行分析;
39、s72:根据关键词的权重占比,选取核心关键词,根据核心关键词对标准化文本指令进行分类。
40、作为优选,在将分类之后的标准化文本指令在相应的分类内进行检索时,包括以下步骤:
41、s81:将步骤s72中得到的核心关键词在数字空间内响应的分类内进行搜索,将所有相关选项提取出来,形成待选数据;
42、s82:将步骤s64中得到的关键词放入待待选数据中进行搜索,对待选数据进行筛选;
43、s83:若经过筛选后的待选数据仅剩一条指令,则直接进行输出,若经过筛选后的待选数据剩余多条指令,则根据步骤s71中的权重占比对剩余的多条指令进行相关度判断,并根据相关度的大小对指令进行排序并输出;
44、s84:将输出的指令转换为交互信息发送至数字人终端。
45、优选的,通过将可识别文本指令进行分类后再进行检索,可以使得文本指令始终在相关的类别内进行检索,从而使得文本指令被判定为无关错误指令的概率减少,增加文本指令检索和判定的准确率,使得数字人更加智能,且使得即使用户所输入的信息与相应的预输入指令有差别,也可以根据类别输出相关性更高的选项,引导用户选择正确的指令,更加智能。
46、作为优选,交互指令用于用户与数字人进行交互,包括让数字人跳舞和让数字人唱歌等;搜寻指令用于用户搜寻想要的目的地或者物品等信息,包括寻找某个物品或者标志点的位置等;问答指令用于用户寻找想要的答案,包括天气和时间等;操控指令用于用户对数字人进行操控,包括改变数字人的形象、改变数字人的声音和改变数字人显示的大小等;功能指令用于用户对数字人终端进行多功能操控,包括通过数字人终端进行呼叫其他用户、控制数字人终端进行关机、控制数字人终端的功能开启和关闭等。
47、作为优选,在检索完成之后发送相应的交互信息至数字人终端时,发送的交互信息若为交互指令、搜寻指令、操控指令和功能指令中的一种,则交互信息则为简略的指令代码,发送的交互信息若为问答指令则为完整的答案文本;数字人终端内储存有与相应的数据,当数字人终端接收到数字空间所发送的交互指令、搜寻指令、操控指令或功能指令后,将指令代码在储存的数据中进行搜索,并根据搜索到的数据对用户进行反馈。
48、优选的,通过将交互信息转换为简略的指令代码进行输出,一方面可以减少数字空间的储存要求,另一方面可以减少信息传输的数据量,降低对网络的要求,且数字人终端的响应延迟相应也会降低。
49、本发明的有益效果:
50、1、相对于现有技术采用数字人终端作为信息接受的终端,当数字人终端采集到信息后,直接发送至数字空间,并不对采集到的信息进行处理和简化,数字人终端采集的信息包括文本信息、语音信息和图像信息,信息内容复杂繁多,因此数字人终端与数字空间的信息交互量大,对网络的要求高,因此相应的延迟大,本方法通过利用数字人终端对采集到的信息进行初步处理和简单,将多余的信息进行剔除,再进行数字人终端和数字空间的交互,信息传输量较小,对网络的要求较低,且因为信息传输的量较小,数字人终端的响应延迟相应也会降低;
51、2、通过对语音指令进行识别,将语音指令转换为文本指令,可以有效减少语音指令的占用空间,因此可以大大减少信息传输的量,对网络的要求较低,且数字人终端的响应延迟相应也会降低,通过对图像指令进行初步识别,可以大大减少图像指令的占用空间,因此可以大大减少信息传输的量,对网络的要求较低;
52、3、通过采用加窗处理的方式对在用户的语音信息中对唤醒指令进行识别,可以有效减少对储存空间的利用,且不需要数字人终端对用户的语音信息进行处理,减少数字人终端的工作量,节省资源,且通过语音采集后停止三秒再重新启动语音采集设备,一方面可以防止语音采集和唤醒指令识别对语音处理的影响,另一方面可以防止干扰噪音干扰唤醒指令识别,导致语音指令发生冲突。
1.一种数字人与数字空间云端交互方法;其特征在于:包括有以下步骤:
2.根据权利要求1所述的一种数字人与数字空间云端交互方法,其特征在于:在利用数字人终端中的语音采集设备对用户语音指令进行采集时,包括以下步骤:
3.根据权利要求2所述的一种数字人与数字空间云端交互方法,其特征在于:在利用数字人终端中的图像采集设备对用户的图像指令进行采集时,包括以下步骤:
4.根据权利要求3所述的一种数字人与数字空间云端交互方法,其特征在于:在利用数字人终端对用户的语音指令进行初步处理时,包括以下步骤:
5.根据权利要求4所述的一种数字人与数字空间云端交互方法,其特征在于:在利用数字人终端对用户的图像指令进行初步处理时,包括以下步骤:
6.根据权利要求5所述的一种数字人与数字空间云端交互方法,其特征在于:在将可识别文本指令在数字空间内进行再次处理,将可识别文本指令转换为标准化文本指令时,包括以下步骤:
7.根据权利要求6所述的一种数字人与数字空间云端交互方法,其特征在于:在将标准化文本指令根据数字空间内的预设信息进行分类时,包括有以下步骤:
8.根据权利要求7所述的一种数字人与数字空间云端交互方法,其特征在于:在将分类之后的标准化文本指令在相应的分类内进行检索时,包括以下步骤:
9.根据权利要求8所述的一种数字人与数字空间云端交互方法,其特征在于:交互指令用于用户与数字人进行交互,包括让数字人跳舞和让数字人唱歌等;搜寻指令用于用户搜寻想要的目的地或者物品等信息,包括寻找某个物品或者标志点的位置等;问答指令用于用户寻找想要的答案,包括天气和时间等;操控指令用于用户对数字人进行操控,包括改变数字人的形象、改变数字人的声音和改变数字人显示的大小等;功能指令用于用户对数字人终端进行多功能操控,包括通过数字人终端进行呼叫其他用户、控制数字人终端进行关机、控制数字人终端的功能开启和关闭等。
10.根据权利要求9所述的一种数字人与数字空间云端交互方法,其特征在于:在检索完成之后发送相应的交互信息至数字人终端时,发送的交互信息若为交互指令、搜寻指令、操控指令和功能指令中的一种,则交互信息则为简略的指令代码,发送的交互信息若为问答指令则为完整的答案文本;数字人终端内储存有与相应的数据,当数字人终端接收到数字空间所发送的交互指令、搜寻指令、操控指令或功能指令后,将指令代码在储存的数据中进行搜索,并根据搜索到的数据对用户进行反馈。
