基于随机森林算法的胰岛素泵评测方法

专利检索2026-07-13  16


本发明涉及一种药物检测领域的技术,具体是一种基于随机森林算法的胰岛素泵评测方法。


背景技术:

1、胰岛素泵是一种持续、精确地输送胰岛素的设备,它可以帮助糖尿病患者更好地控制血糖水平。但胰岛素泵在使用过程中可能因患者存在个体差异而导致效果不佳。因此,根据患者的一般临床资料、糖脂代谢指标及胰岛功能等数据判断患者是否需要使用胰岛素泵治疗是亟待解决的问题。目前需要全新的评测方法根据患者的临床数据判断是否需要采用胰岛素泵治疗。


技术实现思路

1、本发明针对现有技术存在的上述不足,提出一种基于随机森林算法的胰岛素泵评测方法,以未接受胰岛素泵的患者的数据作为输入,通过由随机森林算法训练得到的胰岛素泵药效模型,最终可以预估该患者使用胰岛素泵后的血糖情况。该评估方法适用于数据特征多,数据量较少的情况。

2、本发明是通过以下技术方案实现的:

3、本发明涉及一种基于随机森林算法的胰岛素泵评测方法,通过胰岛素泵的临床数据,构建出初始数据集,在初始数据集上通过随机森林算法训练得到初始模型。在选择指定的已训练好的评估模型后,通过患者临床数据指标的输入可以得到包含模型评估未接受治疗的患者通过胰岛素泵泵后血糖数值,进行胰岛素泵对血糖影响的预测评估。

4、所述方法具体包括:

5、步骤一:通过胰岛素泵的临床数据,构建出初始数据集,具体包括:胰岛素泵的临床数据包含以下指标(胰岛素泵治疗前和治疗后):性别(男1女0)、年龄、吸烟史(有1无0)、饮酒史(有1无0)、家族史(阳1阴0)、高血压(0无1级2级3级)、身高(m)、泵前体重(kg)、泵前颈围、泵前腰围、泵前臀围、泵前bmi、泵前收缩压、泵前舒张压、泵前空腹血糖、泵前餐后2h血糖、泵前空腹ins、泵前2h ins、泵前空腹c-p、泵前空腹2h c-p、泵前空腹甘油三酯、泵前空腹ldl、泵前空腹总胆固醇、泵前空腹糖化血红蛋白、homa-ir。这25个指标作为血糖评估的重要指标是输入模型关键部分。将每位患者的上述指标提取,进行缺省值处理,构建出初始数据集。

6、步骤二:在初始数据集上通过随机森林算法训练得到初始模型,具体包括:鉴于胰岛素泵药效评估数据库有较多的输入特征,且期望返回两个回归值,因此采用回归模型进行评估。本模型由随机森林作为训练方法,构建400棵决策树进行实现。

7、在每次决策的过程中,输入变量均是步骤一当中的25个指标,可以通过基尼系数或者通过信息增益公式:g(d,a)=h(d)-h(d|a),其中:信息增益是指特征a(特征是数据中的每一个指标)对训练数据集d的信息增益g(d,a)定义为数据集d的信息熵h(d)与特征a给定条件下d的信息条件熵h(d|a)之差。

8、通过400棵决策树构建出随机森林模型rf,以一位患者的25个指标作为输入,可以得到:[y1,y2]=rf(x1,x2,....,x25),其中:y1和y2分别表示泵后空腹血糖和泵后餐后2h血糖,x1~x25为上述25个指标。模型可以批量输入患者数据。

9、步骤三:模型可以根据不同的训练数据进行调整,通过初始模型或通过新的临床数据集训练的新模型,其中初始模型的权重weightori,通过已有的数据训练得到的新模型,只能通过接口调用;本地模型的权重weightlocal,根据需求选取本地训练得到的.joblib文件进行调用。

10、步骤四:选择指定模型后,选择进行:在指定模型上通过新的临床数据集继续训练得到需要的模型并保存到本地或将未接受治疗的患者数据构建的数据集输入指定模型从而获取患者通过胰岛素泵治疗后的血糖情况,具体包括:当选择继续训练指定模型,则从本地导入包含指定模型未训练过的已使用胰岛素泵的患者临床数据的文件,得到新的模型权重weightnew并根据需要将新模型保存到本地;当选择获取未经过治疗的患者通过胰岛素泵泵后的血糖情况,则从本地导入包含未接受治疗的患者数据构建的数据的文件,得到包含模型评估未接受治疗的患者通过胰岛素泵泵后血糖情况的文件。

11、本发明涉及一种实现上述方法的系统,包括:数据处理单元、模型训练单元和血糖预测单元,其中:数据处理单元根据患者的临床数据信息,进行数据预处理,得到用于训练随机森林模型的数据集;模型训练单元根据构建的数据集、构造决策树并模拟决策过程,得到决策模型;血糖预测单元根据不含血糖值的临床数据,输入到模型中,通过模型预测,得到对应的血糖预测值。

12、技术效果

13、本发明涉及一种实现上述方法的系统,包括:数据处理单元、模型训练单元、血糖预测单元,其中:数据处理单元根据患者的临床数据信息,进行数据预处理,得到用于训练随机森林模型的数据集;模型训练单元根据上述构建的数据集,构造决策树,模拟决策过程,得到决策模型;血糖预测单元根据不含血糖值的临床数据,输入到模型中,通过模型预测,得到对应的血糖预测值。

14、本发明利用随机森林算法,无需对数据进行特征选择,可以在自动处理缺失值和不平衡数据的同时对于异常值具有很好的鲁棒性。模型可以接受批量数据快速生成结果,性能得到很大的提升,通过计算各个特征在决策树中的贡献来评估特征的重要性并选择最重要的特征并进行特征选择。



技术特征:

1.一种基于随机森林算法的胰岛素泵评测方法,其特征在于,通过胰岛素泵的临床数据,构建出初始数据集,在初始数据集上通过随机森林算法训练得到初始模型,在选择指定的已训练好的评估模型后,通过患者临床数据指标的输入得到包含模型评估未接受治疗的患者通过胰岛素泵泵后血糖数值,进行胰岛素泵对血糖影响的预测评估。

2.根据权利要求1所述的基于随机森林算法的胰岛素泵评测方法,其特征是,所述的临床数据包括:胰岛素泵治疗前和治疗后、性别、年龄、吸烟史、饮酒史、家族史、高血压、身高、泵前体重、泵前颈围、泵前腰围、泵前臀围、泵前bmi、泵前收缩压、泵前舒张压、泵前空腹血糖、泵前餐后2h血糖、泵前空腹ins、泵前2hins、泵前空腹c-p、泵前空腹2hc-p、泵前空腹甘油三酯、泵前空腹ldl、泵前空腹总胆固醇、泵前空腹糖化血红蛋白、homa-ir。

3.根据权利要求1或2所述的基于随机森林算法的胰岛素泵评测方法,其特征是,所述的临床数据经缺省值处理,构建出初始数据集。

4.根据权利要求1所述的基于随机森林算法的胰岛素泵评测方法,其特征是,所述的随机森林算法,通过构建400棵决策树进行实现,在每次决策的过程中,输入变量均是步骤一当中的25个指标,通过信息增益公式:g(d,a)=h(d)-h(d|a),其中:信息增益是指特征a(特征是数据中的每一个指标)对训练数据集d的信息增益g(d,a)定义为数据集d的信息熵h(d)与特征a给定条件下d的信息条件熵h(d|a)之差;通过400棵决策树构建出随机森林模型rf,以一位患者的25个指标作为输入,得到:[y1,y2]=rf(x1,x2,....,x25),其中:y1和y2分别表示泵后空腹血糖和泵后餐后2h血糖,x1~x25为上述25个指标,模型批量输入患者数据。

5.根据权利要求1所述的基于随机森林算法的胰岛素泵评测方法,其特征是,所述的交互方式,具体包括:选择指定模型后,选择进行:在指定模型上通过新的临床数据集继续训练得到需要的模型并保存到本地或将未接受治疗的患者数据构建的数据集输入指定模型从而获取患者通过胰岛素泵治疗后的血糖情况,具体包括:当选择继续训练指定模型,则从本地导入包含指定模型未训练过的已使用胰岛素泵的患者临床数据的文件,得到新的模型权重weightnew并根据需要将新模型保存到本地;当选择获取未经过治疗的患者通过胰岛素泵泵后的血糖情况,则从本地导入包含未接受治疗的患者数据构建的数据的文件,得到包含模型评估未接受治疗的患者通过胰岛素泵泵后血糖情况的文件。

6.一种实现权利要求1-5中任一所述方法的胰岛素泵评测系统,其特征在于,包括:数据处理单元、模型训练单元和血糖预测单元,其中:数据处理单元根据患者的临床数据信息,进行数据预处理,得到用于训练随机森林模型的数据集;模型训练单元根据构建的数据集、构造决策树并模拟决策过程,得到决策模型;血糖预测单元根据不含血糖值的临床数据,输入到模型中,通过模型预测,得到对应的血糖预测值。


技术总结
一种基于随机森林算法的胰岛素泵评测方法,通过胰岛素泵的临床数据,构建出初始数据集,在初始数据集上通过随机森林算法训练得到初始模型。在选择指定的已训练好的评估模型后,通过患者临床数据指标的输入得到包含模型评估未接受治疗的患者通过胰岛素泵泵后血糖数值,进行胰岛素泵对血糖影响的预测评估。本发明以未接受胰岛素泵的患者的临床数据作为输入,通过由随机森林算法训练得到的胰岛素泵药效模型,最终可以预估该患者使用胰岛素泵后的血糖情况,从而判断是否需要使用胰岛素泵,适用于特征多,数据量较少的情况。

技术研发人员:郭啸羽,沈红斌,贾珏,袁国跃,杨玲
受保护的技术使用者:上海交通大学
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1165145.html

最新回复(0)