本发明涉及植被覆盖度反演,特别涉及一种基于可解释性人工智能植被覆盖度反演性能优化方法。
背景技术:
1、目前,卫星遥感技术已成为全球和区域尺度获取植被参数的重要手段。基于卫星遥感数据的光谱信息可以较好地反演出植被参数信息,然而其反演结果需要实测数据验证和标定。受限于传统人工获取实测数据的局限性(特别是能与卫星遥感影像像元空间尺度相匹配的实测数据),可靠的验证方法成为fvc反演过程中的重点和难点。近年来,得益于无人机技术的快速发展,基于与卫星遥感影像像元空间尺度相匹配的无人机数据获取方法为解决此类问题提供了可能性,进一步增强了fvc反演精度的准确性。fvc反演方法主要分为传统回归模型法、像元二分法和机器学习法。基于数据驱动的机器学习方法(ml)不仅能充分捕捉因子之间的线性和非线性关系,还具有较强的稳定性和鲁棒性,因此被广泛应用于不同尺度或区域的fvc反演。总之,尽管ml已成为光谱信息与fvc之间的重要纽带,但是已有研究仅探讨了经典的ml在fvc反演上的适用性,对于xgboost、lightgbm、catboost以及stacking等集成模型的研究较少。
2、ml模型对fvc的反演性能除了受自身特点和数据假设的影响外,还受输入特征、模型超参数和下垫面异质性等因素影响。首先,合适的特征选择方法不仅能通过提取重要信息来增强模型的准确性、可解释性和效益性,还能降低过拟合风险。但单一的特征选择算法不仅会限制模型性能的提升空间,还容易陷入局部最优陷阱。尽管根据不同目的或区域提出的混合算法能在一定程度上提升模型的fvc反演性能,但并不能较好地解决局部最优问题。遗传算法(ga),是模仿自然进化论的元启发式优化算法,能够在大型搜索空间的寻优问题上获取到全局最优解,但在fvc反演的特征选择方面尚未得到应用。其次,模型超参数的合理设置可以最大化模型精度和最小化计算资源。gridsearchcv(gc)是一种通过穷举所有参数组合的超参数调优算法。穷举策略虽然是获取最优解的唯一办法,但需要消耗巨大的计算成本。因此,有必要探索新的超参数调优方法以权衡模型精度和计算成本。再次,虽然通过无人机获取的fvc“真值”保证了反演的准确性,但多数研究忽视了无人机实测数据所在位置的中心点与卫星影像的像元中心不匹配的问题,这使得原位测量的fvc并不能代表同一位置的遥感影像像元的fvc,从而降低了反演精度的准确性和反演结果的可靠性。因此,如何提升fvc原位测量数据的质量,是fvc反演中的重点和难点。最后,上述fvc反演研究仅从特征的相关性角度出发,将与目标相关性较高的特征作为输入,经过ml“黑箱”后输出反演结果。此过程不仅缺乏对模型适用性的充分认识,还缺乏对输入和输出因果性的详细解释。尽管ml的可解释性人工智能备受关注,但在fvc反演中仍然存在空白。因此,本发明提出一种基于可解释性人工智能植被覆盖度反演性能优化方法。
技术实现思路
1、基于上述fvc反演过程中存在的问题,本发明主要的研究目标为:(1)提出结合遗传算法(ga)和xgboost的特征选择方法(ga-xgb),并联合optuna调参方法形成ga-op组合,解决特征选择和参数调优在准确性和计算效益之间的平衡问题。(2)对比分析knn、svr、rf、xgboost、lightgbm、catboost和stacking模型在青藏高原高寒草地fvc中的反演性能。(3)提出ndvi变异系数法(ndvi-cv),研究下垫面异质性对fvc反演精度的影响,进一步提升fvc反演结果的可靠性。(4)利用shap值理论对机器学习模型进行全局性和局部性解释,揭示fvc反演中的“黑箱”现象,增强模型的可解释性。
2、本发明提供的一种基于可解释性人工智能植被覆盖度反演性能优化方法,包括以下步骤:
3、基于gee平台获取与实测目标区域对应的遥感影像数据集;
4、基于遗传算法和xgboost构建ga-xgb特征选择算法;
5、所述ga-xgb特征选择算法对所述遥感影像数据集进行特征选择得到全局最优特征子集;
6、构建堆栈集成模型,基于所述全局最优特征子集和所述堆栈集成模型得到植被覆盖度反演结果。
7、可选地,基于所述堆栈集成模型进行植被覆盖度反演的过程中还包括:将所述ga-xgb特征选择算法和optuna进行结合得到ga-op组合算法,基于所述ga-op组合算法对所述堆栈集成模型进行超参数调优。
8、可选地,基于沙普利加法解释方法得到所述全局最优特征子集对所述植被覆盖度反演结果的反演贡献度。
9、可选地,获取所述遥感影像数据集前,基于无人机进行目标区域数据采集得到实采数据,基于所述实采数据得到实测植被覆盖度数据的过程包括:
10、基于无人机获取目标区域得到航拍图像;
11、计算所述航拍图像中每个像素的egi,并设置初始分割阈值;
12、将每个像素的egi与所述初始分割阈值进行比较,确定植被和非植被得到分割结果;
13、将所述分割结果和所述航拍图像进行叠加,统计植被像元占总像元的比例得到实测植被覆盖度数据。
14、可选地,获取实测植被覆盖度数据后还包括基于归一化差异植被指数变异系数法修正所述实测植被覆盖度数据中下垫面异质性。
15、可选地,基于所述归一化差异植被指数变异系数法进行数据修正的过程包括:
16、基于所述航拍图像的中心点建立ndvi缓冲区;其中,所述ndvi缓冲区包括若干等大网格;
17、获取像元质心落入每个网格范围内的像元ndvi值,并计算ndvi值的变异系数;
18、设定阈值,当所述变异系数小于所述阈值,保留实测数据点,否则剔除;
19、基于保留的实测数据点得到修正后的实测植被覆盖度数据。
20、可选地,计算ndvi值的变异系数的计算公式为:
21、
22、式中,nc为ndvi的变异系数值,xi为第i个像元的ndvi,为所有像元的ndvi均值。
23、可选地,通过计算修正后的实测植被覆盖度数据和植被覆盖度反演结果之间的性能指标对所述堆栈集成模型的反演性能进行精度评估;
24、其中,所述性能指标包括:决定系数、均方根误差、相对分析误差、偏差和方差。
25、本发明具有如下技术效果:
26、本发明中的ga-op组合算法在计算成本和反演精度上要优于rfe-op和ga-gc,optuna调参方法在参数调优上具有巨大潜力。
27、ndvi-cv通过剔除高异质性区域被严重高估或者低估的数据来提升模型的反演性能,增强反演结果的可靠性。
28、shap从全局性和局部性角度揭示stacking模型和catboost模型反演的决策过程,可以进一步探索特征与目标之间的因果关系。
1.一种基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,基于所述堆栈集成模型进行植被覆盖度反演的过程中还包括:将所述ga-xgb特征选择算法和optuna进行结合得到ga-op组合算法,基于所述ga-op组合算法对所述堆栈集成模型进行超参数调优。
3.根据权利要求1所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,基于沙普利加法解释方法得到所述全局最优特征子集对所述植被覆盖度反演结果的反演贡献度。
4.根据权利要求1所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,获取所述遥感影像数据集前,基于无人机进行目标区域数据采集得到实采数据,基于所述实采数据得到实测植被覆盖度数据的过程包括:
5.根据权利要求4所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,获取实测植被覆盖度数据后还包括基于归一化差异植被指数变异系数法修正所述实测植被覆盖度数据中下垫面异质性。
6.根据权利要求5所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,基于所述归一化差异植被指数变异系数法进行数据修正的过程包括:
7.根据权利要求6所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,计算ndvi值的变异系数的计算公式为:
8.根据权利要求6所述的基于可解释性人工智能植被覆盖度反演性能优化方法,其特征在于,通过计算修正后的实测植被覆盖度数据和植被覆盖度反演结果之间的性能指标对所述堆栈集成模型的反演性能进行精度评估;
