全文链接:http://tecdat.cn/?p=31445
课题着眼于环境科学中的近年来土地面积变化影响的课题,应用机器学习的方法,进行数据处理与分析预测。数据的处理方法以及机器学习本身算法理论的学习和代码实现在各领域具有相同性,之后同学可以在其他感兴趣的领域结合数据进行分析,利用此课题所学知识举一反三。
相关视频
区域或局地尺度的气候变化影响研究需要对气候模式输出或再分析资料进行降尺度以获得更细分辨率的气候资料。
本文通过PCA主成分、lasso、岭回归对数据进行降维分析,既能起到对相关的预报因子限制的作用保证了预测结果的稳定性,又不至于掩盖预报因子的贡献以至于丧失模型预测的准确性。
读取数据
数据清洗
主成分分析
发现最优主成分数
lasso 模型
对数据进行lasso模型筛选变量
转换数据类型
找出有强影响的变量
使用lasso方法排除回归模型中的多重共线性是有必要的。在对lasso模型参数的确定过程中,进行统计降尺度时将df设置为17时,cp值最小,因此我们选择1999-2006年的数据较为合理,既能起到对相关的预报因子限制的作用保证了预测结果的稳定性,又不至于掩盖预报因子的贡献以至于丧失模型预测的准确性。
使用ridge regression回归模型
选择GCV为100,带入岭回归模型的lambda中
使用岭回归方法排除回归模型中的多重共线性是有必要的。在对岭回归模型参数α的确定过程中,本文认为在使用岭回归模型对地区土地面积进行统计尺度时将GCV设置为100较为合理,当α过小时,正则项起不到作用,回归模型各项系数分散,此时模型如普通最小二乘多元回归模型,出现过拟合现象,预测结果不稳定;当α过大时,模型各项系数收敛到一处,出现欠拟合现象,预测结果不准确;而当α合理确定时,平衡了模型的稳定性和准确性。
领取专属 10元无门槛券
私享最新 技术干货