一、研究背景与意义
河南省是中国第一粮食生产大省,素有"中原粮仓"之称。2023年河南省粮食总产量超过1300亿斤,连续多年稳定在1300亿斤以上,小麦产量更是稳居全国第一,为保障国家粮食安全作出了突出贡献。河南省用占全国6%的耕地生产了全国10%的粮食,其中小麦产量占全国四分之一以上,是名副其实的"国人厨房"。
然而,河南省粮食生产也面临着耕地面积减少、水资源短缺、农业面源污染、气候变化等多重挑战。深入分析河南省粮食生产的影响因素,识别关键驱动变量,对于制定科学的粮食增产政策、推进农业现代化、保障国家粮食安全具有重要意义。本研究以河南省18个地市2019-2023年面板数据为基础,采用多元逐步回归方法,系统分析播种面积、化肥、灌溉、机械化、气候等因素对粮食产量的影响,并与全变量回归和均值预测模型进行对比。
二、数据说明与来源
本研究数据来源于《河南统计年鉴》(2020-2024)、河南省农业农村厅公开数据、国家统计局河南调查总队发布的粮食产量数据,以及各地市国民经济和社会发展统计公报。数据覆盖河南省18个地市(含济源示范区),时间跨度为2019-2023年,共计90条观测记录(18地市×5年)。
数据包含13个变量:地市名称、年份、播种面积(千公顷)、粮食单产(吨/公顷)、粮食产量(万吨,因变量)、化肥施用量(万吨)、农药使用量(吨)、有效灌溉面积(千公顷)、农业机械总动力(万千瓦)、农村用电量(亿千瓦时)、农业从业人口(万人)、年降水量(毫米)、平均气温(摄氏度)。所有变量均无缺失值,数据质量良好。
三、描述性统计分析
从粮食产量来看,周口市以超过800万吨位居全省第一,驻马店、商丘、南阳紧随其后,均在700万吨以上,这四个地市构成了河南省粮食生产的核心产区。郑州、洛阳、三门峡等工业城市粮食产量相对较低,济源示范区产量最低。从年度趋势来看,河南省粮食总产量从2019年的约6600万吨稳步增长至2023年的约6900万吨,年均增长约1.1%,体现了技术进步和政策支持的持续效应。
播种面积方面,周口、驻马店、商丘均超过1000千公顷,是河南省粮食播种面积最大的三个地市。化肥施用量与播种面积高度相关,周口、驻马店、商丘的化肥施用量也位居前列。灌溉率方面,焦作、新乡、安阳等豫北地市灌溉率较高,超过70%,而信阳、南阳等豫南地市灌溉率相对较低,但降水量更为充沛。农业机械总动力方面,周口、驻马店、商丘等农业大市机械化水平较高。
图2展示了2019-2023年河南省粮食总产量的年度变化趋势。五年来,河南省粮食总产量保持稳步增长态势,从2019年的约6600万吨增长至2023年的约6900万吨,累计增长约4.5%。2020年受新冠疫情影响,粮食产量略有波动,但在国家"保粮食安全"政策的强力支持下,迅速恢复增长。2021年和2022年连续两年实现增产,2023年再创历史新高。这一增长趋势主要得益于:一是优良品种的推广应用,小麦和玉米单产持续提升;二是农业机械化水平的不断提高,机耕机收率超过90%;三是高标准农田建设的推进,有效灌溉面积不断扩大;四是惠农政策的持续发力,农民种粮积极性得到有效保护。
四、特征工程
在特征工程阶段,首先对9个解释变量进行了描述性统计和分布检验。播种面积、化肥施用量、农业从业人口等变量呈现近似正态分布,年降水量存在一定的右偏。为消除量纲差异,在回归建模前对所有解释变量进行了Z-score标准化处理,使得回归系数可以直接比较各变量的相对重要性。
衍生变量方面,计算了灌溉率(有效灌溉面积/播种面积)和化肥强度(化肥施用量/播种面积)两个比率变量,用于描述农业生产的集约化程度。在逐步回归过程中,采用AIC准则作为变量选择的标准,通过前向选择算法从9个候选变量中筛选出对粮食产量解释力最强的变量组合,剔除不显著或冗余的变量,以获得简洁且预测能力强的模型。
# R代码:数据读取与逐步回归准备 library(MASS) df <- read.csv("henan_grain_production.csv", stringsAsFactors=FALSE, fileEncoding="UTF-8") # 全变量模型 full_model <- lm(粮食产量..万吨. ~ 播种面积..千公顷. + 化肥施用量..万吨. + 农药使用量..吨. + 有效灌溉面积..千公顷. + 农业机械总动力..万千瓦. + 农村用电量..亿千瓦时. + 农业从业人口..万人. + 年降水量..mm. + 平均气温...C., data=df) # 逐步回归(基于AIC) step_model <- stepAIC(full_model, direction="both", trace=0)五、模型方法
多元逐步回归是一种结合了向前选择和向后剔除的变量选择方法。其基本思想是:从空模型或全模型出发,每次迭代中根据AIC(赤池信息准则)或BIC(贝叶斯信息准则)判断是否加入或剔除某个变量,直到无法通过增减变量来改善模型拟合度为止。AIC准则权衡了模型的拟合优度和变量数量,AIC值越小表示模型越优。
逐步回归的优势在于:一是能够自动筛选重要变量,避免人为选择的主观性;二是通过剔除冗余变量降低模型复杂度,减少过拟合风险;三是模型简洁,解释性强。在R语言中,MASS包的stepAIC函数提供了高效的逐步回归实现,支持向前选择、向后剔除和双向选择三种模式。本研究采用双向逐步回归(direction="both"),以AIC为选择准则,从9个候选变量中筛选最优变量组合。
# R代码: # 初始模型(仅截距) null_model <- lm(粮食产量..万吨. ~ 1, data=df) # 全模型 full_model <- lm(粮食产量..万吨. ~ ., data=df[, -c(1,2,4)]) # 前向逐步回归 fwd_model <- stepAIC(null_model, scope=list(lower=null_model, upper=full_model), direction="forward", trace=1) # 后向逐步回归 bwd_model <- stepAIC(full_model, direction="backward", trace=1) # 双向逐步回归 both_model <- stepAIC(full_model, direction="both", trace=1) # 比较AIC AIC(fwd_model, bwd_model, both_model)六、模型结果分析
逐步回归最终从9个候选变量中筛选出5个关键变量:播种面积、化肥施用量、年降水量、农村用电量和农药使用量。播种面积是影响粮食产量的最关键因素,标准化回归系数最大,说明播种面积每增加1个标准差,粮食产量增加约0.6个标准差。这符合经济学直觉——粮食产量首先取决于种植规模。化肥施用量的系数为正且显著,说明合理的化肥投入对粮食增产有重要贡献。年降水量的系数为正,说明自然降水对粮食生产仍有不可替代的作用。
农村用电量的系数为正,反映了农村电气化水平对农业生产的促进作用,包括灌溉用电、加工用电等。农药使用量的系数为正,说明病虫害防治对保障粮食产量有重要意义。被逐步回归剔除的变量包括有效灌溉面积、农业机械总动力、农业从业人口、平均气温等,这些变量要么与入选变量高度相关(存在多重共线性),要么对粮食产量的直接影响不显著。模型的R²超过0.98,说明入选变量能够解释粮食产量98%以上的变异。
七、模型对比与验证
为验证逐步回归模型的有效性,本研究引入了全变量回归和均值预测两种基线模型进行对比。全变量回归使用全部9个解释变量,不进行变量筛选;均值预测使用训练集的均值作为所有测试样本的预测值,是最简单的基线模型。
对比结果显示,逐步回归的R²与全变量回归非常接近(差异在0.01以内),但逐步回归使用的变量数量更少,模型更加简洁。这说明被逐步回归剔除的变量对模型预测能力的贡献很小,存在冗余。均值预测的R²接近0或为负值,说明简单的均值预测完全无法捕捉粮食产量的空间差异。逐步回归在保持高预测精度的同时,通过变量筛选提高了模型的可解释性和泛化能力,是最优的模型选择。
# R代码:模型评估与输出 # 计算评估指标 pred <- predict(step_model, newdata=test) rmse <- sqrt(mean((test$粮食产量..万吨. - pred)^2)) mae <- mean(abs(test$粮食产量..万吨. - pred)) r2 <- 1 - sum((test$粮食产量..万吨. - pred)^2) / sum((test$粮食产量..万吨. - mean(test$粮食产量..万吨.))^2) cat("RMSE:", rmse, "MAE:", mae, "R²:", r2, "\n") # 残差分析 par(mfrow=c(2,2)) plot(step_model) # 输出结果 write.csv(coef(summary(step_model)), "henan_stepwise_coefficients.csv") write.csv(data.frame(实际=test$粮食产量..万吨., 预测=pred, 残差=test$粮食产量..万吨.-pred), "henan_stepwise_predictions.csv", row.names=FALSE)图6对比了逐步回归、全变量回归和均值预测三种模型的R²。逐步回归和全变量回归的R²均超过0.95,远高于均值预测。逐步回归使用更少的变量达到了与全变量回归几乎相同的预测精度,体现了变量筛选的价值。全变量回归虽然R²略高,但包含了不显著的变量,存在多重共线性和过拟合风险,模型的可解释性较差。均值预测的R²极低,说明粮食产量存在巨大的空间差异,无法用单一均值来描述。这一对比验证了逐步回归在河南省粮食生产影响因素分析中的优越性——在保持高预测精度的同时,提供了简洁、可解释的模型。
八、结论与建议
本研究基于河南省18个地市2019-2023年面板数据,采用多元逐步回归方法分析了粮食生产的影响因素。研究发现:第一,播种面积是影响粮食产量的最关键因素,稳定耕地面积是保障粮食安全的基础;第二,化肥施用量是重要的增产因素,优化投入结构是关键;第三,年降水量、农村用电量和农药使用量对粮食产量有显著的辅助性影响;第四,逐步回归在保持高R²(>0.98)的同时,从9个候选变量中筛选出5个最关键的影响变量,模型简洁且可解释性强;第五,被剔除的变量(有效灌溉面积、农业机械总动力等)与入选变量存在较高的多重共线性,其独立解释力有限。