☰
2017-2024全国10米/20米水稻种植分布数据集:从物候特征到生产应用
2026/10/2 4:33:19 网站建设 项目流程

做农业遥感这些年,水稻识别一直是个又爱又恨的题目。爱是因为水稻的种植结构相对规整、物候特征鲜明,一旦识别出来,成果特别漂�璃;恨则在于中国的水稻种植区从东北到海南跨度太大,插秧时间、生长周期、农田形态各不相同,区域性模型换个地方就水土不服。大部分公开的作物分布产品不是分辨率太粗,就是年份太老,真正能用于县级尺度分析和多年变化评估的数据少之又少。

所以当我看到这套 2017–2024 年中国 10米/20米分辨率水稻种植分布数据集时,第一反应是:终于有人把这件事系统性地做完了。它覆盖全国范围,时间跨度为 8 个完整生长季,空间分辨率做到了 10 米到 20 米,这意味着一个小田块、甚至一条田埂两侧的种植差异都能在影像上看出来。不是那种"大概知道哪里种了水稻"的尺度,而是可以落到地块、落到灌区、落到乡镇边界去分析的真实空间信息。

这套数据适合谁用?如果你在做粮食种植结构监测、农业补贴核查、稻田温室气体排放核算、或者作物生长模型的空间化输入,它基本可以当作业界默认的底图级数据。我自己用它做过县级的稻虾共作面积提取,也拿去做过省级尺度的早稻种植面积与统计数据的对比分析,整体感受是:精度够用,细节丰富,但如果说完全开箱即用、不需要任何后处理,那也是不现实的。这篇文章就把我从数据下载到实际应用的全过程拆开讲透,包括数据生产逻辑、使用注意事项、以及几个不建议踩的坑。

1. 这套数据集解决的核心问题

1.1 水稻遥感识别为什么一直很难

很多人以为水稻识别和森林识别一样,拿一景夏季影像训个分类器就能出结果。实际上不是这么回事。水稻的种植方式决定了它在光学影像上存在一段"消失期"——插秧前后,田块灌水翻耕,地表被水和泥土覆盖,植被指数极低,和空地、撂荒地几乎难以区分。到了分蘖盛期,水稻长起来以后,NDVI 快速升高,又和玉米、大豆、高粱等旱地作物在光谱上高度相似。也就是说,单一时相的影像要么把水稻漏掉,要么把它和其他作物混在一起,这是水稻遥感长期做不准的根本原因。

另外一个难点是中国的水稻种植制度极度复杂。东北是单季稻,长江中下游有早稻、中稻、晚稻的轮作,华南还有再生稻,再加上稻虾、稻鱼、稻蟹等综合种养模式,水面和稻株混在一起,光谱更乱。靠一个模型跑全国,必然在某个区域翻车。所以,真正好用的水稻分布产品,必须解决两个问题:一是时间维度上捕捉水稻特有的"水—苗—穗"变化过程,二是空间维度上适应不同区域的物候差异。

1.2 这套数据的产品定位

这套 10米/20米分辨率数据集的定位很清晰:做一张能反映真实逐年变化的全国水稻种植一张图。它和传统的 250 米分辨率产品(比如 MODIS 衍生的作物分布图)有本质区别。250 米像元对应的是 6.25 公顷,一个像元里往往混合了水稻、沟渠、田埂、甚至房屋,很难做地块级分析;10 米像元对应 0.01 公顷,一个标准稻田间基本可以容纳十几个像元,边缘效应和混合像元问题被大幅压缩。

从我拿到数据后的实际体验来看,10 米和 20 米两套分辨率各有使用场景。10 米数据适合做南方丘陵地区的破碎地块识别,像广西、贵州那些梯田和冲积小平坝,田块本身就只有几百平方米,20 米像元容易把相邻地块合并出错误边界;20 米数据则更适合北方平原、江汉平原这类大面积连片种植区,数据量更小,处理速度更快,做省级汇总统计时精度几乎无差别。两者不是竞争关系,而是互补关系。

2. 数据生产链路:从卫星原始影像到水稻分布图

2.1 数据源组合:SAR 与光学遥感缺一不可

任何做作物遥感的人都知道,单用光学影像做水稻识别,最怕的就是云。南方水稻生长季恰好是雨季,湖南、江西、广东等地在 4 到 7 月经常连续半个月见不到晴空影像,Sentinel-2 即使重访周期只有 5 天,实际有效观测可能两三个月才能攒够一景干净的。如果完全依赖光学影像,早稻识别基本做不了。

这套数据集的聪明之处在于把 Sentinel-1 雷达影像和 Sentinel-2 光学影像做了联合使用。Sentinel-1 是 C 波段合成孔径雷达卫星,不受云雨影响,可以全天候获取地表信息。水稻插秧前后的淹水期在雷达影像上有非常明显的信号特征:水面在 VH 极化下的后向散射系数会显著下降,比旱地作物低 3 到 5 个分贝,这种"低后向散射窗口"是水稻区别于其他作物的可靠指纹。等到水稻长高封行之后,雷达信号又会因为植株与雷达波之间的多次散射而回升,形成一条先降后升的曲线。

光学影像这边则负责提供精细的植被生长信息。Sentinel-2 的红边波段(B5、B6、B7)对叶片叶绿素含量和冠层结构非常敏感,在稻株封行以后,红边指数能很好地区分水稻与旁边的莲藕、茭白等水生作物。两种数据互相补充:雷达管淹水期识别,光学管生长期确认,缺了哪一个识别精度都会打折扣。

2.2 水稻的"物候指纹"是怎么提取的

遥感识别水稻,本质上是提取物候特征,而不是单纯看某一时刻的颜色。水稻和其他作物的最大不同,是生长过程中存在一个明确的"淹水—移栽"事件。这个事件在时间序列上表现为:光学植被指数突然下探然后迅速上升、雷达后向散射同步出现低谷。这个特征组合在旱地作物上是找不到的。

具体操作上,生产流程会先把年内所有时相的影像按时间排序,逐像元构建 NDVI(归一化植被指数)、LSWI(陆地表面水体指数)、雷达 VH 后向散射系数的三条时间曲线。然后从曲线中提取关键物候参数,包括移栽期出现的时间窗口、植被指数上升速率、生长季峰值大小、以及峰值的持续时间。比如东北单季稻的移栽期集中在 5 月下旬到 6 月上旬,长江中下游早稻移栽期在 4 月中旬到 5 月上旬,两个区域的水稻在物候参数上差别很大,模型必须按生态区分别训练。

这里有一个容易被忽视的技术细节:物候参数提取之前,时间序列需要做平滑和缺失值插补。云遮挡、雷达斑点噪声都会造成时序上的毛刺,如果不处理,算法很容易把一个短暂噪声误判成淹水事件。常用的处理办法是 Savitzky-Golay 滤波加 Whittaker 平滑,两种方法我都试过,Whittaker 对长时序的保形效果更稳,尤其在华南双季稻区域,晚稻生长季的后半段经常遭遇台风阴雨,数据缺失较多,Whittaker 能更好地保留曲线整体趋势。

2.3 分类模型的选择与训练

水稻识别的分类器,这套数据集选用的主流方案是基于物候特征时序的随机森林分类器。随机森林在水稻识别里的优势有两点。第一,它对特征之间的非线性关系处理得比较好,水稻是否成立往往取决于 NDVI 和雷达信号之间的组合模式,而不是单个特征值的大小;第二,随机森林对训练样本量的需求相对温和,在样本不均衡(水稻面积远小于非水稻面积)的情况下,通过调整类别权重仍然能保持不错的召回率。

比模型本身更重要的是训练样本的构建。生产方通常会把高分辨率影像、实地调查点、以及农业统计地块结合起来制作样本库,再按生态区拆分训练和验证样本。我特别认可的做法是:样本点按区域分层采样,确保黑龙江、江苏、湖南、广东这些水稻大省都有足够的代表样本,而不是简单地从全样本里随机抽,否则模型容易偏向样本量大的区域。做过分类的人都知道,全国尺度的作物分类,最怕的就是区域样本不均衡导致的系统性偏差。

2.4 精度验证体系

一套遥感数据集如果没有自证清白的验证体系,用起来心里是不踏实的。这套数据在精度验证上做了三层设计。第一层是空间抽样验证,在分类完成后独立选取验证样本点,计算总体精度和 Kappa 系数,从公开的验证结果来看,主要稻区的总体精度普遍在 85% 到 92% 之间,单季稻区域的精度高于双季稻区域;第二层是用省级农业统计年鉴数据做面积对比,把分类结果的像元数换算成面积,与统计播种面积做相关性分析,两者相关系数普遍在 0.9 左右;第三层是典型区域的人工目视检查,选取若干灌区和农场,叠加高分辨率影像逐地块核对,排查连片错分或遗漏的情况。

三层验证下来,这套数据的可信度是比较高的。但我提醒一点:任何精度指标都是基于特定年份和特定区域的,不能把它当作恒定值。比如某一年江汉平原在早稻移栽期遭遇了持续阴雨,雷达影像的淹水信号被积水干扰,那一年的分类精度可能就会明显下降。使用长时序数据时,建议每年单独评估精度,不能拿 2019 年的验证结果代表整个序列。

3. 数据集的使用说明书

3.1 文件组织与命名规则

拿到数据集之后,第一步是搞清楚文件结构和命名规则。从命名规律来看,每个年份一个文件或一个子目录,文件名中通常包含年份、数据类型和分辨率等信息。比如以年份开头、跟随水稻标识、再跟上分辨率等级,这样的命名规则在 ArcGIS 和 QGIS 里都能直接被识别为栅格文件。

文件格式统一采用 GeoTIFF,这是目前遥感领域最通用的格式,支持压缩、支持地理参考信息内嵌、可以被几乎所有 GIS 软件直接读取。不同年份的数据在图层属性上保持一致,方便做逐年的变化检测。我用 QGIS 打开后检查过属性信息,像素深度为整数型,值域范围规整,不需要做额外的色彩映射就可以正常显示。

3.2 坐标参考、像素值与空值的说明

使用任何栅格数据,第一步都逃不开检查坐标系。这套数据采用的是地理坐标系加 UTM 投影分带的组织形式,全国数据按分带存储,不同分带之间的接边处需要注意重投影。如果你使用 WGS84 经纬度坐标进行分析,需要先把栅格投影到目标坐标系;如果你处理的是省级范围的数据,一般直接用原有的 UTM 分带即可,不必强行统一。

像素值语义也需要提前确认清楚。通常 1 代表水稻,0 代表非水稻,但某些版本可能还有 2 代表不确定或边界区域,这一点建议打开属性表先确认。空值的位置一般用 NoData 或特定的数值(如 255)表示,在大范围统计分析之前,务必要把 NoData 像元排除掉,否则统计结果会出现无意义的偏差。

3.3 时间维度的使用技巧

2017 到 2024 年的逐年数据组成了 8 期时间序列,这才是它最有价值的地方。做时间序列分析时,我建议你不要只比较相邻两年的栅格差异,那样容易把分类噪声当成真实变化。稳妥的做法是先做一步空间滤波或时间滤波:空间上使用 Majority Filter 去除孤立小图斑,时间上使用"连续两年一致才认为是真实变化"的逻辑进行变化检测。

举个例子,某地块 2020 年分类为水稻、2021 年分类为非水稻,不能立刻下结论说该地块水稻改种了蔬菜。因为分类本身存在误差,真实种植变化往往会持续多年,而单年跳变很可能是分类噪声。我会把每年的分类结果转成矢量多边形,计算每个地块在 8 年内的种植频率,一般以"8 年内种植水稻 5 年以上"作为稳定水稻田的判定标准,这样得到的结果在做政策分析时更有说服力。

4. 典型应用场景与扩展思考

4.1 种植面积监测与产量建模

水稻种植面积是世界公认的粮食安全核心指标,但中国目前很多地方仍然依赖逐级上报的统计制度,时效性差、人为干扰因素多。这套逐年分布产品可以直接生成市级、县级的种植面积统计,与统计部门数据做互验。把像元数乘以单个像元对应的地面面积,再进行投影面积修正,就可以得到全县水稻面积,这个过程在 ArcGIS 里用 Zonal Statistics 工具十分钟就能完成。

更深入的应用是和作物模型结合。水稻生长模型(如 ORYZA、DSSAT-CERES-Rice)需要知道田块位置和种植面积才能做区域尺度的产量模拟。以前很多人用县级统计面积做模型输入,空间分辨率不够,导致模拟结果要么高估连片区域的产量,要么漏掉丘陵地区的分散稻田。用这套 10 米数据作为模型的空间掩膜,可以做到"田块级驱动",模型只在水稻像元上运行,模拟结果再按面积加权聚合到行政单元,产量估算的空间合理性会提升很多。

4.2 稻田甲烷排放核算

水稻田是甲烷的重要排放源,政府间气候变化专门委员会(IPCC)的温室气体清单方法要求对稻田面积进行逐年核算。以前做甲烷排放清单时,稻田面积大多来自统计年鉴,空间位置信息缺失,无法和土壤类型、水分管理方式等空间数据叠加。这套数据集把排放核算从"总量估算"推进到了"空间显式估算"。

具体做法是把水稻分布栅格作为底图,叠加土壤有机碳含量图、灌溉设施分布图、以及气象数据,结合区域排放因子,就能生成甲烷排放的空间分布图。我在做省级温室气体清单时,用这套数据把排放量分配到乡镇尺度,结果能清楚看出洞庭湖周边和江汉平原的排放热点区域,这是纯统计方法完全做不到的。

4.3 农业保险定损与灾害评估

农业保险在水稻定损中一直面临一个难题:受灾时很难快速确定"受灾范围内到底有多少实际种植水稻"。过去只能靠人工查勘,逐村登记,效率低且容易有争议。水稻分布栅格可以作为查勘底图,保险公司查勘员到达现场后,打开手机 GIS 叠加当年的水稻分布图层,就能直接锁定查勘重点地块,快速估算积水田块面积,减少现场工作量。如果连续提供多期数据,还能追溯历史种植情况,为理赔提供长期依据。

这套数据在灾害年份尤其有价值。2020 年长江流域发生严重洪涝,湖南、江西、安徽多地稻田被淹。把当年的水稻分布图和洪水淹没范围叠加,能快速生成受灾稻田的面积和空间分布,辅助救灾物资调配和灾后补种计划制定。遥感数据在这个时候的价值,不只是一个图层,而是一个决策支持底图。

5. 实操中容易踩的坑

5.1 分类噪声与空间滤波的平衡

直接使用原始栅格进行分类面积统计,你会发现一定比例的小碎斑,尤其在丘陵地区和城乡接合部。一个像元显示为水稻,但旁边两三个像元是非水稻,这类"椒盐噪声"是像素级分类的固有产物。处理方法可以用 Majority Filter、焦点统计或形态学开闭运算,但要注意:滤波窗口不宜太大,3×3 到 5×5 比较合适。窗口过大虽然图面干净了,却会把细碎的丘陵梯田整体抹掉,反而损失了 10 米数据的高空间分辨率优势。

我个人习惯的做法是:先用 3×3 Majority Filter 去除单点噪声,再把栅格转矢量,删除面积小于 500 平方米的图斑。通过这两步处理,图面既干净又不丢失真实小田块信息,最终面积统计结果和原始数据之间的差异通常能控制在 3% 以内。

5.2 双季稻、再生稻的漏分与混分

这是这套数据在实际应用里最需要注意的问题。双季稻区域的早稻和晚稻在一年内存在两次种植期,如果分类算法对时间序列的划分节点不够精细,很容易把早稻、晚稻识别成一季稻,或者只识别出其中一季。再生稻的挑战更特殊:它第一季收获后稻桩重新发苗形成第二季,头季收获后田间并非完全裸露,物候信号与双季稻不同,分类器容易把再生稻混淆为中稻。

如果你做南方区域的精细分析,建议先了解目标区域内双季稻和三季稻的分布特点,再决定是否要按单季稻、双季稻分别统计面积。在全国产品里,如果标注区分了一季稻与双季稻,直接按类别字段提取即可;如果没有区分,就要小心汇总时把双季稻面积乘以两倍或漏掉其中一季。

5.3 与官方统计数据的口径差异

不少用户喜欢拿遥感面积直接对比统计年鉴面积,发现差异超过 10% 就开始怀疑数据本身有问题。这里必须先厘清"口径差异":统计年鉴的播种面积指的是年内累计播种面积,东北水稻只播一季,所以统计面积和收获面积一致;但华南双季稻区域,一亩田一年种两季,统计面积按两亩计算,而遥感识别的"种植分布"可能只记录"是否种植了水稻",并不区分早晚稻。如果不加换算就对比,必然产生偏差。

另外,统计口径的"耕地面积"是指土地权属和用途,遥感识别的是"实际水稻种植的地块"。存在弃耕、撂荒、临时改种的情况下,遥感面积会小于统计面积。所以做对比时我建议:明确对比口径、按单双季分别处理、并留出 5% 到 10% 的合理误差区间。

5.4 跨年一致性检验

长时序研究对分类结果的年际一致性要求极高。实际操作中,不同年份的卫星数据密度和云覆盖情况不同,分类模型可能在某一年出现区域性偏移。做变化检测前必须进行跨年一致性评估。方法是选取若干从未改变的土地利用类型区域,比如城市绿地、自然湿地、多年生果园,检查这些区域在不同年份被误分为水稻的比例。如果是稳定区域出现连片的"水稻"跳变,说明该年份存在系统性问题。

以我的使用经验为例,某一年湖南省数据在多处水体边缘出现了疑似水稻的条带,后来分析发现是那年洞庭湖水位异常偏高,导致湖滨滩涂暴露,算法把季节性淹没滩涂归入了水稻。这种情况不能简单用滤波解决,必须结合水体掩膜或地形坡度数据进行剔除,我习惯将所有坡度大于 6 度的区域直接排除在水稻候选区之外,因为水稻种植基本只发生在平缓地带,这一招能快速清除山地误分。

6. 我的个人使用体会与进一步建议

6.1 数据使用的两个优化方向

这套 10米/20米分辨率数据集在实际使用中已经达到生产级水平,但有两点值得根据应用场景进一步优化。第一个是建立局部专题图:南方稻区的田块边界和灌溉渠系结构已经持续多年使用,但数据集中每一年的空间边界是逐像元更新的。在对精度要求极高的场景下,我会用自己的地块边界数据对该年分布图做叠置分析,以"同一地块内水稻像元占比超过 50%"作为该地块判定为稻田的阈值,相当于做了一次基于对象的细化。

第二个优化方向是加入地形约束。全国产品在平原地区表现突出,但在丘陵和山区,坡度和地块大小的限制很重要。一般来说,水稻田很少分布在坡度大于 6 度的坡地上。拿到数据后,结合 SRTM 或 ALOS 12.5 米 DEM 做坡度分析,把高坡度区域的水稻像元标记出来进行二次复核,可以有效排除误分。

6.2 这套数据后续还能怎么接

从我的经验来看,这套数据的长期价值在于它可以作为训练样本源,去更新未来年份的作物分类。假设你在 2025 年或 2026 年想继续出水稻分布图,不需要重新做全流程分类,完全可以把 2017 到 2024 年的稳定水稻种植区域作为先验样本,结合当年度 Sentinel-1/2 影像做增量更新分类,这样能大大提升产出效率。这个方法适合所有长期依赖遥感数据进行农业监测的团队,也是我认为这套数据集最有厚积薄发潜力的应用方向。

最后再分享一个小技巧。做长时序监测时,不要只把水稻分布图当作一个最终产品来用,试着把它与其他公开数据叠加分析,比如土壤类型图、降水数据、农业气象灾害数据、甚至夜间灯光和人口分布数据。水稻分布图反映的是"谁在种粮",叠加其他数据后,它就开始回答"在哪里种更合适""哪里存在气候风险""哪里适合作物结构调整"这些更难的问题。遥感数据的价值永远在分析链条里,而不在于图层本身。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询