数字土壤制图研究综述与展望

导 读

土壤的空间分布是土壤形成与发展过程的体现。数字土壤制图是一种新兴的、高效表达土壤空间分布的技术方法,在过去的30 年取得了飞速发展。其理论基础为土壤成土因子学说和地理学第一定律。国内外学者在获取环境变量数据、采样方法、制图模型方法和土壤图产生及评价方面开展了大量的研究,应用案例也从小范围到大区域,甚至是全球尺度。未来数字土壤制图的发展方向包括:环境变量刻画的新技术,特别是体现人类活动方面的环境因子;新型数据和遗留数据的有效利用;土壤发生学知识与数学模型的紧密结合的新型推理方法;支持大数据多终端的计算模式。

文/朱阿兴1,2,3,4,5,6,杨琳3,7*,樊乃卿3,曾灿英1,张甘霖8(1. 南京师范大学地理科学学院;2. 虚拟地理环境教育部重点实验室,南京师范大学;3. 中国科学院地理科学与资源研究所资源与环境信息系统国家重点实验室;4. 江苏省地理信息资源开发与利用协同创新中心;5. 江苏省地理环境演化国家重点实验室培育建设点;6. 美国维斯康星大学麦迪逊分校地理系;7. 南京大学地理与海洋科学学院;8. 中国科学院南京土壤研究所)

来源:地理科学进展(2018年第1期)

1 引言

土壤类型和属性的空间分布信息是生态水文模拟、全球变化研究、资源环境管理所需的基础数据,制图是对土壤空间分布信息获取和表达的有效方式。过去,土壤专家通过野外调查在脑海中形成土壤—景观模型,以多边形为基本表达方式,以手工勾绘为基本技术,依据地形图、航空像片或卫星像片进行土壤制图(Hudson, 1992)。近30 年来,随着地理信息系统、数据挖掘和地表数据获取技术的发展,数字土壤制图(Digital soil mapping)成为一种新兴的、高效表达土壤空间分布的方法(McBratneyet al, 2003; 朱阿兴等, 2008; Hengl et al, 2017)。

数字土壤制图是以土壤—景观模型为理论基础,以空间分析和数学方法为技术手段的土壤调查与制图方法,是有别于传统土壤调查与制图技术的现代化技术体系。其实现过程主要是根据与土壤发生相关的或与土壤具有协同空间变化的地理环境数据以及土壤属性数据,生成数字格式的土壤图,或者根据土壤属性空间分布的自相关特征,应用地统计的方法来推测土壤的空间分布,形成土壤图。以这种方式生成的土壤图通常利用栅格的方式来表达土壤空间变化,从而可以更详细地表达土壤的空间变化。

计算机技术和地理信息系统(GIS)技术的诞生和发展,促进了数字土壤制图的发展。1975 年,第一次国际土壤信息系统会议在新西兰惠灵顿召开并成立了相应的工作组,该工作组随后被国际土壤学会纳入第5 组(土壤发生、分类及地理学组)。此后,土壤信息的数字化表达开始迅速发展。1990 年国际土壤科学联合会成立了计量土壤学(Pedometrics)专业委员会,2005 年成立了数字土壤制图(DigitalSoil Mapping)工作组,2009 年2 月在美国正式启动“全球数字土壤制图计划”。

本文从数字土壤制图的理论基础开始,从获取环境变量数据、采样方法、制图模型方法和土壤图产生及验证四个方面阐述数字土壤制图的研究现状及最新动态,并进一步讨论数字土壤制图的趋势和展望。

2 数字土壤制图的理论基础

数字土壤制图反映的是土壤的空间分布特征和规律,土壤的空间分布是土壤形成与发展过程的体现,因而,数字土壤制图的第一个理论基础是土壤成土因子学说。该学说认为土壤是母质、气候、生物、地形和时间5 个成土因素综合作用的产物(Jenny, 1941)。近年来人类活动也成为改变土壤形成方向和强度的重要环境因子(McBratney et al,2003; 朱阿兴等, 2008; 朱鹤健等, 2010; 宋敏等,2017)。基于成土因子学说,某一地区的土壤,是成土母质在一定水热条件和生物因素作用下,经过一系列物理、化学和生物化学过程所形成。由于土壤与环境因子之间的关系,土壤的空间分布与环境因子的空间分布具有协同变化的关系(Mcbratney etal, 2003)。特定的环境条件组合形成特定的土壤,具有特定的土壤属性。相似的环境因子组合下分布着相似的土壤,占据相应的空间位置,并且环境组合越相似,其对应的土壤越相似(Zhu et al, 2015)。由于环境因子在空间的分布大多具有连续性,土壤在空间分布规律呈现出空间连续渐变的特征,往往体现出空间上距离越近的点土壤属性越相似的特点,也即是所谓的“地理学第一定律”(Tobler,1970)。这是数字土壤制图的第二个理论基础。国内外学者的研究也证实了这一点(Wilding et al,1965; Burrough, 1989; 杨琳, 2009)。相邻两种土壤类型间在空间上往往没有明显的界线,而是呈现出一个过渡区。在过渡区内的土壤具有两类土壤的属性特征,也就是说,过渡区中的土壤与这两种土壤类型均具有某种程度的相似性(朱阿兴等, 2008)。

此外,土壤的空间变化具有尺度效应,并以空间格局的形式呈现,即某一尺度只能揭示相应的变化规律,而某一空间结构只能在某一尺度下体现。在进行大尺度(大空间范围)土壤空间变化分析时,可得到整个区域土壤的空间分布规律,较小尺度(小空间范围)下的空间分布特征往往被掩盖;而在进行小尺度土壤空间变化分析时,大多体现的是土壤在微域环境内的变化,以弥补大尺度分析的不足,但大尺度上的变化往往被忽略( 张黎明等,2011; 邓红眉, 2013)。同时,不同尺度下其主要影响因子也不尽相同(杨奇勇等, 2011; 邓红眉, 2013;Miller et al, 2015)。大尺度土壤空间分布,主要与生物气候条件的变化相适应。在较小的空间范围内,大生物气候因素对土壤的形成基本是均质的,土壤形成和发育主要受局部地形、母质等因素的影响。

3 数字土壤制图的研究现状

数字土壤制图一般可包括四个环节:环境协同变量信息的生成、样点数据的获取、制图模型或方法的建立、土壤图的产生及验证。以下分别介绍这四个方面的研究现状。

3.1 环境协同变量信息的生成

在数字土壤制图中,很多方法需要利用能体现土壤环境空间变化的地理变量作为辅助变量,这些变量统称为“环境协同变量”。环境协同变量的选择是数字土壤制图的一个关键,具体选择哪些环境变量参与数字土壤制图需要考虑两个主要方面:第一是所选变量应该能体现土壤空间变化,除土壤成土因子,更应该包括能体现土壤空间变化的其他因子,比如作物生长状况等;第二是所选变量的空间变化信息须是容易获取的,而难以获取其空间变化的变量,如时间因子,则一般不能直接地被用于数字土壤制图。下文对数字土壤制图中常用的环境变量空间信息的获取作简单介绍。

土壤母质是土壤形成的物质基础,通常直接获取母质信息十分困难。因此,在实际制图工作中,常用地质图或地貌图来代替土壤母质分布图(Zhuet al, 1994; Gray et al, 2016; Hengl et al, 2017),这些地图上的信息通常为矢量化表达的地质类型。气候因素可以分为大气候和小气候。在较大的空间范围内,主要考虑大气候,通常选择年均降水、年均温、积温或相对湿度等因子。在较小的空间范围内,大气候对土壤形成的影响基本是均质的,可以忽略;小气候对土壤形成的影响表现出一定的空间差异,该差异主要由地貌部位和地形条件的差异引起。因此,在较小的空间范围内,一般不考虑气候因素,而是利用地形地貌特征信息来体现小气候对土壤发育的影响(朱阿兴等, 2008)。

地形要素是最常用的环境变量(McSweeney etal, 1994; Behrens et al, 2014),主要包括描述地形特征的定量指标(即地形属性)和描述地貌部位信息的指标(即地貌部位信息)。地形属性可直接或间接由数字高程模型(DEM)计算而得到,如海拔、坡度、坡向、曲率、与河流的距离、与山脊的距离、地形湿度指数等。地貌部位主要指形态相对简单的山脊、坡肩、背坡、坡脚和沟谷等基本的地形组成部分,它类似于地貌元素的概念(Blaszczynski, 1997; MacMillanet al, 2000),通常用坡位来表达。近年来,有学者将在空间渐变的坡位(如坡肩、背坡)进行模糊表达,生成模糊坡位作为新的环境变量,并将其应用于平缓小流域土壤属性的空间分布推测(Qin et al,2009, 2012; 秦承志等, 2010)。

生物要素主要包括植物、动物和微生物。生长在不同土壤上的植被或类型不同或生长状况有异,因而可通过植被类型或状况来推测土壤类型或属性。土壤动物和微生物的信息难以获取,但是它们往往与地表植被状况有相关性,因而在实际制图中就用植被状况来代替。植被信息主要分为两类,一类是定性的类型空间分布信息,如植被类型;另一类是定量的属性空间分布信息,主要通过对遥感影像数据的计算获取植被指数和植被生物物理参数,如归一化植被指数(NDVI)、叶面积指数(LAI)、林冠郁闭度(Canopy Closure,CC) 等(Boettinger 2010;Song et al, 2017)。

在一些平原或地形平缓的地区,常用的地形、植被等信息难以有效的表达土壤的空间变化,于是学者们提出了一种基于特定时段的地表动态反馈来获取土壤空间变化的方法,并借助遥感对地观测和模式定量分析技术来实现(刘峰等, 2009; Zhu etal, 2010; Wang et al, 2012; Zhao et al, 2014; Guo etal, 2015, 2016; Zeng et al, 2017)。该方法通过时序MODIS数据捕捉降雨后短时期内地表变干过程中的光谱动态变化信息或者昼夜温差信息等作为环境协变量推测土壤的空间分布。在地形和植被等其他地表条件类似的情况下,降雨后地表变干过程的动态反馈的空间差异将主要依赖于土壤。因此地表动态反馈信息可以有效指示土壤的空间差异,近年来作为一种新型环境协变量用于推测平缓区

域的土壤空间分布。

母质、气候、生物和地形等因素对土壤发育的影响是通过时间来体现的,但是土壤形成的时间信息难以直接获取,而通常在其他成土环境因子(如地形位置)或当地土壤专家知识中有所体现和表达,因此,在土壤制图中对时间因素暂时还没有进行显式的考虑。

近年来,除上述地表动态反馈信息、模糊坡位外,最新开发和探索使用的环境变量还包括:人类活动因子、历史土壤图和近地传感数据。人类活动因子在土壤空间变化中起越来越大的作用,逐渐受到人们的关注。例如,宋敏等(2017)利用傅立叶变换对NDVI时序数据生成可表达农作物轮作的环境变量,研究结果表明且这些变量可提高农耕区土壤有机质制图的精度。传统土壤图也被用来辅助土壤预测制图,一部分研究是将传统土壤图作为模型的输入用于制图(Brus et al, 2008; Kempen et al,2009);另一些研究是将历史土壤图中蕴含的土壤-环境关系知识提取出来,再进行对历史土壤图的更新或制图(Qi et al, 2003; Yang et al, 2011; 黄魏,2016)。此外,土壤近地传感器获得的数据,如电导率数据、多光谱等数据也被用于土壤制图(Rossel etal, 2008; Besson et al, 2010; Myers et al, 2010; 史舟等, 2011; Shi et al, 2015)。

3.2 土壤样点的采集

土壤样点数据的直接获取方式是野外采样。采样方法可归为三类:①根据概率理论的采样方法;②根据样点空间自相关的采样方法;③环境因子辅助的采样方法。

3.2.1 根据概率理论的采样方法

基于概率理论的采样中最基本的一种策略是简单随机采样,该采样策略从总体中随机抽取每个样点,且每个样点被抽取的概率相同。这种采样的优点是样点采集概率已知和易于操作,常用于先验知识较少或没有的区域。当研究区可明确进行地理分区(层)时,例如具有不同的母质或土地利用类型,可在分层的基础上再进行随机采样,即分层随机采样。由于分层可在一定程度上避免随机采样中样点的空间聚集,往往可提高采样效率(Brus,1994; Yang et al, 2018)。系统采样或规则采样也是土壤采样中常用的一种方式,这种采样将研究区划分为规则的形状(如正方形),在每个规则形状中随机或在中心点选择一个样点。该方法的优点在于对地理空间有较好的覆盖。

由于经典统计理论对于样点互相独立的假设,采样通常不考虑所设计样点的空间关系。事实上,不同空间样点上的目标地理变量值通常存在一定的空间相关性,因此基于概率理论的采样可能会在空间相关性较强的地区设计过多的冗余样点,而在空间相关性较差的地区设计的样点不足。此外,要获取精确的土壤空间分布,采用概率采样设计通常需要大量样点。

3.2.2 根据样点空间自相关的采样方法

基于地统计学的空间采样以最小化预测误差方差(如最大或平均克里格方差)为目标函数设计样点(Sacks et al, 1988 ; van Groenigen et al, 1998 )。该方法以模型估算方差最小化为目标,设计最优的样点数量和空间分布格局,获得具有全局代表性的样点(Hughes et al, 1981; Russo, 1984; Warrick et al,

1987; Wang et al, 2009)。基于空间自相关模型的采样方法能得到样点数量和分布的最优解,其采样效果完全取决于空间自相关模型对于目标地理变量空间变化模拟的效果。然而,建立空间自相关模型通常需要有关目标地理变量空间变化特征的先验知识(Webster et al, 1990),同时也需要满足目标地理变量空间变化二阶平稳假设。因此,在多数实际情况下,特别是在大范围研究区,目标地理变量空间变化特征的先验知识需要大量的先验样本往往很难获得(Webster et al, 1992; Simbahan et al,2006),二阶平稳假设也很难得到满足,这使得基于空间自相关模型的采样设计方法在实际应用中具有一定局限性(Isaaks et al, 1989; Goovaerts, 1999)。为减少空间二阶平稳假设不能得到满足的影响,王劲峰等(2009)、Wang J F等(2013)建立了以最小化层内方差为目标的分层空间采样方法(Sandwich 方法)。目前,该方法主要用于对区域总量的估算,在数字土壤制图中的应用还不够成熟。

3.2.3 环境因子辅助的采样方法

环境因子辅助采样方法的理论基础是土壤与环境因子存在协同关系,利用环境因子辅助采样设计以提高采样效率(Minasny et al, 2006; Brus et al,2007; Zhu et al, 2008, 2010; Mulder et al, 2013; Yanget al, 2013;韩宗伟等, 2014)。环境因子辅助的采样方法大体上可分为3 类:一是基于专家知识的目的性采样方法;二是基于环境因子分层的拉丁超立方采样方法;三是基于环境因子相似性的代表性采样方法。

(1) 基于专家知识的目的性采样。根据研究目的,通过有经验的专家选择少量具有“代表性”或“ 平均状态”的样点(Webster, 1977; Webster et al,1990; Trochim, 2006)。这种采样策略适用于先验知识丰富的区域,可通过相对较少的样点了解土壤的空间分布信息。但是,该方法依赖于调查者的主观经验,难以进行客观评价。

(2) 基于环境因子分层的拉丁超立方采样方法。该采样方法是将设计的样点尽可能地重复环境因子的分布,通过样点对环境因子属性空间的覆盖,使得样点可很好地捕捉环境因子的多元分布特征(Minasny et al, 2006)。条件拉丁超立方采样方法被认为是一种有效的采样方法,应用广泛(Mulderet al, 2013; Clifford et al, 2014; Reza Pahlavan Radet al, 2014; Gao et al, 2016; Stumpf et al, 2016)。拉丁超立方体抽样的关键是对输入概率分布进行分层,分层在累积概率尺度(0~1.0)上把累积曲线分成相等的区间,然后,从输入分布的每个区间中随机抽取样本。在每一区间抽取的样本代表环境因子整个分布空间。

(3) 基于环境因子相似性的代表性采样方法。该采样方法认为任何样点都包含了土壤—环境关系的知识,可代表与其环境条件相似的地区,因此能根据少量的可代表环境因子典型位置的典型样点获得研究区的整体信息,是一种高效的采样方式。主要方法包括模糊C 均值采样(FCMS)(杨琳等, 2010)和多等级代表性采样(杨琳等, 2011; YangL et al, 2013, 2016 )。模糊C均值聚类(Dunn, 1973;Bezdek, 1981)采样(FCMS)是根据基于环境因子形成的聚类中心位置设置典型样点。多等级代表性采样的基本思路是把基于环境因子形成的聚类分成代表性不同的等级,代表性等级高的聚类代表土壤空间变化的主要特征,代表性较低的类代表土壤局域细节特征,在该基础上布设点的先后次序,以合理分配采样资源,提高采样效率(Yang et al,2013)。

拉丁超立方采样和代表性采样都是近年来应用较多、有效利用环境因子的采样方法。不同之处在于:超立方采样方法是等概率地划分环境因子空间,以使样点可以全面覆盖环境因子的多元空间,而代表性采样方法则以聚类的方式、通过寻找典型点来代表研究区土壤空间分布信息,后者可有效地减少所采集的样本量。

除上述采样方法外,最新的研究动态包括基于空间推测不确定性的补样方法和考虑可达性或采样成本的采样方法。空间推测方法的不确定性可分为属性域的不确定性和空间域上的不确定性。基于属性域不确定性的采样方法主要是基于Zhu等(2015)根据样点个体代表性计算的不确定性设计补样(Zhang et al, 2016),空间域上的不确定性主要是基于克里格方差来设计补样(Brus et al, 2007;Juang et al, 2008)。还有学者提出了兼顾属性域和空间域的补样方案(Li et al, 2016)。考虑到实际调查情况,一些学者开始在采样时考虑野外成本或可达性,包括在拉丁超立方采样中加入可达性限制或成本限制,以有效降低采样成本((Roudier et al,2012; Mulder et al, 2013; Godinho Silva et al, 2014,2015);以及定量考虑成本的概率采样方法(Yang etal, 2018)。

3.3 制图方法

目前主流的数字土壤制图方法主要包括基于要素相关性的数字土壤制图方法、基于空间自相关的土壤制图方法和基于要素相关性和空间自相关相结合的数字土壤制图方法。

3.3.1 基于要素相关性的土壤制图

基于要素相关性的数字土壤制图就是基于所建立的土壤属性(或类型)与环境因子(要素)之间的关系,来推测土壤类型或土壤属性的空间分布,以生成土壤图。采用要素相关的土壤推测方法主要包括传统的统计学方法、机器学习与数据挖掘方法、基于专家知识的土壤制图以及基于样点个体代表性的方法等。

(1) 统计学方法

统计学方法是根据土壤与地理环境变量之间的统计关系,推测土壤属性的空间分布并生成土壤图的方法,如线性模型、判别分析等(Moore et al,1993; Odeh et al, 1994)。线性模型是建立土壤属性(或类型)与影响因子之间的定量线性关系的模型。常用的线性模型包括普通线性模型、广义线性模型、广义附加模型等(McBratney et al, 2000, 2003;Zhang et al, 2011)。而判别分析则根据已知样本集建立判别函数,然后根据判别函数或函数集来确定未知样本的所属类别,多用于土壤类型制图(Bell etal, 1992, 1994; Dobos et al, 2001)。

(2) 机器学习与数据挖掘方法

基于机器学习与数据挖掘的方法是利用机器学习与空间数据挖掘的手段,如人工神经元网络模型、贝叶斯模型、回归树/决策树、随机森林等,来获取和表达土壤属性空间变化与环境变量的关系,并根据这种关系推测土壤属性空间分布(Zhu, 2000;Park et al, 2002; Grimm et al, 2008; Hengl et al,2015, 2017; Gray et al, 2016)。

机器学习与数据挖掘方法能够更有效地解决土壤与环境因子之间的非线性问题,是目前为止应用非常广泛的一类方法。但是其中的大部分方法,比如神经网络、贝叶斯模型和随机森林等,属于黑箱或者半黑箱方法,它们所获得的知识难以被转化成规则型知识,难以直观地了解土壤与环境因子之间的定量关系。而回归树模型能够提取出土壤环境关系的规则,但是在采用回归树方法获得的土壤属性图中,由于在每一个节点处土壤属性都是不连续的,因此导致生成的土壤属性图不是一个平滑的连续面,并且在节点较少的情况下,会导致与现实不符的土壤突变现象(McKenzie et al, 1999)。

(3) 基于专家知识的方法

基于专家知识的土壤制图方法从土壤专家获取关于土壤与地理环境变量关系的知识,将专家知识和语义模型相结合,再借助地理信息技术来完成土壤制图,如模糊逻辑推理方法(Zhu et al, 1994,1997, 2001; Zhu, 1997)。该方法一般首先将土壤与环境条件关系的知识表达为隶属度函数,然后根据多个因子的隶属度函数来综合评价某点的土壤属于某种土壤类型的隶属度值,因此某点的土壤可与多个土壤类型具有隶属度(相似度),根据这些隶属度可确定该点的土壤的类型和属性,隶属度的利用可以使土壤空间变化的连续性得到较好的体现(Zhu, 1997; Zhu et al, 1997, 2001)。专家知识可以通过了解当地土壤环境关系的专家获取,也可以通过蕴涵了专家知识的传统土壤图,利用数据挖掘方法获取等(Fayyad et al, 1996; Qi et al, 2003; Stoorvogel et al, 2017)。

(4) 基于样点个体代表性的方法

基于样点个体代表性的方法在环境因子越相似、土壤属性越相近的假设下,认为每一样点可看作包含特定土壤—环境关系的案例,能够代表与之环境因子组合相似的地区,并且代表程度可由两点间的环境相似度来度量,通过分析环境相似度推测不确定性,并以环境相似度为权重计算样点可代表区域的土壤属性值(刘京等, 2013; Zhu et al, 2015)。该方法突破了现有方法对样点集全局代表性的严格要求,为利用大尺度空间范围内数量有限、分布任意的样点进行土壤属性制图提供了途径。

3.3.2 基于空间自相关的土壤制图

基于空间自相关的数字土壤制图是在空间自相关理论的基础上,建立描述目标地理变量空间自相关性的模型,进而结合待推测点的空间位置,推测目标地理变量在该点的特征值(Matheron, 1963;Burgess et al, 1980; Isaaks et al, 1989; Goovaerts,1999)。根据空间自相关分析的范围不同,可分为全局空间自相关分析和局域空间自相关分析。

(1) 全局空间自相关分析

全局空间自相关方法主要为趋势面分析,以样本的地理坐标为自变量,以样本处的土壤属性值为因变量拟合的多项式(一般是低阶多项式)进行全局模拟。趋势面分析是对样本集属性特征进行全局规律的分析,忽略了样本集中的局部规律,因此,对目标变量的局部的特征较难预测,并且一旦研究区改变,趋势面函数往往不适用,需要重新拟合。Davies等(1970)曾利用该方法推测英国肯特郡的土壤Ph 值。王会肖等(2007)在陕西省绥德县辛店沟研究区,基于规则采集的样点利用趋势面分析的方法推测了土壤水分的空间变化趋势。

(2) 局域空间自相关分析

局域空间自相关分析主要包括最邻近法、反距离加权法、样条插值法和克里格插值法等。最邻近法是将与待推测点距离最近的样本的属性值作为待推测点的值。该方法的优点是简单、效率高;缺点为只考虑了与待推测点最近的样本,结果容易出现阶梯状的空间变化,在实际应用中往往精度不高(Nemes et al, 2006)。反距离加权法以待推测点与样本点的空间距离确定权重进行加权平均计算,即离待推测点越近的样本点赋予的权重越大。该方法优点是简便易行,缺点是其结果受所采用的局域空间范围大小、参与样本数量以及距离权重衰减系数影响较大,在样点密度高且在空间上呈规则分布的情况下才可能获得较高的插值精度(Isaaks et al,1989; Chang et al, 2001)。样条插值法是一种分区的分段多项式插值方法,在样本数据量充足且冗余度低的情况下,计算结果快且平滑性较好(Hutchinson,1995; Hallema et al, 2015),但插值结果受所选样本数据的影响较大,当样本数据较多而冗余的时候,求算函数方程复杂耗时,且区域衔接处的值波动会很大(Bishop et al, 1999)。

克里格插值法是基于空间自相关的数字土壤制图中应用最为广泛的一种方法。其基于样本反映的区域化变量的结构信息(变异函数,也称半方差函数),根据待推测点周围或块段有限邻域内的样本数据,对待推测点进行的一种无偏最优估计,并且能给出估计每一个推测点的推测方差(Matheron,1963; Burgess et al, 1980; Webster et al, 1990;Loague, 1992; Zhang et al, 2011)。主要方法包括普通克里格、简单克里格以及分区克里格等方法(Burgesset al, 1980; Stein et al, 1988; McBratney et al,1991; Li et al, 2011, 2014)。与其他传统插值方法相比,克里格插值法的结果更精确,更符合实际;缺点是要求样本数量较多、分布均匀、样本代表性好,而且区域化变量的结构信息要满足二阶平稳假设(Isaaks et al, 1989; Goovaerts, 1999)。从以上阐述可以看出,基于空间自相关的空间推测方法依赖于空间关系(变异函数)的确定,而空间关系的确定是基于所有的样点,因此样点的数量和空间分布成为这类方法的核心。一般情况下,获取具有较好代表性的空间关系需要数量足够大和空间覆盖比较好的样本集(de Gruijter et al, 2006; Brus et al, 2007; Li etal, 2014)。由于对样本的依赖性和对空间关系二阶平稳的要求,所得的空间关系很难被直接应用到其他区域,绝大部分情况下在一个新的区域内必须采集本区域内的样本来定义适用该区域的空间关系(变异函数)。

3.3.3 基于要素相关性和空间自相关相结合的土壤制图

实际上,某点的土壤性状不仅与空间上邻近点的属性相关,而且也与该点的其他地理要素(即土壤环境要素)相关。基于该思想,学者们将上述空间自相关模型与要素相关模型结合,即在考虑土壤属性空间分布具有自相关特征的同时,也考虑土壤与土壤环境要素的关系,形成空间自相关和要素相关性相结合的数字土壤制图方法。其代表方法有协同克里格插值法、回归克里格插值法、地理加权回归模型等。

协同克里格插值法是建立在协同区域化变量(空间相关性)理论基础上,利用目标变量和环境变量之间的协同相关性,建立交叉协方差函数对目标变量进行局部估计(McBratney et al, 1983; Goulardet al, 1992; Odeh et al, 1995; Yang et al, 2016)。回归克里格插值法是将土壤属性与环境变量进行回归分析,然后将回归模型的残差项作为区域化变量进行克里格插值,最后与回归模型的预测值相加,生成最终的土壤属性空间分布图(Knotters et al, 1995;Odeh et al, 1995; McBratney et al, 2000; Mondal etal, 2017;)。地理加权回归是局域线性回归,根据样点离回归中心点的距离,确定样点对回归模型参数估算的权重,距离越近的样点权重越大,从而反映样点及环境变量对回归方程贡献空间上的差异,使回归结果较全局的线性回归更为可信(Kumaret al,2012; 郭龙等, 2012; Wang K et al, 2013; Song et al,2016; Zeng et al, 2016)。

由于该类方法同时考虑空间自相关性和环境变量相关性,一定程度上能提高土壤推测的精度,但其缺点是对样本数量与分布要求较高,样本需要满足二阶平稳的假设并要求要素相关性稳定(Hengl et al, 2004, 2007)。基于要素相关性的方法是现有数字土壤制图方法中应用最广泛的方法,其中随机森林是数据挖掘方法应用广泛的方法,而土壤-景观推理模型(SoLIM模型)则是基于知识的制图方法的突出代表(Zhu et al, 2001; 朱阿兴等,2008)。基于空间自相关推测土壤属性空间分布的方法也应用广泛,这类方法不仅要求样本密度高,而且需要样本能很好捕捉土壤属性的空间自相关特征(Isaaks et al, 1989; Goovaerts, 1999)。基于要素相关性和空间自相关相结合的方法须同时满足2 个方面(要素相关性和空间相关性)基本条件,往往在实践应用中很难得达到。随着全球数字土壤制图计划的开展以及全球变化研究的需求,研究者们开展了全球尺度的土壤制图工作(Hengl et al, 2017)。

3.4 土壤图的产生及验证

不同的制图方法生成的土壤图种类不同,一般而言,可生成的土壤图包括土壤类型模糊隶属度图、土壤类型栅格图和空间上连续的土壤属性图等。土壤类型模糊隶属度图主要是Zhu 等(2001)和朱阿兴等(2008)所提的基于相似度的制图方法所生成的结果,土壤类型模糊隶属度图还可以通过硬化得到土壤类型栅格图,以及结合隶属度和典型点的土壤属性生成土壤属性图(Zhu et al, 2001)。其他方法,如克里格插值、数据挖掘方法等生成的主要是土壤类型栅格图或土壤属性图。此外,土壤类型栅格图可用于编制与传统土壤图可比的、以多边形为表达方式的类常规土壤图(朱阿兴等, 2008)。在土壤图生成的过程中,部分模型同时会产生不确定性分布图,用于指示结果的可靠程度,为土壤图的应用(如决策制定、环境评价等)提供更明确的信息。克里格插值方法可生成每个栅格上的克里格方差来度量制图结果的不确定性。基于环境相似度的方法推测制图时可产生两种不确定性:忽略不确定性(Ignorance Uncertainty)和夸大不确定性(Exaggeration Uncertainty)(Zhu, 1997)。而基于个体代表性的制图方法也给出了一种推测不确定性的计算方法(Zhu et al, 2015)。

土壤图的验证方法主要包括定性与定量评价两种。定性评价主要对土壤图的空间分布合理性进行评估或者根据专家已有经验判断结果的正确性,而定量评价则是验证数字土壤制图精度更为常用的方法。定量评价方法主要通过野外样点的真实观测值与预测值进行对比验证制图的精度。验证方式主要包括3 种:独立验证点验证、留一交叉验证(leave-one-out Cross Validation)以及多折交叉验证(k-fold Cross Validation)。独立验证点验证主要是在制图之后,采集某种特定的采样策略的额外样点对结果进行验证,最为常用的为概率采样样点。留一交叉验证依次将每一个样点作为验证样点,其余N-1 个样点作为训练样点来评价制图结果,该方法主要是在样点数目比较少的情况下使用。而多折交叉验证则是随机将已有样点分为训练样点与验证样点,训练样点用于推测制图,然后通过随机的验证样点来评价制图结果。

土壤图的验证指标根据土壤图的不同而有所差异。对于土壤类型来说,主要通过混淆矩阵验证分类的精度,混淆矩阵包含有总体精度、生产者精度、用户精度以及每种土壤类型的精度等,这些精度指标从不同侧面反映了分类的精度( 杨琳,2006)。而对于土壤属性图来说,验证指标主要为平均绝对误差(MAE)、均方根误差(RMSE)和决定系数等。Brus 等(2011)评比了制图验证所用的土壤采样方法和制图评价指标,并推荐了相应的指标。Malone等(2011)提出了量度数字土壤图预测精度和不确定性的新方法。

4 未来发展趋势和展望

数字土壤制图在过去的30 年取得了飞速发展,国内外学者在获取环境变量数据、采样方法和制图模型方法方面开展了大量的研究,应用案例也从小范围到大区域,甚至是全球尺度(Hengl et al, 2014,2017)。在理论研究方面,未来的可能发展方向包括以下几个方面:

(1) 刻画环境变量的新技术。如何在环境梯度较小地区(往往也是人类活动频繁的地区)获取能反映土壤空间差异的环境信息是数字土壤制图研究中的一个重要内容。遥感技术是获取这类信息的重要手段,随着遥感数据的空间分辨率不断提高,不同平台、不同时相的遥感数据更能有效地反映某些土壤类型的空间差异信息。由于土壤状况不同,其生长的植被状态随时间变化而产生的差异一般会在一系列遥感图像上表现出来,因此,通过长时间序列、高时间分辨率的多光谱遥感信息的分析,可获取与土壤空间变化具有协同关系的信息,进而提高精细土壤普查方法在环境梯度较小地区的应用效果。这方面的工作刚刚起步,还需进行大量深入细致的研究。

(2) 新型数据和遗留数据的有效利用。近年来,土壤近地传感、卫星遥感技术的快速发展为获取土壤空间分布信息提供了更多可用的数据,有效利用这些数据可更好地为土壤制图服务。一些地区经过过去多次的野外调查积累了很多样点数据,这些数据具有或大或小的时间间隔、不同的采样设计和目的,如何将多源样点进行评估,以及标准化和协调利用是未来待解决的问题。此外,很多研究区积累了不同类型的数据,包括历史土壤图、样点、文本资料等等,综合利用这些不同数据的优势可更加有效地进行数字土壤制图。

(3) 新型推理方法。目前机器学习、数据挖掘等方法在数字土壤制图中得到全面的应用,也取得了不错的制图精度,这些方法的特点是利用大量的训练集样点获取土壤与环境因子的关系或空间位置关系,但是,基于样点获得的关系可能过于依赖样点数据,因而需要土壤发生学知识介入才能建立更准确的关系,所以在采用机器学习和数据挖掘方法时如何与土壤发生学知识进行结合也是一个重要的研究方向。

(4) 支持大数据多终端的计算模式。全球变化研究对全球或区域尺度的土壤属性数据提出了较高的要求,然而处理全球尺度的大批量数据对计算模式提出了新的要求。同时,也亟需构建为公众所用的土壤制图服务平台。

(5) 拓展推广应用。主要包括2 方面:一是生产高分辨率大范围的土壤信息数据库;二是与地学过程模型的领域结合。

具体参考文献略。返回搜狐,查看更多

阅读 ()
平台声明
该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。