教程 ·

空间自相关 Moran's I 用 AI 一句话完成 — 全局/局部空间聚集检验

空间自相关 Moran's I 完整教程:用 AI 一句话完成全局 Moran's I 与 LISA 局部分析,自动构建空间权重矩阵,输出 Moran 散点图、LISA 聚集地图,并给出可直接套进论文的 APA 7th 报告句式。

数据带经纬度却不知道怎么检验空间聚集?全局 Moran's I 说"有聚集"但不知道聚在哪里?LISA 热点图怎么画?这篇教程用一句自然语言指令解决空间自相关分析的全套问题,输出可直接贴进论文的 APA 格式报告。


为什么空间数据不能直接用普通统计方法

传统统计学的基本假设之一是观测值相互独立。然而一旦数据带有地理坐标——省级 GDP、城市 PM2.5 浓度、社区犯罪率、县域医疗资源——这一假设几乎总会被违反。

地理学第一定律(Tobler, 1970)指出:任何事物都与其他事物相关,但近处的事物比远处的事物相关性更强。用统计语言表达:地理相邻的观测值倾向于拥有相似(或相异)的属性值,这就是空间自相关(Spatial Autocorrelation)

忽视空间自相关会导致:

  • 普通最小二乘回归的残差存在空间依赖,标准误被低估,显著性检验失效
  • 地区间"溢出效应"被遗漏,政策干预效果被错误归因
  • 误将空间聚集现象当作随机分布,错过重要发现

Moran's I 是检验和量化空间自相关最常用的统计量,由 Moran(1950)提出,分为:

  • 全局 Moran's I:一个汇总指标,描述整个研究区域内属性值的空间聚集程度
  • 局部 Moran's I(LISA):分解到每个空间单元,识别局部热点(High-High)、冷点(Low-Low)及空间异常(High-Low / Low-High)

全局 Moran's I:原理与解读

统计量定义

全局 Moran's I 的计算公式为:

         N * sum_i sum_j [w_ij * (x_i - x_bar) * (x_j - x_bar)]
I = ---------------------------------------------------------------
         S0 * sum_i (x_i - x_bar)^2

其中:

  • N:空间单元总数
  • x_i:第 i 个单元的属性值
  • x_bar:属性值的全局均值
  • w_ij空间权重矩阵第 i 行第 j 列的元素,表示单元 i 与 j 的空间邻接关系
  • S0 = sum_i sum_j w_ij:所有权重之和(行标准化后 S0 = N)

I 值的取值范围与含义

I 值区间空间模式含义
I > E(I),p < .05正空间自相关相似值聚集(高-高 或 低-低 聚集)
I ≈ E(I),p > .05随机分布无显著空间模式
I < E(I),p < .05负空间自相关相异值相邻(高-低 交替分布)

理论期望值 E(I) = -1 / (N - 1),样本量较大时接近 0。

I 的取值理论范围为 [-1, 1],实践中受空间权重矩阵结构影响,不严格等于 ±1。

注意:Moran's I 是相关系数而非效应量,不要将其误读为解释力(R^2)。衡量聚集强度应结合 Z 得分和 p 值综合判断。

显著性检验方法

全局 Moran's I 的推断有两种方式:

  • 正态近似法:假设属性值服从正态分布,将 I 标准化为 Z 得分,查标准正态表
  • 蒙特卡洛置换检验(Permutation Test):对属性值做随机重排(通常 999 次),构造经验分布,直接计算 p 值

蒙特卡洛置换检验是推荐方式,因为它不依赖正态假设,对小样本和非正态数据更稳健。ChatSRS 默认采用 999 次置换检验。


空间权重矩阵:连接空间关系的核心

空间权重矩阵 W 是 Moran's I 计算的基础,它定义了"什么叫空间邻接"。常见构建方式:

邻接型权重矩阵

类型规则适用场景
Rook 邻接共享边界(上下左右)规则网格、行政区划
Queen 邻接共享边界或顶点(8 方向)行政区划(最常用)
k 近邻(KNN)距离最近的 k 个邻居点数据、岛屿多边形
距离衰减w_ij = 1/d_ij^alpha连续距离关系

行标准化(Row-standardization):将每行权重除以行和,使每行总和为 1。标准化后 I 的解释更直观,且对形状不规则的多边形更公平。ChatSRS 默认使用 Queen 邻接 + 行标准化。


局部 Moran's I(LISA):找出热点与冷点

全局 Moran's I 只给出一个全局汇总值,无法告诉你哪里聚集。局部空间关联指标(Local Indicators of Spatial Association, LISA)由 Anselin(1995)提出,将空间自相关分解到每个空间单元:

I_i = z_i * sum_j (w_ij * z_j)

其中 z_i = (x_i - x_bar) / s 为标准化属性值。

LISA 四象限分类

基于 Moran 散点图,每个空间单元被分入四个象限:

象限含义颜色惯例
High-High (HH)高值被高值邻居包围 — 热点红色
Low-Low (LL)低值被低值邻居包围 — 冷点蓝色
High-Low (HL)高值被低值邻居包围 — 空间异常(正)橙/粉色
Low-High (LH)低值被高值邻居包围 — 空间异常(负)浅蓝色
Not Significant无显著局部聚集灰色

LISA 的每个单元 p 值同样通过置换检验获得,通常设置 alpha = .05,仅将显著的聚集区域标注在地图上。


案例数据:中国 285 个地级市 PM2.5 年均浓度的空间聚集检验

研究背景

某环境经济学研究团队分析 2023 年中国 285 个地级市的 PM2.5 年均浓度(微克/立方米)是否存在显著的空间聚集效应,并识别局部热点城市群,为区域联防联控政策提供依据。

数据结构

city_code    城市代码(国家标准行政区划代码)
city_name    城市名称
province     省份
pm25_2023    PM2.5 年均浓度(ug/m^3)
longitude    城市几何中心经度
latitude     城市几何中心纬度

285 行,6 列,附带城市边界 shp 文件(或直接使用经纬度坐标)。


用 AI 一句话完成 Moran's I 分析

chatsrs.com 上传数据(CSV + SHP 或仅 CSV 含经纬度)后输入:

"对 285 个地级市的 PM2.5 年均浓度做空间自相关分析:

  1. 构建 Queen 邻接空间权重矩阵(行标准化),输出邻接统计摘要(最少/最多/平均邻居数)
  2. 全局 Moran's I 检验(999 次蒙特卡洛置换),输出 I 值、Z 得分、p 值,并绘制 Moran 散点图
  3. LISA 局部空间关联分析(alpha = .05),识别 HH/LL/HL/LH 区域,绘制 LISA 聚集地图
  4. 输出显著聚集城市名单(HH 热点 + LL 冷点前 10 名)
  5. 写 APA 7th 格式中文文字描述"

ChatSRS 会调用 R(spdep 包)或 Python(pysal 库)自动完成全套流程,无需手动配置 GIS 环境。


输出结果怎么读

输出 1:空间权重矩阵摘要

空间权重矩阵摘要(Queen 邻接,行标准化,N = 285)

邻居数统计:
  最少邻居数:1(岛屿城市/飞地)
  最多邻居数:12
  平均邻居数:5.84
  中位数邻居数:6

连通性诊断:
  孤立单元(0 邻居):0
  总权重 S0:285.00(行标准化后等于 N)

怎么看:Queen 邻接下平均邻居数约 6,无孤立单元说明权重矩阵构建正常。如有孤立单元(岛屿省份如海南、舟山等),ChatSRS 会自动切换为 k=5 近邻矩阵并给出提示。


输出 2:全局 Moran's I 检验结果

全局 Moran's I 检验结果

属性变量:PM2.5 年均浓度(ug/m^3)
空间权重:Queen 邻接,行标准化
推断方法:蒙特卡洛置换检验(999 次)

Moran's I = 0.4832
期望值 E(I) = -0.0035(= -1/(N-1))
方差 Var(I) = 0.000847
Z 得分 = 16.77
p 值 = 0.001(< .001,基于 999 次置换)

结论:存在显著正空间自相关,PM2.5 浓度呈现高值聚集与低值聚集的空间模式。

读懂关键指标

指标含义本例解读
Moran's I = 0.483正空间自相关强度中-强程度聚集(0 = 随机,1 = 完全聚集)
Z = 16.77标准化得分远超 ±1.96 临界值,极显著
p = .001置换检验 p 值999 次置换中无一次 I 值 >= 观测值

报告惯例:置换检验 p 值的精度受置换次数限制(999 次时最小可报告 p = .001),如需更精确 p 值可增加至 9999 次。APA 格式下写 p < .001 或 p = .001 均可。


输出 3:Moran 散点图解读

Moran 散点图以标准化属性值 z_i 为横轴,空间滞后值(邻居均值)W_z_i 为纵轴,回归线斜率即为全局 Moran's I。

Moran 散点图分布(按象限):

  第 I 象限(HH,高-高聚集):  82 个城市(28.8%)— 华北平原、汾渭平原城市群
  第 II 象限(LH,低-高异常):  19 个城市(6.7%)
  第 III 象限(LL,低-低聚集):  141 个城市(49.5%)— 西南、东南沿海城市
  第 IV 象限(HL,高-低异常):  43 个城市(15.1%)

输出 4:LISA 局部聚集检验结果(alpha = .05)

LISA 显著聚集城市统计(alpha = .05,999 次置换)

聚集类型       城市数    占比
HH 热点         64       22.5%   — 石家庄、邢台、聊城、济南等华北平原城市
LL 冷点         98       34.4%   — 丽水、三明、黔南、西双版纳等南方低污染区
HL 正异常        8        2.8%   — 局部高值孤岛
LH 负异常        5        1.8%   — 低值城市被高值包围
Not Significant 110      38.6%

注:p 值通过 999 次条件置换检验获得;多重比较采用 FDR(Benjamini-Hochberg)校正。

HH 热点前 10 城市(PM2.5 浓度最高且被高值邻居包围)

排名  城市      省份     PM2.5(ug/m^3)  LISA I_i
1     邢台      河北     58.3             0.891
2     邯郸      河北     56.7             0.867
3     聊城      山东     54.2             0.823
4     石家庄    河北     53.8             0.798
5     运城      山西     52.1             0.762
6     临汾      山西     51.4             0.748
7     菏泽      山东     50.9             0.731
8     安阳      河南     50.3             0.714
9     保定      河北     49.7             0.698
10    郑州      河南     48.8             0.672

论文里怎么报告(APA 7th 格式)

APA 报告要素清单

空间自相关分析的方法/结果节需包含:

  1. 空间权重矩阵类型(邻接规则、是否标准化)
  2. 检验方法(蒙特卡洛置换次数)
  3. 全局 Moran's I 值、Z 得分、p 值
  4. LISA 分析的显著性水平与多重比较校正方式
  5. 各类聚集区域的空间分布描述

完整 APA 7th 报告示例

方法节(空间分析部分)

采用全局 Moran's I 指数检验 285 个地级市 PM2.5 年均浓度的空间自相关程度。基于 Queen 邻接规则构建行标准化空间权重矩阵,平均邻居数为 5.84(范围:1~12)。统计推断采用 999 次蒙特卡洛条件置换检验。进一步采用局部空间关联指标(LISA)识别局部聚集区域,显著性水平设定为 alpha = .05,并通过 Benjamini-Hochberg 方法对多重比较进行 FDR 校正。所有空间分析在 R 4.4(spdep v1.3)中实施。

结果节

全局 Moran's I 检验结果显示,2023 年 285 个地级市 PM2.5 年均浓度存在显著正空间自相关,I = 0.483, Z = 16.77, p < .001(基于 999 次置换检验),表明空间上相邻城市的 PM2.5 浓度具有显著趋同性,即高浓度城市倾向于毗邻高浓度城市,低浓度城市倾向于毗邻低浓度城市。

LISA 分析进一步识别了局部聚集区域(alpha = .05)。64 个城市(22.5%)形成显著的 HH 热点聚集,主要集中于华北平原及汾渭平原城市群(如邢台、邯郸、临汾等);98 个城市(34.4%)形成显著的 LL 冷点聚集,分布于西南山地及东南沿海(如丽水、三明、黔南等)。8 个城市呈 HL 空间正异常,5 个城市呈 LH 负异常,余 110 个城市无显著局部空间关联(见图 X)。

句式模板(直接套用)

全局 Moran's I 报告句式

对[变量名]进行全局 Moran's I 空间自相关检验([邻接规则]权重矩阵,
[N] 次蒙特卡洛置换),结果显示[显著/不显著]正/负空间自相关,
Moran's I = [值], Z = [值], p [= / < ] [值],
表明[属性值]在空间上[呈高值聚集与低值聚集/呈随机分布/呈高低交替]模式。

LISA 结果报告句式

LISA 分析(alpha = .[值],[N] 次置换检验,[校正方式]校正)共识别出
[n] 个 HH 热点单元和 [n] 个 LL 冷点单元,
分别占研究区域总单元数的 [%] 和 [%];
热点主要集中于[地理描述],冷点主要集中于[地理描述]。

APA 7th 细节提醒

  • Moran's I 斜体写作 I(正文中可写 Moran's I),与其他统计量(FtZ)保持一致
  • 置换检验 p 值精度受次数限制:999 次时最小可报告 p = .001,9999 次时为 p = .0001
  • Z 得分保留两位小数,p 值小数点前不写 0(写 p < .001,不写 p < 0.001)
  • 需在方法节说明软件及包版本(R spdep、Python pysal

ChatSRS 中的 moran_index 方法

ChatSRS 的 68 号分析方法 moran_index 整合了空间自相关分析的完整流程,三引擎均已支持:

引擎底层实现优势
Rspdep::moran.test + spdep::localmoran学术标准;spdep 是空间统计金标准包
Pythonesda.Moran + esda.Moran_Local(PySAL)与 GeoPandas 无缝集成,适合大规模数据
Stataspwmatrix + moransi与回归模型衔接更便捷(接空间面板数据)

输入一条自然语言指令,ChatSRS 自动选择最优引擎并输出:

  • 空间权重矩阵诊断报告
  • 全局 Moran's I + 置换检验 p 值
  • Moran 散点图(含置信椭圆)
  • LISA 聚集地图(HH/LL/HL/LH + Not Significant 五色配色)
  • APA 格式文字描述(中英文可选)

常见问题 FAQ

Q1:Moran's I = 0.48 算"强"聚集吗?和相关系数 r 能类比吗?

A:Moran's I 的量纲与皮尔逊 r 相似但不完全等价,因为它的期望值不是 0 而是 -1/(N-1),且理论上界受权重矩阵结构影响。粗略参考标准(无 Cohen 式通用阈值,学界按领域经验判断):I < 0.10 为弱,0.100.30 为中等,0.300.50 为强,> 0.50 为极强聚集。本例 I = 0.483 属于强空间聚集,结合 Z = 16.77(极显著),可在论文中报告为"存在显著的强正空间自相关"。注意:不能把 I 解释为解释力(R^2),这是常见误用。

Q2:我的数据是点数据(医院/学校坐标),不是面数据,能用 Moran's I 吗?

A:能,但需要调整权重矩阵构建方式。点数据没有共享边界,应使用 k 近邻矩阵(如 k = 5)或距离阈值矩阵(距离 d 以内的点互为邻居)。在 ChatSRS 中指定"使用 k=5 近邻权重矩阵"即可自动切换。另外,对于点数据还需考虑点过程分析(Ripley's K 函数等)作为补充,Moran's I 更适合已经聚合到面单元的数据(如县/市级统计数据)。

Q3:LISA 分析要做多重比较校正吗?用 Bonferroni 还是 FDR?

A:LISA 分析对每个空间单元独立做显著性检验,多重比较问题确实存在。实践中主流做法有两种:

  • 不校正(最常见):直接使用 alpha = .05,因为空间单元本身就存在相关性(独立性假设已违反),Bonferroni 过于保守
  • FDR 校正(Benjamini-Hochberg):控制假发现率而非家族误差率,比 Bonferroni 保守程度适中,是近年论文的推荐做法

ChatSRS 默认提供两种结果(校正前/后),在指令中指定"FDR 校正"或"不校正"即可。

Q4:全局 Moran's I 显著,但 LISA 找不到显著的局部聚集区域,这正常吗?

A:正常,原因如下:全局 Moran's I 对整个研究区的聚集模式做汇总检验,功效较高;LISA 在每个单元独立检验后经多重比较校正,功效相对较低,尤其当聚集强度弱或样本量小时。解决思路:

  1. 增加置换次数(由 999 次提升至 9999 次),降低 p 值估计误差
  2. 适当放宽局部显著性水平至 alpha = .10(在方法节说明并说明理由)
  3. 改用 Getis-Ord G*(热点分析)——它对单纯的高值聚集(热点)检验功效更高,是 LISA 的有效补充

Q5:空间自相关显著之后,还需要做什么?

A:Moran's I 检验是空间分析的起点而非终点。发现显著空间自相关后,后续常见路径包括:

  • 空间滞后模型(SLM):将邻居因变量 W·y 作为额外自变量纳入回归,建模空间依赖性
  • 空间误差模型(SEM):将空间自相关纳入误差项结构
  • 地理加权回归(GWR):允许回归系数随空间位置变化,探索局部异质性

在 ChatSRS 中可直接输入"在控制 [协变量] 的前提下,对 PM2.5 的空间影响因素做空间滞后回归",无需手动配置空间回归环境。


小结

空间自相关分析的正确流程是:构建空间权重矩阵 → 全局 Moran's I 判断是否存在聚集 → LISA 定位局部热点/冷点 → APA 格式报告

每一步在传统 GIS 或 R/Python 环境中都需要大量前置配置(坐标系统一、邻接矩阵构建、置换检验调参、制图标注……)。ChatSRS 的 moran_index 方法将全套流程压到一条自然语言指令,三引擎(R+Python+Stata)自动选优,输出符合 APA 7th 规范的中文学术报告,Moran 散点图和 LISA 聚集地图一并生成。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。