ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

空间统计热点分析:Getis-Ord Gi*原理与结果解读

空间统计热点分析:Getis-Ord Gi*原理与结果解读 做了那么多期空间统计微信群和后台留言里问得最多的就是“热点分析”。这玩意儿名字听着唬人其实就是把一张图上有聚集特征的高值和低值找出来。你可能已经用ArcGIS里的Hot Spot Analysis (Getis-Ord Gi*)跑出过那张红红蓝蓝的图也听说过z得分、p值这些名词但真让你解释为什么红色区域就是热点或者为什么有些明显很高值的点反而没被识别成热点估计很多人就卡壳了。这篇“上篇”先把概念和原理彻底掰开揉碎包括热点分析到底在算什么、和普通分级着色有什么区别、Getis-Ord Gi*背后的数学直觉以及那张结果图里z得分和p值应该怎么联合解读。把这些搞明白下一篇再讲实操和参数调优就顺理成章了。不管你是搞城市规划、公共卫生、犯罪分析还是商业选址的只要跟“哪里高、哪里低、哪里聚集”打交道这篇都值得看完再走。1. 热点分析到底在算什么1.1 先从一张普通地图说起假设你手头有一份某城市各小区近一年的入室盗窃案件数量分成五个等级深红代表案发最多的区域。把这张图甩给朋友看大多数人第一反应是这些深红色的地方就是“热点”嘛全区最危险的地方还用得着空间统计这里就藏着一个常见的误区。普通分级着色图解决的是“哪里数值高”热点分析回答的是“哪里高得不像随机”。听起来像文字游戏举一个例子你就明白了。某小区因为人口密度大案发30起旁边几个小区全是20多起但全城平均只有8起。单独看每个小区30起确实高但当周围都是二三十起的时候这个30起不过是连绵高值区里普普通通的一员并不存在“鹤立鸡群”的异常聚集。反过来有一个小区案发18起绝对数值不算高但周围一圈小区都只有2到5起那这18起就显得极其突兀统计上反而更值得警惕。热点分析做的就是这个“相对比较”。它不比数值绝对值比的是某个位置和它邻居之间的空间关系。准确地说它识别的是高值聚集区热点和低值聚集区冷点而不是简单的“大值”和“小值”。所以你会看到一种反直觉的现象数值很高的地方可能不显著数值中等的地方反而被判定为热点。理解了这一点你才算真正踩进了空间统计的门槛。1.2 地理学第一定律的实战价值热点分析的理论根基是地理学第一定律所有事物都与其他事物相关但相近的事物关联更紧密。犯罪案件会在某些街区聚集房价会沿着地铁线连片上涨传染病在社区间的传播也有空间上的“亲子关系”。这些现象背后都有一个共同特征——空间自相关。空间自相关听起来复杂其实就是“相邻位置之间存在相互影响”。一个位置的值高周围的值也倾向于高一个位置的值低周围也低。这就是正空间自相关。还有一种情况是高低值间隔分布比如高档小区旁边就是旧城区低值和高值交错出现这叫负空间自相关。热点分析的核心任务就是把这种“空间上的相互影响”量化出来并判断它是不是足够显著。这场判断不能靠肉眼。人眼对颜色敏感但对“显著性”没有感知。一个区域只有三个点点值全都很高地图上一片深红但它样本量太少统计上可能完全不显著另一个区域有一百个点大部分中等偏高整体聚集趋势异常稳定这反而是真正扎眼的“热点”。没有统计检验辅助单靠目视解译很容易被小样本高数值的假象带偏。2. 从空间自相关到Getis-Ord Gi*2.1 全局莫兰指数和局部统计量的区别很多人一接触热点分析就顺带听说过莫兰指数Moran‘s I。莫兰指数也是一种衡量空间自相关的指标但它给出的是一个全局数值比如0.35或者-0.12告诉你整个研究区域内是否存在聚集模式。问题在于全局指标会把细节平均掉。一个城市东南边有显著的犯罪聚集西北边完全是随机分布两个区域的信号混在一起莫兰指数可能只有0.1看着像没有聚集。但东南边的聚集是真实存在的只是被平均了。这也是热点分析存在的核心意义。它做的是局部空间自相关检验对研究区域内的每一个要素都计算一次判断该要素周围是否存在局部聚集。Getis-Ord Gi就是其中最有代表性的一种被ArcGIS直接做成了“热点分析”工具。它和局部莫兰指数LISA的差别在于Gi不仅看“聚不聚”还看“聚的是什么”——高值聚集还是低值聚集。这一点对业务判断特别重要比如犯罪分析中高值聚集是要重点布警的区域低值聚集区域则是安全区两种聚集的含义完全不同输出自然也要分清楚。2.2 Gi*统计量的白话拆解先看一眼公式Gi* (Σj wij xj - X̄ Σj wij) / (S × sqrt([n Σj wij² - (Σj wij)²] / (n - 1)))别被这串字母吓到这个公式说白了就是把目标点周围一圈邻居的值加起来和全区域平均水平做对比再除一个标准差。分子部分衡量的是“局部加权和比全局均值高了多少”分母是“正常情况下这个差值会有多大波动”。如果分子很大、分母适中算出来的Gi*值就高表示这个点的邻居值显著高于整体水平它就是热点。注意公式里那个wij它代表空间权重也就是“邻居关系的定义”。我们可以把空间权重理解成一张人际关系网。全城所有小区都在这个社交网络里但你只关心和你关系好的那几个人。wij就是给每个人打分——距离近的给1分特别远的给0分或者按距离衰减近处给0.8远处给0.2。选什么样的权重规则直接决定了“邻居”的范围和影响力。这也是为什么后面实操时距离阈值和权重方式的选择那么重要。白话翻译一遍Gi*就是在问——以这个点为中心圈定半径范围内的所有值是否显著高于全图平均水准如果显著高就是热点显著低就是冷点不明显就不显著。高和低的判断都带有统计置信度不是随口说说的。2.3 原假设与p值的逻辑任何统计检验都要有个“比较基准”Gi*也不例外。它的原假设是研究区域内各个要素的观测值在空间上随机分布不存在空间聚集。热点分析的所有计算本质上都是在检验这个原假设成不成立。如果计算结果发现某个区域的高值聚集程度高得离谱随机情况下几乎不可能出现那就说明原假设不成立——这里存在真实的高值聚集。p值就是用来衡量“离谱程度”的。p值越小说明这种聚集是随机产生的概率越低结果越可信。比如p0.01意味着如果整张图的值真的是随机分布只有1%的概率会在局部出现这么强的聚集模式。这个概率低到可以忽略于是判定为显著热点。这里经常有人犯错把p值理解成“热点出现的概率”或者“热点强度的概率”。严格来说不是。p值只是在“原假设为真”的条件下观测到当前结果的概率。虽然表述差别细微但理解正确能避免很多解读上的偏差。很多论文和报告里常见的错误就是把p0.05说成“有95%的概率是热点”这种说法在统计学上不严谨懂行的人一眼就能看出问题。3. 读懂热点分析结果里的三个关键值3.1 z得分聚集强度热点分析工具输出结果里第一个必看字段是z得分。z得分是标准差的倍数衡量的是观测值偏离随机分布期望的程度。可以把它想象成一个“标准化后的信号强度”z得分越高说明局部聚集相对于随机分布越强。当z得分是正数且绝对值较大说明这里是高值聚集——热点。比如z2.5表示这个位置周围的高值聚集程度偏离随机分布期望约2.5个标准差。z得分是负数且绝对值较大就是低值聚集——冷点。z得分的绝对大小也很讲究z2和z4虽然都显著但z4说明聚集强度更大可靠程度更高。有一个容易忽略的细节z得分和p值其实是一体两面的关系。正态分布下z越大p越小两者方向相反描述的是同一件事的两个侧面。3.2 p值与置信度定性判断p值衡量的是“随机出现这么强聚集模式的可能性”。但为了方便业务使用很多时候我们会把p值换算成置信度也就是百分比。置信度越高代表结果越可信。常用阈值有三个90%、95%、99%。对应的p值分别是0.1、0.05、0.01。这里有个实操中很重要的概念多重检验问题。你在研究全区几千个小区每个小区做一次检验就是在做几千次独立的假设检验。按照概率规律哪怕数据完全是随机分布也有约5%的检验会碰巧出现p0.05的结果。这就是所谓的“假阳性”。ArcGIS的“热点分析”工具默认不做多重检验校正但“聚类分布制图”工具会提供FDR校正选项。FDR校正的思路是把所有局部检验得到的p值统一排序并重新调整控制假阳性数量在期望范围内。当你研究的要素数量很大时强烈建议开启FDR校正否则图上星星点点的假热点会干扰判断。3.3 置信度分级的真实含义ArcGIS输出结果里按照Gi_Bin字段把要素分成7类置信度99%冷点、95%冷点、90%冷点、不显著、90%热点、95%热点、99%热点。这个字段直接把z得分和p值组合成了一个分组标签方便出图和制表。很多新手拿到结果图后只看红色和蓝色忽略灰色区域。实际上灰色“不显著”区域恰恰是最值得留意的部分。不显著不代表没有聚集只代表没有足够的统计证据证明它显著。特别是在样本量少、方差大的情况下很多真实的聚集信号会被压缩成“不显著”。后续如果增加数据量、优化距离阈值灰色区域可能会转红或转蓝。所以结果解读时建议把注意力集中在置信度90%以上的区域同时对灰色区域保持警惕不要因为不显著就当成完全安全。4. 正式分析前必须搞定的三件事4.1 数据质量热点分析的隐形天花板热点分析对输入数据有一个基本要求每个要素必须有一个数值型字段。这听上去很简单但实际操作中有几个坑。第一如果数据是点数据比如犯罪案件坐标需要先聚合到格网或行政区面再计算每个区域内的案件数、平均值或密度值表达为区划面或网格中心点。第二如果某个区域的数据缺失ArcGIS默认会把空值排除在计算之外。这样会造成邻居数量不一致z得分和p值的可靠程度参差不齐。处理案发数据时缺失值最好填0而不是空着不填。否则计算邻居集合时会少算很多关系。另一个高频问题是数据尺度。热点分析适合处理连续型或比率型数据密度、人均收入、发病率、案件率不太适合直接分析总量数据。举个反例比较两个社区的新冠病例数A社区10万人口、100个病例B社区1万人口、90个病例绝对数量相差不大但感染率差了近10倍。直接用病例数做热点分析会完全扭曲真实风险分布。所以数据准备阶段一定要先想清楚分析的是总量差异还是强度差异。后者往往更符合实际业务需求就需要先算比率、密度或人均值。4.2 空间权重矩阵决定谁是邻居热点分析里最影响结果的一步是选择空间关系概念化方式。ArcGIS里提供了多种选项固定距离、反距离、K最近邻、面邻接Contiguity等。它们本质是在定义“邻居”的范围和权重分配规则。固定距离比较直观给定一个半径半径内的都是邻居半径外的不算。适合点密度比较均匀的数据比如均匀分布的警务亭、采样点。如果点的分布不均匀城区密密麻麻、郊区稀稀拉拉固定距离会导致城区每个点都有几十个邻居郊区却几乎没有邻居算出来的结果可比性很差。这时候更适合K最近邻保证每个点都有相同数量的邻居比如每个点都取最近的8个。面数据行政区、网格则常用面邻接规则相邻的面互相为邻居也可以设置一阶、二阶邻接扩展。实操中建议先用K最近邻跑一版结果再换固定距离跑一版对比。如果两次结果的红蓝格局差异很大说明权重设定对结果影响剧烈需要更谨慎地选择如果结果高度一致说明数据本身聚集信号很强参数设定不是主要矛盾。4.3 距离阈值和带宽影响结果明显程度的旋钮使用固定距离时距离阈值的选择需要认真推敲。阈值太小每个区域的邻居太少空间关系捕捉不全结果上会出现大量碎片化的小热点地图像得了麻疹阈值太大邻居太多全局均值的影响被拉平局部聚集信号被稀释结果可能整片区域都不显著。比较合理的做法是先计算要素之间的平均距离或中位数距离以此作为初始阈值并运行一遍再逐步放大或缩小观察结果的连续性和稳定性。这个过程有点类似调相机的光圈——没有绝对正确的阈值只有相对合理的范围。ArcGIS官方也提供了增量空间自相关工具可以自动计算多个距离带上Moran’s I的变化找到第一个明显峰值点这个峰值对应的距离往往就是最佳阈值。这个方法虽然稍繁琐但比拍脑袋填一个距离靠谱得多。有一种常见错误是把距离阈值设得极大比如直接覆盖整个研究区域希望把所有可能的相关都纳入计算。结果是每个点的邻居集合都近似于全体要素各点的局部统计量趋同热点分析会直接退化成一个全局均值检验完全失去“局部”的意义。这种情况在实操中被叫做“过度平滑”被平滑掉的往往正是最需要识别的局部异常。5. 热点分析最容易踩的五个坑5.1 把边缘区域当成热点或冷点边缘效应是个老问题。研究区域边界上的要素邻居数量天然比中心区域少。因为边界外没有被我们采集的数据但现实中边界外的邻居是真实存在的。就拿城市范围讲城市边缘的小区它真正的邻居可能跨过市政边界分布在另一个城市但数据里没采集计算时自然也不会算进去。邻居少了分母偏小Gi*值容易波动边缘区出现假热点或假冷点的概率就比较高。应对方法有几个一是尽量把研究区域外扩一圈留出“缓冲区”参与计算但分析报告里只展示核心区域二是使用K最近邻保证每个点的邻居数量一致至少从机制上消除邻居数量不均的问题三是解读结果时对边缘区域的红色蓝色保持适度的怀疑不要一看到边界上有热点就立刻写进报告。5.2 小样本区域的统计不可靠统计检验的性能和样本量强相关。一个区域如果只有两三个观测要素哪怕计算出了很高的Gi*值都不应该过度解读。因为样本量过小时方差估计不稳定z得分和p值的可信度大打折扣。比如一个格网里只有3个案件点周围邻居案件数都很少这3个点让局部均值显得很高可能算出z3.2、p0.01的“强热点”。但仔细想想样本只有3个偶然性极大。所以做热点分析时最好在数据聚合阶段设置一个最低样本量的门槛比如每个格网至少要有5个案件点才进入分析案件数少于5的格网直接置为0或剔除。宁可损失一些空间细节也不能让统计推断建立在一个站不住脚的小样本上。5.3 忽略空间尺度效应空间数据有一个特性结果随分析尺度变化而变化。同样是犯罪数据按500米格网聚合热点可能集中在某两条街道按2公里格网聚合热点会变成一个片区按街道办级别聚合可能全城一条大河波浪宽到处都是热点。这不是bug而是空间统计的基本性质——它反映的是不同尺度下的聚集模式。这个特性带来一个重要提醒不要只跑一个尺度就下结论。最好在同一套数据上尝试两三种聚合尺度看看热点格局是否稳定。如果不同尺度下的热点位置基本一致那说明这些区域是“铁打的热点”信号非常强如果热点位置随尺度剧烈变化则说明聚集的尺度依赖性很强结论必须限定在特定尺度下才成立。很多论文里被批评的空间分析不严谨往往就是栽在这上面。5.4 把相关性当因果热点分析识别的是空间上的聚集模式不是因果关系。比如某区域餐饮店聚集且夜间人流量高关联分析可能把这一带识别为商业热点。但这里只说明“餐饮店多的地方夜间人也多”不说明“餐饮店导致了夜间人多”。可能是共同的地铁站位置、居民区分布、租金水平同时影响了这两个变量。解释结果时要注意措辞用“存在显著的高值聚集”而不是“X导致Y”的表达方式。我第一次给一个客户交报告时就犯了错误。分析结果显示某个片区盗窃案热点显著我顺势在报告里写“治安盲区、巡逻建议加强”客户追问“为什么这里会形成热点”我才发现数据里根本没有道路照明、监控摄像头、人口流动这些变量我给不出因果推断层面的解释。后来形成的习惯是热点分析的报告里必须附带“此处为聚集现象具体成因需结合其他数据进一步分析”的声明。5.5 FDR校正到底要不要开前面提到过FDR校正这里重点展开决策逻辑。如果研究区域内有2000个网格每个网格都做一次显著性检验按照显著性水平0.05来算哪怕数据完全随机也可能出现约100个假阳性网格。这100个假热点会严重污染结果尤其当你准备基于热点图做资源配置时等于把预算投到了一批“随机幸运儿”头上。但开启FDR校正也有代价p值会被调严原本置信度90%的边角热点可能被降为不显著热点图会显得更“秃”。这会让非技术背景的决策者产生疑虑“为什么图上热点这么少”为了平衡实操中我通常建议结果输出主图用FDR校正后的版本但它旁边额外放一张未校正的对照图并标注“未校正图中红色区域为候选热点需进一步现场核查”。毕竟空间统计是辅助决策工具不是最后拍板的神谕。最终判断还是要人来做。6. 上篇小结加下篇预告这一篇几乎没有讲ArcGIS里面的按钮位置也没有给你一步步的菜单截图因为我觉得原理才是所有操作的底层支撑。你得先明白Gi*在算什么权重矩阵怎么影响结果p值和z得分的组合意味着什么然后你去点那些按钮的时候才会有底气。不然照着教程点完了输出了一堆红色蓝色也不知道参数为什么要这么设遇到一点异常结果就抓瞎。我个人在实际操作中的体会是热点分析这个工具入门只需要十分钟用熟练需要一两年。每一次分析都会对数据、尺度和研究问题本身有新的理解。同一个数据集换一种权重方式热点格局完全两样换一个聚合尺度结论天翻地覆。这不是工具不行而是空间现象本身就是多尺度的。下一篇会进入真正的实战环节。我准备用一份模拟的商铺营业额数据完整跑一遍热点分析流程数据聚合、字段选择、距离阈值实验、K最近邻与固定距离对比、FDR校正前后的结果变化然后把输出的Gi_Bin字段和z得分做成专题图手把手教你解读每一块颜色背后的统计含义。如果你手头正有一批带坐标的数据卡在分析第一步那篇应该就是你需要的“抄作业”模板。对了如果你跑完热点分析后发现结果图上一大片全红或者全蓝先别怀疑人生。大概率不是你的数据有灵性而是距离阈值设得太大所有邻居都互相连成一团了。把阈值缩小重新看看。这个技巧我当年可是折腾了两个通宵才明白。
返回列表