☰
SPSS两步聚类结果解读:从输出表格到业务洞察的完整指南
2026/10/5 3:51:07 网站建设 项目流程

很多刚接触SPSS的人,第一次跑完两步聚类,面对输出窗口里那一大堆表格和图形,往往是一脸懵。自动聚类表、模型概要、预测变量重要性、单元格分布……每个都认识,连在一起不知道在说什么。这篇文章我就专门盯着“结果解读”这一步,把两步聚类每个输出到底怎么看、怎么用、怎么把结论写进报告里,一层一层拆开讲清楚。内容适合正在做问卷分群、用户画像、客户细分,或者论文里需要做聚类分析但没人带着看结果的新手。

1. 先说清楚两步聚类和其他聚类方法的区别

1.1 为什么偏偏是两步聚类

SPSS里的聚类方法有好几种,最常被提起的是K-means聚类和系统聚类,但两步聚类其实是被低估的那一个,尤其适合做问卷数据分析的人。

K-means的硬伤是你得事先告诉它“我要分成几类”。这在很多探索性研究里不现实,因为研究者自己也不知道样本应该分几类,硬拍一个K值出来,说服力弱。系统聚类虽然能出树状图帮你看类别数,但它对样本量有要求,几千份问卷跑起来树状图几乎没法看,而且变量必须全是连续变量,分类变量一多就力不从心。

两步聚类刚好把这两个痛点都解决了:它能根据数据自身的分布特征,自动给出“到底分几类最合适”的建议;同时它能同时处理连续变量和分类变量,比如年龄、收入这种连续变量,和性别、学历、购买频次这种分类变量,可以放在一起聚类。这一点对问卷数据分析来说是关键优势,因为问卷里本来就是混合类型变量居多。

所以如果你手里的数据是问卷数据,变量当中有连续也有分类,而且你不确定该分几类,优先考虑两步聚类是合理的选择。

1.2 两步聚类到底“两步”在哪里

先说原理,但尽量不堆公式。两步聚类,顾名思义分两个阶段:

第一步叫“构建聚类特征树”。算法会逐个扫描样本,把样本点按照距离的远近,在内存中构建一棵特征树。特征树的每个叶子节点里存放的是若干相似样本的概要信息,而不是原始数据本身。这步做了两件事:一是它把大样本量压成了一个紧凑的树结构,速度快、省内存;二是它在这个过程里还顺带完成了对异常值的识别与处理。

第二步叫“凝聚聚类”。在特征树的基础上,算法再对叶子节点进行凝聚聚类,也就是类似系统聚类的过程,逐步合并最相近的节点,产生一系列不同类别数的聚类方案。然后根据BIC或AIC这类信息准则,加上类别间距的变化,自动确定一个“最优”的类别数。

理解这个原理对结果解读很重要,因为后续输出里的“自动聚类”表、模型概要,都和这两步计算直接相关。你不用会手算,但要明白输出结果里的某些数字,背后的设计逻辑到底是什么。

注意:两步聚类判断最优类别数,输出结果里默认依据是BIC(贝叶斯信息准则)。BIC值越小,说明模型在“拟合优度”和“复杂度”之间取得了更好的平衡。但这只是一个统计上的“建议”,不是金科玉律。业务上如果你觉得3类更好解释,完全可以手动指定聚类数,后面我会展开说。

2. 跑两步聚类之前,先做这些事

2.1 数据格式与变量类型必须检查

很多人在数据预处理上栽跟头,然后怪SPSS不好用,其实问题出在自己身上。两步聚类对输入数据的格式有明确要求,不满足要求,输出结果就可能出乱子。

整理数据时,每一行是一个样本(比如每个问卷填写者),每一列是一个变量。先确认如下几点:

  • 连续变量必须是数值型,在SPSS“变量视图”里类型显示为“数值”。
  • 分类变量必须是名义或有序类型,尤其不要把“性别”这类分类变量设置成数值型,并在“测量”列里保持“名义”或“有序”的属性,否则算法会误当成连续变量处理。
  • 缺失值不能太多。两步聚类虽然有一定的缺失值容忍能力,但它处理缺失值的逻辑是用似然方法估计,缺失比例太高会影响聚类质量。如果某个关键变量缺失超过10%,要慎重考虑是否纳入模型。
  • 连续变量要不要标准化?严格来说,两步聚类不用你手动标准化,算法内部会基于正态分布假设对连续变量做自动缩放。但有一个前提,就是连续变量的量纲差异不能悬殊到离谱。比如收入从几千到几万、年龄从20到60,这种量纲差距算法能消化。但如果有个别极端值特别大,比如收入里混进一个年入千万的,建议先把极端值处理掉。

2.2 变量不要一股脑全丢进去

新手最容易犯的错误,是把问卷里所有题全部丢进聚类模型,想着“反正它能自动选变量”。结果模型概要里的聚类质量显示“差”,然后来问我为什么。

两步聚类本身会自动评估每个变量的重要性,但它不会主动淘汰不重要的变量。你把一堆和分群无关的变量塞进去,它们会在距离计算里产生噪音,把真正有区分力的特征稀释掉。这就像你要区分“苹果和梨”,结果拿一堆“颜色深浅”之外的无关特征一起去算距离,结论自然被干扰。

选变量时把握两个原则:

  • 每个变量都应该有“理论上能区分人群”的潜质。比如研究消费习惯,“月均消费”“购物频次”“价格敏感度”是合适的;但“填问卷花了多长时间”这种变量放进去就没有理论意义。
  • 总量别太多。一般建议纳入聚类的变量控制在10个以内,最多不超过15个。变量越多,解释越复杂,聚类结果的可读性越差。

2.3 缺失值处理的一个快速决策办法

两步聚类的选项里有“使用对数似然距离”和“使用欧氏距离”两种距离度量,官方默认如果是混合类型变量用对数似然。这个距离背后对缺失值有一套基于似然估计的插补机制。

所以,如果缺失较少(小于5%),直接用默认选项让算法自己处理就可以。如果缺失较多(5%-10%),建议在数据预处理阶段先用EM插补或均值替换把缺失填了再跑。缺失再多,就需要考虑这个变量是否可靠了。

我自己的习惯是先跑一次全模型,看一眼模型概要里的质量评级,再针对性地处理变量和缺失,效率更高。

3. 结果解读一:先看模型概览与聚类质量

3.1 模型概要里的关键信息

跑完两步聚类,输出窗口里第一张表格是“模型概要”。这张表最上方显示采用的算法是“两步”,聚类数是多少。这看似人畜无害,但注意一个细节:它显示的是聚类数,不是类别标签。紧接着下方是“聚类质量”的评级。

聚类质量的图标是五个立柱排在一起,显示为“差”“一般”或“良好”三个档位。新手最容易忽略这张图,但这个评级直接决定你下面所有解读有没有意义。如果评级是“差”,需要回到数据预处理阶段重新检查变量和缺失值;如果是“一般”,基本可用但优化空间大;如果是“良好”,恭喜,结果站得住,可以放心往下解读。

3.2 轮廓系数是怎么来的

聚类质量评级背后的量化指标叫“平均轮廓系数”,取值范围是-1到1之间。在SPSS里,这个系数会在模型查看器中显示为具体的数值。

  • 大于0.5:说明类内距离小、类间距离大,聚类结构明显。
  • 0.2到0.5:存在一定聚类结构,但可能有重叠地带。
  • 小于0.2:聚合程度弱,这个聚类结果要慎重使用。

实际跑问卷数据,轮廓系数在0.3到0.5之间都算正常,别追求什么0.8以上,那是合成数据才可能出现的情况。真实问卷数据的噪声本来就大,0.4左右已经足够支撑后续分析。

3.3 聚类数为什么和你想的不一样

模型概要里显示的聚类数,是基于模型判断自动给出的,通常是BIC准则下最小的那个方案。这个数往往不是整数范围偏小,比如自动分成2类或3类。

此时会出现一个局面:自动聚类数和你业务上的预期不一样。别急着接受默认值,也别直接改成你想要的数量。先用“指定固定值”跑一下对比不同聚类数的轮廓系数,选出统计上说得过去、业务上也可解释的那个方案。

具体操作方法是,在“两步聚类分析”对话框里,把“聚类数”选项改成“指定固定值”,分别填入2、3、4、5,跑几轮,记录每次的轮廓系数,再做取舍。不过这个操作要在运行前设置好,每次只能跑一个方案,这也是两步聚类在SPSS里不太方便的一个点,但结果稳定可靠,值这个麻烦。

4. 结果解读二:自动聚类表和聚类分布表

4.1 自动聚类表:算法怎么说服你“分几类”

自动聚类表是一张大型表格,包含BIC、BIC变化量、BIC变化比率、距离度量等指标。

具体每一列代表什么,我一个个说清楚:

  • BIC:贝叶斯信息准则值,越小越好。随着聚类数增加,BIC通常会单调下降。
  • BIC变化量:当前聚类数的BIC和上一个聚类数的BIC之差。变化量为负,说明增加一个类别数之后,拟合优度提升了。
  • BIC变化比率:变化量与前一步变化量的比值,用来辅助判断变的“加速度”。比率突然变小,说明再增加聚类数带来的边际收益在衰减。
  • 距离度量:相邻两类之间的距离比率。这个值越大,说明分成两类之后,两类之间的分离度越高。

解读的时候记住一句口诀:“BIC看趋势,比率看拐点,距离看分离”。SPSS判定最优类别数的逻辑是,先选BIC最小的那个方案,再结合最小类别数不超过总样本数以及类别距离比率做微调。实际报告中,只需要把BIC的变化趋势写清楚,配合聚类质量说明最终选择的类别数是合理的即可。

4.2 聚类分布表:样本落到哪一类里了

模型输出里会有一张“聚类分布”表,显示每个类别的样本数、占比和累计占比。举个例子:

假设自动聚类分为3类,聚类分布表可能显示“聚类1:326人(38.8%)、聚类2:251人(29.9%)、聚类3:263人(31.3%)”。这时要注意一个判断技巧:如果某一类的占比小于5%,说明这个类可能是离群点聚成的边缘群体,需要谨慎对待;如果某个类占比特别大,比如超过70%,说明这个类太宽泛,内部可能还有细分空间,可以考虑增加聚类数。

另外还有一个需要特别留意的坑:SPSS生成的两个聚类结果,如果变量输入顺序不一致,聚类编号可能会对调。简单说就是第一次跑,聚类1是“高收入组”,你改了变量顺序再跑一次,聚类1可能变成“低收入组”。这不是算法出错,而是两步聚类的初始排序机制导致的。所以每次跑模型,务必固定变量顺序,且解读时用聚类分布表和后面的特征描述来确认编号含义,不要只记住“聚类1是XXX”。

4.3 单元格分布表什么时候才需要看

单元格分布表在输出里默认可能不显示,需要在“选项”里勾选。这张表的作用,是展示每个类别在每个分类变量上的表现。比如“聚类1中,男性占比45%,女性占比55%”。

如果你的变量全是连续变量,这张表基本可以不看。但如果你的问卷里有性别、学历、职业这类分类变量,一定要打开这张表,它是后续给类别命名的重要依据。

注意:单元格分布表的解读要小心小样本细格。如果某个交叉分类的单元格样本数很小(比如聚类3里“博士学历”只有5个人),就不要因为差异去下结论,统计上不具备稳定性。

5. 结果解读三:预测变量重要性与簇特征对比

5.1 预测变量重要性图到底在说什么

这一步是结果解读的重头戏。预测变量重要性图是一张横条形图,每个变量对应一条横条,条越长说明该变量对区分聚类结果越重要。

SPSS里这个图的值显示为“预测变量重要性”,范围从0到1。大于0.6的变量被认为是“重要”的预测变量,0.4到0.6算“比较重要”,小于0.4的则解释力较弱。

解读这张图时,有一个关键注意点:重要性高,不等于数值高。它的含义是这个变量在不同聚类之间的差异大、贡献大,和变量本身的均数高低无关。比如“月均收入”的重要性是0.9,说的是收入在区分各个类别时贡献大,而不是说“大家的收入都很高”。

拿到这张图后,按重要性排序挑出排名前三到五的变量,它们就是你给聚类命名和解释类别的核心依据。写报告的时候,可以写“在区分各类别时,贡献最大的变量是A、B、C”。

5.2 怎么用簇特征对比判断类别差异

预测变量重要性图告诉你“哪些变量重要”,但没说清楚“每个类别在这个变量上到底什么水平”。这时候要看簇特征对比图。

在模型查看器下方,SPSS会生成一个簇特征对比的可视化图表,展示每个类别在每个关键变量上的均值或分布差异。比如“聚类1在消费频次上的均值显著高于聚类2”,或者“聚类3中男性比例远高于女性”。

解读的具体步骤建议:

  • 先看连续变量的均值对比,识别出每个类别的“高”和“低”。
  • 再看分类变量的频率对比,看看男女比例、学历构成在各类别间是否有明显差异。
  • 结合预测变量重要性,筛选出差异大且有业务解释意义的变量,形成每个类别的核心画像。

我个人习惯把这个步骤做成一个“画像表格”,比如“聚类1:高收入、高消费频次、对价格不敏感、以男性为主”。这个过程不是统计自动给的,而是基于结果做的业务提炼,也是后续报告中最有价值的部分。

5.3 聚类命名的一个可复用套路

给类别命名建议遵循“特征词+标签”的法则。比如“高活跃高价值用户”“低活跃价格敏感型用户”。注意两点:名字里的特征词必须来自你确认过的关键变量;标签要能让人一看就大概知道这个类别的人是谁。

给自己的类别起好名字之后,回到原始数据文件里生成一个新变量“聚类成员”,这个变量会被追加到数据表末尾,每行样本对应一个类别编号。然后你就可以拿这个新变量去做各种后续分析,比如列联表分析、方差分析、交叉验证了。

6. 实操走一遍:从菜单到参数设置的完整流程

6.1 菜单入口与基本选项

SPSS里启动两步聚类的路径是:“分析” → “分类” → “两步聚类”。打开后看到的对话框包含几个主要区域。

首先要做的就是选定变量。把参与聚类的变量全选进“分析变量”框里。这里需要特别注意,连续变量和分类变量的处理方式不同:SPSS会自动根据变量的测量类型来判断,但最好自己手动检查一遍。在“选项”里可以看到连续变量的标准化方式和分类变量的分布类型,分类变量默认按多项式分布处理,连续变量按正态分布处理。

6.2 关键选项怎么选

距离度量选择,前面说过,默认“对数似然”适合混合类型变量,“欧氏距离”要求所有变量全部是连续变量。你可能想问:那能不能全用连续变量时也选对数似然?技术上可以,但没必要,连续变量之间用欧氏距离更快,结果也更容易解释。

聚类数选择,建议先跑一次“自动确定”,看看模型建议的类别数和轮廓系数。之后再跑几次“指定固定值”,对比不同K值的质量。这就是前面提到过的“横向对比法”。

6.3 输出里需要勾选哪些内容

“输出”选项里,建议勾选“模型查看器”和“聚类成员保存”。模型查看器是交互式界面,可以点击查看不同层次的信息;聚类成员保存会生成一个新变量,必须勾选,否则后续分析还得重新跑一遍。

“选项”按钮里的“处理缺失值”保持默认即可。另外有一个“调整”里的最大节点数、初始距离变更阈值等参数,新手不要动,保持默认,SPSS自己会处理。

6.4 从输出到结论的完整翻译逻辑

模型跑完后,格式上建议按这个逻辑写结论:聚类质量如何 → 自动聚类建议分几类 → 实际选了分几类、为什么 → 各类别样本量占比 → 各类别在关键变量上的差异表现 → 类别命名 → 后续分析方向。

这一套话术,直接用在你论文或报告的结果部分,逻辑是通的,也可以直接作为你写作的骨架。

7. 常见问题与排查技巧实录

7.1 聚类质量总显示“差”怎么办

聚类质量差,绝大多数情况下不是因为算法不行,而是输入数据有问题。按优先级排查:

  • 第一,连续变量里是不是有异常极端值。先做描述统计,看最小最大值,有异常值先处理掉。
  • 第二,分类变量是不是有大量“其他”或“缺失”类别。类别太多、太碎,会稀释信息。
  • 第三,变量太多了。砍到8个以内再跑一次,质量大概率回升。
  • 第四,样本量太小。两步聚类对样本量有底线要求,一般建议至少200个样本。少于100个,聚类结果的稳定性会明显变差。

7.2 自动聚类数和业务预期差太多

比如业务上倾向分3类,算法给出5类。这时候不要直接接受,也不要直接改数字。正确做法是:分别跑3类、4类、5类,对比各自的轮廓系数和业务解释度。如果3类的轮廓系数和5类差距在0.05以内,果断选3类;如果5类明显更好,那就需要反思业务预期是不是过于简化了。

我做过一个实操案例,把12个变量跑出来,自动建议7类,轮廓系数0.35。这个结果拆分太细,客户完全没法用。后来通过变量筛选和固定3类,轮廓系数反而提升到0.42,业务解释也更顺。聚类分析最终服务的是决策,不是数字游戏。

7.3 两次跑出的结果类别编号不一致

这个上面提过,再强调一次:两步聚类的类别编号,在变量顺序改变后可能变化。它不会改变样本的聚类归属,只是重新编号。避免方法就是固定变量顺序,不做随机探索。

7.4 聚类结果和预想的“典型形象”对不上

很多人在跑完聚类后,会犯一个“先入为主”的毛病:心里已经有一个理想的用户分群,结果跑出来后和想象不一样,就觉得是算法错了。

通常我的建议是:以统计结果为主,以业务经验为辅。如果聚类结果里有某个类别确实不符合商业逻辑,单独把这个类别的描述统计调出来核对,很可能是某几个变量在误导聚类。这时候做得不是改算法,而是重新审视变量选择。

7.5 连续变量和分类变量混在一起,没法解释

这个问题的根源往往是分类变量太多,连续变量的作用被淹没了。实际操作中,如果分类变量非常重要,可以考虑把同类型的分类变量合并处理;如果连续变量非常关键,可以只保留分类变量中最重要的两三个,再跑一次。两步聚类最怕的就是“什么都要”,做好取舍模型才能稳定。

8. 给新手的一份实操自查清单

写到最后,分享一份我平时自己用、也建议新手照着检查的清单:

  1. 变量里没有文本型变量混入。
  2. 连续变量没有严重异常值。
  3. 分类变量的测量层级设置正确。
  4. 缺失值提前处理过,比例不高。
  5. 纳入聚类的变量有业务意义。
  6. 先跑自动聚类,记录BIC和质量评级。
  7. 用固定聚类数再做对比。
  8. 确认聚类分布没有异常小类。
  9. 预测变量重要性筛选出3到5个关键变量。
  10. 给聚类命名,并保存聚类成员变量。

这一套流程走下来,结果解读就不会再是“看天书”。两步聚类本身不复杂,复杂的是怎么把统计输出转成能够指导决策的业务洞察。我做过很多次聚类分析,越来越觉得,跑出结果只算完成了20%的工作,剩下80%都在解读、验证和解释。希望这篇内容能帮你把那80%的路走顺,少踩几个坑。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询