自从我开始带数据分析团队,几乎每个月都会遇到类似对话:有人跑过来问“SPSS装好了,怎么找不到神经网络那类建模功能”,或者反过来“公司买的SPSS Modeler怎么和网上的教程长得完全不一样”。一开始我以为是软件版本或界面差异的问题,后来才意识到,大家口中的“SPSS”根本是两样东西——IBM SPSS Statistics和IBM SPSS Modeler。它们共享同一个SPSS招牌,血缘上算是远亲,但在设计理念、操作方法、适用场景上完全是两个物种。
这篇文章我想把这层窗户纸彻底捅破:这两个工具各自解决什么问题、操作逻辑差在哪、统计方法覆盖有什么不同、数据准备和模型落地差距有多大,以及拿到实际任务时到底该选哪一个。不管你是刚下载SPSS做课程作业的学生,还是在用数据挖掘方法做客户分析的从业者,看完应该能少走很多弯路。
1. 同一个SPSS招牌,两个完全不同的产品家族
1.1 血缘关系:一个是老牌统计软件,一个是数据挖掘工具改嫁而来
先讲点背景。SPSS Statistics的历史可以追溯到1968年,最早叫“社会科学统计软件包”,从诞生起就服务于问卷调查、实验设计、统计检验这类分析场景。它长年迭代到今天,名字变成IBM SPSS Statistics,但内核还是那一套:数据编辑器里放数据,菜单栏里选分析方法,输出查看器里看结果。
而SPSS Modeler的前身叫Clementine,由一家叫ISL的公司在上世纪九十年代初开发,本身就是奔着数据挖掘去的。后来SPSS公司收购了Clementine,改名SPSS Clementine,再后来IBM收购SPSS公司,这才变成IBM SPSS Modeler。说白了,Modeler的血统是“客户流失分析”“市场营销响应预测”“风险评分”这类企业级数据挖掘项目,它的设计目标从一开始就不是帮人做学术论文,而是帮企业在业务数据里找规律。
所以你在网上搜“SPSS是什么”,出来的信息可能两种都对,但适用的完全是两套逻辑。
1.2 定位差异:验证过去和预测未来是两件事
我经常用一个比喻:Statistics像是法庭上的法官,它的核心任务是“验证”——这个差异是不是显著?这个因子能不能解释变异性?两个群体之间有没有统计学意义上的不同?而Modeler像是气象预报员,它的核心任务是“预测”——这个客户接下来会不会流失?这个用户有多大概率点击?哪批客户最可能响应活动?
这两种思维导向带来的差异非常大。你用Statistics跑逻辑回归,主要关注的是系数显著性、模型拟合优度、变量的p值,目的是回答“自变量对因变量有没有影响”;你用Modeler的逻辑回归节点建模,同样也是在跑逻辑回归,但关注的却是模型在验证集上的准确率、提升度、ROC曲线下的面积,目的是回答“这个模型能不能有效区分好坏客户”。
Notably,Modeler里也有大量统计检验的节点,比如卡方检验、t检验、方差分析,但这些都是辅助手段,主战场是建模和评分。反过来,Statistics也有决策树、聚类等挖掘味道很重的功能,但输出格式和自动化程度远不如Modeler。
1.3 产品家族全景:你到底装了什么
为了避免一开始就走错门,看清自己电脑里装的版本很重要。
| 维度 | IBM SPSS Statistics | IBM SPSS Modeler |
|---|---|---|
| 早期来源 | 1968年诞生的社会科学统计软件包 | Clementine数据挖掘工具改称而来 |
| 核心定位 | 统计检验、假设验证、报表 | 数据挖掘、预测建模、模型部署 |
| 典型模块 | Base, Regression, Advanced Statistics, AMOS(结构方程) | 数据源节点、数据质量节点、建模节点、评估节点、部署节点 |
| 典型用户 | 科研人员、论文写作者、市场调研分析师、临床研究者 | 数据挖掘工程师、风控建模师、营销分析团队 |
| 主要输出 | 分析结果表格、统计图表,写入输出查看器 | 数据流、模型块(金色节点)、评分结果、PMML等模型文件 |
下载安装时看清楚SPSS Statistics和SPSS Modeler是两个独立安装包,二者不会互相包含。很多学校机房只买了Statistics授权,这意味着你没法在教室里的SPSS中找到数据挖掘那些节点;反之,只买了Modeler授权的企业用户,也别想用它做Cronbach信度分析和正交旋转的因子分析,虽然它也有因子分析节点,但输出和论文要求差得很远。
2. 操作哲学的巨大鸿沟:菜单勾选与数据流画布
2.1 Statistics的三段式工作方式:录入、点菜单、读输出
用过Statistics的人应该很熟悉这个流程:先把数据整理成“一行一个样本、一列一个变量”的宽表,存进.sav文件;然后在菜单栏选择分析类别,比如“分析”菜单下的“描述统计”“比较均值”“回归”;在弹出的对话框里选变量、调选项,点击确定;最后跑到输出查看器里看结果表格和图表。
这个模式的好处是门槛低,但缺点是每一步都在“手动操作”。你要换一个分组变量重新跑一遍回归,就得重新点一遍菜单。虽然可以用SPSS脚本语法把常用分析写成命令,比如热搜里经常出现的COMPUTE就是最常用的生成新变量的语法:
COMPUTE 总分 = Q1 + Q2 + Q3 + Q4 + Q5. EXECUTE.这样一段语法放在语法窗口里,下次改个变量名就能复用,比点菜单快很多。但Statistics的自动化上限就在这——它是“命令-输出”模式,你想让它对100个变量自动批量做卡方检验,写语法的复杂度会迅速上升,维护起来也痛苦。
2.2 Modeler的可视化数据流:把分析过程变成生产线
Modeler的操作方式完全是另一套逻辑。打开软件后,下方是节点面板,按功能分类:数据源节点(读Excel、读数据库、读.sav)、字段操作节点(类型、填充、导出、选择)、建模节点(决策树、神经网络、逻辑回归、聚类)、评估节点(图表、评估)、导出节点(写回数据库、写文件)。
你做的事情就是把这些节点拖到画布上,用线连起来,构成一条“数据流”。比如一个最简单的客户流失数据流长这样:
Excel数据源 → 类型节点(设定目标字段Churn,设定角色) → 分区节点(按7:3拆成训练集/测试集) → C5.0建模节点 → 评估节点(提升图)双击每个节点可以设置参数,全部连好后点右上角的运行按钮,数据会像水一样流过整条管线,每个节点显示运行状态。改任何一个步骤,比如把C5.0换成决策列表,数据流其余部分不需要重连。
Modeler里没有“菜单里找分析方法”的概念,也没有输出查看器。运行结果要么以表格形式出现在节点右侧的输出选项卡里,要么直接生成一个金色模型块节点,展示模型的质量(准确率、提升度、收益图等)。这种设计天然适合探索式建模:你换算法、调参数、比较结果,整个过程就像在搭积木,流程透明,也方便跟同事讨论。
2.3 两种思维方式的冲突与适应
我见过太多从Statistics转到Modeler的人,第一周基本是懵的:他们找不到“结果窗口”,不知道去哪里看显著性,也不理解“为什么每个节点上都有个箭头”。反过来,用惯了Modeler的人在Statistics里也会觉得别扭:为什么数据预处理要在那么多不同菜单里来回切,为什么同一个分析换个变量就要重新配一次对话框。
理解这个落差是关键。Statistics的设计哲学是“用一个分析步骤回答一个问题”,Modeler的设计哲学是“把整个数据处理和建模过程显式化、流程化”。如果你要做的是探索性数据挖掘,答案本身就不是单个统计检验,而是一套可复用的流程,那Modeler的数据流理念更适合你。如果你做的是严格的假设检验,需要完整的统计学输出用于论文或报告,那Statistics的模式反而更稳妥。
3. 统计方法覆盖面:重叠很多,但替代关系几乎没有
3.1 两边都有的常见算法,用途却不相同
从功能列表看,Statistics和Modeler有一大块重叠区。聚类分析、线性回归、逻辑回归、决策树、因子分析、关联规则,两边都能跑。但这不意味着选哪个都行。
拿聚类来说。Statistics里的K-Means聚类输出的是“每个样本被分到哪类”,附上各类的均值对比,适合样本量不大、变量数量不多的小数据场景,分析完之后可以结合业务解读类别特征。Modeler里的K-Means节点输出类似,但它可以和后面的节点无缝衔接:聚类分群结果直接作为新字段流入下一个节点,继续做分群后的响应建模。Modeler的“平衡节点”甚至能根据聚类结果均衡样本比例,这是做大数据挖掘时才真正有价值的能力。
再说回归。用Statistics做线性回归,你会得到非常完整的模型摘要表:R方、调整R方、ANOVA表、各系数的t检验和显著性水平、共线性诊断、残差图。这些内容写论文、出报告是必须的。Modeler里也有线性回归节点,但更关键的能力是“自动建模”——比如自动数值节点(Auto Numeric)可以一口气比较线性回归、CART、CHAD、神经网络、SVM等一堆算法,最后按精度排序,你自己挑一个效果最好的模型块。这种“算法赛马”的思路在Statistics里是没有的。
3.2 Statistics的独有阵地:严谨统计检验的专属领地
如果你是做问卷研究或临床研究,很多标准操作必须在Statistics里完成。原因有两个:首先是Statistics内置了完整的检验模块,其次是它的输出严格对应期刊和学术规范。
- 信度与效度分析:热搜里“spss多维度题项效度分析需要分维度做吗”是个典型问题。在Statistics里做效度分析,走“分析—降维—因子”菜单,可以输出KMO检验、Bartlett球形检验、公因子方差、旋转成分矩阵。多维度问卷是否分维度做探索性因子分析是有讲究的,一般建议分维度分别做,也可以在整体层面做二阶因子分析,这全都依赖Statistics的输出细节。Modeler虽然能做因子分析,但输出不完整,也没有信度分析的Cronbach Alpha系数指标。
- 复杂抽样与多层线性模型:Statistics里的复杂抽样模块支持按抽样设计加权和复杂样本分析,多层线性模型(混合模型)适合嵌套数据,比如学生嵌套在班级里、患者嵌套在医院里。这类模型在Modeler中几乎无处下手。
- 生存分析:Kaplan-Meier曲线、Cox回归也是Statistics的强项,临床随访数据、用户留存分析里经常用。Modeler没有专门的生存分析节点。
- 多重插补:热搜里“spss多重插补合并结果”指的就是Statistics的“分析—缺失值分析—多重插补”模块。插补后生成多个完整数据集,分析时需要合并结果。这个过程在Statistics里有完整的菜单和语法支持,在Modeler里反而绕。
- AMOS结构方程模型:虽然这个插件名义上独立,但和Statistics配套使用,做路径分析、潜变量建模是主流。
3.3 Modeler的独有阵地:为预测建模而生的算法家族
Modeler最有价值的功能恰恰是Statistics做得不够顺手的部分。
一是自动建模节点。除了前面说的Auto Numeric,还有Auto Classifier用于分类问题,它会自动跑一遍C5.0、CART、QUEST、CHAID、神经网络、逻辑回归、贝叶斯网络等算法,并给出准确率排序。数据挖掘工程师拿到新数据时,第一轮通常会跑这种自动建模来快速探索“哪些算法值得深入研究”,人工再进去调参,这种工作流在Modeler里行云流水。
二是特征选择。Modeler里有专门的特征选择节点,用基于卡方或信息值的方法从几百个变量中筛出和目标最相关的变量,这对高维稀疏的业务数据特别重要。Statistics则更依赖你在回归里看共线性诊断或逐步回归,面对几十上百个候选变量时效率低很多。
三是模型评估与部署。Modeler里的评估节点可以输出提升图、利润图、ROC曲线,这些是企业决策的必备图。而且模型训练完后,那颗金色的模型节点可以直接拖到新数据上打分,操作成本和写代码相比低得多。后面专门有一章讲这个,这里先点到为止。
3.4 一张表看懂典型任务的工具选择
| 典型任务 | 首选工具 | 原因 |
|---|---|---|
| 问卷信效度分析、论文假设检验 | Statistics | 完整的KMO、Bartlett、信度系数输出,符合学术规范 |
| 临床生存分析、Cox回归 | Statistics | 专门的生存分析模块 |
| 多层线性模型/混合模型 | Statistics | 内置完善,直接出假设检验结果 |
| 客户分群、营销响应预测 | Modeler | 数据流适合多步骤探索,建模节点算法丰富 |
| 多算法比选、自动建模 | Modeler | Auto Classifier/Auto Numeric一键赛马 |
| 模型上线后的批量评分 | Modeler | 模型块直接连新数据源,导PMML或SQL落地 |
| 单次描述统计、交叉表 | 两者都行 | 这种基础任务无所谓,看你电脑上装了哪个 |
4. 数据准备的现实差异:Struct、分拆、缺失值处理的底层逻辑
4.1 数据结构的完美假象与脏数据现实
Statistics对数据的默认期待是:一张干净的长方形宽表,行是样本,列是变量,变量类型要么是数值要么是字符串,每个变量的取值没有异常值和缺失值。现实中当然没有这么完美,所以你在Statistics里花大量时间做数据清洗:替换缺失值、重新编码、计算新变量、分拆文件。
Modeler则从设计上就假定数据是脏的、杂乱的、需要多步处理的。它提供的Source节点几乎能接所有数据源:Excel、CSV、数据库、ODBC、甚至Hadoop。更关键的是,它有很多专门的数据质量节点——数据审核节点可以一键扫描每个字段的缺失值分布、离群值上限下限、数据类型;类型节点直接统一定义所有字段的角色和类型。你不需要像在Statistics里那样打开一长串对话框,数据质量节点跑一遍,整个数据的健康状况就一目了然了。
4.2 类型节点是Modeler的灵魂,也是初学者的第一个门槛
Modelser里的“类型”节点和Statistics里的“变量视图”表面上都在定义变量属性,但作用完全不同。Statistics的变量视图只是记录变量名、类型、标签、缺失值定义这些元数据。而Modeler的Type节点不只是记录,还控制数据流的走向:你必须在这里给每个字段指定角色——哪些是输入(Input)、哪些是目标(Target)即预测对象、哪些是两者(Both)、哪些是无效(None)——后续所有建模节点都会根据这个设定自动选择字段参与建模,不用在每一个建模对话框里重新选变量。
这个设计初看很抽象,但用顺了会发现极其高效。比如你要对100个候选变量做客户流失预测,只需在Type节点里把Churn字段标记为目标,其他数值型变量标记为输入,那么连接上去的Auto Classifier会自动把所有输入变量纳入模型,并在结束时告诉你哪些变量最重要。这在Statistics里是无法想象的:你需要手动进入每个算法对话框选变量,或者写一长串语法把变量列表塞进去。
4.3 数据分拆、分区、取样:三个容易混淆的概念
热搜词里“spss数据分拆文件”让我想起很多初学者会把Stats里的“拆分文件”和Modeler里的“分区节点”混为一谈,其实它们应对的是不同问题。
Statistics的“拆分文件”(Split File)解决的是“按组分别跑同一个分析”的问题。比如我想分别看男性和女性的薪资均值,用“数据—拆分文件—按组组织输出”把分组变量设为性别,之后再跑“分析—描述统计—频率”,输出会按男、女两组分别出结果。等价语法是:
SORT CASES BY 性别. SPLIT FILE BY 性别. FREQUENCIES VARIABLES=薪资. SPLIT FILE OFF.这个功能在统计检验中非常重要,适合的做法是先拆分再跑检验,这样每个子群体的统计特征、效应量一目了然。
Modeler的“分区节点”(Partition)解决的是“建模评估需要分成训练集、验证集、测试集”的问题。它在数据流中按比例随机抽样,比如70%训练、30%测试,并且保证数据流后面的所有建模节点只拿训练样本去拟合、拿测试样本去验证。这不是为了分组的描述统计,而是为了防止模型过拟合的模型评估策略。两者思路完全不同。
还有取样节点(Sample),它解决的是“数据量太大先抽一部分跑流程”的问题。1000万行记录先抽10万行,把数据流跑通、模型定型,再放到全量数据上打分。这是Modeler里很典型的探索性策略,Stats里没有对应概念。
4.4 缺失值处理:两个世界对“空”的理解不一样
Statistics针对缺失值有两套工具:一套是描述性的“缺失值分析”模块,报告哪些变量缺失多、缺失模式是什么;另一套就是前面提到的多重插补,通过马尔科夫链蒙特卡洛等方法生成多个填充后的完整数据集,把缺失当成一个需要专门统计处理的严肃问题。这在医学、社会科学研究中几乎是必选项,因为缺失不能随便填一个均值就完事。
Modeler对缺失值的态度更工程化。Type节点里可以统一指定缺失值处理策略,比如“丢弃”“填充平均值”“填充众数”“使用指定值”,还包括专门的数据质量节点里的“填充节点”(Fill)和“替换节点”(Replacement)。对大规模业务数据来说,这一步的目的是保证数据能流进建模节点顺利训练,而不是严谨地估计缺失机制。所以你看,同一个“缺失”问题,在两边的解决思路背后是完全不同的学科文化:一个是统计推断,一个是机器学习工程效率。
4.5 练手数据哪里找
如果你刚装上软件还不知道拿什么数据练手,Statistics安装目录自带几个经典样例,比如Employee data.sav里面有员工薪资、职级、性别、教育背景等真实脱敏数据,拿来跑t检验、方差分析、回归都很好用;demo.sav适合做交叉表和卡方检验。Modeler安装也带了十几个演示数据流,最有名的TELCO数据是电信客户流失的经典数据集,字段够多、有目标变量,非常适合练C5.0、神经网络和聚类分析的整条数据流。官方还有DRUG数据集适合做决策树演示。千万别一上来就找那些来路不明的“spss练习数据压缩包”,很多是从论文里扒下来的残缺文件,字段含义都不完整,练起来反而误导。
5. 模型落地与自动化:这是两者分道扬镳的地方
5.1 Statistics的模型应用:保存预测值可以,上生产很痛苦
在Statistics里,你跑完一个二元逻辑回归,如果想把模型应用到新数据上,路径是:在逻辑回归对话框中勾选“保存预测值”和“保存预测概率”,软件会在原始数据表里新增两个字段,里面有每个样本的预测类别和概率。这套操作在小样本研究场景里完全够用,论文里给个预测率就行。但如果你的任务是把模型部署到公司业务系统里,每天对几十万客户跑一次评分,用Statistics就会很尴尬:模型不在一个独立文件里,参数散落在输出里,每次跑都要重新打开.sav重新执行语法,对数据库的直连支持也比较弱。Statistics始终是面向分析员个人的工具,不是面向系统的模型服务。
5.2 Modeler的模型块与部署能力
Modeler在这方面完全是另一个量级。每一个建模节点训练完成后,会在数据流的右上角生成一个金色模型块节点。这个模型块就是你训练好的模型本身。接下来的事可以很直白:
- 把模型块拖到新数据源后面,连线运行,新数据的所有样本就会被打上评分;
- 模型块可以导出成PMML(Predictive Model Markup Language)文件,交给其他系统去解析执行;
- 也可以导出成SQL语句,让数据库直接用SQL完成打分;
- 还可以导出为Python或C++代码,嵌入到自研的评分服务里。
这意味着Modeler天然适合“模型生产化”的工作流。你在画布上把模型调好,给它接上生产环境的数据库表,设置好导出节点定期把评分结果写回数据库,模型就算“上线”了。这在银行风控、保险核保、零售营销场景里是非常常见的做法。
5.3 流式重训练与周期调度
企业级数据挖掘里有个很现实的问题:模型会过时。客户行为会变,市场环境会变,上半年训练好的流失模型下半年可能就不准了。Modeler对这个问题有完整的应对方案:整个数据流是显式结构,你只需要定时重新运行这条数据流,用最新数据重新训练模型,再更新评分。你可以在服务器端配置调度任务,每周自动跑一次数据流,生成新模型文件并推送到生产环境。这种“流即程序”的形态,让Modeler更像一个轻量级的数据挖掘工作流引擎。Statistics做不到这种程度,虽然它的语法脚本也可以保存、也可以计划任务,但它的输出是给人看的,不是给系统用的。
5.4 一个完整示例:用Modeler跑客户流失预测
为了让你更直观感受Modeler的工作方式,我描述一个最简完整的流失预测流:
- 拖入“Statistics File”节点或“Excel”节点,读入客户数据;
- 拖入“Type”节点,把“Churn”标记为目标,把其他预测字段标记为输入;如果没有目标字段的定义,需要双击Type节点在“目标”列手动选;
- 拖入“Partition”节点,默认按70/30分成训练集和测试集;
- 将“Type”输出连到“C5.0”节点,双击选择目标字段和输入字段,运行;
- C5.0节点右上角出现金色模型块,右键“浏览”能看到决策规则树、准确率、响应率、收益图;
- 再拖入一个“评估”节点,连接模型块,对测试集画提升图(Lift Chart),看模型是否真的比随机好;
- 满意后,把金色模型块连到最初的数据源节点上(或者一个新的全量数据源),再连一个“导出”节点,把评分结果写回数据库或Excel。
整个过程全程可视化,你既没有写一行代码,也不需要打开一堆输出报表,但每一步都要求你理解业务和数据含义。这也是Modeler的学习曲线和Statistics不同之处:Statistics要求你懂统计假设,Modeler要求你懂业务流程和模型评估逻辑。
6. 面对真实任务,到底怎么选、怎么混用
6.1 按任务类型判断的核心公式
我的经验是,拿到一个分析需求,先问自己一个最简单的问题:你是在验证一个假设,还是在预测一个结果?
- 如果任务是“验证A组和B组满意度是否有显著差异”,或者“研究学历对薪资的影响”,这是验证型任务,用Statistics。
- 如果任务是“从现有客户中找出最可能流失的20%人群”,或者“给新客户推荐最可能购买的产品”,这是预测型任务,用Modeler。
- 如果任务是把聚类结果、决策树规则落到系统里做实时判断,那是部署型任务,同样用Modeler。
当然有很多灰色地带。论文里做数据挖掘、企业里做统计分析,这种跨界需求很常见。我的建议是:论文以统计检验为主体的章节一定放Statistics里做;论文里如果需要快速对比多种机器学习算法的效果,可以先用Modeler跑一遍,通常这类探究性结果只作为辅助章节。企业分析如果只是月度报表用,Statistics足够;如果需要定期跑模型上生产,那Modeler才是正解。
6.2 混用模式:先用Modeler探索,再用Statistics论证
我个人最喜欢的组合拳是:先上Modeler做快速的数据探索和变量筛选,再用Statistics做明确假设的统计验证。Modeler强大的数据处理和自动建模能力能帮你快速找到数据里哪些变量“显著相关”或“信息量大”,之后这些结果可以缩减成一个精炼的变量清单,回到Statistics里做严谨的回归和方差分析,出报告写论文时引用Statistics的输出结果。这种模式在咨询行业和科研团队里用得很多,既享受了效率,又保住了统计规范的完整性。
6.3 学习路径:先Stats还是先Modeler
如果你是完全的新手,我建议先学Statistics,哪怕你以后只做数据挖掘。原因是Statistics会逼你把数据分析的基本功打牢:变量类型、假设检验、p值、置信区间、模型诊断。这些知识在Modeler里同样重要,但Modeler的数据流画布太容易让人“搭积木式分析”,连上Auto Classifier点一下运行,就得到一堆模型,却没有真正理解数据和算法的关系。先学Stats,你会知道什么是效应量、什么是多重共线性、为什么样本量不够的时候模型不可靠。这些底层认知在Modeler里才是真正的护城河。
反过来,如果你所在团队已经以Modeler为主,那学Statistics也不需要太深入,掌握描述统计、t检验、方差分析、回归、因子分析这几个板块就够了。Modeler里的很多业务问题最终都要靠这些统计概念去解释。
6.4 别迷信“一键建模”,也别忽视业务逻辑
最后说一句逆耳的话。Modeler的Auto Classifier和Auto Numeric让“一键建模”变得太容易了,这反而成了很多人的陷阱。你拖一个Auto Classifier上去,几十秒后得到一棵决策树,准确率看着不错,但你不看提升图、不看业务合理性、不看变量重要性,这个模型很可能只是因为数据里有泄露变量或者分组不平衡导致的假象。Statistics里跑回归至少还会强迫你看一眼显著性、共线性诊断,Modeler的便利性容易让人跳过这些检验的环节。
所以无论用哪个工具,最后决定分析质量的永远是两件事:你对业务的理解和你对统计原理的掌握。工具可以帮你提升效率,但替代不了判断力。
回到开头那个问题,SPSS和SPSS Modeler确实是两个世界。我在实际使用中的体会是,这两个工具不仅不冲突,反而像是分析师的左手和右手:Statistics负责严谨的证明,Modeler负责高效的探索与预测。偶尔会遇到有人拿着Modeler的K-Means聚类结果来问为什么和Statistics的聚类结果不一样,这其实只是两个工具在初始中心设定和预处理方式上的差异,不是谁算错了。你在学习的时候遇到界面现对不上、功能和教程对不上的情况,先去确认你打开的是Statistics还是Modeler,八成问题就解开了一大半。如果你刚接触这块,建议先拿一份自己熟悉的数据,分别在两个工具里走一遍描述统计、一个回归、一个决策树模型,亲身体验这“不一样的世界”到底差在哪,比看一百篇对比文章都有用。