多层线性模型HLM结果解读
一、多层线性模型概述
多层线性模型(Hierarchical Linear Model, HLM),又称多水平模型(Multilevel Model)、线性混合效应模型(Linear Mixed Effects Model)或随机效应模型(Random Effects Model),是处理嵌套分层数据的重要统计方法。在社会科学、医学教育和组织行为学等领域,数据往往具有层次结构,例如学生嵌套于班级、患者嵌套于医院、重复测量嵌套于个体等。传统回归模型假设观测值之间相互独立,但嵌套数据中同一组内的个体往往具有较高的相似性,违反独立性假设,导致标准误估计偏小、假设检验的I类错误率升高。
HLM模型通过将总变异分解为组间变异和组内变异两个层次,同时估计固定效应(fixed effects)和随机效应(random effects)。固定效应描述的是自变量对因变量的平均效应,即总体层面的回归关系;随机效应则刻画不同组别之间回归系数或截距的变异程度,反映组间异质性。组内相关系数(Intraclass Correlation Coefficient, ICC)是HLM模型的关键指标之一,其计算公式为ICC=组间方差/(组间方差+组内方差),取值范围为0~1。ICC值越接近1,说明组间差异越大,使用多层模型的必要性越强;ICC值越接近0,说明组间差异很小,可简化为普通固定效应模型。本研究使用SPSSAU软件建立多层线性模型,分析x1~x4对y的影响,同时将group作为分组变量纳入随机效应结构。
在SPSSAU【实验/医学研究】模块选择【多层线性模型HLM】,将变量拖拽至右侧对应分析框,操作如下图:
二、模型基本情况
表1展示了模型的基本信息。本次分析共纳入384个观测样本,分布在24个组别(group)中,每组包含16个样本,属于均衡设计(balanced design),即各组样本量完全相等。均衡设计有助于提高模型估计的精度和统计检验的效力。模型采用限制性最大似然估计法(Restricted Maximum Likelihood, REML)进行参数估计。REML方法在估计方差成分时通过对固定效应进行约束,能够提供比最大似然估计(ML)更为无偏的方差分量估计,尤其适用于样本量有限的情况。模型的对数似然值(Log-likelihood)为-853.035,该值可用于模型之间的比较,对数似然值越大(即绝对值越小)表示模型拟合越好。
本次研究建立的HLM模型公式如下:
水平1(个体层):Yij = β0j + β1j×X1ij + β2j×X2ij + β3j×X3ij + β4j×X4ij + rij
水平2(组别层):β0j = γ00 + u0j
其中,Yij为第j组第i个个体的因变量值,β0j为第j组的截距,β1j~β4j为各自变量的回归系数,rij为个体水平的残差(组内误差)。在水平2中,γ00为总体平均截距,u0j为第j组的随机截距效应。本模型设定为随机截距模型,即仅截距项随组别变化,各自变量的回归系数在各组间保持固定。
三、固定效应参数估计
表2展示了固定效应参数的估计结果。固定效应反映了各自变量对因变量y的平均效应,即不考虑组别差异时的总体回归关系。
截距项的估计值为21.299(z=5.874,p<0.001),95%置信区间为14.193~28.406,表明当所有自变量取值为0时,y的平均预测值为21.299,且该截距显著不为0。
x1对y的回归系数为1.572,标准误为0.225,z=7.000,p<0.001,95%置信区间为1.132~2.012。回归系数为正且高度显著,说明x1每增加一个单位,y平均增加1.572个单位。置信区间不包含0,进一步证实了x1对y的正向影响具有统计学意义。x1是影响y的一个重要正向预测因子。
x2对y的回归系数为1.634,标准误为0.133,z=12.293,p<0.001,95%置信区间为1.374~1.895。x2的回归系数在四个自变量中z值最高(z=12.293),表明x2对y的正向影响不仅效应量大,而且统计推断的精确度也很高。x2每增加一个单位,y平均增加1.634个单位,是y的最强正向预测因子之一。
x3对y的回归系数为3.935,标准误为2.181,z=1.804,p=0.071>0.05,95%置信区间为-0.339~8.210。虽然回归系数的绝对值较大,但由于标准误也较大(2.181),导致z值未达到0.05水平的显著性标准。95%置信区间包含0(下限为-0.339),说明x3对y的影响在当前样本量下尚不能认为具有统计学意义。但值得注意的是,p=0.071接近0.05的临界值,提示x3可能存在一定的影响效应,未来研究可考虑扩大样本量以进一步验证。
x4对y的回归系数为1.133,标准误为0.065,z=17.531,p<0.001,95%置信区间为1.006~1.260。x4的z值在所有自变量中最高(z=17.531),标准误最小(0.065),表明x4对y的正向影响极其显著且估计精度非常高。x4每增加一个单位,y平均增加1.133个单位。综合来看,x1、x2和x4均对y产生显著的正向影响,其中x4的统计显著性最高,x2次之,x3的影响未达到显著性水平。
四、随机效应协方差估计
表3展示了随机效应的协方差估计结果。随机截距的方差(组间方差)为86.589,标准差SD=9.305,z=5.602,p<0.001,95%置信区间为56.295~116.883。随机截距方差高度显著,说明不同组别之间在因变量y的截距上存在显著的变异,即不同组的y基线水平存在明显差异。这一结果从统计上验证了使用多层模型的必要性——如果忽略组间差异而采用普通回归模型,将导致标准误的低估和假设检验的偏差。
残差方差(组内方差)为3.199,标准差SD=1.791,反映了在控制了组间差异和自变量效应之后,个体水平的剩余变异。组内方差相对较小(3.199远小于组间方差86.589),说明模型已经较好地解释了个体水平的变异。
组内相关系数ICC=组间方差/(组间方差+组内方差)=86.589/(86.589+3.199)=0.964。ICC=0.964是一个极高的值,意味着因变量y的变异中有96.4%可以由不同组别之间的差异来解释,仅有3.6%的变异来源于组内个体之间的差异。这一结果具有两方面含义:第一,数据具有极强的层次结构特征,组别因素对y的影响占据绝对主导地位;第二,使用多层线性模型是非常必要且恰当的,如果忽略这种高度的组间聚集性而采用传统回归方法,将严重违反独立性假设,导致统计推断的可靠性大幅下降。一般而言,ICC>0.1即认为存在足够的组间变异需要使用多层模型,本研究中ICC高达0.964,远超这一标准。
五、随机效应参数相关矩阵
表4展示了随机效应参数估计的相关矩阵。由于本研究仅纳入随机截距项而未纳入随机斜率项,因此不存在随机截距与随机斜率之间的相关系数估计。在更复杂的模型中,如果同时设定随机截距和随机斜率,则需要考察二者之间的相关系数。一般而言,如果随机截距与随机斜率之间的相关系数较低(如绝对值小于0.2),可考虑将二者的协方差限制为0以简化模型。本研究的模型结构相对简洁,仅包含随机截距,模型收敛良好。
六、结论
本研究采用多层线性模型(HLM)对384个嵌套于24个组别的观测数据进行了分析,模型采用REML估计方法,建立了随机截距模型y~1+x1+x2+x3+x4+(1|group)。固定效应分析结果显示,x1(β=1.572,p<0.001)、x2(β=1.634,p<0.001)和x4(β=1.133,p<0.001)均对y产生显著的正向影响,其中x4的统计显著性最高(z=17.531),x2次之(z=12.293)。x3的回归系数虽为正值(β=3.935),但未达到0.05水平的显著性标准(p=0.071),其对y的影响尚需进一步验证。随机效应分析显示,组内相关系数ICC=0.964,表明y的变异中96.4%来源于组间差异,充分说明了使用多层线性模型的必要性。综上所述,x1、x2和x4是y的显著正向预测因子,且数据具有极强的层次结构特征,组别因素对y的影响占据主导地位。