
多层线性模型HLM结果解读一、多层线性模型概述多层线性模型Hierarchical Linear Model, HLM又称多水平模型Multilevel Model、线性混合效应模型Linear Mixed Effects Model或随机效应模型Random Effects Model是处理嵌套分层数据的重要统计方法。在社会科学、医学教育和组织行为学等领域数据往往具有层次结构例如学生嵌套于班级、患者嵌套于医院、重复测量嵌套于个体等。传统回归模型假设观测值之间相互独立但嵌套数据中同一组内的个体往往具有较高的相似性违反独立性假设导致标准误估计偏小、假设检验的I类错误率升高。HLM模型通过将总变异分解为组间变异和组内变异两个层次同时估计固定效应fixed effects和随机效应random effects。固定效应描述的是自变量对因变量的平均效应即总体层面的回归关系随机效应则刻画不同组别之间回归系数或截距的变异程度反映组间异质性。组内相关系数Intraclass Correlation Coefficient, ICC是HLM模型的关键指标之一其计算公式为ICC组间方差/组间方差组内方差取值范围为0~1。ICC值越接近1说明组间差异越大使用多层模型的必要性越强ICC值越接近0说明组间差异很小可简化为普通固定效应模型。本研究使用SPSSAU软件建立多层线性模型分析x1~x4对y的影响同时将group作为分组变量纳入随机效应结构。在SPSSAU【实验/医学研究】模块选择【多层线性模型HLM】将变量拖拽至右侧对应分析框操作如下图二、模型基本情况表1展示了模型的基本信息。本次分析共纳入384个观测样本分布在24个组别group中每组包含16个样本属于均衡设计balanced design即各组样本量完全相等。均衡设计有助于提高模型估计的精度和统计检验的效力。模型采用限制性最大似然估计法Restricted Maximum Likelihood, REML进行参数估计。REML方法在估计方差成分时通过对固定效应进行约束能够提供比最大似然估计ML更为无偏的方差分量估计尤其适用于样本量有限的情况。模型的对数似然值Log-likelihood为-853.035该值可用于模型之间的比较对数似然值越大即绝对值越小表示模型拟合越好。本次研究建立的HLM模型公式如下水平1个体层Yij β0j β1j×X1ij β2j×X2ij β3j×X3ij β4j×X4ij rij水平2组别层β0j γ00 u0j其中Yij为第j组第i个个体的因变量值β0j为第j组的截距β1j~β4j为各自变量的回归系数rij为个体水平的残差组内误差。在水平2中γ00为总体平均截距u0j为第j组的随机截距效应。本模型设定为随机截距模型即仅截距项随组别变化各自变量的回归系数在各组间保持固定。三、固定效应参数估计表2展示了固定效应参数的估计结果。固定效应反映了各自变量对因变量y的平均效应即不考虑组别差异时的总体回归关系。截距项的估计值为21.299z5.874p0.00195%置信区间为14.193~28.406表明当所有自变量取值为0时y的平均预测值为21.299且该截距显著不为0。x1对y的回归系数为1.572标准误为0.225z7.000p0.00195%置信区间为1.132~2.012。回归系数为正且高度显著说明x1每增加一个单位y平均增加1.572个单位。置信区间不包含0进一步证实了x1对y的正向影响具有统计学意义。x1是影响y的一个重要正向预测因子。x2对y的回归系数为1.634标准误为0.133z12.293p0.00195%置信区间为1.374~1.895。x2的回归系数在四个自变量中z值最高z12.293表明x2对y的正向影响不仅效应量大而且统计推断的精确度也很高。x2每增加一个单位y平均增加1.634个单位是y的最强正向预测因子之一。x3对y的回归系数为3.935标准误为2.181z1.804p0.0710.0595%置信区间为-0.339~8.210。虽然回归系数的绝对值较大但由于标准误也较大2.181导致z值未达到0.05水平的显著性标准。95%置信区间包含0下限为-0.339说明x3对y的影响在当前样本量下尚不能认为具有统计学意义。但值得注意的是p0.071接近0.05的临界值提示x3可能存在一定的影响效应未来研究可考虑扩大样本量以进一步验证。x4对y的回归系数为1.133标准误为0.065z17.531p0.00195%置信区间为1.006~1.260。x4的z值在所有自变量中最高z17.531标准误最小0.065表明x4对y的正向影响极其显著且估计精度非常高。x4每增加一个单位y平均增加1.133个单位。综合来看x1、x2和x4均对y产生显著的正向影响其中x4的统计显著性最高x2次之x3的影响未达到显著性水平。四、随机效应协方差估计表3展示了随机效应的协方差估计结果。随机截距的方差组间方差为86.589标准差SD9.305z5.602p0.00195%置信区间为56.295~116.883。随机截距方差高度显著说明不同组别之间在因变量y的截距上存在显著的变异即不同组的y基线水平存在明显差异。这一结果从统计上验证了使用多层模型的必要性——如果忽略组间差异而采用普通回归模型将导致标准误的低估和假设检验的偏差。残差方差组内方差为3.199标准差SD1.791反映了在控制了组间差异和自变量效应之后个体水平的剩余变异。组内方差相对较小3.199远小于组间方差86.589说明模型已经较好地解释了个体水平的变异。组内相关系数ICC组间方差/组间方差组内方差86.589/86.5893.1990.964。ICC0.964是一个极高的值意味着因变量y的变异中有96.4%可以由不同组别之间的差异来解释仅有3.6%的变异来源于组内个体之间的差异。这一结果具有两方面含义第一数据具有极强的层次结构特征组别因素对y的影响占据绝对主导地位第二使用多层线性模型是非常必要且恰当的如果忽略这种高度的组间聚集性而采用传统回归方法将严重违反独立性假设导致统计推断的可靠性大幅下降。一般而言ICC0.1即认为存在足够的组间变异需要使用多层模型本研究中ICC高达0.964远超这一标准。五、随机效应参数相关矩阵表4展示了随机效应参数估计的相关矩阵。由于本研究仅纳入随机截距项而未纳入随机斜率项因此不存在随机截距与随机斜率之间的相关系数估计。在更复杂的模型中如果同时设定随机截距和随机斜率则需要考察二者之间的相关系数。一般而言如果随机截距与随机斜率之间的相关系数较低如绝对值小于0.2可考虑将二者的协方差限制为0以简化模型。本研究的模型结构相对简洁仅包含随机截距模型收敛良好。六、结论本研究采用多层线性模型HLM对384个嵌套于24个组别的观测数据进行了分析模型采用REML估计方法建立了随机截距模型y~1x1x2x3x4(1|group)。固定效应分析结果显示x1β1.572p0.001、x2β1.634p0.001和x4β1.133p0.001均对y产生显著的正向影响其中x4的统计显著性最高z17.531x2次之z12.293。x3的回归系数虽为正值β3.935但未达到0.05水平的显著性标准p0.071其对y的影响尚需进一步验证。随机效应分析显示组内相关系数ICC0.964表明y的变异中96.4%来源于组间差异充分说明了使用多层线性模型的必要性。综上所述x1、x2和x4是y的显著正向预测因子且数据具有极强的层次结构特征组别因素对y的影响占据主导地位。