统计百科 ·

潜在剖面分析LPA/潜在类别分析LCA的APA报告怎么写?类别数确定+各类别占比+分类质量格式全解

统计百科:专攻LPA/LCA报告格式——类别数如何用BIC/熵确定、各类别占比与条件均值/概率怎么报告、分类质量(平均最大后验概率AvePP/模态分配准确率)如何呈现,给出可直接套用的APA 7th完整模板,逐一盘点审稿人最常挑的LPA/LCA报告错误。

LPA(Latent Profile Analysis,潜在剖面分析)和LCA(Latent Class Analysis,潜在类别分析)是挖掘隐藏亚组的经典方法,难点不在于跑出来,而在于格式细节:类别数如何向审稿人交代、BIC和熵到底写哪个、各类别的描述统计怎么呈现、AvePP和分类准确率是什么……这篇文章专攻"LPA/LCA怎么规范写进论文"这一具体格式点,给出APA 7th所有场景的完整模板,并逐一盘点审稿人最常挑的报告错误。


你的LPA/LCA报告有这些问题吗?

审稿人或导师关于LPA/LCA报告最常见的反馈:

  • "类别数如何确定?缺少模型比较表(BIC、AIC、Entropy、LRT检验)"
  • "各类别占比(posterior probability assignment)要写清楚,N和百分比都要有"
  • "熵值(Entropy)要报告,并说明分类质量是否达到可接受标准(≥ .80)"
  • "AvePP(平均最大后验概率)怎么没有?这是检验分类质量的核心指标"
  • "各类别的描述统计(条件均值/条件概率)缺少SE或95% CI"
  • "说明了几个类别,但没说这几个类别是怎么命名/解释的"
  • "只用BIC选了类别数,没有报告VLMR-LRT或BLRT检验结果"

这些错误集中在潜在混合模型(Latent Mixture Model)报告的多个层次,但专门针对LPA/LCA汇总的实操指南并不多。本文只讲一件事:LPA/LCA到底怎么规范写进论文的每一个环节

如果你还没看过姊妹篇 主成分分析PCA的APA报告怎么写?,建议先了解因子/成分类分析的报告逻辑,本文默认你已了解p值不加前导零(.032而非0.032)等基础格式规则,不再重复。


一、LPA与LCA是什么,有什么区别

两者的直觉含义

LPA和LCA都属于**以人为中心(person-centered)**的分析方法,目标是在样本中发现若干个潜在亚组(类别/剖面),使得:

  • 同一类别内的个体在指标上尽量相似
  • 不同类别间的个体在指标上尽量不同

$P(\text{类别}\ k \mid \mathbf{x}_i) \propto \pi_k \cdot f(\mathbf{x}_i \mid \theta_k)$

其中 $\pi_k$ 是第 $k$ 类别的先验比例,$f(\mathbf{x}_i \mid \theta_k)$ 是给定类别参数下指标的条件密度/概率。

LPA vs. LCA 的核心区别

LPA(潜在剖面分析)LCA(潜在类别分析)
指标类型连续型变量(量表分、测量值)类别型变量(是/否、选项)
类别描述各类别的条件均值(M)SD各类别的条件概率(P)
典型软件Mplus、R(tidyLPA)、SPSSMplus、R(poLCA)、SAS
效应量Entropy、AvePPEntropy、AvePP

两者的报告框架完全一致,只在描述类别特征时用均值(LPA)还是概率(LCA)来替换。

LPA/LCA的三大报告挑战

  1. 类别数不唯一:不同拟合指标可能指向不同的类别数,需要结合多个指标和理论意义做决定
  2. 分类质量难量化:最大后验概率分配(modal assignment)存在不确定性,需要AvePP来量化
  3. 类别可解释性:统计上合适的解不一定有实质意义,需要结合领域知识命名和解释

二、类别数如何确定:多指标联合决策框架

必须报告的拟合指标

指标含义判断标准
AIC赤池信息准则越小越好
BIC贝叶斯信息准则越小越好(首选,对过拟合更保守)
aBIC样本量调整BIC越小越好
Entropy整体分类确定性越接近1.0越好,≥ .80为可接受
VLMR-LRTVuong-Lo-Mendell-Rubin似然比检验p < .05表示k类比k-1类显著更好
BLRT自举似然比检验p < .05表示k类比k-1类显著更好(更精确)
各类别N每个类别的样本量最小类别建议 ≥ 总N的5%或n ≥ 25

模型比较表(APA格式)

模型比较结果通常以表格形式呈现,这是APA 7th对LPA/LCA报告的最低标准。

表1 LPA模型拟合指标比较(2至5类别方案)

类别数AICBICaBICEntropyVLMR-LRT pBLRT p最小类别n
2类8421.368503.728453.18.847< .001< .001124 (26.1%)
3类8284.198402.478329.61.883< .001< .00187 (18.3%)
4类8258.748413.478318.49.861.024.00152 (10.9%)
5类8261.338452.038334.98.832.163.08123 (4.8%)

注. 加粗行为选定的最优模型。VLMR-LRT = Vuong-Lo-Mendell-Rubin似然比检验;BLRT = 自举似然比检验;aBIC = 样本量调整的贝叶斯信息准则。5类模型VLMR-LRT和BLRT均不显著,且最小类别占比低于5%,故选择4类方案。

类别数决策的标准描述

方法章节模板

采用Mplus 8.8(Muthén & Muthén, 2022)对[指标列表]进行潜在剖面分析(LPA)/
潜在类别分析(LCA),依次拟合2至6类方案。
类别数确定综合参考以下标准:
(1)BIC和aBIC最小化;
(2)Entropy ≥ .80;
(3)VLMR-LRT和BLRT显著(p < .05),表明k类方案显著优于k-1类;
(4)最小类别样本量 ≥ 总样本量的5%;
(5)各类别具有理论可解释性。
以上标准联合判断,选择[k]类方案作为最终解。

三、各类别描述:占比、均值/概率、置信区间

LPA——连续指标的类别描述(必须含的要素)

每个类别需要报告:

  • 类别标签(自命名,反映特征)
  • 类别N与占比(基于最大后验概率分配)
  • 各指标在该类别的条件均值(M)和标准误(SE)
  • 可选:95% CI

表2 LPA四类别方案各剖面指标均值(M ± SE)

剖面类别标签n (%)情绪调节M(SE)学习动机M(SE)社交能力M(SE)压力水平M(SE)
剖面1高适应型128 (26.9%)4.21 (.08)4.38 (.07)4.15 (.09)2.14 (.10)
剖面2中等适应型156 (32.8%)3.47 (.07)3.52 (.08)3.41 (.07)3.02 (.09)
剖面3低情绪型87 (18.3%)2.31 (.11)3.68 (.10)3.29 (.11)3.87 (.13)
剖面4低适应型105 (22.1%)2.18 (.10)2.24 (.11)2.07 (.12)4.42 (.11)

注. M = 条件均值;SE = 标准误;括号外为均值,括号内为标准误。各指标均采用5点李克特量表(1 = 非常不符合,5 = 非常符合)。类别占比基于最大后验概率(modal assignment)计算。

LCA——类别型指标的类别描述

LCA的类别特征用条件概率(而非均值)来描述,格式相同,只是将"M(SE)"换成"P"。

表3 LCA三类别方案各类别条件概率

类别类别标签n (%)有抑郁症状P有焦虑症状P就医行为P社会支持不足P
类别1低风险型187 (42.3%).08.11.15.12
类别2焦虑主导型143 (32.3%).31.74.38.47
类别3高风险型112 (25.3%).82.79.61.73

注. P = 条件概率(即给定该类别成员身份,该指标为"是/阳性"的概率)。类别占比基于最大后验概率分配。


四、分类质量:熵值、AvePP与模态分配准确率

这是LPA/LCA报告中最容易被遗漏的部分,也是审稿人越来越重视的环节。

Entropy(整体分类确定性)

$\text{Entropy} = 1 - \frac{-\sum_{i=1}^{N}\sum_{k=1}^{K} P(k|x_i)\ln P(k|x_i)}{N \ln K}$

  • 范围:0至1.0
  • 越接近1.0,整体分类越确定
  • ≥ .80为可接受,≥ .90为理想
  • Entropy是模型层面的指标,不单独针对某个类别

报告格式

四类别方案的Entropy = .861,表明整体分类质量良好。

AvePP(平均最大后验概率,Average Maximum Posterior Probability)

AvePP是类别层面的分类质量指标,衡量每个类别内成员被分配到该类别的后验概率均值。

  • 对角线上的AvePP越接近1.0越好
  • 每个类别的AvePP ≥ .70为最低标准,≥ .80为推荐标准(Nagin, 2005; Nylund-Gibson & Choi, 2018)

表4 LPA四类别方案分类质量指标(混淆矩阵,基于AvePP)

分配至剖面1分配至剖面2分配至剖面3分配至剖面4
剖面1(高适应型).921.043.024.012
剖面2(中等适应型).038.884.051.027
剖面3(低情绪型).021.064.863.052
剖面4(低适应型).015.039.073.873

注. 对角线元素为各剖面的AvePP,非对角线元素为误分类概率。所有对角线AvePP均 ≥ .86,表明分类质量良好(最低标准 ≥ .70,推荐标准 ≥ .80,高质量标准 ≥ .90;Nagin, 2005; Nylund-Gibson & Choi, 2018)。

完整分类质量报告模板

各类别分类质量评估如下:Entropy = .861,高于可接受标准(≥ .80)。
各类别平均最大后验概率(AvePP)分别为:
高适应型 = .921,中等适应型 = .884,低情绪型 = .863,低适应型 = .873,
均高于推荐标准(≥ .80;Nylund-Gibson & Choi, 2018),
表明各类别间具有良好的区分效度,分类结果可用于后续分析。

五、各场景完整APA报告模板

场景一:LPA(连续指标,四类别方案)

完整结果章节段落模板

采用潜在剖面分析(LPA)对[N]名[被试群体]在[k个指标]上的得分进行潜在类别探索
(Muthén & Muthén, 2017)。依次拟合2至6类方案,各模型拟合指标见表1。
综合参考BIC最小化、Entropy ≥ .80、VLMR-LRT和BLRT显著(p < .05)以及理论可解释性,
选择4类别方案作为最终解(BIC = X.XX,Entropy = .XX)。

4类别方案(N = [总N])中,各剖面占比如下:
剖面1([标签])占 XX.X%(n = XX),剖面2([标签])占 XX.X%(n = XX),
剖面3([标签])占 XX.X%(n = XX),剖面4([标签])占 XX.X%(n = XX)。
各剖面在指标上的条件均值及其标准误见表2。

分类质量评估结果显示,Entropy = .XX,各类别AvePP均高于.80(范围 = .XX–.XX),
表明分类结果具有较高的准确性(Nylund-Gibson & Choi, 2018)。

填入数值的示例

采用潜在剖面分析(LPA)对476名大学生在情绪调节、学习动机、社交能力和压力水平4个指标上的得分进行潜在类别探索(Muthén & Muthén, 2022)。依次拟合2至6类方案,各模型拟合指标见表1。4类别方案的BIC值(8413.47)相较5类别方案(8452.03)更小,且VLMR-LRT(p = .024)和BLRT(p = .001)均显著,表明4类优于3类;5类方案VLMR-LRT和BLRT均不显著,且最小类别仅占4.8%,故选择4类别方案作为最终解(Entropy = .861)。

4类别方案中,各剖面描述如下:剖面1"高适应型"占26.9%(n = 128),表现为高情绪调节、高动机、高社交能力和低压力;剖面2"中等适应型"占32.8%(n = 156),各指标居中;剖面3"低情绪型"占18.3%(n = 87),情绪调节得分低而动机居中;剖面4"低适应型"占22.1%(n = 105),四项指标均低(动机低,压力高)。各剖面条件均值及标准误见表2。

分类质量评估结果显示,Entropy = .861,各类别AvePP均在.86至.92之间,均高于推荐标准.80(Nylund-Gibson & Choi, 2018),表明分类结果具有较高的准确性,可用于后续的差异检验。

场景二:LCA(二分类指标,三类别方案)

填入数值的示例

采用潜在类别分析(LCA)对442名社区居民在4项心理健康指标(抑郁症状、焦虑症状、就医行为、社会支持不足)上的二分反应模式进行潜在类别探索(Linzer & Lewis, 2011)。依次拟合2至5类方案,3类别方案在BIC(4328.17)最小化的同时,VLMR-LRT(p = .031)和BLRT(p < .001)均显著,且最小类别样本量充足(n = 112,25.3%),故选择3类别方案。

3类别方案中,类别1"低风险型"占42.3%(n = 187),各心理健康问题条件概率均低(P < .15);类别2"焦虑主导型"占32.3%(n = 143),焦虑症状条件概率较高(P = .74),而抑郁症状概率中等(P = .31);类别3"高风险型"占25.3%(n = 112),抑郁(P = .82)和焦虑(P = .79)症状条件概率均高,社会支持不足概率亦高(P = .73)。各类别条件概率见表3。

分类质量方面,Entropy = .876,各类别AvePP分别为.904(低风险型)、.858(焦虑主导型)和.871(高风险型),均高于推荐标准.80(Nylund-Gibson & Choi, 2018),分类结果可信。

场景三:以类别作为后续分析的分组变量

LPA/LCA常见用法是将类别作为自变量,检验类别与结果变量的关系。

报告模板

以最大后验概率分配(modal assignment)确定每名被试所属类别,
将类别变量(k类)作为自变量,对[结果变量]进行单因素方差分析(ANOVA)
(方法见[相关阅读:ANOVA报告])。
注意:分类不确定性可通过"三步法"(Bakk & Vermunt, 2016)或
"BCH权重法"(Bolck, Croon, & Hagenaars, 2004)纳入,
以避免分类误差向下游分析传递(Nylund-Gibson & Masyn, 2016)。

六、在ChatSRS一句话获得规范LPA/LCA报告

打开 chatsrs.com,上传数据后输入:

"对以下6个连续指标(X1–X6)做潜在剖面分析LPA,拟合2至6类方案,输出AIC、BIC、aBIC、Entropy、VLMR-LRT和BLRT的模型比较表;自动选择最优类别数,报告各类别的条件均值(M和SE)、类别占比(n和%)、各类别AvePP分类质量表;按照APA 7th格式输出完整的方法章节和结果章节段落,包括Entropy和AvePP的解释。"

ChatSRS(R引擎,基于tidyLPA/Mplus接口)将自动:

  1. 拟合全系列模型并生成模型比较表
  2. 按多指标联合准则推荐最优类别数
  3. 输出各类别特征表(含SE和95% CI)
  4. 计算Entropy和AvePP混淆矩阵
  5. 生成可直接复制进论文的APA 7th格式报告段落

七、方法章节怎么说明LPA/LCA

标准方法章节描述(LPA)

采用潜在剖面分析(Latent Profile Analysis, LPA;基于潜在混合模型,McLachlan & Peel, 2000)
对[N]名[被试]在[k个指标]上的得分进行基于人群的子组划分。
LPA假设连续指标在各潜在类别内部独立,
分析使用Mplus 8.8(Muthén & Muthén, 2022),
采用最大似然稳健估计(MLR)以应对数据的轻微非正态性。
类别数确定参照BIC最小化、Entropy ≥ .80以及VLMR-LRT/BLRT的显著性(p < .05)。
分类质量以各类别平均最大后验概率(AvePP)评估,
建议标准为AvePP ≥ .80(Nylund-Gibson & Choi, 2018)。
显著性水平设为 alpha = .05。

标准方法章节描述(LCA)

采用潜在类别分析(Latent Class Analysis, LCA;McCutcheon, 1987)
对[N]名[被试]在[k个二分类/多分类指标]上的反应模式进行潜在类别划分。
LCA假设各指标在类别内部条件独立,
分析使用R软件poLCA包(Linzer & Lewis, 2011),设置20个随机起始值以避免局部最优。
类别数判断标准同上(BIC、Entropy、LRT检验)。

八、LPA/LCA报告常见错误对照表

常见错误正确写法违反的规则
只报告BIC,不报告熵值和LRT同时报告AIC/BIC/aBIC/Entropy/VLMR-LRT/BLRT单一指标不足以确定类别数
类别占比只写%,不写n"26.9%(n = 128)"APA要求同时报告比例和绝对人数
缺少AvePP分类质量报告每个类别的AvePP并解释是否达标无法评估分类置信度
条件均值无SE/CI"M = 4.21,SE = .08"推断不确定性需量化
直接用分配的类别变量做ANOVA,未说明分类误差处理说明是否使用三步法/BCH权重法分类误差会低估SE,导致I类错误膨胀
Entropy = .76,仍称"分类质量良好""Entropy = .76,略低于推荐标准(.80),结果解释需谨慎"低于.80应明确说明局限性
只命名类别但不解释命名依据结合各指标的高/低模式说明命名逻辑类别命名须有数据支撑
未报告起始值数量或局部最优处理说明随机起始值数量(≥ 20)和最终对数似然值的重现情况混合模型对起始值敏感

常见FAQ

Q:BIC和Entropy有时"打架"(BIC指向4类但Entropy在3类时更高),该听谁的?

A:两者出发点不同,不能简单对立。BIC惩罚模型复杂度,更关注总体拟合;Entropy反映分类确定性,更关注类别间的清晰程度。实践中推荐的决策顺序是:(1)先用BIC/BLRT确定"统计上合适"的类别数范围(通常2–3个候选);(2)在候选方案中用Entropy和AvePP评估分类质量;(3)最终用理论可解释性做最后裁决。如果4类的BIC更好但Entropy较低(如.73),建议在论文中汇报两个方案,说明理论倾向于选择4类,但承认3类的分类质量更高,并在局限性中讨论。

Q:各类别样本量最小多少才够?

A:没有严格统一标准,但业界常用的两个门槛是:(1)最小类别 ≥ 总样本量的5%;(2)最小类别 n ≥ 25。这两个标准均不满足时,通常认为该类别是"空渣类",应减少类别数。特别注意:某些模型在拟合时即使类别很小也会收敛,但这种小类别往往是算法伪影,而非真实亚组。ChatSRS在输出中会自动标注最小类别占比并给出警告。

Q:LPA做完可以直接用分配的类别做方差分析或回归吗?

A:可以,但有风险。直接使用最大后验概率分配(modal assignment)等于假设分类100%准确,忽略了分类不确定性,会导致标准误低估、I类错误膨胀。更规范的做法是:(1)使用三步法(Bakk & Vermunt, 2016)或BCH权重法在Mplus中直接将类别的不确定性纳入后续建模;(2)或者在分类质量高(AvePP ≥ .90,即高质量标准,高于一般推荐标准 ≥ .80)时,直接使用modal assignment仍被认为可接受,并在方法章节说明。注意三档标准含义不同:≥ .70为最低可接受标准,≥ .80为常规推荐标准,≥ .90方可省略不确定性校正。

Q:LPA的方法章节需要说"局部最优"问题吗?

A:需要,这是混合模型的特有风险。LPA/LCA的最大似然估计依赖迭代优化算法(如EM算法),在多类别方案下容易陷入局部最优而非全局最优。标准做法是设置多个随机起始值(Mplus建议STARTS = 100 25或更多),并确认最优解能被多次复现(Mplus输出中确认"BEST LOGLIKELIHOOD VALUE HAS BEEN REPLICATED")。方法章节应注明起始值数量,例如:"本研究每个模型均使用100个随机起始值和25个最终优化(Mplus STARTS = 100 25),以最小化局部最优风险。"


快速参考:LPA/LCA报告格式速查卡

[模型比较表——必报]
类别数 | AIC | BIC | aBIC | Entropy | VLMR-LRT p | BLRT p | 最小类别n(%)
类别数从2到K,突出选定模型,注明判断标准

[各类别特征表——LPA]
类别标签 | n (%) | 指标1 M(SE) | 指标2 M(SE) | ... | 指标k M(SE)
注明量表范围和占比计算方式

[各类别特征表——LCA]
类别标签 | n (%) | 指标1 P | 指标2 P | ... | 指标k P
注明条件概率含义

[分类质量表(AvePP混淆矩阵)——必报]
行 = 实际类别,列 = 分配类别;对角线为AvePP
报告标准:≥ .80可接受;≥ .90理想(Nylund-Gibson & Choi, 2018)

[文中必报句式]
"[k]类别方案的BIC(X.XX)最小,Entropy = .XX,
各类别AvePP均高于.80(范围 = .XX–.XX),表明分类质量良好。"

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。