统计百科 ·

因子分析怎么选?EFA、CFA 与 PCA 的区别和完整选择树

因子分析中文选择指南:按研究目的区分探索性因子分析 EFA、验证性因子分析 CFA 和主成分分析 PCA,说明样本、提取、旋转、拟合、报告与避免数据驱动修模的边界。

“因子分析”经常被用来统称 EFA、CFA,甚至 PCA,但三者回答的问题并不相同。选错方法,后续的载荷、因子数、拟合指数和结论都会失去清楚含义。

最重要的分叉不是软件菜单,而是研究目的:你要探索潜在结构、验证预设测量模型,还是把多个指标压缩成少数综合轴?


EFA、CFA 还是 PCA:选择树

  1. 选 EFA:当条目背后的潜在结构尚不清楚,研究目标是探索可能有几个共同因子、哪些条目主要属于哪个因子时,使用探索性因子分析。
  2. 选 CFA:当理论或既有量表已经给出因子数量、条目归属和因子关系,研究目标是检验预设测量模型与新样本是否相容时,使用验证性因子分析。
  3. 选 PCA:当目标是降维、压缩相关指标或构建综合得分时,使用主成分分析;PCA 不是共同因子分析的同义词,它直接分解观测变量的总方差,不以潜变量测量模型为前提。

如果你只是想对多个指标降维或构建综合指标,请读主成分分析(PCA)完整指南。如果潜变量测量模型之后还要检验潜变量之间的结构路径,再进入结构方程模型的诊断与报告


一张表看懂三种方法

维度EFACFAPCA
主要问题数据可能包含哪些共同因子预设测量模型与数据是否相容如何用少数线性组合保留较多方差信息
理论先验可以较弱,但条目设计仍需内容依据必须明确指定结构不要求潜变量理论
方差观念关注共同方差与独特方差显式建模载荷和测量误差分解观测变量总方差
核心输出因子数、载荷、共同度、因子相关拟合、载荷、因子相关、误差与识别特征值、解释方差、成分载荷、得分
常见用途新量表早期探索、结构不确定成熟量表验证、测量模型比较降维、可视化前处理、综合指标
主要风险按结果反复筛题、因子数凭单一规则用修正指数追拟合、同一样本反复修模把成分解释成潜在构念、机械排名

三种方法都不能由软件替研究者定义构念。条目内容、研究对象、量表使用语境和外部证据仍是效度判断的一部分。

EFA:探索潜在共同结构

什么时候适合

  • 新开发条目,潜在维度尚无稳定理论;
  • 既有结构在新文化或新群体中可能变化;
  • 文献对因子数量和条目归属存在实质分歧;
  • 研究明确标记为探索性,并准备在独立数据中验证。

关键决策

  1. 相关矩阵:连续近似变量、有序题和二分类题可能需要不同的相关与估计策略;
  2. 因子数:结合平行分析、碎石图、理论可解释性和稳定性,不只用“特征值大于 1”;
  3. 提取方法:共同因子分析不等于 PCA,应选择与分布和研究目的匹配的方法;
  4. 旋转方式:社会科学构念往往相关,斜交旋转通常更容易解释;是否正交应有理论依据;
  5. 条目处理:载荷、交叉载荷、共同度和内容覆盖一起判断,不能只按一个阈值自动删题。

EFA 报告至少包括

  • 样本与条目、相关矩阵或估计依据;
  • 适宜性证据及其限制;
  • 因子数决定方法;
  • 提取与旋转方法;
  • 载荷、交叉载荷、共同度与因子相关;
  • 条目保留或调整的内容与统计依据;
  • 探索性结论需要独立验证的说明。

CFA:检验预设测量模型

什么时候适合

  • 使用已有明确结构的成熟量表;
  • EFA 已在独立开发样本中形成候选结构;
  • 比较竞争测量模型;
  • 在组间比较前检验测量不变性;
  • 结构方程模型需要先建立可信的测量部分。

CFA 不只是看四个拟合指数

完整判断还包括:

  • 模型是否识别、参数是否可解释;
  • 估计方法是否匹配题项尺度和分布;
  • 标准化载荷、残差和因子相关是否合理;
  • 是否出现负方差、极端相关或其他不当解;
  • 拟合指数、区间和模型比较是否与样本和模型复杂度一起解释;
  • 模型修改是否有预先或理论依据,并在新数据中验证。

CFI、TLI、RMSEA、SRMR 等经验阈值是诊断提示,不是跨领域统一的“通过线”。把多个修正指数都释放到达阈值,会把验证性分析变成事后探索。

样本量不能只套倍数规则

“每题多少人”或“至少 200”都只能作为粗略提醒。EFA/CFA 所需样本取决于:

  • 因子与指标数量;
  • 载荷大小、共同度和因子相关;
  • 条目尺度与分布;
  • 模型复杂度、缺失和估计方法;
  • 是否拆分样本、交叉验证或做组间比较。

更稳妥的做法是结合设计阶段的模拟或方法文献,并在论文中透明说明样本限制。若同一数据先探索、再修改、再“验证”,应明确这仍是数据驱动过程;理想情况下使用独立样本或新的数据收集验证。

常见错误与纠正

把 EFA 当作理论验证

EFA 可以发现与理论相似的结构,但不能因为结果相似就称为独立验证。已有清楚结构时,应使用 CFA 或说明为什么仍需探索。

把 PCA 当作因子分析

PCA 适合降维,但主成分不是自动等同于心理或社会构念。若研究问题是潜变量与测量误差,应使用共同因子或测量模型框架。

用载荷阈值机械删题

删除条目会改变构念覆盖。任何调整都要同时考虑题目内容、反向表述、样本特征和新数据中的稳定性,不能只为了更好看的载荷或 α。

用修正指数追求完美拟合

修正必须有理论与测量依据,并清楚标记为数据驱动。如果修改很多,应在独立数据中验证,而不是把同一样本上的改善写成确认性证据。


可复用的分析清单

提交分析前写清:

  • 研究目的是探索、验证还是降维;
  • 每个条目的类型、编码和理论归属;
  • 样本、缺失、反向题和排除规则;
  • 因子数、提取、旋转或测量模型的依据;
  • 允许哪些预先修改,哪些只能标记为探索;
  • 要报告的载荷、拟合、区间、因子相关和异常解;
  • 谁负责解释、删题与最终效度结论。

进入 ChatSRS 按选择树整理 EFA 或 CFA 输入。结果必须结合条目内容、理论、估计方法和原始输出复核,平台不替研究者决定构念或自动删题。


常见问题

Q1:成熟量表还需要先做 EFA 吗?

不一定。若结构在相似语境中有充分证据,通常可直接用 CFA 检验预设结构;若翻译、群体或使用方式变化很大,可基于明确理由增加探索,但要区分探索与验证。

Q2:EFA 和 CFA 能用同一批数据吗?

技术上能运行,但同一数据上的 CFA 不能提供独立验证。样本受限时应透明说明,并考虑重抽样稳定性、交叉验证或后续独立样本。

Q3:CFA 拟合不好,可以看修正指数删题吗?

修正指数只是可能的局部失配提示。先检查数据、估计、识别、条目内容和模型设定;任何删题或误差相关都要有理论依据,并在新数据中验证。

Q4:PCA 得到几个成分,就等于量表有几个因子吗?

不等于。PCA 分解的是观测变量总方差,成分数量不能直接作为潜在因子数量的证据。量表结构问题应使用与潜变量假设匹配的 EFA/CFA。


相关阅读


本文提供 EFA、CFA 与 PCA 的选择框架,不把经验阈值当作统一审核线。具体分析应结合学科规范与原始数据。