统计百科 ·

主成分分析PCA的APA报告怎么写?KMO/Bartlett+成分载荷矩阵+方差解释格式全解

统计百科:专攻PCA主成分分析APA 7th报告格式——KMO值与Bartlett球形检验的报告句式、成分载荷矩阵三线表标准、累计方差解释率写法,给出可直接套用进论文的完整报告模板,并盘点审稿人最常挑的PCA报告格式错误。

跑完PCA最难的不是统计本身,而是格式细节:KMO值和Bartlett检验怎么合并报告、成分载荷矩阵三线表哪几列必须有、"累计解释方差62.4%"该放正文还是表注、载荷截止值0.30还是0.40……这篇文章专攻"PCA结果怎么规范写进论文"这一具体格式点,给出APA 7th所有PCA报告场景的完整模板,并逐一盘点审稿人最常挑的格式错误。


你的PCA报告有这些问题吗?

审稿人或导师关于PCA报告最常见的反馈:

  • "KMO值要报告到三位小数,缺少Bartlett球形检验的chi-square和df"
  • "成分载荷矩阵缺少方差解释率行,读者无法判断各成分重要性"
  • "只给了旋转后的载荷,原始成分矩阵呢?或者至少说明旋转方法"
  • "累计方差解释率应放在方法章节或表注中说明,而非只出现在正文"
  • "主成分数量的保留依据写得不清楚,是特征根>1?还是碎石图?"
  • "载荷系数未说明截止值标准,0.30还是0.40?"

这些错误集中在APA Publication Manual第七版关于多变量统计报告的规范,以及心理测量学期刊对因子分析类报告的约定俗成标准。本文只讲一件事:PCA主成分分析结果到底怎么规范写进论文的每个环节

如果你的研究目的是量表验证而非降维,应使用探索性因子分析(EFA)或验证性因子分析(CFA),而非PCA。两者在APA报告上有实质区别。本文聚焦于降维目的的PCA场景。


一、PCA是什么,报告逻辑从哪里开始

PCA的核心目标

主成分分析(Principal Component Analysis, PCA)回答的问题是:能否用更少的综合变量(主成分)来代表原始多个变量,同时尽量保留原始信息?

PCA通过线性变换,将原始 $p$ 个相关变量转换为 $k$ 个互不相关的主成分($k < p$),每个主成分是原始变量的线性组合,且第一主成分解释最多方差,后续成分依次递减。

$PC_j = a_{j1}X_1 + a_{j2}X_2 + \cdots + a_{jp}X_p$

其中 $a_{ji}$ 为第 $j$ 个主成分对第 $i$ 个变量的载荷(loading)。

APA报告需要覆盖的五个层次

层次报告内容放在哪里
适用性检验KMO值 + Bartlett球形检验方法章节或结果章节开头
主成分数量确定特征根>1准则 / 碎石图 / 累计方差标准方法章节(说明依据)
成分载荷矩阵各变量在各主成分上的载荷,含旋转方法结果章节,配三线表
方差解释率各成分特征根、方差% 和累计方差%结果章节,通常在表中
主成分得分应用(如有)综合得分公式或排名结果章节末尾

二、适用性检验报告:KMO与Bartlett球形检验

为什么需要适用性检验

PCA要求变量之间存在足够的相关性——若变量彼此完全独立,降维毫无意义。KMO和Bartlett检验是判断数据是否适合做PCA的标准前提检验。

KMO取样适切性量数

Kaiser-Meyer-Olkin (KMO) 取样适切性量数衡量变量间的偏相关程度,值域为[0, 1],越接近1说明变量间的公共因子结构越强,越适合做PCA。

APA报告中的KMO判断标准(Kaiser, 1974):

KMO值适切性评价
.90以上非常好(Marvelous)
.80 - .89良好(Meritorious)
.70 - .79尚可(Middling)
.60 - .69勉强(Mediocre)
.50 - .59不佳(Miserable)
.50以下不可接受(Unacceptable)

APA 7th要求报告KMO精确到两到三位小数,并给出适切性评价(可引用Kaiser, 1974)。

Bartlett球形检验

Bartlett球形检验(Bartlett's Test of Sphericity)检验相关矩阵是否为单位矩阵(即所有变量完全不相关),$H_0$: 相关矩阵 = 单位矩阵。若检验显著($p < .05$),说明变量间存在相关性,适合进行PCA。

报告格式要素

要素格式示例
卡方值$\chi^2(df) = X.XX$$\chi^2(45) = 1523.84$
p值$p < .001$ 或 $p = .XXX$$p < .001$
自由度$df = p(p-1)/2$$p$为变量数

自由度计算:$df = \frac{p(p-1)}{2}$,其中 $p$ 为纳入分析的变量个数。例如10个变量:$df = \frac{10 \times 9}{2} = 45$。

APA格式:KMO+Bartlett联合报告句式

KMO取样适切性量数 = .XX,[评价](Kaiser, 1974),
Bartlett球形检验显著,chi^2([df]) = XXXX.XX, p < .001,
表明数据适合进行主成分分析。

填入数值的示例

KMO取样适切性量数 = .863,取样适切性良好(Kaiser, 1974),Bartlett球形检验显著,$\chi^2(45) = 1523.84$,$p < .001$,表明10个观测变量之间具有足够的共同方差,数据适合进行主成分分析。


三、主成分数量确定:三种标准的APA报告方式

方法一:特征根大于1准则(Kaiser准则)

最常用的保留标准:保留特征根(Eigenvalue) > 1 的主成分。

APA报告句式

依据Kaiser(1960)特征根大于1准则,共提取[N]个主成分,
特征根分别为[值1]、[值2]……[值N]。

示例

依据Kaiser(1960)特征根大于1准则,共提取3个主成分,特征根分别为4.12、2.07和1.34,共解释原始变量总方差的75.3%。

方法二:碎石图(Scree Plot)

观察特征根折线图,选取"肘部"(明显弯折点)之前的成分数量。

APA报告句式

碎石图(见图[X])显示,特征根在第[N]个成分后出现明显折弯,
据此保留[N]个主成分。

方法三:累计方差解释率标准

社会科学通常要求累计解释方差达60%以上(部分理工科要求80%以上)。

APA报告句式

为使累计解释方差达到[XX]%以上,依据方差最大化原则保留[N]个主成分。
前[N]个主成分累计解释方差为[XX.X]%,满足分析要求。

四、成分载荷矩阵:三线表格式与旋转方法报告

旋转方法的选择与报告

PCA通常在提取后进行成分旋转,以增强可解释性。旋转不改变总方差解释量,只重新分配各成分的方差。

常见旋转方法

旋转类型方法名假设适用情形
正交旋转Varimax(方差最大化)成分间不相关构建彼此独立的综合指标
正交旋转Quartimax成分间不相关少数变量高度饱和时
斜交旋转Oblimin / Promax成分间可以相关研究构念本身可能相关时

报告旋转方法的句式

采用[旋转方法]对成分矩阵进行旋转,
以[正交旋转/斜交旋转]方式提升成分的可解释性。
载荷系数绝对值低于.40([或.30])的项目不在表中显示。

成分载荷矩阵三线表标准格式

APA 7th要求统计表格使用三线表(顶线、标题线、底线,无竖线),成分载荷矩阵三线表的标准列构成如下:

表X. 主成分分析成分载荷矩阵(Varimax旋转后)

变量成分1成分2成分3共同度h²
变量名称1.82.12.08.69
变量名称2.79.18.11.67
变量名称3.74.23.15.63
变量名称4.09.86.14.77
变量名称5.15.81.19.71
变量名称6.21.76.22.66
变量名称7.13.17.84.74
变量名称8.08.22.79.68
变量名称9.17.25.73.63
特征根4.122.071.34
方差解释率%41.220.713.4
累计方差%41.261.975.3

注. 采用Varimax正交旋转。载荷绝对值< .40已省略。h² = 共同度。

表格要素说明

  • 列名:变量名(通常为题项或指标名)+ 各主成分(成分1、成分2……)+ 共同度(h²)
  • 最后三行:特征根、方差解释率%、累计方差%(这三行必须有)
  • 表注:注明旋转方法、载荷截止值、缩写释义
  • 加粗惯例:部分期刊要求将每个变量最高载荷值加粗,以标示其归属成分,但APA 7th本身不强制要求
  • 共同度h²:表示每个变量被所有提取成分共同解释的方差比例,是评估变量拟合质量的重要指标

五、方差解释率报告:正文与表格如何配合

正文中的方差解释率句式

正文需要点明各成分解释率和累计解释率,不能只靠表格,需要叙述性句子呼应:

[旋转方法]旋转后,第一主成分解释总方差的[XX.X]%(特征根 = X.XX),
第二主成分解释[XX.X]%(特征根 = X.XX),
第三主成分解释[XX.X]%(特征根 = X.XX),
三个主成分共累计解释总方差的[XX.X]%。

填入数值的示例

Varimax旋转后,第一主成分解释总方差的41.2%(特征根 = 4.12),反映城市的经济规模与产业实力;第二主成分解释20.7%(特征根 = 2.07),反映基础设施与公共服务水平;第三主成分解释13.4%(特征根 = 1.34),反映科技创新能力。三个主成分共累计解释总方差的75.3%,符合社会科学研究中累计解释率60%以上的一般要求。

未旋转vs.旋转后方差解释率

注意:进行正交旋转(如Varimax)后,各成分的方差解释率会发生变化,但总累计解释率不变。斜交旋转后由于成分间存在相关,各成分方差解释率相加会超过总累计解释率,此时需在表注中说明。


六、完整APA结果段落模板

场景一:三成分PCA降维(城市综合竞争力评价)

完整报告段落模板

首先检验数据对主成分分析的适用性。KMO取样适切性量数 = .XXX,
取样适切性[评价](Kaiser, 1974),Bartlett球形检验显著,
chi^2([df]) = XXXX.XX, p < .001,表明变量间具有足够共同方差,
适合进行主成分分析。

依据Kaiser(1960)特征根大于1准则,共提取[N]个主成分
(见表[X])。采用Varimax正交旋转提升成分可解释性,
旋转后各主成分特征根分别为[值],累计解释总方差[XX.X]%。

成分载荷矩阵(见表[X])显示:
第一主成分在[变量组A]上载荷较高(.XX至.XX),命名为"[标签]";
第二主成分在[变量组B]上载荷较高(.XX至.XX),命名为"[标签]";
第三主成分在[变量组C]上载荷较高(.XX至.XX),命名为"[标签]"。
各变量共同度h²介于.XX至.XX之间,表明提取的主成分对原始变量的
拟合质量[评价]。

填入数值的完整示例

首先检验数据对主成分分析的适用性。KMO取样适切性量数 = .863,取样适切性良好(Kaiser, 1974),Bartlett球形检验显著,$\chi^2(45)$ = 1523.84,$p$ < .001,表明10个城市指标之间具有足够共同方差,适合进行主成分分析。

依据Kaiser(1960)特征根大于1准则,共提取3个主成分(见表1)。采用Varimax正交旋转提升成分可解释性,旋转后三个主成分特征根分别为4.12、2.07和1.34,累计解释总方差75.3%。

成分载荷矩阵(见表1)显示:第一主成分在GDP总量、规模以上工业产值、社会消费品零售总额等经济规模指标上载荷较高(.74至.82),命名为"经济规模因子";第二主成分在公路密度、医疗床位数、绿化覆盖率等基础设施指标上载荷较高(.76至.86),命名为"基础设施因子";第三主成分在R&D支出比、专利申请量、高新技术企业数上载荷较高(.73至.84),命名为"创新驱动因子"。各变量共同度h²介于.63至.77之间,表明三个主成分对原始指标的解释效果良好。

场景二:问卷量表PCA降维(5个维度)

完整报告段落模板

对量表[N]个题项进行主成分分析。KMO = .XXX([评价]),
Bartlett球形检验,chi^2([df]) = XXXX.XX, p < .001,
数据适合主成分分析。

碎石图显示,在第[N]个成分后特征根出现明显折弯,
结合特征根大于1准则,共提取[N]个主成分。
采用[旋转方法]旋转,旋转前后累计解释方差保持为[XX.X]%。

所有题项在其归属成分上的载荷均高于.50,
且跨载荷(cross-loadings)均低于.30,
表明各题项的结构归属清晰,分类效度良好。

七、在ChatSRS一句话获得规范PCA报告

打开 chatsrs.com,上传数据后输入:

"对这10个城市竞争力指标做主成分分析:先报告KMO值和Bartlett球形检验(含chi-square和df);用特征根>1准则确定主成分数量;采用Varimax旋转,输出旋转后的成分载荷矩阵(含特征根、方差解释率%、累计方差%三行,共同度h²一列);给出可直接套用进论文的APA 7th完整报告段落,说明各成分的可解释命名,载荷绝对值<0.40的不显示。"

ChatSRS会自动输出符合上文格式的完整报告段落和三线表,数值直接填入,可复制进论文。

如果你需要斜交旋转(如Oblimin),在指令中改说"采用Oblimin斜交旋转",ChatSRS会同时输出模式矩阵(Pattern Matrix)和结构矩阵(Structure Matrix),并说明斜交旋转报告规范。


八、方法章节怎么描述PCA分析过程

标准方法章节描述(研究目的为综合评价降维)

采用主成分分析(Principal Component Analysis, PCA)对[N]个[变量类型]
进行降维处理,以提取综合性评价指标。分析前以KMO取样适切性量数
和Bartlett球形检验评估数据适用性,要求KMO > .60且Bartlett检验显著(p < .05)。
主成分数量以Kaiser(1960)特征根大于1准则和碎石图共同确定。
采用Varimax正交旋转法提升成分可解释性;载荷系数绝对值低于.40的
变量不计入主成分命名依据。
显著性水平设为alpha = .05。
<!-- 注:请在此处填写您所使用的统计软件(如SPSS、R、Python等)。 -->

标准方法章节描述(研究目的为量表维度探索)

为探索[量表名称]的潜在维度结构,对[N]个题项进行主成分分析。
数据适用性通过KMO取样适切性量数(> .70)和Bartlett球形检验(p < .001)
评估。主成分数量参照特征根大于1准则与碎石图共同确定,
采用Varimax正交旋转以保证各主成分的独立性,
并参照载荷系数≥.40作为题项归属判断标准。
注:主成分分析属于变量简化方法,若研究目的为潜在结构验证,
建议进一步采用CFA确认。

九、PCA报告常见错误对照表

常见错误正确写法违反的规范
只写KMO,不写BartlettKMO = .XXX,Bartlett chi^2(df) = XX.XX, p < .001两项检验均须报告
Bartlett只写p不写chi^2chi^2([df]) = XXXX.XX, p < .001须完整报告统计量
自由度算错df = p(p-1)/2,p为变量数常见于变量数填错
载荷矩阵缺方差解释率行末三行:特征根、方差%、累计方差%这三行是必报要素
共同度h²缺失表格右列加h²列APA因子分析表格惯例
未说明旋转方法明确写"采用Varimax正交旋转"方法可重复性要求
未说明载荷截止值方法章节或表注写明".40以下不显示"可重复性与透明度
主成分数量依据不清明确写"依据特征根>1准则"方法章节透明度要求
斜交旋转只报告一个矩阵斜交旋转需同时报告模式矩阵和结构矩阵斜交旋转特有要求
方差% 超过100%斜交旋转各成分%之和可超100%,需表注说明斜交旋转的数学特性

FAQ

Q:PCA和EFA(探索性因子分析)有什么区别?APA报告格式一样吗?

A:两者的目的和统计假设不同。PCA是数学降维方法,目标是最大化解释总方差,没有潜在因子的假设;EFA假设存在潜在因子(latent factors)驱动观测变量,提取的是共同方差。在APA报告上,两者的KMO/Bartlett报告格式相同,但EFA还需报告共同度提取方法(如主轴因子法PAF)、以及因子载荷矩阵(Factor Loading Matrix)中的独特性(Uniqueness = 1 - h²)。如果你的研究目的是量表结构探索,APA建议使用EFA(或进一步CFA),而非PCA。

Q:载荷截止值是0.30还是0.40?哪个更合适?

A:两者均有文献支持。Comrey & Lee(1992)提出的标准:.71以上为优秀,.63为非常好,.55为好,.45为尚可,.32为差。实际操作中:社会科学、教育学研究多用.40作为截止值(相当于一个变量有16%的方差由该成分解释);心理学测量研究有时用.30。重要的是在方法章节或表注中明确说明你用的截止值,不同截止值本身不是错误,缺乏说明才是问题。ChatSRS默认输出.40截止,可在指令中修改。

Q:Varimax旋转和Oblimin斜交旋转哪个更好?

A:取决于理论假设。若你的研究理论上认为提取的主成分(或因子)彼此独立,用Varimax正交旋转,报告更简单(只需一个载荷矩阵)。若理论上允许成分/因子相互关联(如各人格维度可能相关),用Oblimin或Promax斜交旋转,需同时报告模式矩阵(Pattern Matrix,用于命名)和结构矩阵(Structure Matrix,用于了解成分与变量的相关),并报告成分间的相关矩阵。APA 7th对两种方法都不排斥,关键是交代清楚旋转类型及选择依据。

Q:主成分分析结果报告中需要报告主成分得分(Component Score)吗?

A:如果主成分得分是后续分析的输入变量(如用作回归预测变量、综合排名权重),则需在结果章节报告主成分得分的计算方式,并在表格或附录中呈现各主成分的得分系数矩阵(Score Coefficient Matrix)。如果PCA只用于降维可视化或变量筛选,不涉及得分应用,则不必单独报告得分。APA 7th关于这一点没有强制规定,按研究目的决定。


快速参考:PCA报告格式速查卡

[适用性检验]
KMO = .XXX([评价],Kaiser, 1974)
Bartlett chi^2([p*(p-1)/2]) = XXXX.XX, p < .001

[成分数量确定]
依据特征根>1准则(Kaiser, 1960),提取[N]个主成分
—— 或 —— 碎石图显示第[N]个成分后明显折弯

[成分载荷矩阵表格必备行]
倒数三行:特征根 / 方差解释率% / 累计方差%
最右列:共同度 h²
表注:旋转方法 + 载荷截止值说明

[正文方差解释率句式]
第一主成分解释总方差的XX.X%(特征根 = X.XX),……
[N]个主成分共累计解释总方差的XX.X%

[旋转方法表注]
正交旋转:注. 采用Varimax正交旋转。载荷绝对值< .40已省略。
斜交旋转:注. 采用Oblimin斜交旋转,呈现模式矩阵。成分间相关见表[Y]。

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。