统计百科 ·
主成分分析PCA的APA报告怎么写?KMO/Bartlett+成分载荷矩阵+方差解释格式全解
统计百科:专攻PCA主成分分析APA 7th报告格式——KMO值与Bartlett球形检验的报告句式、成分载荷矩阵三线表标准、累计方差解释率写法,给出可直接套用进论文的完整报告模板,并盘点审稿人最常挑的PCA报告格式错误。
跑完PCA最难的不是统计本身,而是格式细节:KMO值和Bartlett检验怎么合并报告、成分载荷矩阵三线表哪几列必须有、"累计解释方差62.4%"该放正文还是表注、载荷截止值0.30还是0.40……这篇文章专攻"PCA结果怎么规范写进论文"这一具体格式点,给出APA 7th所有PCA报告场景的完整模板,并逐一盘点审稿人最常挑的格式错误。
你的PCA报告有这些问题吗?
审稿人或导师关于PCA报告最常见的反馈:
- "KMO值要报告到三位小数,缺少Bartlett球形检验的chi-square和df"
- "成分载荷矩阵缺少方差解释率行,读者无法判断各成分重要性"
- "只给了旋转后的载荷,原始成分矩阵呢?或者至少说明旋转方法"
- "累计方差解释率应放在方法章节或表注中说明,而非只出现在正文"
- "主成分数量的保留依据写得不清楚,是特征根>1?还是碎石图?"
- "载荷系数未说明截止值标准,0.30还是0.40?"
这些错误集中在APA Publication Manual第七版关于多变量统计报告的规范,以及心理测量学期刊对因子分析类报告的约定俗成标准。本文只讲一件事:PCA主成分分析结果到底怎么规范写进论文的每个环节。
如果你的研究目的是量表验证而非降维,应使用探索性因子分析(EFA)或验证性因子分析(CFA),而非PCA。两者在APA报告上有实质区别。本文聚焦于降维目的的PCA场景。
一、PCA是什么,报告逻辑从哪里开始
PCA的核心目标
主成分分析(Principal Component Analysis, PCA)回答的问题是:能否用更少的综合变量(主成分)来代表原始多个变量,同时尽量保留原始信息?
PCA通过线性变换,将原始 $p$ 个相关变量转换为 $k$ 个互不相关的主成分($k < p$),每个主成分是原始变量的线性组合,且第一主成分解释最多方差,后续成分依次递减。
$PC_j = a_{j1}X_1 + a_{j2}X_2 + \cdots + a_{jp}X_p$
其中 $a_{ji}$ 为第 $j$ 个主成分对第 $i$ 个变量的载荷(loading)。
APA报告需要覆盖的五个层次
| 层次 | 报告内容 | 放在哪里 |
|---|---|---|
| 适用性检验 | KMO值 + Bartlett球形检验 | 方法章节或结果章节开头 |
| 主成分数量确定 | 特征根>1准则 / 碎石图 / 累计方差标准 | 方法章节(说明依据) |
| 成分载荷矩阵 | 各变量在各主成分上的载荷,含旋转方法 | 结果章节,配三线表 |
| 方差解释率 | 各成分特征根、方差% 和累计方差% | 结果章节,通常在表中 |
| 主成分得分应用(如有) | 综合得分公式或排名 | 结果章节末尾 |
二、适用性检验报告:KMO与Bartlett球形检验
为什么需要适用性检验
PCA要求变量之间存在足够的相关性——若变量彼此完全独立,降维毫无意义。KMO和Bartlett检验是判断数据是否适合做PCA的标准前提检验。
KMO取样适切性量数
Kaiser-Meyer-Olkin (KMO) 取样适切性量数衡量变量间的偏相关程度,值域为[0, 1],越接近1说明变量间的公共因子结构越强,越适合做PCA。
APA报告中的KMO判断标准(Kaiser, 1974):
| KMO值 | 适切性评价 |
|---|---|
| .90以上 | 非常好(Marvelous) |
| .80 - .89 | 良好(Meritorious) |
| .70 - .79 | 尚可(Middling) |
| .60 - .69 | 勉强(Mediocre) |
| .50 - .59 | 不佳(Miserable) |
| .50以下 | 不可接受(Unacceptable) |
APA 7th要求报告KMO精确到两到三位小数,并给出适切性评价(可引用Kaiser, 1974)。
Bartlett球形检验
Bartlett球形检验(Bartlett's Test of Sphericity)检验相关矩阵是否为单位矩阵(即所有变量完全不相关),$H_0$: 相关矩阵 = 单位矩阵。若检验显著($p < .05$),说明变量间存在相关性,适合进行PCA。
报告格式要素:
| 要素 | 格式 | 示例 |
|---|---|---|
| 卡方值 | $\chi^2(df) = X.XX$ | $\chi^2(45) = 1523.84$ |
| p值 | $p < .001$ 或 $p = .XXX$ | $p < .001$ |
| 自由度 | $df = p(p-1)/2$ | $p$为变量数 |
自由度计算:$df = \frac{p(p-1)}{2}$,其中 $p$ 为纳入分析的变量个数。例如10个变量:$df = \frac{10 \times 9}{2} = 45$。
APA格式:KMO+Bartlett联合报告句式
KMO取样适切性量数 = .XX,[评价](Kaiser, 1974),
Bartlett球形检验显著,chi^2([df]) = XXXX.XX, p < .001,
表明数据适合进行主成分分析。
填入数值的示例:
KMO取样适切性量数 = .863,取样适切性良好(Kaiser, 1974),Bartlett球形检验显著,$\chi^2(45) = 1523.84$,$p < .001$,表明10个观测变量之间具有足够的共同方差,数据适合进行主成分分析。
三、主成分数量确定:三种标准的APA报告方式
方法一:特征根大于1准则(Kaiser准则)
最常用的保留标准:保留特征根(Eigenvalue) > 1 的主成分。
APA报告句式:
依据Kaiser(1960)特征根大于1准则,共提取[N]个主成分,
特征根分别为[值1]、[值2]……[值N]。
示例:
依据Kaiser(1960)特征根大于1准则,共提取3个主成分,特征根分别为4.12、2.07和1.34,共解释原始变量总方差的75.3%。
方法二:碎石图(Scree Plot)
观察特征根折线图,选取"肘部"(明显弯折点)之前的成分数量。
APA报告句式:
碎石图(见图[X])显示,特征根在第[N]个成分后出现明显折弯,
据此保留[N]个主成分。
方法三:累计方差解释率标准
社会科学通常要求累计解释方差达60%以上(部分理工科要求80%以上)。
APA报告句式:
为使累计解释方差达到[XX]%以上,依据方差最大化原则保留[N]个主成分。
前[N]个主成分累计解释方差为[XX.X]%,满足分析要求。
四、成分载荷矩阵:三线表格式与旋转方法报告
旋转方法的选择与报告
PCA通常在提取后进行成分旋转,以增强可解释性。旋转不改变总方差解释量,只重新分配各成分的方差。
常见旋转方法:
| 旋转类型 | 方法名 | 假设 | 适用情形 |
|---|---|---|---|
| 正交旋转 | Varimax(方差最大化) | 成分间不相关 | 构建彼此独立的综合指标 |
| 正交旋转 | Quartimax | 成分间不相关 | 少数变量高度饱和时 |
| 斜交旋转 | Oblimin / Promax | 成分间可以相关 | 研究构念本身可能相关时 |
报告旋转方法的句式:
采用[旋转方法]对成分矩阵进行旋转,
以[正交旋转/斜交旋转]方式提升成分的可解释性。
载荷系数绝对值低于.40([或.30])的项目不在表中显示。
成分载荷矩阵三线表标准格式
APA 7th要求统计表格使用三线表(顶线、标题线、底线,无竖线),成分载荷矩阵三线表的标准列构成如下:
表X. 主成分分析成分载荷矩阵(Varimax旋转后)
| 变量 | 成分1 | 成分2 | 成分3 | 共同度h² |
|---|---|---|---|---|
| 变量名称1 | .82 | .12 | .08 | .69 |
| 变量名称2 | .79 | .18 | .11 | .67 |
| 变量名称3 | .74 | .23 | .15 | .63 |
| 变量名称4 | .09 | .86 | .14 | .77 |
| 变量名称5 | .15 | .81 | .19 | .71 |
| 变量名称6 | .21 | .76 | .22 | .66 |
| 变量名称7 | .13 | .17 | .84 | .74 |
| 变量名称8 | .08 | .22 | .79 | .68 |
| 变量名称9 | .17 | .25 | .73 | .63 |
| 特征根 | 4.12 | 2.07 | 1.34 | — |
| 方差解释率% | 41.2 | 20.7 | 13.4 | — |
| 累计方差% | 41.2 | 61.9 | 75.3 | — |
注. 采用Varimax正交旋转。载荷绝对值< .40已省略。h² = 共同度。
表格要素说明:
- 列名:变量名(通常为题项或指标名)+ 各主成分(成分1、成分2……)+ 共同度(h²)
- 最后三行:特征根、方差解释率%、累计方差%(这三行必须有)
- 表注:注明旋转方法、载荷截止值、缩写释义
- 加粗惯例:部分期刊要求将每个变量最高载荷值加粗,以标示其归属成分,但APA 7th本身不强制要求
- 共同度h²:表示每个变量被所有提取成分共同解释的方差比例,是评估变量拟合质量的重要指标
五、方差解释率报告:正文与表格如何配合
正文中的方差解释率句式
正文需要点明各成分解释率和累计解释率,不能只靠表格,需要叙述性句子呼应:
[旋转方法]旋转后,第一主成分解释总方差的[XX.X]%(特征根 = X.XX),
第二主成分解释[XX.X]%(特征根 = X.XX),
第三主成分解释[XX.X]%(特征根 = X.XX),
三个主成分共累计解释总方差的[XX.X]%。
填入数值的示例:
Varimax旋转后,第一主成分解释总方差的41.2%(特征根 = 4.12),反映城市的经济规模与产业实力;第二主成分解释20.7%(特征根 = 2.07),反映基础设施与公共服务水平;第三主成分解释13.4%(特征根 = 1.34),反映科技创新能力。三个主成分共累计解释总方差的75.3%,符合社会科学研究中累计解释率60%以上的一般要求。
未旋转vs.旋转后方差解释率
注意:进行正交旋转(如Varimax)后,各成分的方差解释率会发生变化,但总累计解释率不变。斜交旋转后由于成分间存在相关,各成分方差解释率相加会超过总累计解释率,此时需在表注中说明。
六、完整APA结果段落模板
场景一:三成分PCA降维(城市综合竞争力评价)
完整报告段落模板:
首先检验数据对主成分分析的适用性。KMO取样适切性量数 = .XXX,
取样适切性[评价](Kaiser, 1974),Bartlett球形检验显著,
chi^2([df]) = XXXX.XX, p < .001,表明变量间具有足够共同方差,
适合进行主成分分析。
依据Kaiser(1960)特征根大于1准则,共提取[N]个主成分
(见表[X])。采用Varimax正交旋转提升成分可解释性,
旋转后各主成分特征根分别为[值],累计解释总方差[XX.X]%。
成分载荷矩阵(见表[X])显示:
第一主成分在[变量组A]上载荷较高(.XX至.XX),命名为"[标签]";
第二主成分在[变量组B]上载荷较高(.XX至.XX),命名为"[标签]";
第三主成分在[变量组C]上载荷较高(.XX至.XX),命名为"[标签]"。
各变量共同度h²介于.XX至.XX之间,表明提取的主成分对原始变量的
拟合质量[评价]。
填入数值的完整示例:
首先检验数据对主成分分析的适用性。KMO取样适切性量数 = .863,取样适切性良好(Kaiser, 1974),Bartlett球形检验显著,$\chi^2(45)$ = 1523.84,$p$ < .001,表明10个城市指标之间具有足够共同方差,适合进行主成分分析。
依据Kaiser(1960)特征根大于1准则,共提取3个主成分(见表1)。采用Varimax正交旋转提升成分可解释性,旋转后三个主成分特征根分别为4.12、2.07和1.34,累计解释总方差75.3%。
成分载荷矩阵(见表1)显示:第一主成分在GDP总量、规模以上工业产值、社会消费品零售总额等经济规模指标上载荷较高(.74至.82),命名为"经济规模因子";第二主成分在公路密度、医疗床位数、绿化覆盖率等基础设施指标上载荷较高(.76至.86),命名为"基础设施因子";第三主成分在R&D支出比、专利申请量、高新技术企业数上载荷较高(.73至.84),命名为"创新驱动因子"。各变量共同度h²介于.63至.77之间,表明三个主成分对原始指标的解释效果良好。
场景二:问卷量表PCA降维(5个维度)
完整报告段落模板:
对量表[N]个题项进行主成分分析。KMO = .XXX([评价]),
Bartlett球形检验,chi^2([df]) = XXXX.XX, p < .001,
数据适合主成分分析。
碎石图显示,在第[N]个成分后特征根出现明显折弯,
结合特征根大于1准则,共提取[N]个主成分。
采用[旋转方法]旋转,旋转前后累计解释方差保持为[XX.X]%。
所有题项在其归属成分上的载荷均高于.50,
且跨载荷(cross-loadings)均低于.30,
表明各题项的结构归属清晰,分类效度良好。
七、在ChatSRS一句话获得规范PCA报告
打开 chatsrs.com,上传数据后输入:
"对这10个城市竞争力指标做主成分分析:先报告KMO值和Bartlett球形检验(含chi-square和df);用特征根>1准则确定主成分数量;采用Varimax旋转,输出旋转后的成分载荷矩阵(含特征根、方差解释率%、累计方差%三行,共同度h²一列);给出可直接套用进论文的APA 7th完整报告段落,说明各成分的可解释命名,载荷绝对值<0.40的不显示。"
ChatSRS会自动输出符合上文格式的完整报告段落和三线表,数值直接填入,可复制进论文。
如果你需要斜交旋转(如Oblimin),在指令中改说"采用Oblimin斜交旋转",ChatSRS会同时输出模式矩阵(Pattern Matrix)和结构矩阵(Structure Matrix),并说明斜交旋转报告规范。
八、方法章节怎么描述PCA分析过程
标准方法章节描述(研究目的为综合评价降维)
采用主成分分析(Principal Component Analysis, PCA)对[N]个[变量类型]
进行降维处理,以提取综合性评价指标。分析前以KMO取样适切性量数
和Bartlett球形检验评估数据适用性,要求KMO > .60且Bartlett检验显著(p < .05)。
主成分数量以Kaiser(1960)特征根大于1准则和碎石图共同确定。
采用Varimax正交旋转法提升成分可解释性;载荷系数绝对值低于.40的
变量不计入主成分命名依据。
显著性水平设为alpha = .05。
<!-- 注:请在此处填写您所使用的统计软件(如SPSS、R、Python等)。 -->
标准方法章节描述(研究目的为量表维度探索)
为探索[量表名称]的潜在维度结构,对[N]个题项进行主成分分析。
数据适用性通过KMO取样适切性量数(> .70)和Bartlett球形检验(p < .001)
评估。主成分数量参照特征根大于1准则与碎石图共同确定,
采用Varimax正交旋转以保证各主成分的独立性,
并参照载荷系数≥.40作为题项归属判断标准。
注:主成分分析属于变量简化方法,若研究目的为潜在结构验证,
建议进一步采用CFA确认。
九、PCA报告常见错误对照表
| 常见错误 | 正确写法 | 违反的规范 |
|---|---|---|
| 只写KMO,不写Bartlett | KMO = .XXX,Bartlett chi^2(df) = XX.XX, p < .001 | 两项检验均须报告 |
| Bartlett只写p不写chi^2 | chi^2([df]) = XXXX.XX, p < .001 | 须完整报告统计量 |
| 自由度算错 | df = p(p-1)/2,p为变量数 | 常见于变量数填错 |
| 载荷矩阵缺方差解释率行 | 末三行:特征根、方差%、累计方差% | 这三行是必报要素 |
| 共同度h²缺失 | 表格右列加h²列 | APA因子分析表格惯例 |
| 未说明旋转方法 | 明确写"采用Varimax正交旋转" | 方法可重复性要求 |
| 未说明载荷截止值 | 方法章节或表注写明".40以下不显示" | 可重复性与透明度 |
| 主成分数量依据不清 | 明确写"依据特征根>1准则" | 方法章节透明度要求 |
| 斜交旋转只报告一个矩阵 | 斜交旋转需同时报告模式矩阵和结构矩阵 | 斜交旋转特有要求 |
| 方差% 超过100% | 斜交旋转各成分%之和可超100%,需表注说明 | 斜交旋转的数学特性 |
FAQ
Q:PCA和EFA(探索性因子分析)有什么区别?APA报告格式一样吗?
A:两者的目的和统计假设不同。PCA是数学降维方法,目标是最大化解释总方差,没有潜在因子的假设;EFA假设存在潜在因子(latent factors)驱动观测变量,提取的是共同方差。在APA报告上,两者的KMO/Bartlett报告格式相同,但EFA还需报告共同度提取方法(如主轴因子法PAF)、以及因子载荷矩阵(Factor Loading Matrix)中的独特性(Uniqueness = 1 - h²)。如果你的研究目的是量表结构探索,APA建议使用EFA(或进一步CFA),而非PCA。
Q:载荷截止值是0.30还是0.40?哪个更合适?
A:两者均有文献支持。Comrey & Lee(1992)提出的标准:.71以上为优秀,.63为非常好,.55为好,.45为尚可,.32为差。实际操作中:社会科学、教育学研究多用.40作为截止值(相当于一个变量有16%的方差由该成分解释);心理学测量研究有时用.30。重要的是在方法章节或表注中明确说明你用的截止值,不同截止值本身不是错误,缺乏说明才是问题。ChatSRS默认输出.40截止,可在指令中修改。
Q:Varimax旋转和Oblimin斜交旋转哪个更好?
A:取决于理论假设。若你的研究理论上认为提取的主成分(或因子)彼此独立,用Varimax正交旋转,报告更简单(只需一个载荷矩阵)。若理论上允许成分/因子相互关联(如各人格维度可能相关),用Oblimin或Promax斜交旋转,需同时报告模式矩阵(Pattern Matrix,用于命名)和结构矩阵(Structure Matrix,用于了解成分与变量的相关),并报告成分间的相关矩阵。APA 7th对两种方法都不排斥,关键是交代清楚旋转类型及选择依据。
Q:主成分分析结果报告中需要报告主成分得分(Component Score)吗?
A:如果主成分得分是后续分析的输入变量(如用作回归预测变量、综合排名权重),则需在结果章节报告主成分得分的计算方式,并在表格或附录中呈现各主成分的得分系数矩阵(Score Coefficient Matrix)。如果PCA只用于降维可视化或变量筛选,不涉及得分应用,则不必单独报告得分。APA 7th关于这一点没有强制规定,按研究目的决定。
快速参考:PCA报告格式速查卡
[适用性检验]
KMO = .XXX([评价],Kaiser, 1974)
Bartlett chi^2([p*(p-1)/2]) = XXXX.XX, p < .001
[成分数量确定]
依据特征根>1准则(Kaiser, 1960),提取[N]个主成分
—— 或 —— 碎石图显示第[N]个成分后明显折弯
[成分载荷矩阵表格必备行]
倒数三行:特征根 / 方差解释率% / 累计方差%
最右列:共同度 h²
表注:旋转方法 + 载荷截止值说明
[正文方差解释率句式]
第一主成分解释总方差的XX.X%(特征根 = X.XX),……
[N]个主成分共累计解释总方差的XX.X%
[旋转方法表注]
正交旋转:注. 采用Varimax正交旋转。载荷绝对值< .40已省略。
斜交旋转:注. 采用Oblimin斜交旋转,呈现模式矩阵。成分间相关见表[Y]。
相关阅读
- 方差分析ANOVA的APA报告怎么写?F值+偏η²+事后比较格式全解
- 相关分析APA报告怎么写?r、p、CI、显著性标记完整指南
- 回归分析APA表格怎么做 — B/β/SE/t/p/R²标准格式与三线表模板全解
- 信度分析的APA报告怎么写 — Cronbach α、McDonald ω与组合信度CR格式全解
- 主成分分析(PCA)用AI一句话完成 — 从降维到综合排名全攻略
- Harman单因子检验是什么?共同方法偏差怎么检验
本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。