统计百科 ·

K-Means 聚类分析 APA 报告怎么写?聚类中心表 + 各类占比 + F 统计量模板全解

统计百科:专攻"K-Means 聚类结果怎么写进论文"——聚类中心差异 F 统计量、各簇样本占比、聚类中心表格式、APA 7th 方法与结果章节完整模板,盘点审稿人最常挑的聚类报告格式错误。

聚类分析的难点不在于跑算法,而在于"结果怎么写进论文":聚类中心表格怎么排、F 统计量从哪里来、各簇人数比例要不要报告、APA 7th 怎么描述一个无监督学习结果……本文专攻"K-Means 聚类如何规范写进论文"这一具体格式点,给出聚类中心表、F 统计量、轮廓系数、各类占比的完整 APA 7th 模板,并逐一盘点审稿人最常挑的格式错误。


你的聚类报告有这些问题吗?

导师或审稿人关于聚类分析报告最常见的反馈:

  • "聚类中心表没有给出各变量的 F 统计量和显著性,无法判断聚类效果"
  • "结果只说了分几类,但各类的样本量(百分比)没有报告"
  • "聚类方法描述不清楚——初始聚类中心怎么确定?迭代次数是多少?"
  • "轮廓系数(Silhouette Coefficient)没有报告,怎么判断 k=3 是最优的?"
  • "聚类中心表的数值是原始均值还是标准化后的?没有说明"
  • "方法章节说'用 K-Means 聚成三类',但没有说明分类的理论依据或聚类数选择依据"

这些错误集中在两个环节:聚类数的选取与报告聚类结果的规范呈现。本文只讲一件事:K-Means 聚类结果到底怎么规范写进 APA 7th 格式的论文

如果你还没看过姊妹篇 F 值的 APA 7th 报告写法,建议先读那篇——聚类中心表里的 F 统计量格式与 ANOVA 完全相同,本文默认你已了解 F(df1, df2)、p 值不加前导零等基础规则,不再重复。


一、K-Means 聚类的报告逻辑:从算法结果到论文语言

K-Means 输出了什么

运行 K-Means 聚类后,统计软件通常给出以下核心输出:

输出项含义报告必要性
各簇聚类中心(Final Cluster Centers)每个簇在每个变量上的均值必须(核心结果)
簇间距离矩阵(Distances Between Final Cluster Centers)各簇中心之间的欧氏距离建议报告(说明簇分离程度)
ANOVA 表(F 统计量)各变量在区分各簇时的贡献 F 值必须(量化聚类效果)
各簇样本量每簇的 N 和百分比必须(描述各类规模)
迭代历史(Iteration History)各轮迭代的聚类中心变化量可选(方法部分简要说明)

轮廓系数(Silhouette Coefficient) 需要额外计算,值域 [-1, 1],越接近 1 表示聚类质量越好。大多数软件(R 的 cluster 包、Python 的 sklearn)可直接输出。

聚类分析在 APA 论文中属于哪种统计

K-Means 聚类是探索性、描述性分析,不是假设检验——这意味着:

  • 没有"显著性"结论(聚类结果没有 p < .05 的解读方式)
  • 聚类中心差异 F 统计量是辅助性指标,说明"各变量对聚类区分的贡献",不用于做推断检验
  • 报告的核心是"各簇的特征描述",而非"差异是否显著"

二、聚类数 k 的选择:必须报告的依据

APA 审稿人经常追问"为什么选 k=3",论文必须给出方法依据。常用的三种方法:

肘部法(Elbow Method)

绘制 k 从 2 到 8 时的组内平方和(WSS / Inertia)折线图,找"肘点"——WSS 下降速率明显减缓处对应的 k 值。

报告句式

采用肘部法(Elbow Method)评估最优聚类数,绘制 k = 2 至 8 的组内平方和折线图,结果显示 k = 3 时曲线出现明显拐点,此后边际收益显著减小,据此确定将样本划分为 3 个类别。

轮廓系数法(Silhouette Analysis)

对每个 k 值计算平均轮廓系数,选取轮廓系数最高的 k 值。

报告句式

通过轮廓系数法(Silhouette Analysis)辅助确认聚类数,k = 2 至 6 的平均轮廓系数依次为 .42、.57、.49、.38、.31,k = 3 时轮廓系数最高(S = .57),表明三类划分的内聚性与分离性最优。

BIC / 间隙统计量(Gap Statistic)

对每个 k 值计算 Gap Statistic,选取 Gap 值显著高于随机基准的最小 k。

报告句式

采用间隙统计量(Tibshirani 等,2001)辅助确定聚类数,结果显示 k = 3 的 Gap 值(Gap = 0.432)显著高于 k = 2(Gap = 0.371)和 k = 4(Gap = 0.419),综合理论意义与统计标准,确定 k = 3 为最终聚类数。


三、聚类中心表(核心结果表):APA 格式规范

表格结构

聚类中心表是聚类报告的核心,APA 7th 格式要求:

  • 三线表格式(顶线 + 表头下横线 + 底线)
  • 变量为行,各簇(Cluster 1 / 2 / 3)为列
  • 同时报告 F 统计量(df1, df2)和 p 值

标准聚类中心表示例

表 1

K-Means 聚类最终聚类中心(N = 320)

变量簇 1:学习动力型 (n = 98, 30.6%)簇 2:焦虑回避型 (n = 134, 41.9%)簇 3:高效自律型 (n = 88, 27.5%)F(2, 317)p
学习动机3.822.144.51187.34< .001
自我效能感3.562.084.73214.62< .001
焦虑水平2.914.381.94156.78< .001
学习投入3.742.234.68203.15< .001
拖延行为3.214.521.87178.93< .001

注:聚类中心为各变量在该簇的均值;各变量已标准化(M = 0, SD = 1)后进行聚类;F 统计量用于描述各变量对聚类区分的贡献,不应用于推断性假设检验(Aldenderfer & Blashfield, 1984; Hair et al., 2019)。

表格注意事项

  • 注明是否标准化:若聚类前对变量进行了 z 标准化,必须在表注中说明,否则不同量纲的变量均值不可比
  • 簇名称建议命名:用描述性标签代替"簇 1/2/3",体现每簇的核心特征(如"高动机型""低效焦虑型")
  • F 值解释提示:表注应提醒读者这里的 F 是描述性指标,避免误读为 ANOVA 推断检验
  • N 和百分比必须报告:每簇的样本量(n)和占总样本比例(%)是聚类规模描述的核心

四、各簇距离矩阵(可选但推荐)

簇间距离矩阵说明各聚类中心之间的分离程度,数值越大说明簇间差异越明显:

表 2

各簇聚类中心间的欧氏距离

簇 1簇 2簇 3
簇 13.8474.219
簇 23.8475.063
簇 34.2195.063

注:距离为欧氏距离,基于标准化变量计算。距离越大表明两簇中心差异越显著。

报告句式

各聚类中心间的欧氏距离矩阵显示,簇 2(焦虑回避型)与簇 3(高效自律型)之间的距离最大(d = 5.063),表明两簇在心理特征上的差异最为显著;簇 1 与簇 2 之间的距离最小(d = 3.847),但仍具有明显区分度。


五、APA 7th 完整报告模板

方法章节:统计分析小节

采用 K-Means 聚类分析(MacQueen,1967)对 [N] 名 [研究对象] 在 [变量数] 个
[维度名称] 变量上进行类型划分。聚类前对所有变量进行 z 标准化(M = 0,SD = 1)
以消除量纲差异。通过肘部法和轮廓系数法确定最优聚类数,综合评估后确定 k = [k 值]。
采用随机初始化种子(random_state = 42)以保证结果可重复,最大迭代次数设为 300 次,
当各簇中心变化量低于 0.0001 时收敛。聚类质量通过平均轮廓系数(S = X.XX)评估。
统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)完成。

填入数值的示例

采用 K-Means 聚类分析(MacQueen,1967)对 320 名在校大学生在学习动机、自我效能感、焦虑水平、学习投入和拖延行为 5 个变量上进行学习风格类型划分。聚类前对所有变量进行 z 标准化(M = 0,SD = 1)以消除量纲差异。通过肘部法绘制 k = 2 至 8 的组内平方和折线图,结合轮廓系数分析(k = 3 时 S = .57,为各 k 值中最高),确定最优聚类数为 k = 3。随机初始化种子设为 42,最大迭代次数 300 次,收敛阈值 0.0001,算法在第 12 次迭代时达到收敛。统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)完成。

结果章节:聚类结果报告

K-Means 聚类分析将 [N] 名 [研究对象] 划分为 [k] 个类别(见表 X)。
簇 1([名称],n = XX,XX%)在[特征变量]上得分最高(M = X.XX),
在[对比变量]上得分最低(M = X.XX);
簇 2([名称],n = XX,XX%)表现为[特征描述];
簇 3([名称],n = XX,XX%)在全部变量上均呈现[整体特征]。
F 统计量显示,各变量对聚类区分均有显著贡献,
其中 [变量名] 的 F 值最高,F([k-1], [N-k]) = X.XX,p < .001,
表明该变量是区分三类学生最重要的特征。
平均轮廓系数 S = X.XX,表明聚类结构具有合理的内聚性与分离性。

填入数值的示例

K-Means 聚类分析将 320 名大学生划分为 3 个学习风格类别(见表 1)。簇 1(学习动力型,n = 98,30.6%)学习动机(M = 3.82)和自我效能感(M = 3.56)均处于中高水平,焦虑水平(M = 2.91)适中,呈现出主动学习但尚未达到最优效率的特征;簇 2(焦虑回避型,n = 134,41.9%)焦虑水平(M = 4.38)和拖延行为(M = 4.52)显著偏高,学习动机(M = 2.14)和自我效能感(M = 2.08)处于三簇中最低水平,是样本中占比最大的问题性学习风格;簇 3(高效自律型,n = 88,27.5%)在学习动机(M = 4.51)、自我效能感(M = 4.73)和学习投入(M = 4.68)上均显著高于另两簇,焦虑(M = 1.94)和拖延(M = 1.87)处于最低水平,代表适应性最佳的学习者群体。F 统计量显示,5 个变量对聚类区分均有显著贡献(均 p < .001),其中自我效能感的 F 值最高,F(2, 317) = 214.62,p < .001,为最强聚类区分变量。三簇平均轮廓系数 S = .57,聚类结构具有较好的内聚性与分离性。


六、在 ChatSRS 一句话获得规范聚类报告

打开 chatsrs.com,上传数据后输入:

"对以下 5 个变量(学习动机、自我效能感、焦虑水平、学习投入、拖延行为)做 K-Means 聚类,先 z 标准化,用肘部法和轮廓系数法确定最优 k 值(k 范围 2-6);输出最终聚类中心表(含各簇 n 和百分比)、各变量 F 统计量(含 df)、簇间距离矩阵、平均轮廓系数;给出符合 APA 7th 格式的方法章节和结果章节完整报告段落,对各簇命名并描述特征。"

ChatSRS 自动完成聚类、生成 APA 格式三线表、输出可直接复制的结果段落,数值自动填入,格式符合审稿要求。


七、方法章节的文献引用

聚类分析报告在方法章节需要引用相应来源,常用引用如下:

K-Means 算法原始来源

MacQueen, J. (1967). Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, 1, 281–297.

轮廓系数

Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65. https://doi.org/10.1016/0377-0427(87)90125-7

间隙统计量(如使用):

Tibshirani, R., Walther, G., & Hastie, T. (2001). Estimating the number of clusters in a data set via the gap statistic. Journal of the Royal Statistical Society: Series B, 63(2), 411–423. https://doi.org/10.1111/1467-9868.00293

在方法章节明确软件(ChatSRS):

统计分析使用 ChatSRS(版本 2.x;chatsrs.com)完成,该平台整合 SPSS、R 及 Stata 引擎,支持聚类质量评估与 APA 格式报告自动生成。


八、聚类报告常见错误对照表

常见错误正确做法违反的规范
聚类中心只报告原始均值,变量量纲不同标准化后聚类,表注说明"均值为标准化得分"量纲不一致导致大量纲变量主导聚类结果
不报告各簇 n 和百分比必须报告每簇的 n(%)读者无法评估各类别的代表性和样本平衡
只说"聚成 3 类",无选 k 依据报告肘部法 / 轮廓系数 / Gap Statistic 依据APA 方法章节要求"分析决策均需有据可查"
把聚类 F 值解读为 ANOVA 推断结论表注明确"F 为描述性指标,不用于推断检验"聚类 F 值违反 ANOVA 独立性假设,不可推断
F 值缺少自由度:F = 214.62F(2, 317) = 214.62APA 格式要求 F(df1, df2)
p = .000p < .001.000 是舍入假值,APA 规定写 < .001
不报告轮廓系数报告平均轮廓系数 S = X.XX无法评估聚类质量优劣
没有对各簇命名根据聚类中心特征给出描述性名称纯编号无助于读者理解各类型的实质含义
方法章节漏写迭代收敛条件说明最大迭代次数和收敛阈值可重复性要求:他人无法复现分析流程

常见 FAQ

Q:聚类中心表里的 F 值和方差分析(ANOVA)的 F 值是一回事吗?

A:形式相同,含义不同。聚类中心表里的 F 值是事后计算的——先做完聚类,再用聚类标签作为"分组变量"跑 ANOVA,得到 F 值。这个 F 值只能描述"各变量在区分各簇时的贡献大小",不能用于推断性检验(不能说"p < .05 说明聚类显著")。原因是:ANOVA 假设分组是独立先验确定的,而聚类分组是由数据本身决定的,已经最大化了组间差异,F 值天然偏大,p 值因此无效。APA 要求在表注中明确这一点。

Q:k 值必须用统计方法确定吗,能不能直接根据理论定 3 类?

A:可以,但要在方法章节说明理由。如果研究有强理论依据(如"参考 Smith(2020)的三类型框架先验设定 k = 3"),需要写明理论来源;然后在结果章节补充报告轮廓系数,说明该 k 值在统计上也具有合理性。纯靠经验或"感觉好像 3 类"而不给理由,审稿人通常会要求补充依据。

Q:聚类分析的效应量怎么报告?

A:K-Means 聚类没有统一公认的"效应量"指标。目前惯用的替代方案有两种:一是报告轮廓系数(S),参考标准:S > .70 为强结构,S = .51–.70 为合理结构,S = .26–.50 为弱结构;二是报告聚类解释的方差比例(即各变量 F 值对应的 eta^2 = SS_between / SS_total),但必须在表注中说明这是描述性而非推断性指标。ChatSRS 默认同时输出轮廓系数和各变量的描述性 eta^2。

Q:数据标准化后,怎么在报告里描述各簇特征(均值是负数怎么说)?

A:标准化后均值为 z 分,描述时有两种方式:(1)直接描述 z 分相对高低,如"簇 1 在焦虑变量上的标准化均值(z = -0.87)显著低于簇 2(z = 1.24)";(2)将聚类标签映射回原始量表,对原始数据按簇计算均值和标准差,报告原始分数(这是更直觉友好的方式)。两种方式均被 APA 接受,但若报告原始分数,表注需注明"聚类基于标准化数据,表中报告原始量表得分",防止读者误解。


快速参考:聚类 APA 报告格式速查卡

[方法章节要素]
- 算法:K-Means(引用 MacQueen,1967)
- 预处理:z 标准化(M = 0,SD = 1)
- k 值依据:肘部法 / 轮廓系数 / Gap Statistic
- 初始化方式 + 迭代设置
- 聚类质量评估:平均轮廓系数 S = X.XX
- 软件:ChatSRS / R / SPSS

[结果报告要素]
- 各簇 n 和百分比:Cluster 1 (n = XX, XX%)
- 聚类中心表(APA 三线表):变量 × 簇,含 F(df1, df2) 和 p 值
- 簇间距离矩阵(可选)
- 各簇描述性命名 + 特征描述

[聚类中心 F 值格式]
F([k-1], [N-k]) = X.XX, p [< .001 / = .XXX]
注:F 为描述性指标,不用于推断检验

[轮廓系数报告]
平均轮廓系数 S = X.XX(> .50 为合理聚类结构)

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。