统计百科 ·
K-Means 聚类分析 APA 报告怎么写?聚类中心表 + 各类占比 + F 统计量模板全解
统计百科:专攻"K-Means 聚类结果怎么写进论文"——聚类中心差异 F 统计量、各簇样本占比、聚类中心表格式、APA 7th 方法与结果章节完整模板,盘点审稿人最常挑的聚类报告格式错误。
聚类分析的难点不在于跑算法,而在于"结果怎么写进论文":聚类中心表格怎么排、F 统计量从哪里来、各簇人数比例要不要报告、APA 7th 怎么描述一个无监督学习结果……本文专攻"K-Means 聚类如何规范写进论文"这一具体格式点,给出聚类中心表、F 统计量、轮廓系数、各类占比的完整 APA 7th 模板,并逐一盘点审稿人最常挑的格式错误。
你的聚类报告有这些问题吗?
导师或审稿人关于聚类分析报告最常见的反馈:
- "聚类中心表没有给出各变量的 F 统计量和显著性,无法判断聚类效果"
- "结果只说了分几类,但各类的样本量(百分比)没有报告"
- "聚类方法描述不清楚——初始聚类中心怎么确定?迭代次数是多少?"
- "轮廓系数(Silhouette Coefficient)没有报告,怎么判断 k=3 是最优的?"
- "聚类中心表的数值是原始均值还是标准化后的?没有说明"
- "方法章节说'用 K-Means 聚成三类',但没有说明分类的理论依据或聚类数选择依据"
这些错误集中在两个环节:聚类数的选取与报告 和 聚类结果的规范呈现。本文只讲一件事:K-Means 聚类结果到底怎么规范写进 APA 7th 格式的论文。
如果你还没看过姊妹篇 F 值的 APA 7th 报告写法,建议先读那篇——聚类中心表里的 F 统计量格式与 ANOVA 完全相同,本文默认你已了解 F(df1, df2)、p 值不加前导零等基础规则,不再重复。
一、K-Means 聚类的报告逻辑:从算法结果到论文语言
K-Means 输出了什么
运行 K-Means 聚类后,统计软件通常给出以下核心输出:
| 输出项 | 含义 | 报告必要性 |
|---|---|---|
| 各簇聚类中心(Final Cluster Centers) | 每个簇在每个变量上的均值 | 必须(核心结果) |
| 簇间距离矩阵(Distances Between Final Cluster Centers) | 各簇中心之间的欧氏距离 | 建议报告(说明簇分离程度) |
| ANOVA 表(F 统计量) | 各变量在区分各簇时的贡献 F 值 | 必须(量化聚类效果) |
| 各簇样本量 | 每簇的 N 和百分比 | 必须(描述各类规模) |
| 迭代历史(Iteration History) | 各轮迭代的聚类中心变化量 | 可选(方法部分简要说明) |
轮廓系数(Silhouette Coefficient) 需要额外计算,值域 [-1, 1],越接近 1 表示聚类质量越好。大多数软件(R 的 cluster 包、Python 的 sklearn)可直接输出。
聚类分析在 APA 论文中属于哪种统计
K-Means 聚类是探索性、描述性分析,不是假设检验——这意味着:
- 没有"显著性"结论(聚类结果没有 p < .05 的解读方式)
- 聚类中心差异 F 统计量是辅助性指标,说明"各变量对聚类区分的贡献",不用于做推断检验
- 报告的核心是"各簇的特征描述",而非"差异是否显著"
二、聚类数 k 的选择:必须报告的依据
APA 审稿人经常追问"为什么选 k=3",论文必须给出方法依据。常用的三种方法:
肘部法(Elbow Method)
绘制 k 从 2 到 8 时的组内平方和(WSS / Inertia)折线图,找"肘点"——WSS 下降速率明显减缓处对应的 k 值。
报告句式:
采用肘部法(Elbow Method)评估最优聚类数,绘制 k = 2 至 8 的组内平方和折线图,结果显示 k = 3 时曲线出现明显拐点,此后边际收益显著减小,据此确定将样本划分为 3 个类别。
轮廓系数法(Silhouette Analysis)
对每个 k 值计算平均轮廓系数,选取轮廓系数最高的 k 值。
报告句式:
通过轮廓系数法(Silhouette Analysis)辅助确认聚类数,k = 2 至 6 的平均轮廓系数依次为 .42、.57、.49、.38、.31,k = 3 时轮廓系数最高(S = .57),表明三类划分的内聚性与分离性最优。
BIC / 间隙统计量(Gap Statistic)
对每个 k 值计算 Gap Statistic,选取 Gap 值显著高于随机基准的最小 k。
报告句式:
采用间隙统计量(Tibshirani 等,2001)辅助确定聚类数,结果显示 k = 3 的 Gap 值(Gap = 0.432)显著高于 k = 2(Gap = 0.371)和 k = 4(Gap = 0.419),综合理论意义与统计标准,确定 k = 3 为最终聚类数。
三、聚类中心表(核心结果表):APA 格式规范
表格结构
聚类中心表是聚类报告的核心,APA 7th 格式要求:
- 三线表格式(顶线 + 表头下横线 + 底线)
- 变量为行,各簇(Cluster 1 / 2 / 3)为列
- 同时报告 F 统计量(df1, df2)和 p 值
标准聚类中心表示例
表 1
K-Means 聚类最终聚类中心(N = 320)
| 变量 | 簇 1:学习动力型 (n = 98, 30.6%) | 簇 2:焦虑回避型 (n = 134, 41.9%) | 簇 3:高效自律型 (n = 88, 27.5%) | F(2, 317) | p |
|---|---|---|---|---|---|
| 学习动机 | 3.82 | 2.14 | 4.51 | 187.34 | < .001 |
| 自我效能感 | 3.56 | 2.08 | 4.73 | 214.62 | < .001 |
| 焦虑水平 | 2.91 | 4.38 | 1.94 | 156.78 | < .001 |
| 学习投入 | 3.74 | 2.23 | 4.68 | 203.15 | < .001 |
| 拖延行为 | 3.21 | 4.52 | 1.87 | 178.93 | < .001 |
注:聚类中心为各变量在该簇的均值;各变量已标准化(M = 0, SD = 1)后进行聚类;F 统计量用于描述各变量对聚类区分的贡献,不应用于推断性假设检验(Aldenderfer & Blashfield, 1984; Hair et al., 2019)。
表格注意事项
- 注明是否标准化:若聚类前对变量进行了 z 标准化,必须在表注中说明,否则不同量纲的变量均值不可比
- 簇名称建议命名:用描述性标签代替"簇 1/2/3",体现每簇的核心特征(如"高动机型""低效焦虑型")
- F 值解释提示:表注应提醒读者这里的 F 是描述性指标,避免误读为 ANOVA 推断检验
- N 和百分比必须报告:每簇的样本量(n)和占总样本比例(%)是聚类规模描述的核心
四、各簇距离矩阵(可选但推荐)
簇间距离矩阵说明各聚类中心之间的分离程度,数值越大说明簇间差异越明显:
表 2
各簇聚类中心间的欧氏距离
| 簇 1 | 簇 2 | 簇 3 | |
|---|---|---|---|
| 簇 1 | — | 3.847 | 4.219 |
| 簇 2 | 3.847 | — | 5.063 |
| 簇 3 | 4.219 | 5.063 | — |
注:距离为欧氏距离,基于标准化变量计算。距离越大表明两簇中心差异越显著。
报告句式:
各聚类中心间的欧氏距离矩阵显示,簇 2(焦虑回避型)与簇 3(高效自律型)之间的距离最大(d = 5.063),表明两簇在心理特征上的差异最为显著;簇 1 与簇 2 之间的距离最小(d = 3.847),但仍具有明显区分度。
五、APA 7th 完整报告模板
方法章节:统计分析小节
采用 K-Means 聚类分析(MacQueen,1967)对 [N] 名 [研究对象] 在 [变量数] 个
[维度名称] 变量上进行类型划分。聚类前对所有变量进行 z 标准化(M = 0,SD = 1)
以消除量纲差异。通过肘部法和轮廓系数法确定最优聚类数,综合评估后确定 k = [k 值]。
采用随机初始化种子(random_state = 42)以保证结果可重复,最大迭代次数设为 300 次,
当各簇中心变化量低于 0.0001 时收敛。聚类质量通过平均轮廓系数(S = X.XX)评估。
统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)完成。
填入数值的示例:
采用 K-Means 聚类分析(MacQueen,1967)对 320 名在校大学生在学习动机、自我效能感、焦虑水平、学习投入和拖延行为 5 个变量上进行学习风格类型划分。聚类前对所有变量进行 z 标准化(M = 0,SD = 1)以消除量纲差异。通过肘部法绘制 k = 2 至 8 的组内平方和折线图,结合轮廓系数分析(k = 3 时 S = .57,为各 k 值中最高),确定最优聚类数为 k = 3。随机初始化种子设为 42,最大迭代次数 300 次,收敛阈值 0.0001,算法在第 12 次迭代时达到收敛。统计分析使用 ChatSRS(SPSS + R + Stata 三引擎)完成。
结果章节:聚类结果报告
K-Means 聚类分析将 [N] 名 [研究对象] 划分为 [k] 个类别(见表 X)。
簇 1([名称],n = XX,XX%)在[特征变量]上得分最高(M = X.XX),
在[对比变量]上得分最低(M = X.XX);
簇 2([名称],n = XX,XX%)表现为[特征描述];
簇 3([名称],n = XX,XX%)在全部变量上均呈现[整体特征]。
F 统计量显示,各变量对聚类区分均有显著贡献,
其中 [变量名] 的 F 值最高,F([k-1], [N-k]) = X.XX,p < .001,
表明该变量是区分三类学生最重要的特征。
平均轮廓系数 S = X.XX,表明聚类结构具有合理的内聚性与分离性。
填入数值的示例:
K-Means 聚类分析将 320 名大学生划分为 3 个学习风格类别(见表 1)。簇 1(学习动力型,n = 98,30.6%)学习动机(M = 3.82)和自我效能感(M = 3.56)均处于中高水平,焦虑水平(M = 2.91)适中,呈现出主动学习但尚未达到最优效率的特征;簇 2(焦虑回避型,n = 134,41.9%)焦虑水平(M = 4.38)和拖延行为(M = 4.52)显著偏高,学习动机(M = 2.14)和自我效能感(M = 2.08)处于三簇中最低水平,是样本中占比最大的问题性学习风格;簇 3(高效自律型,n = 88,27.5%)在学习动机(M = 4.51)、自我效能感(M = 4.73)和学习投入(M = 4.68)上均显著高于另两簇,焦虑(M = 1.94)和拖延(M = 1.87)处于最低水平,代表适应性最佳的学习者群体。F 统计量显示,5 个变量对聚类区分均有显著贡献(均 p < .001),其中自我效能感的 F 值最高,F(2, 317) = 214.62,p < .001,为最强聚类区分变量。三簇平均轮廓系数 S = .57,聚类结构具有较好的内聚性与分离性。
六、在 ChatSRS 一句话获得规范聚类报告
打开 chatsrs.com,上传数据后输入:
"对以下 5 个变量(学习动机、自我效能感、焦虑水平、学习投入、拖延行为)做 K-Means 聚类,先 z 标准化,用肘部法和轮廓系数法确定最优 k 值(k 范围 2-6);输出最终聚类中心表(含各簇 n 和百分比)、各变量 F 统计量(含 df)、簇间距离矩阵、平均轮廓系数;给出符合 APA 7th 格式的方法章节和结果章节完整报告段落,对各簇命名并描述特征。"
ChatSRS 自动完成聚类、生成 APA 格式三线表、输出可直接复制的结果段落,数值自动填入,格式符合审稿要求。
七、方法章节的文献引用
聚类分析报告在方法章节需要引用相应来源,常用引用如下:
K-Means 算法原始来源:
MacQueen, J. (1967). Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, 1, 281–297.
轮廓系数:
Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65. https://doi.org/10.1016/0377-0427(87)90125-7
间隙统计量(如使用):
Tibshirani, R., Walther, G., & Hastie, T. (2001). Estimating the number of clusters in a data set via the gap statistic. Journal of the Royal Statistical Society: Series B, 63(2), 411–423. https://doi.org/10.1111/1467-9868.00293
在方法章节明确软件(ChatSRS):
统计分析使用 ChatSRS(版本 2.x;chatsrs.com)完成,该平台整合 SPSS、R 及 Stata 引擎,支持聚类质量评估与 APA 格式报告自动生成。
八、聚类报告常见错误对照表
| 常见错误 | 正确做法 | 违反的规范 |
|---|---|---|
| 聚类中心只报告原始均值,变量量纲不同 | 标准化后聚类,表注说明"均值为标准化得分" | 量纲不一致导致大量纲变量主导聚类结果 |
| 不报告各簇 n 和百分比 | 必须报告每簇的 n(%) | 读者无法评估各类别的代表性和样本平衡 |
| 只说"聚成 3 类",无选 k 依据 | 报告肘部法 / 轮廓系数 / Gap Statistic 依据 | APA 方法章节要求"分析决策均需有据可查" |
| 把聚类 F 值解读为 ANOVA 推断结论 | 表注明确"F 为描述性指标,不用于推断检验" | 聚类 F 值违反 ANOVA 独立性假设,不可推断 |
| F 值缺少自由度:F = 214.62 | F(2, 317) = 214.62 | APA 格式要求 F(df1, df2) |
| p = .000 | p < .001 | .000 是舍入假值,APA 规定写 < .001 |
| 不报告轮廓系数 | 报告平均轮廓系数 S = X.XX | 无法评估聚类质量优劣 |
| 没有对各簇命名 | 根据聚类中心特征给出描述性名称 | 纯编号无助于读者理解各类型的实质含义 |
| 方法章节漏写迭代收敛条件 | 说明最大迭代次数和收敛阈值 | 可重复性要求:他人无法复现分析流程 |
常见 FAQ
Q:聚类中心表里的 F 值和方差分析(ANOVA)的 F 值是一回事吗?
A:形式相同,含义不同。聚类中心表里的 F 值是事后计算的——先做完聚类,再用聚类标签作为"分组变量"跑 ANOVA,得到 F 值。这个 F 值只能描述"各变量在区分各簇时的贡献大小",不能用于推断性检验(不能说"p < .05 说明聚类显著")。原因是:ANOVA 假设分组是独立先验确定的,而聚类分组是由数据本身决定的,已经最大化了组间差异,F 值天然偏大,p 值因此无效。APA 要求在表注中明确这一点。
Q:k 值必须用统计方法确定吗,能不能直接根据理论定 3 类?
A:可以,但要在方法章节说明理由。如果研究有强理论依据(如"参考 Smith(2020)的三类型框架先验设定 k = 3"),需要写明理论来源;然后在结果章节补充报告轮廓系数,说明该 k 值在统计上也具有合理性。纯靠经验或"感觉好像 3 类"而不给理由,审稿人通常会要求补充依据。
Q:聚类分析的效应量怎么报告?
A:K-Means 聚类没有统一公认的"效应量"指标。目前惯用的替代方案有两种:一是报告轮廓系数(S),参考标准:S > .70 为强结构,S = .51–.70 为合理结构,S = .26–.50 为弱结构;二是报告聚类解释的方差比例(即各变量 F 值对应的 eta^2 = SS_between / SS_total),但必须在表注中说明这是描述性而非推断性指标。ChatSRS 默认同时输出轮廓系数和各变量的描述性 eta^2。
Q:数据标准化后,怎么在报告里描述各簇特征(均值是负数怎么说)?
A:标准化后均值为 z 分,描述时有两种方式:(1)直接描述 z 分相对高低,如"簇 1 在焦虑变量上的标准化均值(z = -0.87)显著低于簇 2(z = 1.24)";(2)将聚类标签映射回原始量表,对原始数据按簇计算均值和标准差,报告原始分数(这是更直觉友好的方式)。两种方式均被 APA 接受,但若报告原始分数,表注需注明"聚类基于标准化数据,表中报告原始量表得分",防止读者误解。
快速参考:聚类 APA 报告格式速查卡
[方法章节要素]
- 算法:K-Means(引用 MacQueen,1967)
- 预处理:z 标准化(M = 0,SD = 1)
- k 值依据:肘部法 / 轮廓系数 / Gap Statistic
- 初始化方式 + 迭代设置
- 聚类质量评估:平均轮廓系数 S = X.XX
- 软件:ChatSRS / R / SPSS
[结果报告要素]
- 各簇 n 和百分比:Cluster 1 (n = XX, XX%)
- 聚类中心表(APA 三线表):变量 × 簇,含 F(df1, df2) 和 p 值
- 簇间距离矩阵(可选)
- 各簇描述性命名 + 特征描述
[聚类中心 F 值格式]
F([k-1], [N-k]) = X.XX, p [< .001 / = .XXX]
注:F 为描述性指标,不用于推断检验
[轮廓系数报告]
平均轮廓系数 S = X.XX(> .50 为合理聚类结构)
相关阅读
- F 值的 APA 7th 报告写法 — F(df1,df2)格式、效应量 eta 平方、报告模板全解
- ANOVA 方差分析 APA 报告写法 — 完整模板
- PCA 主成分分析 APA 报告写法
- 事后多重比较 APA 报告写法
- AI 做聚类分析全教程
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。