场景案例 ·

出版与读者调查数据怎么用 AI 分析?— 阅读行为分群 + 多元回归完整教程

出版研究、传播学与图书馆学必看:从读者阅读行为 K-means 分群、多元回归预测订阅意愿,到 APA 7th 论文报告句式,ChatSRS AI 一句话跑完读者调查全套分析。

出版学、新闻传播、图书馆学方向的研究者,读者调查是最常见的数据来源——但拿到 500 份问卷之后,往往不知道该先做什么:读者画像用什么方法刻画?哪些因素影响续订意愿?分群结果怎么报告?这篇教程以"读者阅读行为调查"为场景,串起 K-means 聚类分群 + 多元线性回归两条分析链,每步给出可在 chatsrs.com 直接使用的真实指令,以及可抄进论文的 APA 7th 报告句式。


出版与读者研究为什么需要专门的分析策略

如果你正在做以下方向的论文或项目报告:

  • 期刊/报纸/电子书平台的读者满意度调查
  • 图书馆用户阅读偏好与资源利用行为研究
  • 数字出版转型背景下的受众细分研究
  • 学术期刊订阅意愿与支付意愿预测

你大概率会遇到这些问题:

  • 读者行为变量很多(阅读频率、时长、类型偏好、设备习惯……),不知道怎么压缩成有意义的"读者类型"
  • 想知道哪些因素预测续订/购买意愿,但不确定该用线性回归还是逻辑回归
  • 聚类出来 3 个读者群,不知道怎么命名、怎么写进论文
  • 调查结果表格做完了,导师说"再报告一下效应量和 95% CI"
  • 审稿意见:请补充多重共线性诊断结果(VIF)

这些痛点的核心在于:出版与读者研究的数据结构往往是"多行为变量 + 人口学背景 + 态度/意愿因变量"的混合结构,需要描述统计 → 信效度 → 聚类分群 → 回归预测这条完整链条。

chatsrs.com 把这整条链条变成对话。下面以"数字阅读平台读者行为调查"为例演示。


典型数据结构:读者调查问卷

本文使用的示例数据来自一项针对某数字阅读平台用户的问卷调查,共 482 名有效受访者。数据结构如下:

人口学变量(分类)

性别(男/女)、年龄段(18-25/26-35/36-45/46+)、
学历(专科及以下/本科/硕士及以上)、职业类型(学生/职场/自由职业/其他)

阅读行为变量(连续 / 有序)

周阅读频率(次/周)、单次阅读时长(分钟)、月阅读书目数(本)、
纸质书占比(%)、电子书占比(%)、有声书占比(%)、
阅读类型偏好评分(文学/社科/技术/工具各 1-5 分)

平台使用变量(连续 / 有序)

平台使用月数、功能使用广度(1-7 种功能已用)、
分享行为频率(1-5 Likert)、内容评论频率(1-5 Likert)

因变量

续订意愿(1-5 Likert 总分,经信度验证后加总为连续变量)

分析链条一:K-means 聚类 — 绘制读者行为画像

聚类分析的目标是:把 482 名读者按行为模式自动分成若干"典型读者群",为差异化运营或精准研究提供依据。

第一步:描述统计 + 正态性检验

打开 chatsrs.com,上传数据后输入:

"请对所有阅读行为连续变量(周阅读频率、单次阅读时长、月阅读书目数、有声书占比、功能使用广度)做描述统计,输出均值、标准差、偏度、峰度,生成 APA 格式三线表;并做 Shapiro-Wilk 正态性检验。"

ChatSRS 输出描述统计三线表,并自动标注偏度绝对值 > 1 的变量,提示后续聚类前需标准化处理。


第二步:确定聚类数 — 肘部法则 + 轮廓系数

"对阅读行为变量(周阅读频率、单次阅读时长、月阅读书目数、有声书占比、功能使用广度)先做 z-score 标准化,然后用 K-means 聚类,用肘部法则(组内平方和 WSS 图)和平均轮廓系数分别判断最优聚类数 k,范围 k = 2 到 7。"

ChatSRS 输出肘部图和轮廓系数折线图,并给出自动判断:

肘部法则:k = 3 处折点明显,WSS 下降斜率从 k=2→3 显著减小后趋于平缓。
平均轮廓系数:k = 3 时轮廓系数最高(0.41),k = 4 时下降至 0.34。
建议 k = 3。

第三步:K-means 聚类 — 输出分群结果

"以 k = 3 做 K-means 聚类(设随机种子 42,重复运行 25 次取最优),输出:各聚类的样本量和占比、各变量的聚类中心(原始尺度,反标准化后的均值)、聚类中心差异的 ANOVA F 检验(含 p 值)、轮廓系数分布,生成 APA 格式聚类中心三线表。"

ChatSRS 输出:

表 1  K-means 聚类中心(原始尺度,k = 3)

变量                聚类 1 (n=158, 32.8%)   聚类 2 (n=201, 41.7%)   聚类 3 (n=123, 25.5%)   F(2, 479)   p
周阅读频率(次)         1.8                     4.2                     6.9                  312.4    <.001
单次阅读时长(分钟)     22.4                    48.7                    91.3                  428.6    <.001
月阅读书目数(本)        0.6                     2.1                     5.4                  289.1    <.001
有声书占比(%)          12.3                    28.6                    41.7                   87.3    <.001
功能使用广度(种)         1.4                     3.2                     5.6                  203.7    <.001

注. 聚类间所有变量差异均显著(p < .001),聚类方案具有良好区分度。

根据聚类中心特征,三个读者群可命名为:

  • 聚类 1(轻度读者):低频、短时、几乎不用平台深度功能,占 32.8%
  • 聚类 2(中度读者):中等频率、时长居中、功能使用适中,占 41.7%
  • 聚类 3(重度读者):高频、长时、多类型阅读、平台黏性高,占 25.5%

第四步:聚类画像的人口学交叉验证

"对上述三个聚类,交叉分析人口学变量(性别、年龄段、学历、职业类型)在三群中的分布,做卡方检验,报告 chi^2 值、自由度、p 值和 Cramér's V 效应量,生成 APA 格式交叉表。"

ChatSRS 输出各人口学变量与聚类的交叉检验结果,自动用星号标记显著项(* p < .05,** p < .01,*** p < .001)。

详细聚类分析方法,参见:聚类分析(K-means)用 AI 一句话完成 — 客户细分/市场分群完整教程


分析链条二:多元回归 — 预测读者续订意愿

在刻画读者分群之后,研究的第二个核心问题是:哪些因素实质性地预测了读者的续订意愿?

第五步:续订意愿量表信效度验证

续订意愿由 4 道 Likert 题组成,在做回归之前必须先验证量表质量:

"对续订意愿量表(4 道 5 点 Likert 题)做信度分析,报告 Cronbach's alpha 和删题后 alpha;做 KMO 和 Bartlett 球形检验,判断是否适合做因子分析;如适合,做探索性因子分析(主轴因子法、正交旋转),提取因子及载荷矩阵。"

ChatSRS 输出:

Cronbach's alpha = .87(95% CI [.85, .89]),内部一致性良好。
KMO = .82,Bartlett: chi^2(6) = 1284.3,p < .001,适合因子分析。
单因子解释方差 = 64.7%,四题载荷范围 .74 ~ .86。

结论:续订意愿量表单维结构成立,4 题总分可作为连续因变量进入回归。


第六步:多元线性回归 — 主分析

"以续订意愿总分为因变量,以以下变量为自变量,做多元线性回归:周阅读频率、单次阅读时长、功能使用广度、内容评论频率、分享行为频率、聚类归属(聚类 2 和聚类 3 相对聚类 1 的虚拟变量)、年龄段(有序虚拟变量)、学历(有序虚拟变量)。报告:R^2、调整 R^2、F 值;每个预测变量的非标准化系数 B、标准误、标准化系数 Beta、t 值、p 值和 95% CI;VIF 多重共线性诊断;残差正态性和异方差检验。生成 APA 标准多元回归系数表。"

ChatSRS 输出完整回归结果:

表 2  续订意愿多元回归系数表(n = 482)

预测变量                     B       SE      Beta      t        p       95% CI            VIF
(截距)                      8.43    0.62              13.60   <.001   [7.21, 9.65]
周阅读频率                   0.34    0.07     .21      4.86   <.001   [0.20, 0.48]        1.43
单次阅读时长                  0.02    0.01     .13      2.97    .003   [0.01, 0.04]        1.62
功能使用广度                  0.58    0.09     .29      6.44   <.001   [0.40, 0.76]        1.71
内容评论频率                  0.41    0.11     .16      3.73   <.001   [0.19, 0.63]        1.38
分享行为频率                  0.22    0.10     .09      2.20    .028   [0.02, 0.42]        1.31
聚类 2 vs 聚类 1(虚拟变量)  1.14    0.23     .20      4.96   <.001   [0.69, 1.59]        1.54
聚类 3 vs 聚类 1(虚拟变量)  2.76    0.28     .41      9.86   <.001   [2.21, 3.31]        1.68
年龄段(有序虚拟变量)         0.18    0.11     .07      1.64    .102   [-0.04, 0.40]       1.24
学历(有序虚拟变量)           0.09    0.13     .03      0.69    .490   [-0.17, 0.35]       1.19

注. R^2 = .58,调整 R^2 = .57,F(9, 472) = 72.4,p < .001。所有 VIF < 2.0,无多重共线性问题。
残差 Shapiro-Wilk:W = 0.991,p = .142,满足正态性假设。
Breusch-Pagan 异方差检验:BP = 11.3,p = .254,方差齐性假设成立。

第七步:回归结果的可视化与补充分析

"绘制标准化回归系数的森林图(含 95% CI,按 Beta 绝对值降序排列,p < .05 的用不同颜色标注);并绘制功能使用广度与续订意愿的散点图加回归线(控制其他变量在均值)。"

ChatSRS 输出两张图,可直接嵌入论文或报告。


论文方法/结果写法(APA 7th,出版研究报告句式)

以下是可直接抄进论文的 APA 7th 规范段落,替换自己的数值即可。

方法章节:数据分析策略

本研究数据分析分两个阶段进行。第一阶段采用 K-means 聚类分析(k = 3)对读者阅读行为进行分群,聚类数的确定依据肘部法则(组内平方和折点)和平均轮廓系数的综合判断;聚类前对所有连续变量进行 z-score 标准化处理。第二阶段以多元线性回归检验读者行为特征及聚类归属对续订意愿的预测效应;回归前检验了多重共线性(方差膨胀因子 VIF)、残差正态性(Shapiro-Wilk 检验)及异方差性(Breusch-Pagan 检验)等假设。续订意愿量表的信度以 Cronbach's alpha 报告,结构效度以探索性因子分析(主轴因子法,正交旋转)检验。所有分析均使用 ChatSRS 完成(R 引擎,显著性水平 alpha = .05)。

结果章节:聚类分析

K-means 聚类分析(k = 3)将 482 名受访者划分为三个读者群体:轻度读者(n = 158,32.8%)、中度读者(n = 201,41.7%)与重度读者(n = 123,25.5%)。三群在所有聚类变量上的差异均达到显著水平(ps < .001;见表 1),平均轮廓系数为 0.41,表明聚类方案具有较好的内部一致性与外部区分度。

结果章节:多元线性回归主效应

多元线性回归分析结果显示,模型整体显著,F(9, 472) = 72.4,p < .001,调整 R^2 = .57,模型解释了续订意愿总方差的 57%。功能使用广度是最强的正向预测变量,Beta = .29,B = 0.58,95% CI [0.40, 0.76],p < .001;重度读者(聚类 3)的续订意愿显著高于轻度读者(参照组),Beta = .41,B = 2.76,95% CI [2.21, 3.31],p < .001。周阅读频率(Beta = .21)、单次阅读时长(Beta = .13)及内容评论频率(Beta = .16)亦为显著正向预测变量(ps < .01)。年龄段和学历的预测效应均未达到显著水平(ps > .10)。所有预测变量的方差膨胀因子(VIF)介于 1.19 至 1.71 之间,不存在多重共线性问题。


以上三段可直接进论文 Methods 和 Results 章节。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写数值。


常见 FAQ

Q1: 阅读行为是连续变量,能直接做 K-means 吗?Likert 题怎么处理?

可以。K-means 适用于连续变量,但需要注意:

  1. 必须先标准化(z-score):不同量纲的变量(如"次/周"与"分钟/次")直接聚类会导致量纲大的变量主导结果
  2. Likert 题的处理:1-5 分 Likert 题在样本量 > 100 时通常视作近似连续变量处理,可直接纳入聚类;若对量测层次敏感,可改用 K-medoids(PAM)聚类

在 ChatSRS 里告知"变量包含 Likert 评分题,请在聚类前做 z-score 标准化",AI 会自动处理并在报告中说明预处理步骤。

Q2: 续订意愿是 1-5 分,用线性回归还是有序逻辑回归?

这取决于变量的实际分布:

  • 如果续订意愿是多题求和的复合评分(如 4 题 × 5 分 = 4-20 分),通常视作近似连续变量,用多元线性回归,报告 R^2 和 Beta
  • 如果续订意愿是单题评分(只有 1 题,5 个等级),则更严格地应使用有序逻辑回归(Ordinal Logistic Regression),报告比例优势比(OR)
  • ChatSRS 会根据因变量结构自动提示选择哪种回归;也可直接问:"我的因变量是 4 题 Likert 加总,应该用线性回归还是有序逻辑回归?"

Q3: 聚类得到 3 类读者,怎么给它们命名?论文里怎么报告?

命名步骤:

  1. 输出聚类中心表(原始尺度,反标准化后的均值)
  2. 识别每个聚类在各变量上的相对位置(高/中/低)
  3. 结合研究背景给出描述性名称(如"轻度浏览型""深度阅读型""平台深耕型")

论文报告格式:在描述聚类结果的段落后,附上聚类中心三线表(表 1),在正文中用命名而非"聚类 1/2/3"引用,例如:"深度阅读群体(n = 123,25.5%)在功能使用广度上的均值(M = 5.6)显著高于轻度浏览群体(M = 1.4),F(2, 479) = 203.7,p < .001。"

Q4: 回归系数 Beta 和 B 有什么区别,论文里报告哪个?

  • B(非标准化回归系数):原始尺度,代表自变量增加 1 个单位时因变量的变化量,适合解释"实际变化量"(如"功能使用广度每增加 1 种,续订意愿增加 0.58 分")
  • Beta(标准化回归系数):消除量纲,可跨变量比较"相对重要性"(Beta 绝对值越大,该变量的预测贡献越强)

APA 7th 的规范做法:两者均报告。回归系数表中同时列出 B、SE(标准误)、Beta、t、p 和 95% CI。正文重点叙述 Beta 用于比较各预测变量的相对效应,B 用于解释实际意义。

Q5: 审稿人要求"控制混淆变量后重新分析",如何操作?

在 ChatSRS 里使用分层回归(Hierarchical Regression):

"做分层线性回归,第一层纳入控制变量(性别、年龄段、学历),第二层纳入阅读行为变量(周阅读频率、单次阅读时长、功能使用广度),第三层纳入聚类虚拟变量。报告每层的 R^2 变化量 delta R^2、F 变化量及其显著性,说明每层自变量在控制前一层后的增量解释力。"

分层回归可清晰呈现"在控制人口学差异之后,阅读行为的净预测效应",是应对审稿意见最有说服力的分析策略。


出版与读者研究分析快查表

研究问题方法ChatSRS 关键词
读者画像刻画K-means 聚类"阅读行为变量 z-score 标准化后 K-means,肘部法则 + 轮廓系数"
聚类人口学特征卡方检验 + Cramér's V"聚类归属与人口学变量交叉分析,卡方检验效应量"
续订/购买意愿预测多元线性回归"多元线性回归,Beta VIF 95% CI APA 系数表"
控制混淆变量分层回归"分层线性回归,delta R^2 增量解释力"
变量间关系强度Pearson 相关"相关矩阵,Pearson r 及显著性标注"
量表可靠性验证Cronbach alpha + EFA"信效度分析,alpha KMO 因子载荷"
不同读者群均值比较单因素 ANOVA"单因素方差分析,事后检验 Tukey,效应量 partial eta^2"

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。