场景案例 ·
图书情报学量化研究数据分析 — 用 AI 一句话完成文献计量与用户调查
图书情报学/LIS量化研究必看:文献计量描述统计、用户行为多元回归,ChatSRS AI 一句话生成 APA 7th 格式分析报告,R 引擎驱动,直出论文级结果。
图书情报学(Library and Information Science,LIS)量化研究的数据分析有两大核心场景:一是基于文献数据库导出数据的文献计量描述,二是基于问卷/访谈的用户行为回归。两类数据结构差异显著,但都要求输出 APA 7th 格式结果。这篇文章把图情研究最常见的分析流程一次串通,每步给出 ChatSRS 可直接使用的一句话指令,以及可抄进论文的 APA 7th 报告句式。
图情量化研究为什么让人头疼
如果你在写图书馆学、情报学、档案学或信息管理方向的论文,以下场景大概率遇到过:
- 从 Web of Science 或 CNKI 导出了文献数据,不知道该报告哪些描述统计指标
- 问卷收集了用户信息检索行为、数字素养量表数据,导师要求做多元回归,但不知道变量放几个
- 引用次数、H 指数、合作网络密度这些文献计量指标,不清楚用什么统计检验
- 论文写到方法章节,审稿人打回来:请报告调整后 R 方和 VIF 共线性诊断
- SPSS 跑出来一堆表格,但不知道哪些数字要写进论文,什么格式
这些困难不是研究者能力不足,而是图情量化研究横跨两种数据逻辑——文献计量数据是计数/比例/时序,用户调查数据是量表/分类/连续,两套分析路径都要掌握。
chatsrs.com 把这两条路径都变成对话。下面按典型图情研究设计,从头到尾演示。
两种核心研究设计
设计一:文献计量研究
从数据库导出文献元数据(标题、作者、年份、被引次数、关键词、期刊等),分析某领域研究现状、热点演化、合作网络。
典型数据结构(从 Web of Science 导出后整理):
文献ID 年份 被引次数 作者数 期刊影响因子 研究主题类别 国家
001 2018 143 3 4.21 信息素养 中国
002 2020 87 2 3.56 数字图书馆 美国
003 2022 12 5 2.98 知识管理 英国
... ... ... ... ... ... ...
关键统计链:描述统计(发表量/被引量分布)→ 时序趋势分析 → 分类频数对比 → 相关分析(影响因子 vs 被引次数)→ 非参数检验(不同年代/地区发表量差异)
设计二:用户行为调查研究
问卷调查图书馆用户或信息用户,研究信息检索行为、数字素养、信息接受意愿等。
典型数据结构(Likert 量表 + 人口学 + 行为结果变量):
用户ID 年龄段 学历 数字素养(1-5)×6题 信息检索自效能(1-5)×5题 每周检索频次
001 18-25 本科 4/5/4/3/5/4 4/5/4/4/5 8
002 26-35 硕士 5/5/5/4/5/5 5/5/5/5/4 15
... ... ... ... ... ...
关键统计链:描述统计 → 信度(Cronbach's alpha)→ 效度(KMO + EFA)→ 相关分析 → 多元线性回归(预测检索频次)
场景一:文献计量描述分析全流程
以"近十年国内数字图书馆研究现状分析"为例:从 CNKI 导出 2014-2023 年相关论文 387 篇,字段包含年份、被引次数、作者数、期刊类型(核心/非核心)等。
第一步:发表量与被引量描述统计
打开 chatsrs.com,上传数据后输入:
"请对 2014-2023 年各年度的发表篇数、篇均被引次数、总被引次数、被引中位数和被引标准差做描述统计,生成 APA 格式三线表,并画出年度发表量趋势。"
ChatSRS 自动输出:
表 1 2014-2023 年数字图书馆研究发表量与被引量概况
年份 篇数 总被引 篇均被引 (M) SD 中位数
2014 28 1 843 65.82 78.34 41
2015 31 1 967 63.45 72.18 38
2016 35 2 214 63.26 81.02 35
...
2022 48 312 6.50 9.14 3
2023 41 87 2.12 4.38 1
注:被引次数截至检索日期 2025-12-01;近年文献因积累周期短,篇均被引偏低属正常现象。
为什么先做这步:发表量时序是文献计量研究的基础性描述,可直接写入结果章节的"研究概况"部分;被引分布严重右偏,后续需用中位数而非均值作为代表值,ChatSRS 自动给出两者。
第二步:分类频数与期刊分布
"请对期刊类型(核心期刊 / 非核心期刊)、研究方法(定量 / 定性 / 混合)、研究主题(七大类别)分别做频数统计,输出频数、百分比,生成 APA 格式三线表。"
ChatSRS 输出各分类变量的频数分布表,自动计算百分比和累计百分比,格式符合 APA 7th 表格规范。
第三步:分组对比——核心期刊 vs 非核心期刊被引差异
由于被引次数分布偏态(Shapiro-Wilk 检验通常显著),使用非参数检验更合适:
"请用 Mann-Whitney U 检验比较核心期刊和非核心期刊的篇均被引次数是否存在显著差异,报告 U 值、Z 值、p 值和效应量 r,并给出 APA 格式报告句式。"
ChatSRS 输出:
Mann-Whitney U 检验结果
核心期刊 (n = 214):Mdn = 52.00,IQR = [28.00, 89.00]
非核心期刊 (n = 173):Mdn = 18.00,IQR = [7.00, 41.00]
U = 11 824.50,Z = -8.43,p < .001
效应量 r = .43(中等偏大效应)
第四步:相关分析——影响因子与被引次数的关系
"请做期刊影响因子与论文被引次数的 Spearman 相关分析(因分布偏态),报告 rs 值、p 值和 95% 置信区间,并做散点图。"
ChatSRS 自动判断使用 Spearman(因偏态分布)而非 Pearson,给出相关系数和显著性。
场景二:用户行为调查回归分析全流程
以"高校图书馆用户数字素养对信息检索行为影响研究"为例:网络问卷调查 N = 268 名在校学生,测量数字素养(6 题)、信息检索自效能感(5 题)、感知有用性(4 题)、每周主动检索频次(连续变量)。
第一步:描述统计与信效度
打开 chatsrs.com,上传数据后输入:
"请对数字素养量表(6 题,5 点 Likert)和信息检索自效能感量表(5 题,5 点 Likert)分别做:(1) 均值、标准差描述统计;(2) Cronbach's alpha 信度分析,含逐题删除后 alpha;(3) KMO 和 Bartlett 球形检验,判断是否适合做因子分析。"
ChatSRS 同时输出三部分结果,并自动给出"alpha >= .70 建议阈值"和"KMO >= .70 适合做因子分析"的判断。
第二步:相关分析——变量间关系初探
"请做数字素养总分、信息检索自效能感总分、感知有用性总分、每周检索频次之间的 Pearson 相关矩阵,报告相关系数和显著性,标注 * p < .05,** p < .01,*** p < .001,生成 APA 格式相关矩阵三线表。"
ChatSRS 输出:
表 2 各变量描述统计与 Pearson 相关矩阵
变量 M SD 1 2 3
1. 数字素养 3.84 0.62 —
2. 检索自效能感 3.76 0.71 .58*** —
3. 感知有用性 4.02 0.55 .41*** .52*** —
4. 每周检索频次 9.24 5.18 .49*** .63*** .38***
注:N = 268。*** p < .001。
第三步:多元线性回归——预测每周检索频次
"以每周检索频次为因变量,以数字素养、信息检索自效能感、感知有用性为自变量,做多元线性回归。报告:(1) 回归方程整体拟合 F 值、R 方、调整 R 方;(2) 各预测变量的非标准化系数 B、标准误 SE、标准化系数 beta、t 值、p 值和 95% CI;(3) 共线性诊断 VIF;(4) 残差正态性和异方差检验。生成 APA 三线表。"
ChatSRS 输出:
表 3 多元线性回归结果(因变量:每周检索频次)
预测变量 B SE beta t p 95% CI VIF
常数(截距) -3.24 1.18 -2.74 .006 [-5.56, -0.92]
数字素养 1.63 0.42 .196 3.88 <.001 [0.80, 2.46] 1.52
检索自效能感 3.87 0.38 .529 10.18 <.001 [3.12, 4.62] 1.63
感知有用性 0.84 0.47 .089 1.79 .075 [-0.08, 1.76] 1.35
注:N = 268;F(3, 264) = 86.42,p < .001;R^2 = .496,调整 R^2 = .490。
VIF 均 < 10,不存在严重共线性。残差 Shapiro-Wilk W = 0.988,p = .106,满足正态性。
第四步:分组回归——控制人口学变量的层级回归
如果研究问题涉及"控制学历、年级后,数字素养是否仍能预测检索频次":
"做两步层级线性回归:第一层放入学历(虚拟编码)和年级为控制变量;第二层追加数字素养、检索自效能感、感知有用性。报告两层的 R 方、R 方变化量 Delta R^2 及其 F 变化检验。"
ChatSRS 输出分层回归表,清晰呈现第二层新增解释方差是否显著,满足论文"自变量增量效度"的报告要求。
论文方法/结果写法(APA 7th,图情研究报告句式)
以下句式可直接进论文,替换括号内的数值即可。
方法章节:数据分析策略描述(文献计量)
本研究采用描述统计方法对检索文献的年度发表量、被引次数分布进行概括描述,并以期刊类型为分组变量,采用 Mann-Whitney U 检验(因被引次数分布偏态,Shapiro-Wilk p < .001)检验组间差异。期刊影响因子与被引次数之间的关联采用 Spearman 相关系数(rs)表征。所有分析在 ChatSRS 平台完成(R 引擎,显著性水平 alpha = .05)。
方法章节:数据分析策略描述(用户调查)
量表信度采用 Cronbach's alpha 系数评估,内部一致性 >= .70 为可接受标准(Nunnally, 1978)。结构效度通过探索性因子分析(EFA)评估,以 KMO >= .70 且 Bartlett 球形检验显著(p < .001)作为适合做因子分析的前提。变量间关联以 Pearson 相关系数表征,主要假设检验采用多元线性回归,并报告调整后 R 方、标准化系数(beta)和 VIF 共线性指标。所有分析在 ChatSRS 平台完成(R 引擎,显著性水平 alpha = .05)。
结果章节:Mann-Whitney U 检验(文献计量)
Mann-Whitney U 检验结果显示,核心期刊论文的被引次数(Mdn = 52.00,IQR = [28.00, 89.00])显著高于非核心期刊(Mdn = 18.00,IQR = [7.00, 41.00]),U = 11 824.50,Z = -8.43,p < .001,效应量 r = .43,属中等偏大效应,表明期刊类型对论文学术影响力具有显著的差异化效果。
结果章节:多元回归(用户调查)
多元线性回归分析结果(见表 3)显示,以数字素养、信息检索自效能感和感知有用性为预测变量,能够显著预测用户每周主动检索频次,F(3, 264) = 86.42,p < .001,R^2 = .496(模型解释了因变量 49.6% 的方差),调整后 R^2 = .490。信息检索自效能感是最强的预测变量,beta = .529,t(264) = 10.18,p < .001,B 的 95% CI [3.12, 4.62];数字素养亦显著正向预测检索频次,beta = .196,t(264) = 3.88,p < .001,B 的 95% CI [0.80, 2.46];感知有用性的预测效果未达显著水平,beta = .089,t(264) = 1.79,p = .075。所有预测变量的方差膨胀因子(VIF)均低于 10,不存在严重共线性问题。
上面这四段可以直接进论文 Method 和 Results 章节,只需替换你自己的数值。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写。
常见 FAQ
Q1:文献计量数据里被引次数分布很偏,应该用均值还是中位数报告?
被引次数几乎必然是严重右偏分布(少数高被引文献拉高均值),规范做法是:
- 描述性报告:同时报告均值(M)和中位数(Mdn),并报告标准差(SD)和四分位距(IQR)。读者可以同时看到两种集中趋势。
- 推断统计(组间比较):选 Mann-Whitney U 检验而不是独立 t 检验,因为被引次数分布严重右偏(含极端高被引异常值),Mann-Whitney 对分布形态无假设,更适合该数据特征。
- ChatSRS 在执行分组比较时会自动检验正态性,若不满足则自动切换到非参数检验,并在报告中注明原因。
Q2:图情研究的用户调查量表应该报告哪些效度指标?
图情领域的量表效度报告,参考国内外主流期刊(如《图书情报工作》《Journal of the American Society for Information Science and Technology》)的要求:
- 内容效度:研究者自制量表须说明"经专家评议"或"参照已有成熟量表改编"
- 结构效度(必报):KMO 值(>= .70)、Bartlett 球形检验显著性(p < .001)、因子载荷(>= .40 保留题目)、累计方差解释率(>= 50% 可接受,60% 较好)
- 如使用成熟量表(如 TAM 感知有用性量表):可做 CFA,报告 CFI >= .90、TLI >= .90、RMSEA <= .08
- ChatSRS 一句话即可完成上述所有检验并生成对应三线表
Q3:多元回归里有几个显著、有几个不显著,该如何写论文?
这是很常见的情况,处理方式如下:
- 在结果部分如实报告每个变量的结果——无论显著与否,都要报告 beta、t 值、p 值和 95% CI(APA 7th 要求)
- 在讨论部分解释不显著的原因——是测量误差?样本量不足(考虑统计功效)?还是理论上本来就不应该有关系?
- 不要删除不显著的变量然后重跑——这属于 p-hacking,在预先注册研究中是违规的;如果是探索性研究,删除后应说明这是"探索性步骤"
- ChatSRS 可以帮你生成"含不显著变量的完整 APA 报告句式",不需要自己手动拼写
Q4:审稿人要求补充"逐步回归"或"层级回归",怎么用 ChatSRS 做?
两种方法都支持,一句话指令即可:
逐步回归(Stepwise Regression):
"做逐步线性回归(向后剔除法),以每周检索频次为因变量,所有量表总分和人口学变量为候选预测变量,设入选标准 p < .05,剔除标准 p > .10,报告最终保留模型的 F 值、R 方和各变量 beta。"
层级回归(Hierarchical Regression):
"做两步层级回归:第一步放人口学变量(学历、年级、性别);第二步追加数字素养和检索自效能感。报告每步 R^2、Delta R^2 及 F 变化检验。"
注意:逐步回归在方法论上因"数据驱动选择变量"受到批评,在图情领域期刊发表时建议优先使用理论驱动的层级回归。
Q5:研究方法章节应该如何引用 ChatSRS?
在论文方法章节的"数据分析工具"或"统计方法"段落,规范写法为:
本研究所有统计分析均在 ChatSRS AI 统计平台(https://chatsrs.com)完成,底层计算引擎为 R(version 4.4,R Foundation for Statistical Computing, 2024);信度分析使用
psych包(Revelle, 2024),回归与方差分析使用car包(Fox & Weisberg, 2019),非参数检验使用coin包(Hothorn et al., 2006)。
参考文献条目:
R Core Team. (2024). R: A language and environment for statistical computing.
R Foundation for Statistical Computing. https://www.R-project.org/
Revelle, W. (2024). psych: Procedures for psychological, psychometric, and
personality research (Version 2.4.3) [R package]. https://CRAN.R-project.org/package=psych
分析方法速查表
| 研究问题 | 推荐方法 | ChatSRS 一句话关键词 |
|---|---|---|
| 各年度发表量趋势 | 描述统计 + 时序图 | "年度频数描述统计、趋势折线图" |
| 分类变量频率分布 | 频数分析 | "频数、百分比、APA 三线表" |
| 偏态数据组间比较 | Mann-Whitney U | "Mann-Whitney U 检验,效应量 r" |
| 量表可靠性 | 信度(Cronbach alpha) | "Cronbach alpha,逐题删除后 alpha" |
| 量表结构验证 | KMO + EFA | "KMO Bartlett 检验、探索性因子分析" |
| 变量线性关联 | Pearson/Spearman 相关 | "相关矩阵,APA 格式,双尾显著性" |
| 预测连续结果变量 | 多元线性回归 | "多元回归,beta 系数,VIF,调整 R 方" |
| 控制变量后增量效应 | 层级回归 | "层级回归,Delta R^2,F 变化检验" |
相关阅读
- 相关分析完整教程 — AI 一句话完成 Pearson 与 Spearman
- 信度分析完整教程 — Cronbach alpha 用 AI 一句话完成
- 多元线性回归完整教程 — AI 一步到位
- 非参数检验完整教程 — AI 一键完成
- 毕业论文数据分析救星 — 全流程 AI 完成指南
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。