场景案例 ·

图书情报学量化研究数据分析 — 用 AI 一句话完成文献计量与用户调查

图书情报学/LIS量化研究必看:文献计量描述统计、用户行为多元回归,ChatSRS AI 一句话生成 APA 7th 格式分析报告,R 引擎驱动,直出论文级结果。

图书情报学(Library and Information Science,LIS)量化研究的数据分析有两大核心场景:一是基于文献数据库导出数据的文献计量描述,二是基于问卷/访谈的用户行为回归。两类数据结构差异显著,但都要求输出 APA 7th 格式结果。这篇文章把图情研究最常见的分析流程一次串通,每步给出 ChatSRS 可直接使用的一句话指令,以及可抄进论文的 APA 7th 报告句式。


图情量化研究为什么让人头疼

如果你在写图书馆学、情报学、档案学或信息管理方向的论文,以下场景大概率遇到过:

  • 从 Web of Science 或 CNKI 导出了文献数据,不知道该报告哪些描述统计指标
  • 问卷收集了用户信息检索行为、数字素养量表数据,导师要求做多元回归,但不知道变量放几个
  • 引用次数、H 指数、合作网络密度这些文献计量指标,不清楚用什么统计检验
  • 论文写到方法章节,审稿人打回来:请报告调整后 R 方和 VIF 共线性诊断
  • SPSS 跑出来一堆表格,但不知道哪些数字要写进论文,什么格式

这些困难不是研究者能力不足,而是图情量化研究横跨两种数据逻辑——文献计量数据是计数/比例/时序,用户调查数据是量表/分类/连续,两套分析路径都要掌握。

chatsrs.com 把这两条路径都变成对话。下面按典型图情研究设计,从头到尾演示。


两种核心研究设计

设计一:文献计量研究

从数据库导出文献元数据(标题、作者、年份、被引次数、关键词、期刊等),分析某领域研究现状、热点演化、合作网络。

典型数据结构(从 Web of Science 导出后整理):

文献ID   年份   被引次数   作者数   期刊影响因子   研究主题类别   国家
001      2018     143        3          4.21          信息素养     中国
002      2020      87        2          3.56          数字图书馆   美国
003      2022      12        5          2.98          知识管理     英国
...      ...      ...       ...         ...           ...          ...

关键统计链:描述统计(发表量/被引量分布)→ 时序趋势分析 → 分类频数对比 → 相关分析(影响因子 vs 被引次数)→ 非参数检验(不同年代/地区发表量差异)

设计二:用户行为调查研究

问卷调查图书馆用户或信息用户,研究信息检索行为、数字素养、信息接受意愿等。

典型数据结构(Likert 量表 + 人口学 + 行为结果变量):

用户ID   年龄段   学历    数字素养(1-5)×6题   信息检索自效能(1-5)×5题   每周检索频次
001      18-25    本科    4/5/4/3/5/4          4/5/4/4/5                   8
002      26-35    硕士    5/5/5/4/5/5          5/5/5/5/4                  15
...      ...      ...     ...                  ...                        ...

关键统计链:描述统计 → 信度(Cronbach's alpha)→ 效度(KMO + EFA)→ 相关分析 → 多元线性回归(预测检索频次)


场景一:文献计量描述分析全流程

以"近十年国内数字图书馆研究现状分析"为例:从 CNKI 导出 2014-2023 年相关论文 387 篇,字段包含年份、被引次数、作者数、期刊类型(核心/非核心)等。

第一步:发表量与被引量描述统计

打开 chatsrs.com,上传数据后输入:

"请对 2014-2023 年各年度的发表篇数、篇均被引次数、总被引次数、被引中位数和被引标准差做描述统计,生成 APA 格式三线表,并画出年度发表量趋势。"

ChatSRS 自动输出:

表 1  2014-2023 年数字图书馆研究发表量与被引量概况

年份   篇数    总被引    篇均被引 (M)    SD      中位数
2014    28      1 843       65.82        78.34    41
2015    31      1 967       63.45        72.18    38
2016    35      2 214       63.26        81.02    35
...
2022    48       312        6.50         9.14      3
2023    41        87        2.12         4.38      1

注:被引次数截至检索日期 2025-12-01;近年文献因积累周期短,篇均被引偏低属正常现象。

为什么先做这步:发表量时序是文献计量研究的基础性描述,可直接写入结果章节的"研究概况"部分;被引分布严重右偏,后续需用中位数而非均值作为代表值,ChatSRS 自动给出两者。


第二步:分类频数与期刊分布

"请对期刊类型(核心期刊 / 非核心期刊)、研究方法(定量 / 定性 / 混合)、研究主题(七大类别)分别做频数统计,输出频数、百分比,生成 APA 格式三线表。"

ChatSRS 输出各分类变量的频数分布表,自动计算百分比和累计百分比,格式符合 APA 7th 表格规范。


第三步:分组对比——核心期刊 vs 非核心期刊被引差异

由于被引次数分布偏态(Shapiro-Wilk 检验通常显著),使用非参数检验更合适:

"请用 Mann-Whitney U 检验比较核心期刊和非核心期刊的篇均被引次数是否存在显著差异,报告 U 值、Z 值、p 值和效应量 r,并给出 APA 格式报告句式。"

ChatSRS 输出:

Mann-Whitney U 检验结果

核心期刊 (n = 214):Mdn = 52.00,IQR = [28.00, 89.00]
非核心期刊 (n = 173):Mdn = 18.00,IQR = [7.00, 41.00]

U = 11 824.50,Z = -8.43,p < .001
效应量 r = .43(中等偏大效应)

第四步:相关分析——影响因子与被引次数的关系

"请做期刊影响因子与论文被引次数的 Spearman 相关分析(因分布偏态),报告 rs 值、p 值和 95% 置信区间,并做散点图。"

ChatSRS 自动判断使用 Spearman(因偏态分布)而非 Pearson,给出相关系数和显著性。


场景二:用户行为调查回归分析全流程

以"高校图书馆用户数字素养对信息检索行为影响研究"为例:网络问卷调查 N = 268 名在校学生,测量数字素养(6 题)、信息检索自效能感(5 题)、感知有用性(4 题)、每周主动检索频次(连续变量)。

第一步:描述统计与信效度

打开 chatsrs.com,上传数据后输入:

"请对数字素养量表(6 题,5 点 Likert)和信息检索自效能感量表(5 题,5 点 Likert)分别做:(1) 均值、标准差描述统计;(2) Cronbach's alpha 信度分析,含逐题删除后 alpha;(3) KMO 和 Bartlett 球形检验,判断是否适合做因子分析。"

ChatSRS 同时输出三部分结果,并自动给出"alpha >= .70 建议阈值"和"KMO >= .70 适合做因子分析"的判断。


第二步:相关分析——变量间关系初探

"请做数字素养总分、信息检索自效能感总分、感知有用性总分、每周检索频次之间的 Pearson 相关矩阵,报告相关系数和显著性,标注 * p < .05,** p < .01,*** p < .001,生成 APA 格式相关矩阵三线表。"

ChatSRS 输出:

表 2  各变量描述统计与 Pearson 相关矩阵

变量                M      SD      1         2         3
1. 数字素养       3.84    0.62     —
2. 检索自效能感   3.76    0.71    .58***     —
3. 感知有用性     4.02    0.55    .41***    .52***    —
4. 每周检索频次   9.24    5.18    .49***    .63***   .38***

注:N = 268。*** p < .001。

第三步:多元线性回归——预测每周检索频次

"以每周检索频次为因变量,以数字素养、信息检索自效能感、感知有用性为自变量,做多元线性回归。报告:(1) 回归方程整体拟合 F 值、R 方、调整 R 方;(2) 各预测变量的非标准化系数 B、标准误 SE、标准化系数 beta、t 值、p 值和 95% CI;(3) 共线性诊断 VIF;(4) 残差正态性和异方差检验。生成 APA 三线表。"

ChatSRS 输出:

表 3  多元线性回归结果(因变量:每周检索频次)

预测变量           B       SE     beta     t        p       95% CI           VIF
常数(截距)    -3.24    1.18             -2.74    .006   [-5.56, -0.92]
数字素养         1.63    0.42     .196    3.88    <.001   [0.80, 2.46]      1.52
检索自效能感     3.87    0.38     .529    10.18   <.001   [3.12, 4.62]      1.63
感知有用性       0.84    0.47     .089    1.79    .075    [-0.08, 1.76]     1.35

注:N = 268;F(3, 264) = 86.42,p < .001;R^2 = .496,调整 R^2 = .490。
VIF 均 < 10,不存在严重共线性。残差 Shapiro-Wilk W = 0.988,p = .106,满足正态性。

第四步:分组回归——控制人口学变量的层级回归

如果研究问题涉及"控制学历、年级后,数字素养是否仍能预测检索频次":

"做两步层级线性回归:第一层放入学历(虚拟编码)和年级为控制变量;第二层追加数字素养、检索自效能感、感知有用性。报告两层的 R 方、R 方变化量 Delta R^2 及其 F 变化检验。"

ChatSRS 输出分层回归表,清晰呈现第二层新增解释方差是否显著,满足论文"自变量增量效度"的报告要求。


论文方法/结果写法(APA 7th,图情研究报告句式)

以下句式可直接进论文,替换括号内的数值即可。

方法章节:数据分析策略描述(文献计量)

本研究采用描述统计方法对检索文献的年度发表量、被引次数分布进行概括描述,并以期刊类型为分组变量,采用 Mann-Whitney U 检验(因被引次数分布偏态,Shapiro-Wilk p < .001)检验组间差异。期刊影响因子与被引次数之间的关联采用 Spearman 相关系数(rs)表征。所有分析在 ChatSRS 平台完成(R 引擎,显著性水平 alpha = .05)。

方法章节:数据分析策略描述(用户调查)

量表信度采用 Cronbach's alpha 系数评估,内部一致性 >= .70 为可接受标准(Nunnally, 1978)。结构效度通过探索性因子分析(EFA)评估,以 KMO >= .70 且 Bartlett 球形检验显著(p < .001)作为适合做因子分析的前提。变量间关联以 Pearson 相关系数表征,主要假设检验采用多元线性回归,并报告调整后 R 方、标准化系数(beta)和 VIF 共线性指标。所有分析在 ChatSRS 平台完成(R 引擎,显著性水平 alpha = .05)。

结果章节:Mann-Whitney U 检验(文献计量)

Mann-Whitney U 检验结果显示,核心期刊论文的被引次数(Mdn = 52.00,IQR = [28.00, 89.00])显著高于非核心期刊(Mdn = 18.00,IQR = [7.00, 41.00]),U = 11 824.50,Z = -8.43,p < .001,效应量 r = .43,属中等偏大效应,表明期刊类型对论文学术影响力具有显著的差异化效果。

结果章节:多元回归(用户调查)

多元线性回归分析结果(见表 3)显示,以数字素养、信息检索自效能感和感知有用性为预测变量,能够显著预测用户每周主动检索频次,F(3, 264) = 86.42,p < .001,R^2 = .496(模型解释了因变量 49.6% 的方差),调整后 R^2 = .490。信息检索自效能感是最强的预测变量,beta = .529,t(264) = 10.18,p < .001,B 的 95% CI [3.12, 4.62];数字素养亦显著正向预测检索频次,beta = .196,t(264) = 3.88,p < .001,B 的 95% CI [0.80, 2.46];感知有用性的预测效果未达显著水平,beta = .089,t(264) = 1.79,p = .075。所有预测变量的方差膨胀因子(VIF)均低于 10,不存在严重共线性问题。


上面这四段可以直接进论文 Method 和 Results 章节,只需替换你自己的数值。ChatSRS 的"APA 报告"功能可自动生成对应段落,无需手动转写。


常见 FAQ

Q1:文献计量数据里被引次数分布很偏,应该用均值还是中位数报告?

被引次数几乎必然是严重右偏分布(少数高被引文献拉高均值),规范做法是:

  • 描述性报告:同时报告均值(M)和中位数(Mdn),并报告标准差(SD)和四分位距(IQR)。读者可以同时看到两种集中趋势。
  • 推断统计(组间比较):选 Mann-Whitney U 检验而不是独立 t 检验,因为被引次数分布严重右偏(含极端高被引异常值),Mann-Whitney 对分布形态无假设,更适合该数据特征。
  • ChatSRS 在执行分组比较时会自动检验正态性,若不满足则自动切换到非参数检验,并在报告中注明原因。

Q2:图情研究的用户调查量表应该报告哪些效度指标?

图情领域的量表效度报告,参考国内外主流期刊(如《图书情报工作》《Journal of the American Society for Information Science and Technology》)的要求:

  • 内容效度:研究者自制量表须说明"经专家评议"或"参照已有成熟量表改编"
  • 结构效度(必报):KMO 值(>= .70)、Bartlett 球形检验显著性(p < .001)、因子载荷(>= .40 保留题目)、累计方差解释率(>= 50% 可接受,60% 较好)
  • 如使用成熟量表(如 TAM 感知有用性量表):可做 CFA,报告 CFI >= .90、TLI >= .90、RMSEA <= .08
  • ChatSRS 一句话即可完成上述所有检验并生成对应三线表

Q3:多元回归里有几个显著、有几个不显著,该如何写论文?

这是很常见的情况,处理方式如下:

  1. 在结果部分如实报告每个变量的结果——无论显著与否,都要报告 beta、t 值、p 值和 95% CI(APA 7th 要求)
  2. 在讨论部分解释不显著的原因——是测量误差?样本量不足(考虑统计功效)?还是理论上本来就不应该有关系?
  3. 不要删除不显著的变量然后重跑——这属于 p-hacking,在预先注册研究中是违规的;如果是探索性研究,删除后应说明这是"探索性步骤"
  4. ChatSRS 可以帮你生成"含不显著变量的完整 APA 报告句式",不需要自己手动拼写

Q4:审稿人要求补充"逐步回归"或"层级回归",怎么用 ChatSRS 做?

两种方法都支持,一句话指令即可:

逐步回归(Stepwise Regression)

"做逐步线性回归(向后剔除法),以每周检索频次为因变量,所有量表总分和人口学变量为候选预测变量,设入选标准 p < .05,剔除标准 p > .10,报告最终保留模型的 F 值、R 方和各变量 beta。"

层级回归(Hierarchical Regression)

"做两步层级回归:第一步放人口学变量(学历、年级、性别);第二步追加数字素养和检索自效能感。报告每步 R^2、Delta R^2 及 F 变化检验。"

注意:逐步回归在方法论上因"数据驱动选择变量"受到批评,在图情领域期刊发表时建议优先使用理论驱动的层级回归。

Q5:研究方法章节应该如何引用 ChatSRS?

在论文方法章节的"数据分析工具"或"统计方法"段落,规范写法为:

本研究所有统计分析均在 ChatSRS AI 统计平台(https://chatsrs.com)完成,底层计算引擎为 R(version 4.4,R Foundation for Statistical Computing, 2024);信度分析使用 psych 包(Revelle, 2024),回归与方差分析使用 car 包(Fox & Weisberg, 2019),非参数检验使用 coin 包(Hothorn et al., 2006)。

参考文献条目:

R Core Team. (2024). R: A language and environment for statistical computing.
    R Foundation for Statistical Computing. https://www.R-project.org/

Revelle, W. (2024). psych: Procedures for psychological, psychometric, and
    personality research (Version 2.4.3) [R package]. https://CRAN.R-project.org/package=psych

分析方法速查表

研究问题推荐方法ChatSRS 一句话关键词
各年度发表量趋势描述统计 + 时序图"年度频数描述统计、趋势折线图"
分类变量频率分布频数分析"频数、百分比、APA 三线表"
偏态数据组间比较Mann-Whitney U"Mann-Whitney U 检验,效应量 r"
量表可靠性信度(Cronbach alpha)"Cronbach alpha,逐题删除后 alpha"
量表结构验证KMO + EFA"KMO Bartlett 检验、探索性因子分析"
变量线性关联Pearson/Spearman 相关"相关矩阵,APA 格式,双尾显著性"
预测连续结果变量多元线性回归"多元回归,beta 系数,VIF,调整 R 方"
控制变量后增量效应层级回归"层级回归,Delta R^2,F 变化检验"

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。