教程 ·

内容分析法,怎么把开放题/文本定性资料转成可统计的数据

问卷开放题、访谈文本这类定性资料怎么转化成可以统计分析的数据?本文讲清楚内容分析法的编码流程、编码者信度检验方法,以及编码完成后如何用统计方法进一步分析。

问卷里的开放题、访谈转录文本,看起来是一堆无法直接"算"的文字,但内容分析法(Content Analysis)提供了一条把这类文本资料系统性转化为可统计数据的路径。这不是简单的"数关键词",而是一套有方法学依据的编码流程。


内容分析法在做什么

内容分析法的核心逻辑是:把非结构化的文本资料,按照一套明确的编码规则,系统地转化为结构化的类别或数值,转化之后就可以像处理问卷题目一样,做频数统计、交叉分析,甚至纳入回归模型。

它和纯粹的质性研究(如扎根理论)不完全一样:扎根理论更强调从数据中"生长"出理论,过程相对开放;内容分析法则更强调编码规则的系统性和可重复性,即使是探索性的内容分析,也需要明确的编码手册和可检验的一致性标准,这也是它能够和定量分析衔接的关键原因。


内容分析法的两种取向

定向内容分析(Directed / 演绎式)

基于已有理论或前人研究,预先设定好编码类别,再用文本资料去验证或补充这些类别是否成立。适合已有较成熟理论框架、希望检验理论在新情境下是否适用的研究。

常规内容分析(Conventional / 归纳式)

不预设编码类别,直接从文本资料中归纳提炼类别,类别是"长"出来的而不是提前定好的。适合研究主题较新、缺乏成熟理论框架可以直接套用的场景。

多数论文实际采用的是介于两者之间的混合取向——带着大致的理论方向去看文本,但保持开放,允许在编码过程中根据文本内容调整或新增类别。


标准编码流程

  1. 通读全部文本,形成初步印象:不急于编码,先整体阅读,对文本的整体内容和结构有基本把握
  2. 制定编码手册(Codebook):明确每个类别的定义、包含/排除标准,并给出典型例句,这是保证多人编码一致性的关键工具
  3. 试编码,修订编码手册:先用少量文本(如 10%-20%)试编码,检查编码手册是否清晰、类别之间是否存在重叠或遗漏,据此修订编码手册
  4. 正式编码:由至少两名编码员独立按编码手册对全部文本进行编码
  5. 计算编码者信度(Inter-rater Reliability):检验多名编码员的编码结果是否具有足够的一致性
  6. 解决分歧,形成最终编码:对编码员意见不一致的部分,通过讨论或第三方仲裁达成一致,形成最终的编码数据集
  7. 转化为可统计变量:将编码结果整理成频数表或哑变量,进入后续统计分析环节

编码者信度:为什么必须要有第二个人

内容分析法要求可重复性——如果换一个人编码,得到的结果差异很大,说明编码规则不够清晰或者太主观,这样的数据是不能拿去做统计分析的。因此编码者信度检验几乎是内容分析法能否被期刊接受的硬性门槛

常见的编码者信度指标:

指标适用场景说明
百分比一致率(Percent Agreement)快速粗略检验计算简单,但没有校正随机一致的可能性,容易高估
Cohen's Kappa两名编码员、类别变量校正了随机一致的概率,是最常用的双人编码信度指标
Krippendorff's Alpha多名编码员、多种数据类型适用范围最广(可用于名义、顺序、等距等各类数据),也支持缺失数据,是目前学界更推荐的通用指标

一般经验标准:Kappa 或 Alpha 系数 ≥0.8 表示信度良好,0.67-0.8 可接受(部分探索性研究),低于 0.67 通常需要重新修订编码手册并重新编码。


编码完成后能做哪些统计分析

一旦文本被转化为编码类别(本质上就是分类变量),后续的统计分析路径和处理问卷封闭题几乎一样:

  • 频数与百分比统计:各类别出现的频率分布,回答"哪种意见/主题最常见"
  • 交叉表与卡方检验:编码类别与其他分类变量(如性别、部门)之间是否存在关联,比如"不同群体提到的痛点类型是否有显著差异"
  • 将编码结果作为哑变量纳入回归模型:比如把"是否提到价格因素"编码为 0/1 变量,作为预测变量之一纳入满意度回归模型
  • 编码频次与其他连续变量做相关分析:比如某类负面评价的提及次数与整体满意度评分之间的相关性

论文里怎么写

方法部分需要交代完整的编码流程细节,这是内容分析法能否被认可的关键:

本研究采用常规内容分析法对 328 份问卷开放题回答进行编码。由两名研究者独立通读文本并制定编码手册,经过预编码修订后正式编码,编码者信度检验 Krippendorff's Alpha = 0.84,达到良好一致性水平。编码分歧部分经讨论后达成一致,最终形成 6 个主题类别,各类别频数统计结果见表 X。

结果部分建议给出编码类别的频数表,并适当引用典型的原始文本作为例证,帮助读者理解每个类别的具体含义(这一点和混合研究方法中的"联合展示"思路类似,可参考《混合研究方法,定量数据和定性资料怎么结合分析》)。


用 ChatSRS 怎么处理编码后的数据

内容分析法本身的文本编码环节(阅读文本、制定编码手册、多人独立编码)仍然需要研究者人工完成,这是保证方法学严谨性的核心步骤,无法也不应该被完全自动化替代。但编码完成之后的统计分析环节——频数统计、卡方检验、把编码结果作为哑变量纳入回归——这部分是标准的定量分析工作,可以直接用 ChatSRS 完成,比如:

"这是我把开放题编码之后的分类结果(6 个主题类别的 0/1 编码),帮我做频数统计,再看看这些主题类别和部门之间是否存在显著关联。"

AI 会按标准流程给出频数表、卡方检验结果和三线表,省去手动在 Excel 里透视统计的时间。


常见 FAQ

Q:只有一个人编码可以吗?

A:不建议。单人编码无法计算编码者信度,审稿人很难判断编码结果是否可靠、是否掺杂了过多的主观判断。即使受限于人力只能一人完成全部编码,也建议找第二个人对至少一部分文本(如20%)做独立编码来计算信度,作为编码质量的佐证。

Q:编码类别应该定多少个合适?

A:没有固定数量标准,但类别过多(比如超过 10-15 个)会导致每个类别下的样本量过少,难以支撑后续的统计检验;类别过少又可能丢失文本中重要的差异信息。一个实用做法是先在试编码阶段归纳出较多的初步类别,再通过合并相近类别、剔除低频类别,收敛到一个既能体现文本差异、又有足够统计效力的数量。

Q:内容分析法得到的数据可以做因子分析吗?

A:如果编码得到的是多个相关的二元/顺序变量(比如同一份文本可能同时被编码为涉及"价格""服务""质量"等多个主题),理论上可以探索这些编码类别之间是否存在潜在维度结构,但需要谨慎考虑编码类别本身的独立性假设是否成立,这和从头设计的量表题目性质不完全相同,解读时应更为审慎。


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内【用户中心 -> 帮助与反馈】联系我们。