教程 ·

问卷多选题怎么分析?响应数、响应率与普及率的真实口径

说明 ChatSRS 当前多选题分析的真实输入和输出:用户明确指定二分类选项列,系统计算响应数、响应率和普及率,并披露有效样本分母与非常见二值编码风险。

ChatSRS 当前的 MultipleChoiceAnalyzer 只分析用户明确传入的一组列;每列必须是二分类列或至多两个不同值。它输出每个选项的响应数、响应率和普及率,不会自动把任意问卷格式变成完整的多重响应研究。

下列字段只是多选题结果的字段顺序模板,不是真实产品回执;请用同一次运行的真实输出替换,并逐项复核选项列、选中编码、有效样本分母和 warning。

先准备成“一个选项一列”

当前入口要求每个选项占一列。例如一道“使用过哪些渠道”的多选题,可以整理为:

channel_a  channel_b  channel_c
0          1          0
1          1          0
0          0          1

运行时要明确给出这三列。页面不能只提供一个列名前缀,也不能只提供一列逗号分隔文本后假定分析器会自动展开。

正式运行前应核对:

  1. 每列是否对应同一道多选题的一个选项;
  2. 每列的两个值分别代表“选中”还是“未选中”;
  3. 空值、拒答和“不适用”是否被错误编码成有效选择;
  4. 本次列清单是否遗漏或混入其他题目;
  5. 需要报告的样本总体与当前有效分母是否一致。

二值编码怎样识别

常见的 0/1、是/否、选中/未选中、Yes/No 和 True/False 编码可以识别。

若某列是不常见的二值编码,分析器会产生 warning,并在没有已知正值时把两个可比较值中的较大值当作选中值。这个回退可能与问卷字典相反,因此必须根据原始编码表核对,不能看到两种值就默认方向正确。

当前还有一个已知缺陷:当值按 [5, 2] 的顺序首次出现时,warning 可能写成“2 是选中、5 是未选中”,实际计数却会把较大值 5 当作选中。warning 与实际计数方向不一致时,不能任选一方继续解释;所有非常见二值编码都应停用当前结果,先按问卷字典人工核验并重编码为明确的 0/1、是/否或其他已知模式,再重新运行。

列中出现三个及以上非缺失值时,该列会被排除;只有一个未识别值的列也可能无法成为有效二分类列。全部列均不合格时,本次分析不会返回多选题表。

三个输出口径分别是什么

响应数

响应数是某个选项被判定为“选中”的次数。一个受访者可以选多个选项,所以各选项响应数之和可能大于有效样本数。

响应率

响应率的分母是所有有效选项的总响应次数:

某选项响应率 = 该选项响应数 / 全部选项响应数之和

各选项响应率合计为 100%。它回答“全部选择动作中,这个选项占多少”,不是“多少受访者选择了它”。

普及率

普及率的分母是至少选择一个有效选项的样本数,不是原始总行数:

某选项普及率 = 该选项响应数 / 至少选择一个有效选项的样本数

因此,各选项普及率相加通常可以超过 100%。全零、全缺失或没有任何有效选择的行不会进入这个分母。

当前表格真实包含哪些字段

字段当前含义核对重点
选项本次传入并通过二值检查的列是否属于同一道题
响应数该列被判定为选中的次数选中编码是否正确
响应率响应数除以全部响应次数不能当作个案比例
普及率响应数除以至少选一项的有效 N不能用原始总行数替换
合计总响应数、100% 响应率和平均选择项数对应的百分比不是独立样本量

当前表头会把有效样本数写在普及率字段中。报告时应把这个 N 与原始行数、完整问卷数和研究目标总体区分开。

当前明确不支持什么

当前不支持自动拆分逗号分隔字符串、自动按前缀发现题组、多重响应交叉表或任何图形。

当前不提供卡方、点二列相关、tetrachoric EFA。

当前不提供 KR-20、LDA 或文本聚类、时间趋势。也没有固定图片分辨率、固定耗时或固定数据规模的性能保证。

如果研究问题需要按性别或地区比较多选题、研究选项之间的结构,或者处理开放文本,应先建立新的、单独核验的方法合同,不能从当前频率表直接外推。

一个可复核的执行流程

  1. 冻结题目和选项清单:写明每个选项的真实列名。
  2. 核对编码:确认正值、负值、缺失和“不适用”。
  3. 显式传入列:不要只写通配符或前缀。
  4. 阅读 warning:尤其检查非常见二值编码和被排除列;一旦出现非常见编码 warning,停用当前结果,按问卷字典人工核验并重编码后重跑。
  5. 核对有效 N:统计至少选择一个有效选项的行数。
  6. 核对总响应数:抽查若干行,确认一人多选被正确累计。
  7. 分别解释两个百分比:响应率与普及率不能混写。
  8. 形成待审草稿:只使用同一次真实运行中存在的字段。

需要先整理连续变量和分类变量的基础口径时,可参考描述统计与频数分析的真实字段

多选题结果字段顺序模板

数据与题目:
- 数据版本:[真实文件或数据集版本]
- 题目名称:[真实题干]
- 选项列:[实际列名]
- 选中编码:[逐列核对]
- 缺失与拒答编码:[真实规则]

本次分母:
- 原始总行数:[真实值]
- 至少选择一个有效选项的样本数:[真实输出]
- 全部有效响应次数:[真实输出]

选项结果:
- [选项 A]:响应数[真实值];响应率[真实值];普及率[真实值]
- [选项 B]:响应数[真实值];响应率[真实值];普及率[真实值]
- warning:[原样保留;非常见编码先停用结果,完成字典核验与重编码后重跑]

待审草稿:
“在[数据版本]中,对[题目名称]的[实际选项列]进行多选题频率分析。
普及率以至少选择一个有效选项的[真实 N]个样本为分母;
响应率以[真实总响应数]次选择为分母。各选项结果见[真实表号]。”

模板只规定字段顺序。任何固定数字、组间差异或结构结论都必须来自另一次经过核验的实际分析。

常见问题

逗号分隔的一列文本能直接分析吗?

不能由当前分析器直接完成。应先按问卷字典拆成“一个选项一列”的二分类结构,并保存转换规则和抽查记录。

列名有相同前缀,系统会自动发现整道题吗?

不会。当前入口依赖用户明确传入列清单;相同前缀只是人工整理线索。

普及率为什么相加超过 100%?

因为同一受访者可以选择多个选项。每个选项都用“至少选一项的有效 N”作分母,各选项比例不互斥。

可以据此判断不同人群是否有显著差异吗?

不可以。当前表没有分组交叉和显著性检验。若要比较人群,需要另行定义列结构、分母、检验方法和多重比较策略。

可以自动算多选题信度吗?

当前多选题分析器不计算 KR-20 或 Alpha。是否需要内部一致性证据还取决于这些二分类选项是否被设计为同一构念的测量题项,不能把任意偏好列表当量表。