统计百科 ·
效度分析 APA 7th 报告写法 — CVI/AVE/HTMT 聚合效度与区分效度表格模板全解
统计百科:专攻"效度分析怎么写进论文"这一具体格式点——CVI 内容效度、AVE 聚合效度、HTMT 与相关系数平方区分效度的 APA 7th 完整报告模板,含可直接套用的表格格式与正文描述句式。
量表研究里,"效度怎么写进论文"比"效度怎么跑"更让人困惑:CVI 放在哪、AVE 和 CR 要不要一张表、HTMT 用矩阵还是列表、区分效度的判断标准写哪个版本……本文专攻这一具体格式点,给出 APA 7th 所有效度场景的完整报告模板,并逐一说明审稿人最常挑的效度报告格式错误。
你的效度报告有这些问题吗?
导师或审稿人关于效度报告最常见的反馈:
- "CVI 只报告了 I-CVI,没有报告 S-CVI/Ave,不符合规范"
- "聚合效度表只有 AVE,缺 CR(组合信度),两者应同时报告"
- "区分效度判断标准没有说明——是用 Fornell-Larcker 准则还是 HTMT?"
- "HTMT 矩阵里对角线填的什么?应该留空或填 AVE 平方根"
- "Fornell-Larcker 准则表中对角线应是 AVE 的平方根,不是 AVE 本身"
- "效度分析段落没有引用标准来源(Fornell & Larcker,1981;Henseler et al.,2015)"
- "聚合效度判断标准是 AVE > .50,但表里有个维度 AVE = .44,却写'聚合效度良好',前后矛盾"
这些错误集中在结构效度报告的细节规范,但专门汇总的实操指南并不多。本文只讲一件事:效度到底怎么规范写进论文的每一种场景。
一、效度的类型与报告结构
效度类型速览
| 效度类型 | 核心指标 | 典型分析方法 |
|---|---|---|
| 内容效度 | I-CVI、S-CVI | 专家评分法(Lynn,1986) |
| 结构效度 — 聚合效度 | AVE、CR(组合信度) | 验证性因素分析(CFA) |
| 结构效度 — 区分效度 | HTMT、Fornell-Larcker 准则 | CFA 相关矩阵 |
| 效标效度 | 相关系数 r、AUC | 与外部效标的相关分析 |
| 聚合效度(收敛效度) | 因子载荷 lambda | CFA 标准化载荷 ≥ .70 |
论文测量模型章节通常依次报告:因子载荷(收敛效度)→ CVI(内容效度,若有)→ AVE + CR(聚合效度)→ Fornell-Larcker / HTMT(区分效度)。
二、内容效度:I-CVI 与 S-CVI/Ave 的 APA 报告
核心指标含义
I-CVI(Item-level Content Validity Index):单题内容效度指数,指所有专家中将该题评为"相关"或"非常相关"(3-4 分制中的 3 或 4)的比例。
$I\text{-}CVI = \frac{\text{评为相关或非常相关的专家人数}}{\text{专家总人数}}$
S-CVI/Ave(Scale-level CVI,平均法):所有题目 I-CVI 的算术平均值。
$S\text{-}CVI/Ave = \frac{\sum I\text{-}CVI_i}{k}$
判断标准(Lynn,1986;Polit & Beck,2006):
| 指标 | 可接受标准 | 优秀标准 |
|---|---|---|
| I-CVI | >= .78 ^a^ | >= .90 |
| S-CVI/Ave | >= .80 | >= .90 |
^a^ 专家数 >= 6 时适用;若专家数 3–5,标准提升至 >= .83(Lynn,1986)。
内容效度 APA 报告模板
表格格式(置于方法章节或附录):
表 X
各维度题目内容效度指数(I-CVI)
| 题目编号 | 维度 | 专家1 | 专家2 | 专家3 | 专家4 | 专家5 | I-CVI |
|---|---|---|---|---|---|---|---|
| Q1 | 认知投入 | 4 | 3 | 4 | 4 | 3 | 1.00 |
| Q2 | 认知投入 | 4 | 4 | 4 | 3 | 4 | 1.00 |
| Q3 | 认知投入 | 3 | 4 | 3 | 4 | 3 | 1.00 |
| Q4 | 情感投入 | 3 | 2 | 3 | 3 | 4 | .80 |
| Q5 | 情感投入 | 4 | 3 | 4 | 4 | 3 | 1.00 |
| Q6 | 行为投入 | 4 | 4 | 3 | 4 | 4 | 1.00 |
| Q7 | 行为投入 | 3 | 3 | 4 | 3 | 4 | 1.00 |
| S-CVI/Ave | — | — | — | — | — | — | .97 |
注. 专家评分采用 4 分制(1 = 不相关,2 = 需大幅修订,3 = 相关但需少量修订,4 = 非常相关)。I-CVI = 评为 3 或 4 的专家比例。
正文描述模板(可直接套用):
邀请 [X] 名具有 [研究领域] 背景的专家对量表进行内容效度评估,采用 4 分制对每一题目的相关性进行评分(1 = 不相关,4 = 非常相关)。结果显示,所有题目的 I-CVI 均在 .80 至 1.00 之间,均满足 Lynn(1986)建议的 .78 最低标准;量表整体 S-CVI/Ave = .97,超过 Polit 和 Beck(2006)建议的 .90 优秀标准,表明量表具有良好的内容效度。
三、聚合效度:AVE 与 CR 的 APA 报告
核心指标含义与标准
AVE(Average Variance Extracted,平均方差提取量):
$AVE = \frac{\sum \lambda_i^2}{\sum \lambda_i^2 + \sum \delta_i}$
其中 $\lambda_i$ 为标准化因子载荷,$\delta_i$ 为测量误差方差。
CR(Composite Reliability,组合信度),又称 Rho_c:
$CR = \frac{(\sum \lambda_i)^2}{(\sum \lambda_i)^2 + \sum \delta_i}$
判断标准(Fornell & Larcker,1981;Hair et al.,2019):
| 指标 | 可接受标准 | 备注 |
|---|---|---|
| AVE | > .50 | AVE < .50 时该维度聚合效度不足 |
| CR | > .70 | 理想 CR > .80;CR > .95 可能提示题目冗余 |
| 因子载荷 | >= .70(理想) | .50-.69 可接受,但应说明 |
聚合效度 APA 报告表格
表 X
验证性因素分析:各维度因子载荷、AVE 与 CR
| 维度 | 题目 | 标准化载荷 (λ) | AVE | CR |
|---|---|---|---|---|
| 认知投入 | Q1 | .823 | .648 | .881 |
| Q2 | .796 | |||
| Q3 | .808 | |||
| 情感投入 | Q4 | .741 | .572 | .843 |
| Q5 | .784 | |||
| Q6 | .752 | |||
| 行为投入 | Q7 | .812 | .621 | .868 |
| Q8 | .769 | |||
| Q9 | .795 |
注. N = [样本量]. 所有因子载荷均在 p < .001 水平上显著。AVE = 平均方差提取量;CR = 组合信度。
正文描述模板:
验证性因素分析结果显示,所有题目的标准化因子载荷在 .741 至 .823 之间(均 p < .001),满足 .70 的最低要求(Hair et al.,2019)。各维度 AVE 介于 .572 至 .648 之间,均超过 Fornell 和 Larcker(1981)建议的 .50 临界值;CR 介于 .843 至 .881 之间,超过 .70 的标准,表明各维度均具有良好的聚合效度。
四、区分效度:Fornell-Larcker 准则与 HTMT 的 APA 报告
这是效度报告中最容易出格式错误的部分。两种方法可以单独报告,也可以同时报告——高水平期刊通常要求同时报告。
方法一:Fornell-Larcker 准则
原理:每个维度的 AVE 平方根(即 $\sqrt{AVE}$)应大于该维度与其他任何维度之间的相关系数,即:
$\sqrt{AVE_i} > r_{ij} \quad \text{(对所有 } j \neq i \text{)}$
表格格式(对角线填 AVE 平方根,下三角填潜变量间相关系数):
表 X
Fornell-Larcker 准则区分效度矩阵
| 认知投入 | 情感投入 | 行为投入 | |
|---|---|---|---|
| 认知投入 | .805 | ||
| 情感投入 | .612 | .756 | |
| 行为投入 | .584 | .597 | .788 |
注. 对角线粗体数字为各维度 AVE 的平方根;非对角线数字为潜变量间相关系数。区分效度成立的条件:对角线值 > 同行/同列的最大非对角线值。
正文描述模板:
采用 Fornell 和 Larcker(1981)准则检验区分效度。表 X 显示,各维度 AVE 平方根(对角线)介于 .756 至 .805 之间,均大于该维度与其他维度之间的相关系数(最大值为 .612),满足 Fornell-Larcker 准则,说明各维度之间具有良好的区分效度。
方法二:HTMT(异质-单质特征比)
HTMT 由 Henseler 等(2015)提出,是比 Fornell-Larcker 准则更严格、更不易受样本量影响的区分效度指标。
$HTMT = \frac{\overline{r_{HT}}}{\sqrt{\overline{r_{HH}} \cdot \overline{r_{TT}}}}$
其中 $\overline{r_{HT}}$ 为两维度之间的异质-单质相关均值,$\overline{r_{HH}}$ 和 $\overline{r_{TT}}$ 分别为两维度内部的同质相关均值。
判断标准:
| 标准 | 来源 | 说明 |
|---|---|---|
| HTMT < .85 | Henseler et al.(2015) | 较为严格的保守标准 |
| HTMT < .90 | Gold et al.(2001) | 常用宽松标准 |
| HTMT 置信区间不含 1.0 | Henseler et al.(2015) | Bootstrap 95% CI 判断 |
HTMT 矩阵格式(仅下三角,对角线留空):
表 X
HTMT 区分效度矩阵
| 认知投入 | 情感投入 | 行为投入 | |
|---|---|---|---|
| 认知投入 | — | ||
| 情感投入 | .694 | — | |
| 行为投入 | .661 | .678 | — |
注. HTMT = 异质-单质特征比(Heterotrait-Monotrait Ratio)。区分效度判断标准:HTMT < .85(Henseler et al.,2015,较严格)或 HTMT < .90(Gold et al.,2001)。置信区间通过 5000 次 Bootstrap 法估计,所有维度对的 95% CI 均不包含 1.0。
正文描述模板:
采用 Henseler 等(2015)提出的 HTMT 准则进一步检验区分效度。结果显示,所有维度对之间的 HTMT 值介于 .661 至 .694 之间,均低于 .85 的严格临界值(Henseler et al.,2015),且 Bootstrap(5000 次)生成的 95% 置信区间均不包含 1.0,支持各维度之间具有良好的区分效度。
同时报告两种方法的综合段落
区分效度采用 Fornell-Larcker 准则与 HTMT 双重检验。Fornell-Larcker 准则结果(表 X)显示,各维度 AVE 平方根(.756–.805)均大于该维度与其他维度之间的相关系数(最大值 .612),满足区分效度要求(Fornell & Larcker,1981)。HTMT 分析(表 X+1)显示,所有维度对 HTMT 值均低于 .85(范围:.661–.694;Henseler et al.,2015),且 Bootstrap 95% 置信区间不包含 1.0(Henseler et al.,2015),进一步支持区分效度成立。
五、效度报告的完整方法章节写法
标准方法章节描述(结构效度段落)
采用验证性因素分析(CFA)评估量表的结构效度,使用 [软件名称]
(版本 X.X)进行分析,最大似然法估计参数。
聚合效度以平均方差提取量(AVE)和组合信度(CR)评估,
参照 Fornell 和 Larcker(1981)建议,AVE > .50 且 CR > .70
为聚合效度可接受标准。
区分效度以 Fornell-Larcker 准则和 HTMT 准则双重检验:
Fornell-Larcker 准则要求各维度 AVE 平方根大于其与其他维度的相关系数;
HTMT 值低于 .85(Henseler et al.,2015)且 Bootstrap(5000 次)95% 置信区间
不包含 1.0(Henseler et al.,2015)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。
六、在 ChatSRS 一句话获得规范效度报告
打开 chatsrs.com,上传数据后输入:
"对我的量表数据做验证性因素分析(CFA),输出:①各维度标准化因子载荷表;②AVE 和 CR 聚合效度表;③Fornell-Larcker 准则区分效度矩阵(对角线填 AVE 平方根,下三角填潜变量相关);④HTMT 矩阵(5000 次 Bootstrap,报告 95% CI);所有表格和正文段落符合 APA 7th 格式,可直接复制进论文。"
ChatSRS 将自动完成 CFA 计算、指标提取和 APA 格式排版,validity 相关指标(AVE、CR、HTMT)在 68 条指标清单内全部覆盖,输出表格可直接插入 Word。
七、效度报告常见错误对照表
| 常见错误 | 正确写法 | 违反的规则 |
|---|---|---|
| Fornell-Larcker 对角线填 AVE | 对角线填 AVE 平方根 (sqrt(AVE)) | Fornell-Larcker 准则的核心比较对象是 sqrt(AVE) |
| 只报告 AVE,不报告 CR | AVE 和 CR 必须同时报告 | CR < .70 时 AVE > .50 不足以说明聚合效度 |
| AVE < .50 却写"聚合效度良好" | 须说明该维度聚合效度不达标,或修正题目 | Fornell & Larcker(1981)最低标准 |
| HTMT 矩阵对角线填 1.0 | 对角线留空或填"—" | HTMT 只比较不同维度之间,无自比较 |
| 未报告 HTMT 置信区间 | 补充 Bootstrap 95% CI | Henseler et al.(2015)推荐置信区间判断法 |
| 仅用一种区分效度方法 | 同时报告 Fornell-Larcker + HTMT | 高水平期刊通常要求双重检验 |
| 效度引用缺失 | 明确引用 Fornell & Larcker(1981)、Henseler et al.(2015) | APA 7th 须给出判断标准来源 |
| I-CVI 仅报告总平均,不报逐题 | 报告每题 I-CVI + S-CVI/Ave | Lynn(1986)逐题与整体均须报告 |
| 标准化载荷未注明显著性 | 所有载荷后注"(p < .001)" 或表注说明 | CFA 载荷的统计显著性须报告 |
八、FAQ
Q:AVE < .50 的维度还能保留吗?
A:理想情况下,AVE 须 > .50。若某维度 AVE 在 .40–.50 之间,但 CR > .60,部分学者认为仍具有一定聚合效度(Hair et al., 2010),可在论文中说明:"该维度 AVE(.46)略低于 .50 的标准,但 CR = .73 仍满足最低要求,且本研究为探索性量表开发,予以保留并在局限性章节说明。"若 AVE < .40,通常建议删除该维度或重新设计题目。
Q:Fornell-Larcker 和 HTMT 哪个更严格,非得两个都报告吗?
A:HTMT 是更严格的方法,对小样本不敏感,是目前 PLS-SEM 和 CB-SEM 领域的主流推荐(Hair et al.,2019;Henseler et al.,2015)。Fornell-Larcker 准则因操作简单、历史悠久,很多期刊仍接受。高水平 Q1/Q2 期刊通常要求同时报告两种,一方面互相印证,另一方面显示研究者熟悉最新标准。若期刊只接受一种,优先选 HTMT。
Q:HTMT 矩阵用 Bootstrap 的样本量设多少?
A:5000 次是目前学界通用标准(Henseler et al.,2015),部分期刊要求 10000 次。ChatSRS 默认 5000 次,如需更高次数在指令中说明即可。置信区间须报告 95% CI(Bias-Corrected and Accelerated,BCa),若 CI 上界 < 1.0,区分效度成立。
Q:CVI 评估需要几个专家?
A:Lynn(1986)建议至少 5 名专家,I-CVI 才有统计意义(5 人时 I-CVI = .80 即 4/5 人同意)。Grant 和 Davis(1997)建议 5–10 名。专家数量影响 I-CVI 判断标准:3–5 名专家要求 I-CVI >= .83;6–10 名要求 I-CVI >= .78。方法章节须注明专家人数、背景与评分标准,以便读者判断 CVI 的可信度。
快速参考:效度报告格式速查卡
[内容效度]
I-CVI = 评为3或4的专家数 / 专家总数 (>= .78 可接受, >= .90 优秀)
S-CVI/Ave = 所有 I-CVI 的平均值 (>= .80 可接受, >= .90 优秀)
来源: Lynn (1986); Polit & Beck (2006)
[聚合效度 — CFA]
AVE > .50 (Fornell & Larcker, 1981)
CR > .70 (理想 > .80, 但 < .95 避免冗余)
因子载荷 >= .70 (所有载荷须在 p < .001 显著)
[区分效度 — Fornell-Larcker 准则]
对角线 = sqrt(AVE)
非对角线 = 潜变量间相关系数 r
要求: 每行/列对角线 > 同行/列非对角线的最大值
[区分效度 — HTMT]
HTMT < .85 (Henseler et al., 2015; 严格) 或 < .90 (Gold et al., 2001; 宽松)
Bootstrap (5000次) 95% CI 上界 < 1.0
来源: Henseler et al. (2015)
[完整 APA 格式表注示例]
注. N = [样本量]. λ = 标准化因子载荷; AVE = 平均方差提取量;
CR = 组合信度. 对角线粗体数字为 AVE 平方根;
HTMT 置信区间以 5000 次 Bootstrap 估计。
***p < .001.
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。