统计百科 ·

效度分析 APA 7th 报告写法 — CVI/AVE/HTMT 聚合效度与区分效度表格模板全解

统计百科:专攻"效度分析怎么写进论文"这一具体格式点——CVI 内容效度、AVE 聚合效度、HTMT 与相关系数平方区分效度的 APA 7th 完整报告模板,含可直接套用的表格格式与正文描述句式。

量表研究里,"效度怎么写进论文"比"效度怎么跑"更让人困惑:CVI 放在哪、AVE 和 CR 要不要一张表、HTMT 用矩阵还是列表、区分效度的判断标准写哪个版本……本文专攻这一具体格式点,给出 APA 7th 所有效度场景的完整报告模板,并逐一说明审稿人最常挑的效度报告格式错误。


你的效度报告有这些问题吗?

导师或审稿人关于效度报告最常见的反馈:

  • "CVI 只报告了 I-CVI,没有报告 S-CVI/Ave,不符合规范"
  • "聚合效度表只有 AVE,缺 CR(组合信度),两者应同时报告"
  • "区分效度判断标准没有说明——是用 Fornell-Larcker 准则还是 HTMT?"
  • "HTMT 矩阵里对角线填的什么?应该留空或填 AVE 平方根"
  • "Fornell-Larcker 准则表中对角线应是 AVE 的平方根,不是 AVE 本身"
  • "效度分析段落没有引用标准来源(Fornell & Larcker,1981;Henseler et al.,2015)"
  • "聚合效度判断标准是 AVE > .50,但表里有个维度 AVE = .44,却写'聚合效度良好',前后矛盾"

这些错误集中在结构效度报告的细节规范,但专门汇总的实操指南并不多。本文只讲一件事:效度到底怎么规范写进论文的每一种场景


一、效度的类型与报告结构

效度类型速览

效度类型核心指标典型分析方法
内容效度I-CVI、S-CVI专家评分法(Lynn,1986)
结构效度 — 聚合效度AVE、CR(组合信度)验证性因素分析(CFA)
结构效度 — 区分效度HTMT、Fornell-Larcker 准则CFA 相关矩阵
效标效度相关系数 r、AUC与外部效标的相关分析
聚合效度(收敛效度)因子载荷 lambdaCFA 标准化载荷 ≥ .70

论文测量模型章节通常依次报告:因子载荷(收敛效度)→ CVI(内容效度,若有)→ AVE + CR(聚合效度)→ Fornell-Larcker / HTMT(区分效度)


二、内容效度:I-CVI 与 S-CVI/Ave 的 APA 报告

核心指标含义

I-CVI(Item-level Content Validity Index):单题内容效度指数,指所有专家中将该题评为"相关"或"非常相关"(3-4 分制中的 3 或 4)的比例。

$I\text{-}CVI = \frac{\text{评为相关或非常相关的专家人数}}{\text{专家总人数}}$

S-CVI/Ave(Scale-level CVI,平均法):所有题目 I-CVI 的算术平均值。

$S\text{-}CVI/Ave = \frac{\sum I\text{-}CVI_i}{k}$

判断标准(Lynn,1986;Polit & Beck,2006):

指标可接受标准优秀标准
I-CVI>= .78 ^a^>= .90
S-CVI/Ave>= .80>= .90

^a^ 专家数 >= 6 时适用;若专家数 3–5,标准提升至 >= .83(Lynn,1986)。

内容效度 APA 报告模板

表格格式(置于方法章节或附录):

表 X

各维度题目内容效度指数(I-CVI)

题目编号维度专家1专家2专家3专家4专家5I-CVI
Q1认知投入434431.00
Q2认知投入444341.00
Q3认知投入343431.00
Q4情感投入32334.80
Q5情感投入434431.00
Q6行为投入443441.00
Q7行为投入334341.00
S-CVI/Ave.97

注. 专家评分采用 4 分制(1 = 不相关,2 = 需大幅修订,3 = 相关但需少量修订,4 = 非常相关)。I-CVI = 评为 3 或 4 的专家比例。

正文描述模板(可直接套用):

邀请 [X] 名具有 [研究领域] 背景的专家对量表进行内容效度评估,采用 4 分制对每一题目的相关性进行评分(1 = 不相关,4 = 非常相关)。结果显示,所有题目的 I-CVI 均在 .80 至 1.00 之间,均满足 Lynn(1986)建议的 .78 最低标准;量表整体 S-CVI/Ave = .97,超过 Polit 和 Beck(2006)建议的 .90 优秀标准,表明量表具有良好的内容效度。


三、聚合效度:AVE 与 CR 的 APA 报告

核心指标含义与标准

AVE(Average Variance Extracted,平均方差提取量)

$AVE = \frac{\sum \lambda_i^2}{\sum \lambda_i^2 + \sum \delta_i}$

其中 $\lambda_i$ 为标准化因子载荷,$\delta_i$ 为测量误差方差。

CR(Composite Reliability,组合信度),又称 Rho_c:

$CR = \frac{(\sum \lambda_i)^2}{(\sum \lambda_i)^2 + \sum \delta_i}$

判断标准(Fornell & Larcker,1981;Hair et al.,2019):

指标可接受标准备注
AVE> .50AVE < .50 时该维度聚合效度不足
CR> .70理想 CR > .80;CR > .95 可能提示题目冗余
因子载荷>= .70(理想).50-.69 可接受,但应说明

聚合效度 APA 报告表格

表 X

验证性因素分析:各维度因子载荷、AVE 与 CR

维度题目标准化载荷 (λ)AVECR
认知投入Q1.823.648.881
Q2.796
Q3.808
情感投入Q4.741.572.843
Q5.784
Q6.752
行为投入Q7.812.621.868
Q8.769
Q9.795

注. N = [样本量]. 所有因子载荷均在 p < .001 水平上显著。AVE = 平均方差提取量;CR = 组合信度。

正文描述模板

验证性因素分析结果显示,所有题目的标准化因子载荷在 .741 至 .823 之间(均 p < .001),满足 .70 的最低要求(Hair et al.,2019)。各维度 AVE 介于 .572 至 .648 之间,均超过 Fornell 和 Larcker(1981)建议的 .50 临界值;CR 介于 .843 至 .881 之间,超过 .70 的标准,表明各维度均具有良好的聚合效度。


四、区分效度:Fornell-Larcker 准则与 HTMT 的 APA 报告

这是效度报告中最容易出格式错误的部分。两种方法可以单独报告,也可以同时报告——高水平期刊通常要求同时报告。

方法一:Fornell-Larcker 准则

原理:每个维度的 AVE 平方根(即 $\sqrt{AVE}$)应大于该维度与其他任何维度之间的相关系数,即:

$\sqrt{AVE_i} > r_{ij} \quad \text{(对所有 } j \neq i \text{)}$

表格格式(对角线填 AVE 平方根,下三角填潜变量间相关系数):

表 X

Fornell-Larcker 准则区分效度矩阵

认知投入情感投入行为投入
认知投入.805
情感投入.612.756
行为投入.584.597.788

注. 对角线粗体数字为各维度 AVE 的平方根;非对角线数字为潜变量间相关系数。区分效度成立的条件:对角线值 > 同行/同列的最大非对角线值。

正文描述模板

采用 Fornell 和 Larcker(1981)准则检验区分效度。表 X 显示,各维度 AVE 平方根(对角线)介于 .756 至 .805 之间,均大于该维度与其他维度之间的相关系数(最大值为 .612),满足 Fornell-Larcker 准则,说明各维度之间具有良好的区分效度。

方法二:HTMT(异质-单质特征比)

HTMT 由 Henseler 等(2015)提出,是比 Fornell-Larcker 准则更严格、更不易受样本量影响的区分效度指标。

$HTMT = \frac{\overline{r_{HT}}}{\sqrt{\overline{r_{HH}} \cdot \overline{r_{TT}}}}$

其中 $\overline{r_{HT}}$ 为两维度之间的异质-单质相关均值,$\overline{r_{HH}}$ 和 $\overline{r_{TT}}$ 分别为两维度内部的同质相关均值。

判断标准:

标准来源说明
HTMT < .85Henseler et al.(2015)较为严格的保守标准
HTMT < .90Gold et al.(2001)常用宽松标准
HTMT 置信区间不含 1.0Henseler et al.(2015)Bootstrap 95% CI 判断

HTMT 矩阵格式(仅下三角,对角线留空):

表 X

HTMT 区分效度矩阵

认知投入情感投入行为投入
认知投入
情感投入.694
行为投入.661.678

注. HTMT = 异质-单质特征比(Heterotrait-Monotrait Ratio)。区分效度判断标准:HTMT < .85(Henseler et al.,2015,较严格)或 HTMT < .90(Gold et al.,2001)。置信区间通过 5000 次 Bootstrap 法估计,所有维度对的 95% CI 均不包含 1.0。

正文描述模板

采用 Henseler 等(2015)提出的 HTMT 准则进一步检验区分效度。结果显示,所有维度对之间的 HTMT 值介于 .661 至 .694 之间,均低于 .85 的严格临界值(Henseler et al.,2015),且 Bootstrap(5000 次)生成的 95% 置信区间均不包含 1.0,支持各维度之间具有良好的区分效度。

同时报告两种方法的综合段落

区分效度采用 Fornell-Larcker 准则与 HTMT 双重检验。Fornell-Larcker 准则结果(表 X)显示,各维度 AVE 平方根(.756–.805)均大于该维度与其他维度之间的相关系数(最大值 .612),满足区分效度要求(Fornell & Larcker,1981)。HTMT 分析(表 X+1)显示,所有维度对 HTMT 值均低于 .85(范围:.661–.694;Henseler et al.,2015),且 Bootstrap 95% 置信区间不包含 1.0(Henseler et al.,2015),进一步支持区分效度成立。


五、效度报告的完整方法章节写法

标准方法章节描述(结构效度段落)

采用验证性因素分析(CFA)评估量表的结构效度,使用 [软件名称]
(版本 X.X)进行分析,最大似然法估计参数。

聚合效度以平均方差提取量(AVE)和组合信度(CR)评估,
参照 Fornell 和 Larcker(1981)建议,AVE > .50 且 CR > .70
为聚合效度可接受标准。

区分效度以 Fornell-Larcker 准则和 HTMT 准则双重检验:
Fornell-Larcker 准则要求各维度 AVE 平方根大于其与其他维度的相关系数;
HTMT 值低于 .85(Henseler et al.,2015)且 Bootstrap(5000 次)95% 置信区间
不包含 1.0(Henseler et al.,2015)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。

六、在 ChatSRS 一句话获得规范效度报告

打开 chatsrs.com,上传数据后输入:

"对我的量表数据做验证性因素分析(CFA),输出:①各维度标准化因子载荷表;②AVE 和 CR 聚合效度表;③Fornell-Larcker 准则区分效度矩阵(对角线填 AVE 平方根,下三角填潜变量相关);④HTMT 矩阵(5000 次 Bootstrap,报告 95% CI);所有表格和正文段落符合 APA 7th 格式,可直接复制进论文。"

ChatSRS 将自动完成 CFA 计算、指标提取和 APA 格式排版,validity 相关指标(AVE、CR、HTMT)在 68 条指标清单内全部覆盖,输出表格可直接插入 Word。


七、效度报告常见错误对照表

常见错误正确写法违反的规则
Fornell-Larcker 对角线填 AVE对角线填 AVE 平方根 (sqrt(AVE))Fornell-Larcker 准则的核心比较对象是 sqrt(AVE)
只报告 AVE,不报告 CRAVE 和 CR 必须同时报告CR < .70 时 AVE > .50 不足以说明聚合效度
AVE < .50 却写"聚合效度良好"须说明该维度聚合效度不达标,或修正题目Fornell & Larcker(1981)最低标准
HTMT 矩阵对角线填 1.0对角线留空或填"—"HTMT 只比较不同维度之间,无自比较
未报告 HTMT 置信区间补充 Bootstrap 95% CIHenseler et al.(2015)推荐置信区间判断法
仅用一种区分效度方法同时报告 Fornell-Larcker + HTMT高水平期刊通常要求双重检验
效度引用缺失明确引用 Fornell & Larcker(1981)、Henseler et al.(2015)APA 7th 须给出判断标准来源
I-CVI 仅报告总平均,不报逐题报告每题 I-CVI + S-CVI/AveLynn(1986)逐题与整体均须报告
标准化载荷未注明显著性所有载荷后注"(p < .001)" 或表注说明CFA 载荷的统计显著性须报告

八、FAQ

Q:AVE < .50 的维度还能保留吗?

A:理想情况下,AVE 须 > .50。若某维度 AVE 在 .40–.50 之间,但 CR > .60,部分学者认为仍具有一定聚合效度(Hair et al., 2010),可在论文中说明:"该维度 AVE(.46)略低于 .50 的标准,但 CR = .73 仍满足最低要求,且本研究为探索性量表开发,予以保留并在局限性章节说明。"若 AVE < .40,通常建议删除该维度或重新设计题目。

Q:Fornell-Larcker 和 HTMT 哪个更严格,非得两个都报告吗?

A:HTMT 是更严格的方法,对小样本不敏感,是目前 PLS-SEM 和 CB-SEM 领域的主流推荐(Hair et al.,2019;Henseler et al.,2015)。Fornell-Larcker 准则因操作简单、历史悠久,很多期刊仍接受。高水平 Q1/Q2 期刊通常要求同时报告两种,一方面互相印证,另一方面显示研究者熟悉最新标准。若期刊只接受一种,优先选 HTMT。

Q:HTMT 矩阵用 Bootstrap 的样本量设多少?

A:5000 次是目前学界通用标准(Henseler et al.,2015),部分期刊要求 10000 次。ChatSRS 默认 5000 次,如需更高次数在指令中说明即可。置信区间须报告 95% CI(Bias-Corrected and Accelerated,BCa),若 CI 上界 < 1.0,区分效度成立。

Q:CVI 评估需要几个专家?

A:Lynn(1986)建议至少 5 名专家,I-CVI 才有统计意义(5 人时 I-CVI = .80 即 4/5 人同意)。Grant 和 Davis(1997)建议 5–10 名。专家数量影响 I-CVI 判断标准:3–5 名专家要求 I-CVI >= .83;6–10 名要求 I-CVI >= .78。方法章节须注明专家人数、背景与评分标准,以便读者判断 CVI 的可信度。


快速参考:效度报告格式速查卡

[内容效度]
I-CVI = 评为3或4的专家数 / 专家总数  (>= .78 可接受, >= .90 优秀)
S-CVI/Ave = 所有 I-CVI 的平均值    (>= .80 可接受, >= .90 优秀)
来源: Lynn (1986); Polit & Beck (2006)

[聚合效度 — CFA]
AVE > .50  (Fornell & Larcker, 1981)
CR > .70  (理想 > .80, 但 < .95 避免冗余)
因子载荷 >= .70 (所有载荷须在 p < .001 显著)

[区分效度 — Fornell-Larcker 准则]
对角线 = sqrt(AVE)
非对角线 = 潜变量间相关系数 r
要求: 每行/列对角线 > 同行/列非对角线的最大值

[区分效度 — HTMT]
HTMT < .85 (Henseler et al., 2015; 严格) 或 < .90 (Gold et al., 2001; 宽松)
Bootstrap (5000次) 95% CI 上界 < 1.0
来源: Henseler et al. (2015)

[完整 APA 格式表注示例]
注. N = [样本量]. λ = 标准化因子载荷; AVE = 平均方差提取量;
CR = 组合信度. 对角线粗体数字为 AVE 平方根;
HTMT 置信区间以 5000 次 Bootstrap 估计。
***p < .001.

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。