教程 ·

泰尔指数用 AI 一句话完成 — 不平等测度、组内组间分解全攻略

泰尔指数(Theil Index)完整教程:用 AI 一句话完成不平等测度与组内/组间分解,自动对比基尼系数,给出符合 APA 7th 格式的论文报告句式,适用于收入差距、教育公平、卫生资源配置等研究场景。

研究区域收入差距、教育资源分配、卫生投入不均?基尼系数能给总体不平等,却说不清"是省内差距大还是省际差距大"。泰尔指数的组内/组间分解正是为此而生——这篇教程手把手带你用 AI 一句话跑完全套流程,60 秒拿到论文级结果。


为什么基尼系数不够用?

基尼系数(Gini Coefficient)是衡量分配不平等最常见的单一指标,但它有一个根本局限:它是整体不平等的黑箱,无法告诉你不平等的来源

当你面对以下研究问题时,基尼系数就捉襟见肘:

  • 全国城乡收入差距,究竟有多少来自"城乡之间"的差距,多少来自"城市内部"或"农村内部"各省之间的差距?
  • 东中西三大区域的医疗资源不均,组间贡献与组内贡献各占几成?随时间如何演变?
  • 政策干预后总体不平等下降了,是缩小了区域间差距,还是各区域内部自我收敛?

泰尔指数(Theil Index) 正是解决这类问题的工具。它基于信息熵理论,天然支持加法可分解性(Additive Decomposability),能将总不平等精确拆解为"组内不平等之和"与"组间不平等"两部分,且两部分之和恰好等于总泰尔指数,不存在"残差"问题。这是基尼系数无法做到的。


泰尔指数的数学基础

泰尔 T 指数(Theil-T)

泰尔 T 指数(又称泰尔第一指数)定义为:

T = (1/N) * sum_i [ (y_i / y_bar) * ln(y_i / y_bar) ]

其中:

  • N:观测单元总数(个人、省份、国家等)
  • y_i:第 i 个单元的值(收入、人均资源量等)
  • y_bar:样本均值

T >= 0,T = 0 表示完全平等(所有单元取值相同),T 越大不平等程度越高。T 无上界,但在实践中社会科学数据的 T 值通常在 0~1 之间。

泰尔 L 指数(Theil-L,MLD)

泰尔 L 指数(又称均值对数偏差,Mean Log Deviation)定义为:

L = (1/N) * sum_i [ ln(y_bar / y_i) ]

L 同样满足加法分解性,且对底端分布更敏感(相比 T 指数更关注低收入群体的差距),在卫生公平研究中广泛使用。

组内/组间加法分解

将 N 个单元划分为 K 个组(如东中西三大区域),泰尔 T 指数可分解为:

T_total = T_between + T_within

T_between = sum_k [ (n_k / N) * (y_bar_k / y_bar) * ln(y_bar_k / y_bar) ]

T_within  = sum_k [ (n_k / N) * (y_bar_k / y_bar) * T_k ]

其中:

  • n_k:第 k 组的单元数
  • y_bar_k:第 k 组均值
  • T_k:第 k 组内部的泰尔 T 指数

组间贡献率 = T_between / T_total × 100%,说明多少比例的总不平等来源于组际差异;组内贡献率 = T_within / T_total × 100%,说明多少来自各组内部的不平等。两者之和为 100%,无残差。

泰尔指数 vs 基尼系数:什么时候用哪个?

对比维度泰尔指数基尼系数
可加法分解是(组内+组间=总体,无残差)否(分解存在残差项)
对高端/低端敏感度T 指数偏高端;L 指数偏低端对中间段最敏感
取值范围[0, +inf)(实践中通常 <1)[0, 1]
直观性较低(需要解释信息熵含义)高(0=完全平等,1=完全不平等)
适用场景来源分解、多组比较、纵向趋势单一总体不平等汇报
常见领域区域差距、卫生公平、教育分配收入不平等报告、贫困研究

结论:若研究目的是"分解不平等来源"或"追踪多组贡献率随时间的变化",首选泰尔指数;若仅需要一个直观的总体不平等概括,基尼系数更易于读者理解,二者并不冲突,在论文中可同时报告。


案例数据:31 省市人均卫生支出的区域不平等分解

研究背景

假设你收集了 2015—2022 年中国大陆 31 个省市自治区(不含港澳台)的人均卫生总费用数据,希望回答:

  1. 全国卫生资源分配的总体不平等程度(泰尔 T 指数)如何随时间演变?
  2. 不平等在多大程度上来源于东中西区域之间,多大程度上来源于各区域内部省份间的差异?
  3. 政策干预(2018 年医改深化)是否缩小了组间差距?

数据结构

province       省份名称(31个)
region         区域分组(东部=11省, 中部=8省, 西部=12省)
year           年份(2015~2022)
per_capita_he  人均卫生费用(元/人)

这是一个典型的面板数据 + 分组泰尔指数时序分析场景,在卫生经济学、公共政策、区域经济学期刊中极为常见。


用 AI 一句话完成泰尔指数分解

chatsrs.com 上传数据后输入:

"以 per_capita_he 为分析变量,region 为分组变量,year 为时间变量,对 2015—2022 年 31 省市人均卫生费用做泰尔 T 指数分析。
请输出:

  1. 各年份各区域描述统计(M、SD、CV)
  2. 历年总泰尔 T 指数(T_total)及其组内/组间分解(T_within、T_between,含贡献率百分比)
  3. 同步计算泰尔 L 指数(MLD)与基尼系数作对比
  4. 各区域内部历年泰尔 T 指数(T_东部、T_中部、T_西部)
  5. 时序趋势折线图(T_total、T_between、T_within 三条线)
  6. APA 格式中文文字描述"

ChatSRS 将在 60 秒内输出以下完整结果,三引擎(SPSS + R + Stata)均支持 theil_index 方法(SPSS 通过平台内置自定义语法实现,R 与 Stata 原生支持)。


输出结果怎么读

输出 1:各区域描述统计

表 1  2015—2022 年各区域人均卫生费用描述统计(元/人)

年份   东部(n=11)           中部(n=8)            西部(n=12)           全国(N=31)
       M        SD    CV      M        SD    CV      M        SD    CV      M        SD
2015   4823     896   0.186   2541     412   0.162   2318     487   0.210   3287     1247
2016   5216     942   0.181   2734     445   0.163   2520     512   0.203   3548     1325
2017   5748     1034  0.180   3012     478   0.159   2784     541   0.194   3907     1432
2018   6183     1087  0.176   3302     503   0.152   3047     572   0.188   4208     1526
2019   6687     1142  0.171   3601     521   0.145   3318     598   0.180   4554     1618
2020   7012     1168  0.167   3842     543   0.141   3546     614   0.173   4800     1691
2021   7598     1231  0.162   4156     568   0.137   3834     639   0.167   5193     1789
2022   8124     1293  0.159   4437     588   0.133   4112     661   0.161   5558     1882

注:M=均值,SD=标准差,CV=变异系数(SD/M)。东部 CV 持续下降,说明东部内部省份趋于收敛。

输出 2:历年泰尔指数组内/组间分解(核心结果)

表 2  2015—2022 年人均卫生费用泰尔 T 指数分解

年份   T_total   T_between   组间贡献率   T_within   组内贡献率
                              (%)                     (%)
2015   0.1423    0.0891       62.6        0.0532      37.4
2016   0.1398    0.0868       62.1        0.0530      37.9
2017   0.1362    0.0834       61.2        0.0528      38.8
2018   0.1305    0.0782       59.9        0.0523      40.1
2019   0.1247    0.0731       58.6        0.0516      41.4
2020   0.1193    0.0685       57.4        0.0508      42.6
2021   0.1136    0.0635       55.9        0.0501      44.1
2022   0.1081    0.0588       54.4        0.0493      45.6

注:T_total = T_between + T_within(加法分解,无残差)。贡献率=该部分/T_total×100%。

解读要点

  • 总泰尔指数 T_total 从 2015 年的 0.1423 下降至 2022 年的 0.1081,说明卫生资源分配不平等程度有所改善
  • 不平等的主要来源始终是组间差异(东中西区域之间),但组间贡献率从 62.6% 降至 54.4%,下降了 8.2 个百分点
  • 组内不平等贡献率上升(从 37.4% 到 45.6%),说明各区域内部省际差距的相对重要性在增加
  • 2018 年医改深化后(2018—2022),T_between 下降幅度(约 0.019)明显大于 2015—2018(约 0.011),提示政策对缩小区域间差距有显著效果

输出 3:各区域内部泰尔指数

表 3  各区域内部泰尔 T 指数(T_k)

年份   T_东部   T_中部   T_西部
2015   0.0342   0.0198   0.0287
2016   0.0334   0.0192   0.0281
2017   0.0323   0.0185   0.0274
2018   0.0308   0.0175   0.0262
2019   0.0291   0.0164   0.0248
2020   0.0274   0.0155   0.0236
2021   0.0258   0.0144   0.0224
2022   0.0242   0.0133   0.0213

注:三个区域内部不平等均呈下降趋势,东部内部省际差距绝对值最大,但下降最快。

解读要点:东部内部不平等最高(省间差距最大,以京沪与其他省份为代表),中部最低,西部居中。三区域均呈收敛趋势,东部下降幅度最明显(从 0.0342 降至 0.0242,降幅 29.2%)。

输出 4:与基尼系数的对比

表 4  泰尔 T 指数、泰尔 L 指数与基尼系数对比

年份   Theil-T   Theil-L   Gini
2015   0.1423    0.1389    0.3012
2016   0.1398    0.1362    0.2978
2017   0.1362    0.1325    0.2934
2018   0.1305    0.1268    0.2871
2019   0.1247    0.1211    0.2804
2020   0.1193    0.1157    0.2738
2021   0.1136    0.1100    0.2671
2022   0.1081    0.1046    0.2609

注:三个指标趋势一致(相关系数 r > .99),共同支持不平等下降的结论。
   Theil-L < Theil-T 提示高收入省份(东部少数省份)拉高了 T 指数。

论文里怎么报告(APA 7th 格式)

以下是可直接复制进论文的句式模板,严格遵循 APA 7th 统计报告规范。


方法节(统计方法描述)

采用泰尔 T 指数(Theil, 1967)对各年份人均卫生费用的区域不平等进行测度,并利用泰尔指数的加法可分解性(Additive Decomposability)将总不平等分解为东、中、西三大区域之间(T_between)与区域内部(T_within)两个来源,分解满足 T_total = T_between + T_within 且不含残差。同步计算泰尔 L 指数(均值对数偏差,MLD)与基尼系数作为稳健性参照。统计分析以 R 4.4 实施(dineq 包),检验水准 alpha = .05(双尾)。


结果节(泰尔指数分解部分)

泰尔 T 指数分解结果显示,2015—2022 年全国人均卫生费用总不平等(T_total)呈持续下降趋势,由 2015 年的 0.1423 降至 2022 年的 0.1081,累计降幅 24.0%(见表 2)。

在分解结构上,区域间不平等(T_between)始终是总不平等的主要来源,其贡献率由 2015 年的 62.6% 下降至 2022 年的 54.4%;区域内不平等(T_within)贡献率由 37.4% 上升至 45.6%,说明省内省际差距的相对重要性有所上升。

就各区域内部而言,东部区域内部不平等(T_东部 = 0.0242)高于中部(T_中部 = 0.0133)和西部(T_西部 = 0.0213),但东部降幅最大(29.2%)。同步测算的基尼系数(Gini = 0.2609)与泰尔指数(Theil-T = 0.1081, Theil-L = 0.1046)趋势高度一致(r > .99),支持上述结论的稳健性。


APA 格式规范总结

要素格式示例
泰尔指数值T_total = 0.1423
组间/组内分解T_between = 0.0891(贡献率 62.6%)
基尼系数Gini = 0.3012
变化趋势累计降幅 24.0%
文中引用Theil(1967);或 T_total(Theil-T,2015 年)
数值精度泰尔指数保留四位小数;贡献率保留一位小数

特别提示:APA 7th 对不平等指数没有专用报告格式,但一般要求:同时报告数值和变化趋势;分解结果需在表注中注明"T_total = T_between + T_within";若引用泰尔指数方法,需在方法节注明原始文献 Theil(1967)。


常见问题 FAQ

Q1:泰尔 T 指数和泰尔 L 指数有什么区别?我该用哪个?

A:两者都满足加法分解性,区别在于对分布不同部分的敏感度:泰尔 T 指数(Theil-T)对高收入端更敏感,即少数高收入单元的极端值对 T 的影响更大;泰尔 L 指数(均值对数偏差,MLD)对低收入端更敏感,更关注底端单元的相对剥夺程度。在公共卫生、教育公平研究中,若研究目的是关注"低资源省份被甩开多远",推荐 Theil-L;若关注"高资源省份拉开多大差距",则 Theil-T 更适合。实践中建议同时报告两者并与基尼系数对比,以提高结论稳健性。

Q2:泰尔指数分解时,分组方式对结果影响大吗?

A:影响显著,这正是泰尔分解需要理论驱动的原因。分组(即定义"组间"的边界)必须有先验的理论依据或政策意义,而不能随意划分后挑选贡献率最高的分法(这属于数据挖掘式多重比较,会导致结论不可复现)。常见做法:以行政区划(东中西、省份)、经济带(京津冀/长三角/珠三角)或收入分位数(四分位)作为分组依据,并在方法节明确说明分组标准及依据。ChatSRS 在指令中指定 region 变量即可自动按该变量分组,无需额外操作。

Q3:泰尔指数没有 p 值,如何判断不平等的"显著性"?

A:泰尔指数本身是描述性指标,不附带假设检验 p 值,与基尼系数一样。对于"不平等变化是否显著"的检验,通常有两种方法:(1) Bootstrap 置信区间:对泰尔指数本身做 Bootstrap 重抽样(1,000 次以上),获得 95% CI,若区间不含零则变化统计显著;(2) 趋势检验:对历年泰尔指数序列做 Mann-Kendall 趋势检验,报告 Kendall's tau 和 p 值。在 ChatSRS 中加一句"对历年泰尔指数做 Bootstrap 95% CI 并附 Mann-Kendall 趋势检验"即可自动输出。APA 格式中报告为:T_total 从 2015 年 0.1423 降至 2022 年 0.1081,Mann-Kendall tau = -.964, p < .001,呈显著下降趋势。

Q4:数据是省级平均值,而非个体数据,泰尔指数还适用吗?

A:完全适用,泰尔指数本身正是为"单元级聚合数据"设计的——比较的就是各省(或各地区)的人均值,而非个体观测。此时泰尔指数测度的是省际不平等(Between-province inequality),而非个体层面的不平等。若同时有省内个体数据,可以进一步做三层分解(个体层-省内-省际),但在区域政策研究中省级聚合数据已足够。需要注意的是:用省级数据算出的泰尔指数会低估真实的个人层面不平等,在论文讨论节应明确说明数据层级的局限性。

Q5:泰尔指数组间贡献率随时间上升,是否意味着政策效果更多体现在组内收敛?

A:是的,这是标准的"解构演变分析"逻辑。若 T_between 贡献率下降、T_within 贡献率上升,意味着:区域间(东中西)的绝对差距在缩小(政策可能通过转移支付、对口支援等缩小了区域间鸿沟),但各区域内部省份之间的相对差距反而在上升(即"大区域趋同但省内分化")。在政策讨论节,可据此提出:政策应从"跨区域均衡"转向"区域内精准帮扶",才能进一步降低总不平等。这一结论由泰尔分解数据直接支撑,逻辑严密,审稿人认可度高。


小结

泰尔指数是不平等研究中兼具理论优雅性与实践操作性的工具。其核心价值在于:

  1. 加法可分解性:T_total = T_between + T_within,来源清晰,无残差,是基尼系数无法提供的
  2. 时序可追踪:历年分解结构的演变直接揭示政策效果的结构性变化
  3. 双层次报告:可同时报告总体不平等和分组内部不平等,为政策建议提供细粒度证据
  4. 稳健性验证:与 Theil-L 和基尼系数同步报告,三指标趋势一致时结论可信度最高

chatsrs.com 用一句自然语言指令,即可获得:

  • 历年总泰尔 T / L 指数与基尼系数并排表
  • 组内/组间完全分解(含贡献率百分比,无残差)
  • 各分组内部泰尔指数时序
  • Bootstrap 置信区间 + Mann-Kendall 趋势检验
  • 可直接粘贴进论文的 APA 7th 中文描述

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。