场景案例 ·
保险精算数据分析用AI一句话完成 — 风险建模与广义线性模型
保险精算与风险管理必看:从索赔频率泊松回归、索赔严重度Gamma GLM到费率厘定,ChatSRS AI一句话跑完精算核心分析,生成APA 7th格式精算统计报告。
保险精算师、风险管理专业学生的数据分析痛点:索赔频率用泊松还是负二项不知道怎么选、严重度建模用Gamma分布还是逆高斯拿不定主意、GLM模型的偏差统计和拟合诊断散落在十几张输出表里读不懂……这篇文章把精算核心GLM建模链条一次串通,每步给出ChatSRS可直接使用的一句话指令,以及可抄进精算报告与学术论文的APA 7th格式句式。
精算GLM建模为什么让人望而生畏
如果你在从事保险精算、风险管理、非寿险定价方向的工作或论文研究,以下场景很可能已经遇到:
- 手上有保单明细数据(曝险年、索赔次数、索赔金额、承保特征),不知道该从哪个分布入手建GLM
- 泊松GLM跑出来了,但过度分散检验怎么做?何时应该换负二项?
- Gamma GLM的对数连接和恒等连接有什么区别,系数怎么解读才规范?
- 模型诊断要看哪些指标——偏差、AIC、皮尔逊卡方残差、影响力诊断,输出一大堆却不知道重点在哪里
- 导师或精算师督导说"先把费率相对性表做出来",但GLM系数怎么转换成费率因子完全没思路
这些困难不是精算技能不足,而是非寿险GLM建模的链条横跨统计理论、精算惯例和报告规范——从分布选择、连接函数、偏差分析到费率因子提取,每步都有前提要检验,每步都有精算界认可的报告格式。
chatsrs.com 把这整条链条变成对话。下面按精算GLM建模的标准流程,从头到尾演示。
精算GLM的两步建模框架
非寿险纯保费(Pure Premium)的精算定价基于如下分解:
纯保费 = 索赔频率 × 平均索赔严重度
= E[N/W] × E[X | N > 0]
其中 W 为曝险量(如保单年数或车辆年数),N 为索赔次数,X 为单次索赔金额。
两步GLM框架:
| 步骤 | 因变量 | 分布 | 连接函数 | 权重 |
|---|---|---|---|---|
| 第一步:频率模型 | 索赔次数 N | 泊松 / 负二项 | 对数(log) | 曝险量 W(offset) |
| 第二步:严重度模型 | 索赔金额 X | Gamma / 逆高斯 | 对数(log) | 索赔次数(可选) |
典型数据结构:
保单ID 曝险年 索赔次数 总索赔金额 车龄 驾龄 地区 车辆类型 用途
P001 1.00 0 0 3 8 华东 轿车 私家
P002 0.75 1 12400 7 2 华北 SUV 私家
P003 1.00 2 31600 1 1 华南 轿车 商用
...
全流程分析演示(车险定价场景)
以"商业车险纯保费GLM定价"为例:样本10,000张保单,5个承保特征,分析期间1年。
第一步:描述统计与损失分布探查
打开 chatsrs.com,上传数据后输入:
"请对索赔次数和索赔金额分别做描述统计,输出均值、标准差、偏度、峰度、零值比例;对索赔次数绘制频率分布直方图,对有索赔的记录绘制索赔金额的对数变换直方图;检验索赔次数的过度分散(均值与方差对比),判断是否适合泊松分布。"
ChatSRS自动输出:
索赔次数描述统计
均值(Mean)= 0.142,方差(Var)= 0.187
过度分散比 Var/Mean = 1.317(> 1,存在轻度过度分散)
零次索赔比例 = 87.6%,一次 = 10.8%,二次及以上 = 1.6%
索赔金额描述统计(有索赔记录,n = 1,421)
均值 = 15,840 元,中位数 = 9,200 元
SD = 22,316,偏度 = 3.47,峰度 = 18.9
对数变换后偏度 = 0.31 — 对数正态特征明显,支持Gamma族GLM假设。
初步结论:索赔次数Var/Mean = 1.317,轻度过度分散,泊松GLM可作为基准;
若偏差检验仍不理想,建议升级为负二项(NB2)GLM。
为什么先做这步:分布探查决定了模型选型。泊松假设均值=方差,一旦存在过度分散,泊松GLM低估标准误,导致费率因子置信区间偏窄,定价风险被低估。
第二步:泊松GLM — 索赔频率建模
"以索赔次数为因变量,曝险年为offset(对数变换后加入线性预测子),车龄、驾龄、地区、车辆类型、用途为自变量,拟合泊松GLM(对数连接)。输出:(1) 模型摘要(系数、标准误、z值、p值、95% CI);(2) 零偏差、残差偏差和AIC;(3) 皮尔逊卡方残差与自由度之比(拟合优度);(4) 费率相对性表(以基准类别为1.000的乘数因子)。"
ChatSRS输出:
泊松GLM — 索赔频率模型
模型拟合统计
零偏差(Null deviance):3,847.2,df = 9,999
残差偏差(Residual deviance):3,124.6,df = 9,988
AIC = 5,872.3
皮尔逊卡方 / df = 1.341(轻度过度分散,建议稳健标准误)
系数表(对数尺度)
变量 Estimate SE z p 95% CI
(Intercept) -2.847 0.092 -30.95 <.001 [-3.027, -2.667]
车龄(3-5年) 0.213 0.048 4.44 <.001 [ 0.119, 0.307]
车龄(6-10年) 0.381 0.052 7.33 <.001 [ 0.279, 0.483]
车龄(>10年) 0.487 0.061 7.98 <.001 [ 0.367, 0.607]
驾龄(<3年) 0.524 0.055 9.53 <.001 [ 0.416, 0.632]
地区(华北) 0.178 0.043 4.14 <.001 [ 0.094, 0.262]
地区(华南) -0.094 0.051 -1.84 .066 [-0.194, 0.006]
商用途径 0.631 0.071 8.89 <.001 [ 0.492, 0.770]
费率相对性表(频率因子,基准 = 新车/驾龄>=3年/华东/私家)
车龄 3-5年:1.237;6-10年:1.464;>10年:1.628
驾龄 <3年:1.689
地区 华北:1.195;华南:0.910(p = .066,未达显著)
商用:1.879
第三步:过度分散检验与负二项GLM对比
"对上述泊松GLM做过度分散检验(Dean检验或Score检验),若显著则拟合负二项GLM(NB2),对比两模型的AIC、残差偏差和费率相对性差异;输出NB2的额外参数theta(过度分散参数)及其置信区间。"
ChatSRS输出:
过度分散检验(Dean Score Test)
z = 3.47,p = .001 — 存在统计显著的过度分散,建议使用NB2 GLM。
NB2 GLM vs 泊松 GLM 对比
指标 泊松 GLM NB2 GLM 变化
AIC 5,872.3 5,691.8 -180.5(NB2更优)
残差偏差/df 1.341 1.072 更接近1(拟合更好)
theta(过散参数) — 8.74 (95% CI [6.21, 12.31])
费率因子对比(商用途径,泊松 vs NB2)
泊松:1.879(95% CI [1.636, 2.160])
NB2: 1.872(95% CI [1.591, 2.203])
结论:点估计接近,但NB2置信区间更宽,反映了过度分散带来的额外不确定性。
精算含义:泊松与NB2的费率因子点估计相近,但定价时NB2的置信区间更诚实,不会低估高风险群体的区间宽度,有利于风险资本的保守估计。
第四步:Gamma GLM — 索赔严重度建模
筛选有索赔记录(N >= 1)的子集,对平均索赔金额建模:
"筛选索赔次数>=1的记录,以平均索赔金额(总索赔金额/索赔次数)为因变量,车龄、驾龄、地区、车辆类型、用途为自变量,拟合Gamma GLM(对数连接)。输出:(1) 系数表含95% CI;(2) 残差偏差和AIC;(3) 严重度费率相对性表;(4) 残差诊断图(Q-Q图、残差vs拟合值、尺度-位置图)。"
ChatSRS输出:
Gamma GLM — 索赔严重度模型(n = 1,421)
模型拟合统计
残差偏差 / df = 0.987(拟合良好,接近1)
AIC = 24,371.6
形状参数(dispersion) = 0.412
系数表(对数尺度,因变量:ln(平均索赔金额))
变量 Estimate SE t p 95% CI
(Intercept) 9.134 0.108 84.6 <.001 [8.922, 9.346]
车龄(>10年) 0.287 0.074 3.88 <.001 [0.142, 0.432]
驾龄(<3年) 0.194 0.081 2.40 .016 [0.035, 0.353]
商用途径 0.341 0.096 3.55 <.001 [0.153, 0.529]
地区(华北) 0.112 0.068 1.65 .099 [-0.021, 0.245]
严重度费率相对性表
车龄 >10年:1.332;驾龄 <3年:1.214;商用:1.406
华北:1.118(p = .099,边际显著)
为什么用Gamma而非线性回归:索赔金额右偏、恒为正值,违反线性回归的正态误差假设。Gamma GLM的对数连接保证预测值始终为正,且方差随均值二次增长(与实际损失数据特征吻合),是精算界GLM建模的标准选择(McCullagh & Nelder, 1989)。
第五步:纯保费GLM — 整合频率与严重度
"将频率模型(NB2 GLM)和严重度模型(Gamma GLM)的费率相对性相乘,生成综合纯保费费率表;以基准类别(新车/驾龄>=3年/华东私家)为基准费率1.000,输出各因子组合的纯保费相对性;同时对比Tweedie GLM(power=1.5)直接建模纯保费的AIC,判断两步法与Tweedie单步法的差异。"
ChatSRS输出:
综合纯保费费率相对性(频率因子 × 严重度因子)
风险特征 频率因子 严重度因子 综合相对性
基准(新车/>=3年/华东私家) 1.000 1.000 1.000
车龄>10年 + 驾龄<3年 + 商用 1.628×1.689×1.872 1.332×1.214×1.406 = 11.70
车龄3-5年 + 驾龄>=3年 + 私家 1.237 1.000 1.237
新车 + 驾龄<3年 + 私家 1.689 1.214 2.050
Tweedie GLM(p=1.5)直接建模纯保费
AIC = 29,847.3(vs 两步法AIC之和 = 30,063.4)
两步法结构更透明,便于精算解释;Tweedie AIC略优,适合黑盒定价场景。
论文方法/结果写法(APA 7th,精算GLM报告句式)
这是最直接帮到你的部分——把上面每步分析翻译成论文可用的APA格式句子。
方法章节:统计分析策略
本研究采用两步广义线性模型(GLM)框架对非寿险定价进行风险建模,遵循精算学界的标准分解方法(de Jong & Heller, 2008)。在索赔频率建模中,以索赔次数为因变量、曝险年为偏移量(offset),先拟合泊松GLM(对数连接),并通过Dean得分检验评估过度分散;若检验显著,则改用负二项GLM(NB2)。在索赔严重度建模中,对有索赔记录子集,以平均索赔金额为因变量,采用Gamma GLM(对数连接)。所有承保特征的系数均以费率相对性(rating relativities)形式报告,以基准类别为1.000的乘数因子表示。统计分析使用ChatSRS完成(R引擎,显著性水平 alpha = .05)。
结果章节:频率模型
泊松GLM的过度分散检验结果显示,Dean得分检验统计量 z = 3.47,p = .001,存在统计显著的过度分散,因此采用负二项GLM(NB2)进行索赔频率建模。NB2模型的过度分散参数 theta = 8.74(95% CI [6.21, 12.31]),残差偏差/自由度 = 1.072,AIC = 5,691.8,模型拟合良好。车龄、驾龄及承保用途对索赔频率的影响均达统计显著水平(ps < .001),其中商用途径的频率相对性为1.872(95% CI [1.591, 2.203]),表明商用车辆的索赔频率约为同等私家车的1.87倍。
结果章节:严重度模型
Gamma GLM索赔严重度模型的残差偏差/自由度 = 0.987,AIC = 24,371.6,模型拟合指标符合精算实践要求(McCullagh & Nelder, 1989)。商用途径的严重度相对性为1.406(95% CI [1.165, 1.697],p < .001),车龄超过10年的严重度相对性为1.332(95% CI [1.153, 1.540],p < .001)。整合频率与严重度后,最高风险组合(车龄>10年、驾龄<3年、商用)的综合纯保费相对性为11.70(频率部分1.628×1.689×1.872≈5.147,严重度部分1.332×1.214×1.406≈2.273),即其期望损失约为基准风险的11.70倍。
上面三段可直接进论文Results章节,只需替换为你自己数据的数值。ChatSRS的"APA报告"功能可自动生成对应段落,无需手动转写。
常见FAQ
Q1: 索赔频率建模应该用泊松还是负二项,怎么判断?
这取决于过度分散程度:
- 泊松GLM:假设均值=方差,适合分散程度接近1(Var/Mean ≈ 1)的场景。作为基准模型先拟合,再诊断
- 负二项GLM(NB2):方差 = 均值 + 均值^2/theta,适合存在过度分散(Var/Mean > 1)的场景
- 零膨胀模型(ZIP/ZINB):若零次索赔比例远超泊松预期(>90%),考虑零膨胀结构
实际操作:在ChatSRS里先跑泊松GLM,输出中自动包含Dean过度分散检验,p < .05则建议升级NB2。
Q2: Gamma GLM的对数连接系数怎么解读?
Gamma GLM采用对数连接时,系数 beta 的含义是:
- exp(beta) 是因变量(索赔金额)的乘数因子
- 例如:商用途径系数 = 0.341,则 exp(0.341) = 1.406,表示商用车平均索赔金额约为同等私家车的1.406倍
- 这与泊松GLM的频率因子解读方式完全一致,便于两步法的费率相对性直接相乘
在ChatSRS中,指令里加"输出费率相对性表",会自动完成exp变换并以乘数形式展示。
Q3: 什么时候用Tweedie GLM替代两步法?
| 场景 | 推荐方法 |
|---|---|
| 需要解释每个因子对频率/严重度的独立贡献 | 两步法(泊松+Gamma) |
| 黑盒纯保费预测,追求单一模型AIC最优 | Tweedie GLM(p∈(1,2)) |
| 数据量极少,两步模型子集样本不足 | Tweedie GLM |
| 监管要求提交可解释费率因子分解 | 两步法(监管友好) |
两步法是精算行业(特别是中国银保监会报备要求)的主流实践;Tweedie常用于机器学习辅助定价场景。
Q4: 如何从GLM系数提取"费率因子"用于实际定价?
精算费率因子 = exp(GLM系数),具体步骤:
- 确定基准类别(通常选最大曝险量的类别,如新车/私家/华东)
- 基准类别的截距项 exp(Intercept) 对应基准风险的频率或严重度
- 其他类别的费率因子 = exp(该类别系数),直接乘以基准费率
- 频率费率因子 × 严重度费率因子 = 纯保费费率因子
- 纯保费费率因子 × 基准纯保费 = 该风险组的纯保费
ChatSRS在"费率相对性表"输出中自动完成所有exp变换,直接给出可录入定价系统的乘数表。
Q5: 模型诊断要看哪些指标,各自说明什么?
| 诊断指标 | 理想范围 | 说明 |
|---|---|---|
| 残差偏差/df | 0.8 — 1.2 | 接近1表示分布假设合理 |
| AIC | 越小越好 | 用于模型选择(不同分布间不可直接比较) |
| 皮尔逊卡方/df | 接近1 | 类似残差偏差/df,Poisson中更常用 |
| Cook距离 | > 1 为高影响力观测警戒线(Cook 1977);也可用 4/n 作为样本量自适应阈值 | 超出需检查是否数据异常 |
| 残差Q-Q图 | 点沿对角线 | 判断残差是否符合假设分布 |
| 尺度-位置图 | 水平带状 | 判断方差齐性(等散性) |
在ChatSRS中,指令里加"输出残差诊断图",自动生成上述全套图表,并附文字判断。
精算GLM建模小结
非寿险定价GLM建模,方法链条清晰但每步有精算惯例要遵守:
| 分析目的 | 方法 | ChatSRS一句话关键词 |
|---|---|---|
| 了解数据分布特征 | 描述统计 + 过度分散检验 | "索赔次数均值方差比,过度分散检验" |
| 索赔频率建模 | 泊松/NB2 GLM(对数连接+offset) | "泊松GLM,曝险年为offset,输出费率相对性" |
| 严重度建模 | Gamma GLM(对数连接) | "Gamma GLM,对数连接,输出exp系数和费率因子" |
| 模型选择 | AIC + 残差偏差/df对比 | "对比泊松与NB2的AIC和残差偏差" |
| 纯保费整合 | 频率因子 × 严重度因子 | "输出两步法综合费率相对性表" |
| 模型诊断 | 残差图 + Cook距离 | "输出残差诊断图,标注高影响力观测" |
| 单步纯保费 | Tweedie GLM(p∈1,2) | "Tweedie GLM,power参数1.5,与两步法AIC对比" |
每一步的输出ChatSRS都能直接生成APA 7th报告句式,在论文里改改数值就能用。
如果你是第一次系统做精算或风险管理方向的论文数据分析,推荐先看总指南:毕业论文数据分析救星 — 全流程AI完成指南
相关阅读
本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。