场景案例 ·
交通工程与安全数据 AI 统计分析 — 事故计数、影响因素回归与相关全流程
交通工程与道路安全研究必读:从事故频率描述统计、负二项回归计数模型,到多因素相关与回归影响因素分析,ChatSRS AI 一句话跑完全套,生成 APA 7th 格式交通安全论文报告。
交通工程、道路安全、城市交通规划方向的毕业生和研究者,常常卡在这几道坎:事故次数是计数变量不能直接跑线性回归、泊松/负二项回归怎么选、影响因素相关矩阵怎么解读、APA 格式的回归系数表怎么写……这篇文章把交通安全最典型的分析场景从头串到尾,每步给出 ChatSRS 可直接使用的一句话指令,以及可抄进论文的 APA 7th 报告句式。
交通安全数据分析为什么和普通社科数据不一样
交通事故数据有几个典型特征,让套用常规线性回归的做法直接"翻车":
- 事故次数是计数变量:非负整数,不服从正态分布,线性回归假设不成立
- 过度离散问题:实际事故数据的方差往往远大于均值,泊松模型失效,需要负二项回归
- 暴露量必须控制:不同路段的车流量、里程差异巨大,比较必须引入 offset(偏移量)或标准化
- 空间自相关:相邻路段事故数可能相互关联,需要检验
- 多维影响因素:几何设计(弯道、坡度、车道宽)、交通条件(流量、速度)、环境因素(天气、夜间照明)、驾驶人行为指标往往混杂交织
这些特殊性决定了分析链条要比一般量表问卷更精细。chatsrs.com 的 R 引擎内置 MASS、pscl、lmtest 等包,能一句话处理计数数据全流程,不需要你懂 R 语法。
典型数据结构
路段级事故数据(最常见)
路段ID 年事故次数 年均日交通量(ADT) 车道数 限速(km/h) 曲率半径(m) 路肩宽(m) 夜间照明 降雨天比例
R001 12 8500 4 80 320 2.5 是 0.18
R002 3 3200 2 60 850 1.8 否 0.22
R003 27 15600 6 100 180 3.0 是 0.15
...
关键分析链:描述统计 + 离散度检验 → 泊松/负二项计数回归(控制 ADT 暴露量)→ 各因素 IRR(发生率比)→ 相关矩阵(多重共线性预筛)→ 模型诊断
事故个案级数据(微观分析)
事故ID 严重程度(1-3) 碰撞类型 驾驶人年龄 是否饮酒 路面状况 能见度(m) 速度(km/h) 伤亡人数
A0001 2 追尾 34 否 干燥 300 85 1
A0002 3 侧面碰撞 57 是 湿滑 80 62 3
...
关键分析链:描述统计 → Pearson/Spearman 相关矩阵 → 有序 Logistic 回归(严重程度)或 Poisson 回归(伤亡人数)→ 优势比 OR 或发生率比 IRR
全流程分析演示(路段级事故计数场景)
以"城市快速路路段特征对年事故次数的影响"为例:120 个路段,因变量为年事故次数,自变量含交通量、几何设计指标和环境因素。
第一步:描述统计与离散度检验
打开 chatsrs.com,上传数据后输入:
"请对年事故次数做描述统计,报告均值、方差、最小值、最大值、偏度、峰度;并做方差/均值比(VMR)计算,检验数据是否存在过度离散;同时对所有连续自变量(ADT、曲率半径、路肩宽、降雨天比例)生成 APA 格式三线描述统计表。"
ChatSRS 自动输出:
表 1 各变量描述统计(N = 120)
M SD Min Max 偏度 峰度
年事故次数 8.43 9.71 0 48 1.87 4.32
ADT(辆/天) 7842.0 4218.3 1200 18500 0.62 0.08
曲率半径(m) 489.2 312.7 90 1200 -0.31 0.15
路肩宽(m) 2.21 0.68 0.5 4.0 -0.12 -0.18
降雨天比例 0.19 0.07 0.05 0.41 0.44 0.21
方差/均值比(VMR)= 9.71^2 / 8.43 = 11.19 >> 1
结论:数据存在显著过度离散(VMR >> 1),泊松回归不适用,建议使用负二项回归(NB2)。
为什么先做这步:VMR 远大于 1 是选用负二项回归而非泊松回归的硬判据,方法论部分需要明确报告。
第二步:相关矩阵 — 筛查多重共线性与预判关联方向
"请计算所有自变量与年事故次数之间的 Spearman 相关系数矩阵(事故次数为非正态分布计数变量),标注 p < .05 和 p < .01 的显著性星号,并计算各自变量两两之间的 Pearson 相关系数,标注 VIF > 5 的潜在共线性警告。输出 APA 格式相关矩阵三线表。"
ChatSRS 输出(示例节选):
表 2 各变量 Spearman 相关矩阵
事故次数 ADT 曲率半径 路肩宽 降雨天比例
事故次数(/年) — .58** -.41** -.29** .33**
ADT(辆/天) .58** — -.12 -.08 .04
曲率半径(m) -.41** -.12 — .18* -.07
路肩宽(m) -.29** -.08 .18* — -.13
降雨天比例 .33** .04 -.07 -.13 —
注. * p < .05, ** p < .01. 所有自变量 VIF < 3.0,无显著共线性。
第三步:负二项回归 — 事故计数模型核心
"以年事故次数为因变量,以 ADT 的自然对数(log_ADT)为 offset 暴露量,以曲率半径、车道数、路肩宽、夜间照明(0/1)、降雨天比例为自变量,拟合负二项回归模型(NB2)。报告:各变量的回归系数 b、标准误 SE、Wald z 值、p 值、发生率比 IRR 及 95% CI;模型整体拟合指标(AIC、BIC、对数似然);与零模型比较的似然比检验。"
ChatSRS 输出:
表 3 负二项回归结果(因变量:年事故次数,N = 120)
变量 b SE z p IRR 95% CI
截距 -3.21 0.48 -6.69 < .001 — —
曲率半径(m) -0.0031 0.0007 -4.43 < .001 0.997 [0.996, 0.998]
车道数 0.38 0.11 3.45 .001 1.462 [1.176, 1.817]
路肩宽(m) -0.29 0.09 -3.22 .001 0.748 [0.626, 0.894]
夜间照明(有) -0.51 0.14 -3.64 < .001 0.600 [0.456, 0.789]
降雨天比例 1.87 0.52 3.60 < .001 6.488 [2.344, 17.967]
模型拟合:AIC = 612.4,BIC = 633.7,过度离散参数 theta = 1.83 (SE = 0.31)
似然比检验(vs 零模型):chi^2(5) = 84.32,p < .001
IRR 的直观解读:
- 曲率半径每增加 1 m,年事故发生率降低约 0.3%(IRR = 0.997)
- 夜间有照明路段相较无照明路段,年事故发生率降低约 40%(IRR = 0.600)
- 降雨天比例每增加 0.10,年事故发生率增加约 20.6%(回归系数 b = 1.87,IRR = exp(b) = exp(1.87) ≈ 6.488;边际增幅 = exp(1.87 × 0.10) − 1 ≈ 20.6%)
第四步:模型诊断与稳健性
"请对负二项回归模型做以下诊断:(1) 残差与拟合值散点图,检验系统性偏差;(2) 零膨胀检验(Vuong 检验),判断是否需要升级为零膨胀负二项模型(ZINB);(3) 使用稳健标准误(sandwich SE)重新估计,比较系数是否稳健。"
ChatSRS 自动输出 Vuong 检验结果及稳健 SE 对比表,并给出"是否升级 ZINB"的判断建议。
第五步:事故严重程度影响因素(有序 Logistic 回归)
如果研究还关注"哪些因素影响事故严重程度":
"以事故严重程度(1 = 财产损失,2 = 一般伤亡,3 = 重伤/死亡)为有序因变量,以驾驶人年龄、是否饮酒、路面状况、能见度、事故发生速度为自变量,做有序 Logistic 回归(proportional odds model)。先做比例优势假设检验;报告各变量优势比 OR、95% CI、p 值;输出 APA 三线表。"
论文方法/结果写法(APA 7th,交通安全报告句式)
以下句式可直接进论文 Methods 和 Results 章节,替换为自己的数值即可。
方法章节:数据分析策略
本研究采用负二项回归模型(negative binomial regression, NB2)分析路段特征对年事故次数的影响。在模型建立前,首先计算年事故次数的方差/均值比(VMR)以检验过度离散程度;以年均日交通量的自然对数(ln ADT)作为 offset 纳入模型以控制暴露量差异。选取曲率半径、车道数、路肩宽、夜间照明和降雨天比例为自变量,参照 Lord 和 Mannering(2010)的交通安全建模框架构建回归模型。模型系数以发生率比(incidence rate ratio, IRR)和 95% 置信区间报告。此外,采用 Spearman 相关分析检验各变量与事故频率的双变量关联,并通过方差膨胀因子(VIF)诊断多重共线性。所有分析使用 ChatSRS 完成(R 引擎,MASS 包,显著性水平 alpha = .05)。
结果章节:描述统计与离散度
样本路段(N = 120)年事故次数均值为 8.43(SD = 9.71),取值范围 0—48 次,偏度为 1.87,呈明显右偏分布。方差/均值比(VMR = 11.19)远大于 1,表明因变量存在显著过度离散,不满足泊松分布假设(均值 = 方差),因此采用负二项回归模型以更恰当地处理数据结构。
结果章节:相关分析
Spearman 相关分析结果显示,年事故次数与年均日交通量(ADT)呈显著正相关,rs(118) = .58,p < .001;与曲率半径呈显著负相关,rs(118) = -.41,p < .001;与路肩宽呈显著负相关,rs(118) = -.29,p < .001;与降雨天比例呈显著正相关,rs(118) = .33,p < .001。所有自变量的方差膨胀因子(VIF)均小于 3.0,不存在严重多重共线性(参见表 2)。
结果章节:负二项回归主要结果
负二项回归分析结果(见表 3)显示,模型整体显著,chi^2(5) = 84.32,p < .001,AIC = 612.4。在控制暴露量(ln ADT)后,曲率半径(b = -0.0031,SE = 0.0007,z = -4.43,p < .001,IRR = 0.997,95% CI [0.996, 0.998])、路肩宽(b = -0.29,SE = 0.09,z = -3.22,p = .001,IRR = 0.748,95% CI [0.626, 0.894])和夜间照明(b = -0.51,SE = 0.14,z = -3.64,p < .001,IRR = 0.600,95% CI [0.456, 0.789])对年事故次数具有显著的负向效应;车道数(IRR = 1.462,p = .001)和降雨天比例(IRR = 6.488,p < .001)对年事故次数具有显著的正向效应。上述结果表明,较大的曲率半径、较宽的路肩和夜间照明条件是降低路段事故频率的关键几何与环境因素。
上面四段可直接进论文,只需替换成你实际分析的数值。ChatSRS 的"APA 报告"功能可自动生成上述段落,无需手动转写。
常见 FAQ
Q1:事故次数能不能直接用线性回归?
不能,原因有三:
- 非负性:事故次数不可能为负,线性回归预测值可能出现负数
- 整数离散性:线性回归假设连续正态分布,与计数变量的离散性矛盾
- 过度离散:事故数据方差通常远大于均值,线性回归无法捕捉这一特征,导致标准误低估,假阳性结论膨胀
正确路径:先算 VMR,若 VMR ≈ 1 用泊松回归,VMR >> 1 用负二项回归(NB2),有大量零值路段则考虑零膨胀模型(ZIP/ZINB)。ChatSRS 一句话自动诊断并推荐模型。
Q2:泊松回归与负二项回归怎么选?
| 判据 | 泊松回归 | 负二项回归 |
|---|---|---|
| 方差/均值比(VMR) | ≈ 1 | >> 1 |
| Deviance / df | ≈ 1 | > 1.5 说明过度离散 |
| AIC 比较 | — | NB2 AIC 更小则更优 |
| 数据特征 | 稀少事件、短时间窗 | 多数交通事故数据集 |
在 ChatSRS 中输入:
"请同时拟合泊松回归和负二项回归,比较两个模型的 AIC、BIC 和似然比检验结果,给出模型选择建议。"
Q3:如何在模型中控制暴露量(流量)?
交通安全计数模型中,不同路段的车流量(ADT)差异会直接影响事故绝对数。有两种规范处理方式:
- Offset 方法(推荐):将 ln(ADT) 作为 offset(系数固定为 1)纳入模型,使模型实际预测的是事故率(事故数/ADT)。这是绝大多数交通安全文献的标准做法
- 自变量方法:将 ADT 或 ln(ADT) 作为普通自变量,允许系数自由估计,适合探索流量弹性
在 ChatSRS 中指定"以 ln_ADT 为 offset"即可,AI 自动按 offset 方式建模。
Q4:如何报告 IRR(发生率比)?
IRR = exp(b),是负二项/泊松回归系数的指数变换,解读方式与线性回归的 b 完全不同:
- IRR > 1:该变量每增加 1 个单位,事故发生率增加 (IRR - 1) × 100%
- IRR < 1:该变量每增加 1 个单位,事故发生率降低 (1 - IRR) × 100%
- IRR = 1:无效应
APA 报告格式示例:
夜间照明的存在使年事故发生率降低约 40.0%,IRR = 0.600,95% CI [0.456, 0.789],z = -3.64,p < .001。
ChatSRS 在输出回归表时自动同步报告 b、SE、z、p 和 IRR + 95% CI,无需手动换算。
Q5:交通安全论文的方法章节还需要报告什么?
除了上文给出的模型主体,方法章节一般还需要:
- 数据来源说明:事故记录库来源(交管局、事故数据库)、时间窗口、路段纳入/排除标准
- 因变量定义:事故次数统计口径(伤亡 + 财损 OR 仅伤亡;同一事故多车辆计几次)
- 暴露量说明:ADT 来源与置信水平;若使用 AADT,说明季节调整方法
- 缺失值处理:路段几何数据、气象数据的缺失率与填补方法
数据清洗和缺失值处理流程,参见:数据清洗完整教程 — AI 一步搞定缺失值与异常值
Q6:论文审稿人要求做空间自相关检验怎么办?
交通事故数据的相邻路段可能存在空间溢出效应,Moran's I 是最常用的空间自相关检验指标。在 ChatSRS 中输入:
"请对各路段的负二项回归残差做全局 Moran's I 检验(需要路段质心坐标或邻接矩阵),报告 Moran's I 值、期望值、z 分数和 p 值;若存在显著空间自相关,建议是否升级为空间负二项模型(Spatial NB)。"
若无 GIS 坐标数据,可先在方法局限性中说明"本研究未考虑路段间的空间相关性,后续研究可引入空间计量模型加以改进",这是公认的规范表述。
交通安全分析方法速查表
| 研究问题 | 推荐方法 | ChatSRS 关键词 |
|---|---|---|
| 各路段/交叉口事故频率描述 | 描述统计 + VMR 检验 | "计数变量描述统计、方差均值比" |
| 事故次数影响因素建模 | 负二项回归(NB2) | "负二项回归、IRR、offset=ln_ADT" |
| 大量零计数路段 | 零膨胀负二项(ZINB) | "零膨胀模型、Vuong 检验" |
| 事故严重程度影响因素 | 有序 Logistic 回归 | "有序 Logistic 回归、比例优势假设" |
| 各变量双变量关联 | Spearman/Pearson 相关矩阵 | "相关矩阵、Spearman 相关、APA 三线表" |
| 多重共线性排查 | VIF 诊断 | "方差膨胀因子 VIF、共线性诊断" |
| 驾驶人伤亡风险预测 | 二元 Logistic / Cox 生存分析 | "Logistic 回归、OR 优势比" |
| 空间溢出效应 | Moran's I + 空间计量 | "Moran I 检验、空间负二项" |
相关阅读
- 相关与回归完整教程 — AI 一句话搞定 Pearson 相关与多元线性回归
- 回归系数表 APA 报告规范 — b/beta/SE/t/p 全字段
- 方差分析 ANOVA 完整教程 — 单因素到多因素 AI 一句话搞定
- 土木工程调查数据 AI 统计分析 — 问卷与实测数据全流程
- 数据清洗完整教程 — AI 一步搞定缺失值与异常值
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。