本页说明全系列 92 个方法教程共用的案例数据:数据从哪里来、为什么使用同一套口径、变量如何构造、能够覆盖哪些方法。 所有方法页里出现的数字,都是从这份数据真实跑出来的,不是模板占位符。 读者只需要先理解这页,后续 91 个方法页就默认沿用同一份样本和变量口径。
一、为什么是这份数据
这套教程采用「方法换、数据不换」的学习路径。初学者最容易被不同数据集、不同变量名和不同样本口径打断;同一份案例能让注意力回到方法本身:这个方法回答什么问题、需要什么变量、输出表应该怎么读。
这套系列里所有方法都用同一份面板数据。这样的好处:
- 看到 Day 04 Hausman 报
chi2(10)=42.91,你能直接和 Day 01 Table 1 里 Patent 的右偏对上号; - 看到 Day 38 PSM 的处理组 / 控制组样本量,你能立刻知道这是从 Day 01 那 1,200 obs 里切出来的;
- 方法之间的对比变得直观:Day 11 OLS / Day 04 Hausman / Day 43 DID 同一组数据跑出来,系数差异是真的「方法选择带来的差异」,不是「数据不同造成的假象」。
二、数据构造
| 字段 | 口径 |
|---|---|
| 来源 | CSMAR 风格 A 股上市公司面板(结构和量纲与 CSMAR、Wind 公开版一致) |
| 样本期间 | 2015 年 - 2020 年,共 6 年 |
| 样本量 | 196 家公司 × 6 年 ≈ 1,200 个公司-年观测 |
| 观测单位 | 公司-年(firm × year) |
| 因变量 Y | Patent = 当年发明专利申请数;后续用 ln(1 + Patent) 进入 OLS / FE 回归 |
| 核心解释变量 X | DFI = 北大数字普惠金融指数(地级市层面,原始量纲约 165-375;部分案例输出会展示标准化后的 dfi_index) |
| 控制变量 | ROA、Lev、Size、Growth、Cashflow、TobinQ、Top1、Indep、Age(共 9 个) |
| 分组变量 | SOE(是否国企,民企 894 obs,国企 306 obs,用于异质性分析) |
| 固定效应 | firm_id(公司)+ year(年份),可同时控制 |
| 处理 | 所有连续变量按年度 1% 双侧缩尾(winsor2 cuts(1 99) by(year)) |
三、这份数据能覆盖哪些方法
这份 CSMAR 风格面板和数字普惠金融指数的时间变化,足以支撑 92 个方法教程中的大部分教学场景。不同方法会从同一套变量中抽取不同角色,例如面板 ID、时间、处理组、政策后、工具变量或分组变量。
| 章节 | 能跑的方法 |
|---|---|
| Ch1 入门体检(Day 01-10) | 描统、相关、VIF、Hausman、Chow(问卷类 Cronbach/EFA/CFA/SEM 用副案例) |
| Ch2 基准回归(Day 11-24) | OLS+FE、Logit(僵尸企业=1)、Tobit、Poisson/NB、分位数、Heckman |
| Ch3 稳健性礼包(Day 25-33) | Placebo、boottest、Oster、winsor 敏感性、Driscoll-Kraay、Newey-West |
| Ch4 内生性(Day 34-42) | IV、Bartik shift-share、PSM、CEM、熵平衡、IPW、DR-IPWRA |
| Ch5 DID 全家桶(Day 43-55) | 经典 DID、CSDID、Sun-Abraham、DCDH、BJS、honest DID、合成控制、SDID |
| Ch6 机制与异质性(Day 56-62) | 中介、调节、JN 区间、异质性分组、DML、因果森林、Oaxaca |
| Ch7 面板(Day 63-71) | 面板单根、Pesaran CD、MG/PMG、系统 GMM、门槛、xtgls、Hausman-Taylor |
少量方法会使用副案例或派生变量:
- 问卷量表类(Cronbach/Harman/EFA/CFA/SEM):使用派生题项或独立问卷结构讲清信度、效度和潜变量路径,避免把企业面板变量硬解释成问卷题项。
- 时序类(ADF/协整/VAR/SVAR/VECM/ARIMA/GARCH):使用按时间聚合的序列或独立宏观序列讲清平稳性、滞后、冲击响应和波动率。
四、为什么使用 CSMAR 风格数据
CSMAR / Wind 是商业付费数据库,不能直接对外发布原始数据。使用 CSMAR 风格数据可以保留真实研究中常见的字段结构、变量量纲、分布形状和相关方向,同时避免数据授权问题。
这份「CSMAR 风格」数据使用真实分布参数生成:DFI 的量纲、Patent 的右偏、ROA 的均值/sd、SOE 的占比,均对齐北大原始指数和 A 股公开统计。页面展示的表格和图形来自同一套案例生成口径,用于保证案例材料可核对。
部分页面表格来自完整案例生成流程。生成流程会做缺失过滤、变量映射和标准化,所以部分表的有效样本是 720 obs、DFI 区间是标准化后的 -3 到 3 左右。这不是另一套案例,而是同一案例进入建模管线后的分析口径。
五、如何核对案例资产
这页下面的 csmar_innovation_realistic.csv、生成脚本和各方法资产都已经放在仓库里。
你可以按每一讲的代码逐段核对变量、结果表和案例图是否一致,这比只看截图更能帮助你理解方法的来龙去脉。