实证方法教程 / conley_hac

Conley 空间 HAC SE

把内生性、稳健性和标准误问题说清楚

这节课解决什么用于处理内生性、弱识别、标准误、空间相关或多重检验等识别风险。
先准备哪些变量因变量 / 核心解释变量
会看到哪张表conley_hac_results.csv
论文里怎么克制解释披露校正口径和失败/不可用状态,不把补充诊断伪装成主规格显著性。

Conley 空间 HAC SE是什么?

Conley 空间 HAC 标准误处理的是误差项在地理距离内相关的问题。它不估计空间溢出效应,只是在空间相关存在时让标准误更稳健。

先用一句话理解

把 Conley 想成承认相邻地区会一起受冲击。普通标准误假装北京和天津的误差完全独立,但很多经济冲击会沿空间距离扩散;Conley 会按距离修正这种相关。

什么时候用

判断项教科书式判断
适合用在样本有经纬度或空间位置,误差可能在一定距离内相关。
先不要用在没有空间坐标,或研究问题是估计溢出效应而不是修正标准误。
最关键的前提距离 cutoff 要有研究依据,不能为了显著性选择。
读表顺序先看 cutoff 和距离口径,再看 Conley SE 与主标准误差异。
论文表述边界Conley 是空间相关稳健推断,不是空间计量模型。

把它和相近方法分清楚

容易混淆的对象怎么区分初学者记法
Cluster SE允许同一聚类内相关。相关边界离散。
Conley HAC允许一定地理距离内相关。相关随距离 cutoff 定义。
Spatial DID估计邻近处理溢出效应。不是标准误修正。

核心直觉和模型公式

距离 cutoff 内的相关

Conley 的核心想法可以写成:

\[Cov(\varepsilon_i,\varepsilon_j)\ne0\quad \text{if }dist(i,j)\le c\]

距离超过 cutoff c 的误差相关被降权或视为无关。

公式里的符号怎么读

符号含义在本页怎么理解
dist(i,j)空间距离两个观测单位之间的地理距离。
ccutoff允许空间相关的最大距离。
epsilon_i误差项模型未解释部分。
Cov误差协方差空间邻近造成的相关。
Conley SE空间 HAC 标准误对空间相关稳健的推断口径。

专业使用口径

专业 Conley 报告要说明距离、cutoff 和是否做敏感性。

口径专业写法
坐标来源说明经纬度或空间位置如何获得。
距离度量说明球面距离、公里距离或网络距离。
cutoff报告主 cutoff,并做多个 cutoff 敏感性。
定位强调只修正标准误,不估计空间溢出。

一步一步做:从问题到结果的五步

步骤这一页具体做什么做到什么程度才算读懂
1. 准备空间坐标每个观测需要可计算距离的位置。坐标错误会直接污染标准误。
2. 固定主模型系数方程不变。Conley 只改推断。
3. 选择 cutoff根据经济距离、通勤圈或文献设定。不能事后调显著性。
4. 计算 Conley SE允许 cutoff 内误差相关。比较标准误变化。
5. 做敏感性多个 cutoff 下结果是否稳定。单一 cutoff 不够。

结果怎么读:先读口径,再读数字

本页案例读表时,先记住这个口径:核心系数 = 0.0032;同一份 firm-year 样本的 DFI 估计。

读表顺序本页怎么读不要这样读
先看 cutoff空间相关允许到多远。不报告 cutoff 不可复核。
再看标准误Conley 是否显著大于 cluster/robust。变化大说明空间相关重要。
然后看 p 值结论是否对空间相关稳健。不要只保留常规 p。
最后看定位它不是溢出效应估计。不要把标准误修正写成机制。

初学者最容易错在哪里

误读为什么错
把 Conley 当空间模型错。它只修正标准误。
cutoff 事后选择错。会变成显著性搜索。
没有坐标仍硬报错。空间距离是核心输入。
不做 cutoff 敏感性不够。Conley 结果依赖距离设定。

先看这个案例的结论

  • 核心系数 = 0.0032;同一份 firm-year 样本的 DFI 估计。
  • cluster SE = 0.0010;按企业聚类的标准误。
  • HC1 SE = 0.0010;异方差稳健标准误对照。
  • 这些数字来自页面里的结果表;写论文时先解释数值含义,再讨论理论含义。

变量要求和案例口径

字段口径
数据CSMAR 风格 A 股企业创新面板
原始样本196 家上市公司,2015-2020 年,约 1200 个公司-年观测;各方法有效样本以本页输出表 N 为准
因变量patent_count;回归页通常使用 ln(1 + patent_count)
核心解释变量dfi_index,数字普惠金融指数;部分案例输出展示的是标准化后的 dfi_index
控制变量roa、lev、size、growth、cashflow、tobinq、top1、dual、board、indep、soe、age
输出文件conley_hac_results.csv
角色要求因变量、核心解释变量
依赖包acreg

实际代码

下面是本页案例里的最小 Stata 代码。它的作用是帮助你看清变量怎么进入模型、结果文件怎么生成,而不是要求你在网页里手动运行。

import delimited "$DATA_PATH", clear varnames(1) encoding(UTF-8)
gen ln_patent1 = ln(1 + patent_count)
egen firm_id = group(stkcd)
xtset firm_id year

global y ln_patent1
global count_y patent_count
global x dfi_index
global controls roa lev size growth cashflow tobinq top1 dual board indep soe age
gen post = year >= 2018
bysort firm_id: egen pre_dfi = mean(cond(year < 2018, dfi_index, .))
quietly summarize pre_dfi, detail
gen treat = pre_dfi >= r(p50)
gen did = treat * post
gen high_patent = patent_count > 2
gen running_dfi = dfi_index - 260
gen rdd_treat = running_dfi >= 0

reg $y $x $controls i.year
* acreg $y $x $controls, latitude(lat) longitude(lon) dist(100)
export delimited using "$JOB_DIR/conley_hac_results.csv", replace

实际输出表

这张表是本方法页配套案例的输出结果,用来把前面的公式、变量口径和代码对应到实际数字。

指标数值解释
样本1200 obs / 196 firms / 2015-2020来自共用案例 CSV
因变量ln(1 + patent_count)企业创新产出
核心解释变量dfi_index数字普惠金融指数
输出文件conley_hac_results.csvempirical-wizard 对应方法产物
核心系数0.0032同一份 firm-year 样本的 DFI 估计
cluster SE0.0010按企业聚类的标准误
HC1 SE0.0010异方差稳健标准误对照
SE 比值0.9766Conley 空间 HAC SE 页重点说明标准误口径如何改变推断

案例图

这是一张由同一份案例数据生成的页面内诊断图。

Conley 空间 HAC SE 的共用案例输出图。
Conley 空间 HAC SE 的共用案例输出图。

论文里怎么写

为缓解模型设定或内生性担忧,本文补充报告Conley 空间 HAC SE。相关估计输出见 conley_hac_results.csv。该检验不替代研究设计本身,但可以说明核心结论在替代识别、标准误或稳健性口径下是否保持一致。

检查清单

  • 先确认经纬度或空间距离变量真实存在,不能用行政编码假装距离。
  • 说明空间 cutoff 和时间 lag,Conley 标准误对这些选择敏感。
  • Conley 修正的是空间/时间相关推断,不改变核心系数本身。

返回教程库 · 查看共用案例