实证方法教程 / xthtaylor

Hausman-Taylor 估计

用同一份企业面板跑出可解释的模型证据

这节课解决什么适合企业、地区、个人等重复观测数据,重点控制个体不随时间变化的遗漏因素。
先准备哪些变量因变量 / 核心解释变量 / 个体 ID / 时间变量
会看到哪张表xthtaylor_results.csv
论文里怎么克制解释必须说明是否控制个体/时间固定效应,以及标准误按什么层级聚类。

Hausman-Taylor 估计是什么?

Hausman-Taylor 估计回答的是面板随机效应模型里,如何同时估计时变变量和时不变变量,并处理部分解释变量可能和个体效应相关的问题。

先用一句话理解

把 Hausman-Taylor 想成固定效应和随机效应之间的折中。固定效应能控制个体不变差异,但会吃掉性别、地理位置这类时不变变量;Hausman-Taylor 试图用模型内部的外生变量做工具,把一部分时不变变量的效应估出来。

什么时候用

判断项教科书式判断
适合用在面板数据中既有时变变量也有时不变变量,且部分变量可能与个体效应相关。
先不要用在所有关键变量都有充分组内变化,普通 FE 已经能回答问题。
最关键的前提变量必须被清楚分为时变/时不变、外生/内生四类。
读表顺序先看变量分类,再看工具变量来源、过识别和 RE/FE 对照。
论文表述边界HT 依赖内部工具变量假设,不能写成自动优于 FE。

把它和相近方法分清楚

容易混淆的对象怎么区分初学者记法
固定效应控制所有个体不变因素。不能估计时不变变量效应。
随机效应可估计时不变变量。要求个体效应与解释变量无关。
Hausman-Taylor用内部工具处理部分相关性。依赖变量分类和工具有效性。

核心直觉和模型公式

时变与时不变变量并存

Hausman-Taylor 的基本面板方程可写成:

\[Y_{it}=X_{1it}\beta_1+X_{2it}\beta_2+Z_{1i}\gamma_1+Z_{2i}\gamma_2+\alpha_i+\varepsilon_{it}\]

X 表示时变变量,Z 表示时不变变量;下标 1/2 通常对应外生与内生分组。

公式里的符号怎么读

符号含义在本页怎么理解
X1_it时变外生变量可作为内部工具的一类变量。
X2_it时变内生变量可能和个体效应相关。
Z1_i时不变外生变量随机效应下可直接估计。
Z2_i时不变内生变量HT 重点想估计但需要工具。
α_i个体效应不随时间变化的未观察个体特质。

专业使用口径

专业 HT 报告的核心不是软件命令,而是变量分类是否可信。

口径专业写法
四类变量逐项说明哪些变量是 X1、X2、Z1、Z2。
内部工具解释为什么某些组内/组间变化可作为工具。
对照模型和 FE、RE、IV 或 Mundlak 规格对照。
过识别如果有过识别检验,要披露结果和边界。

一步一步做:从问题到结果的五步

步骤这一页具体做什么做到什么程度才算读懂
1. 明确研究目标是否必须估计时不变变量效应。否则 FE 可能更简单。
2. 划分变量类型按时变/时不变、外生/内生分类。分类错误会直接破坏识别。
3. 构造内部工具利用外生变量的组内或组间变化。工具来源要讲清。
4. 估计 HT在随机效应框架下使用工具变量。系数解释依赖假设。
5. 做模型对照比较 FE/RE/HT 方向。冲突时不能只选 HT。

结果怎么读:先读口径,再读数字

本页案例读表时,先记住这个口径:一阶段工具变量 = L.dfi_index;教学案例用滞后 DFI 演示 IV 流程;正式论文需要外生来源。

读表顺序本页怎么读不要这样读
先看变量分类四类变量是否列清。没有分类就无法评估 HT。
再看工具来源内部工具是否有经济含义。纯软件生成不够。
然后看时不变变量HT 是否提供了核心估计。这是它相对 FE 的价值。
最后看敏感性和 FE/RE 是否冲突。冲突要保守解释。

初学者最容易错在哪里

误读为什么错
为了保留时不变变量就直接用 HT错。还要满足工具假设。
不报告变量分类错。读者无法判断识别。
把 HT 写成固定效应错。它在随机效应和 IV 框架下工作。
忽略过识别风险不严谨。内部工具也可能无效。

先看这个案例的结论

  • 一阶段工具变量 = L.dfi_index;教学案例用滞后 DFI 演示 IV 流程;正式论文需要外生来源。
  • 一阶段 F = 2.0575;弱工具变量诊断的核心指标。
  • 2SLS 系数 = -0.0237;第二阶段使用预测 DFI。
  • 这些数字来自页面里的结果表;写论文时先解释数值含义,再讨论理论含义。

变量要求和案例口径

字段口径
数据CSMAR 风格 A 股企业创新面板
原始样本196 家上市公司,2015-2020 年,约 1200 个公司-年观测;各方法有效样本以本页输出表 N 为准
因变量patent_count;回归页通常使用 ln(1 + patent_count)
核心解释变量dfi_index,数字普惠金融指数;部分案例输出展示的是标准化后的 dfi_index
控制变量roa、lev、size、growth、cashflow、tobinq、top1、dual、board、indep、soe、age
输出文件xthtaylor_results.csv
角色要求因变量、核心解释变量、个体 ID、时间变量
依赖包无额外 Stata 社区包要求

实际代码

下面是本页案例里的最小 Stata 代码。它的作用是帮助你看清变量怎么进入模型、结果文件怎么生成,而不是要求你在网页里手动运行。

import delimited "$DATA_PATH", clear varnames(1) encoding(UTF-8)
gen ln_patent1 = ln(1 + patent_count)
egen firm_id = group(stkcd)
xtset firm_id year

global y ln_patent1
global count_y patent_count
global x dfi_index
global controls roa lev size growth cashflow tobinq top1 dual board indep soe age
gen post = year >= 2018
bysort firm_id: egen pre_dfi = mean(cond(year < 2018, dfi_index, .))
quietly summarize pre_dfi, detail
gen treat = pre_dfi >= r(p50)
gen did = treat * post
gen high_patent = patent_count > 2
gen running_dfi = dfi_index - 260
gen rdd_treat = running_dfi >= 0

xthtaylor $y $x roa lev size growth cashflow tobinq top1 indep age, endog($x)
export delimited using "$JOB_DIR/xthtaylor_results.csv", replace

实际输出表

这张表是本方法页配套案例的输出结果,用来把前面的公式、变量口径和代码对应到实际数字。

指标数值解释
样本1200 obs / 196 firms / 2015-2020来自共用案例 CSV
因变量ln(1 + patent_count)企业创新产出
核心解释变量dfi_index数字普惠金融指数
输出文件xthtaylor_results.csvempirical-wizard 对应方法产物
一阶段工具变量L.dfi_index教学案例用滞后 DFI 演示 IV 流程;正式论文需要外生来源
一阶段 F2.0575弱工具变量诊断的核心指标
2SLS 系数-0.0237第二阶段使用预测 DFI
2SLS p 值0.2853与 OLS/FE 方向对照,不单独当成识别证明

案例图

这是一张由同一份案例数据生成的页面内诊断图。

Hausman-Taylor 估计 的共用案例输出图。
Hausman-Taylor 估计 的共用案例输出图。

论文里怎么写

本文在共用企业面板样本上报告Hausman-Taylor 估计,核心输出见 xthtaylor_results.csv。结果解释时同时关注样本口径、变量构造、系数方向、标准误和适用前提,避免只凭单个 p 值完成方法选择。

检查清单

  • 先把变量分成时变/时不变、外生/内生四类。
  • Hausman-Taylor 的识别来自这些分类,分类没有理论依据就不能用。
  • 报告时说明为什么要保留时不变变量而不直接使用 FE。

返回教程库 · 查看共用案例