用面板数据处理反向因果关系

  • Leszczensky, L., & Wolbring, T. (2019). How to deal with reverse causality using panel data? Recommendations for researchers based on a simulation study. Sociological Methods & Research, 0049124119882473.
  • 复制性程序:https://osf.io/ytsab/
  • 面板模型在观察数据中解开x与y的动态相互作用关系
    • 带有滞后自变量的一阶差分模型(LFD)
    • 依赖工具变量的动态面板模型
    • 交叉滞后结构方程模型
    • 具有固定效应的交叉滞后面板模型
  • 现有面板模型存在的问题
    • 对时间滞后项的正确设定非常敏感
      • 滞后一阶差分模型存在高度的误导性估计
  • 严格外生性假设下的面板模型
    • 假设一个大n小t的微观面板模型,采用POLS模型估计x对y的影响
    • 该模型将y_it映射为时变变量x_it、非时变变量Z_i、及独立同分布误差项ε_it的可加性线性函数(additive linear function)
      • 如果误差项是同时性外生的(contemporaneously exogenous),即与自变量不存在同期相关,那么可以得到自变量的无偏和一致估计
      • POLS模型只有在充分捕捉到同时影响x和y的所有变量时才有效
    • 将该模型的误差项分解为单元指定项(unit-specific part)α_i和异质项(idiosyncratic part)ε_it,得到包含两个误差来源的模型
    • 为了处理单元指定项,目前主要方法有两种
      • 固定效应模型:允许单元指定误差项与自变量相关,并通过估计单元指定常数项,或在x和y中提取单元指定均值,消除单元之间的异质性
        • 由于单元指定误差项刻画所有非时变的异质性,因此不受单元指定混淆变量的不受控制的影响
        • 对于固定效应模型,方程不包含非时变变量:
      • 随机效应模型:也包含单元指定误差项α_i,但预设其与自变量不想干,并被当作一个随机变量服从一定的概率分布
        • 与固定效应相比,随机效应模型可以为非时变变量提供估计,但代价是要求有关非时变未观测异质性提供附加的外生性假设
      • 固定效应模型和随机效应模型都有关于未观测异质性的严格外生性预设
    • 如果存在反向因果关系,固定效应和随机效应模型的严格外生性预设必然被违背
      • 严格外生性意味着:ε_it现在的取值不能与x_it过去、现在、未来的取值相关
      • 若y_it影响x_it+1,且反向因果关系成立,那么ε_it必然与x_it+1相关
      • 违背严格外生性假设,固定效应和随机效应模型估计结果必然存在偏差
  • 处理严格外生性预设违背的面板模型
    • 自变量滞后期模型:在模型中加入x的滞后期而非当期
      • 认为当因果关系为逆向时,ε_it与x_it+1相关,但ε_it-1未必相关
      • 仅在固定效应和随机效应中加入自变量的滞后项无法解决内生性问题
    • 放松严格外生性预设的面板模型:滞后项一阶差分模型(LFD)
      • 一阶差分模型
      • 一阶差分模型差分掉α_i,因而不需要关于α_i的外生性假设,但要求序列外生性假设
      • 一阶差分模型建立在比固定效应模型更弱的外生性假设
        • 一阶差分模型只使用前一期数据进行差分
        • 固定效应模型使用全部数据来去均值
      • 建立滞后项一阶差分模型
      • 与固定效应和随机效应模型相比,滞后项一阶差分模型可以:
        • 防止不可观测非时变异质性引起的偏差
          • 通过取一阶差分,消除单元指定误差项α_i
        • 防止反向因果关系引起的偏差
          • 允许x与未来ε相关来允许x对y的因果反馈
      • 滞后项一阶差分模型对因果效应时间非常敏感,其依赖于关键预设
        • 两个时间点(two points in time)之间的y的变化,确实是前置两个时间点(two preceding points in time)之间x的指定差分(specified difference)的函数
        • 若x对y的影响是同时期而非滞后,滞后项一阶差分模型将大大低估真正的因果效应,并可能得到相反方向的估计结果
        • 滞后项一阶差分模型是否恰当,关键取决于面板数据中的滞后项是否与所研究过程中的现实因果滞后项相匹配,这种模型设定错误风险说明需要精确的理论,来描述关于实际滞后结构的因果过程
    • 同时考虑严格和序列外生的动态面板模型
      • 以往滞后因变量的动态面板模型(LDV)
        • 通过将因变量的滞后项纳入模型来刻画x与y之间随时间推移而产生的相互作用
        • 但这种模型可能存在特定误差项ε_it与滞后因变量之间的相关性,从而违反严格外生性假设
        • 偏差在大N小T数据中,比大T面板数据(t>10),更严重
      • AB模型(Arellano & Bond,1991):结合滞后项因变量和差分模型
        • 首先采取差分法,消除非时变的异质性
        • 然后把y_it-2作为Δy_it-1的工具变量,通过广义矩估计进行计算
        • 原始版AB方法推荐使用LDV的所有先前因变量(y_it-22、y_it-3……)作为工具变量
        • 拓展版AB方法强调使用LDV的所有先前因变量的差分取值(Δy_it-22、Δy_it-3……)作为工具变量
        • 原始版和拓展版都允许区分严格外生变量和序列外生变量(即前定变量predetermined)
          • 严格外生百年来不允许与异质性误差项的过去、现在和未来取值相关
          • 序列外生变量不允许与异质性误差项的当前取值相关
        • AB方法在计量经济学中得到广泛应用,但存在一定局限:
          • 存在大量的矩估计和弱工具变量问题
          • 存在已知的低估偏误,由此削弱因果推断
          • 在有限样本条件下性能较差,需要大量的样本单元(大N)
      • 带有固定效应的交叉滞后面板模型,即MB方法(Moral-Benito,2013)
        • 在结构方程模型框架下进行最大似然估计,因此称为ML—SEM方法
        • 以4期数据为例
        • ML—SEM的预设
          • 异质性误差项ε_it允许与解释变量的未来取值相关
          • 为了方便,图中省略了前定变量x和y与任何先前时间点的误差项之间的相关性
          • 不允许异质性误差项ε_it之间存在序列相关性
        • ML—SEM的特点
          • 可以估计非时变可观测变量,而非像FE和FD那样仅仅控制
          • 在无偏性和有效性方面优于AB方法
        • ML—SEM的局限
          • 尚未考虑对时间滞后项正确设定的敏感性
          • x对y同时存在当期效应恶化滞后效应时,可能存在偏误
          • 个体在不同时期要有足够的异质性
          • 至少存在三期以上的数据
          • 当异质性误差项存在序列相关时,可能造成有偏估计