Linear Regression的惊人有效性
万物皆可回归
万物皆可回归
这里我们假设:i为组别号,Y1i is the dealed group i , τ=Y1i−Y0i means the individual treatment effect, and we can knowYi,the result of grouo is:
Yi=Y0i+Ti(τ)因此,目前让我们聚焦于估算平均因果效应这一更简单的任务。基于此,我们既承认不同个体对处理的反应存在差异,也接受无法具体识别哪些个体反应更佳的事实。相反,我们将仅试图从平均意义上验证处理是否有效。
ATE=E[Y1−Y0]注意区分,ate和这个E[Y∣T=1]−E[Y∣T=0]是不一样的。ate指的是同一组的结果差异,因此可以直接相减,而后者并非。后者minus bias才是ate
现在,是时候来看看我们如何用 因果推断的主力工具——线性回归(Linear Regression) 来完成这一切了!可以这样想:如果说简单地比较处理组与对照组的均值是饭后的一颗苹果,那么线性回归就是一份冰凉柔滑的提拉米苏。又或者,如果前者是一片陈旧单调的白面包片,那么线性回归就是一块外壳酥脆、内部松软、由查德·罗伯逊亲手烘焙的乡村酸面包。

回归理论
我并不打算深入探讨线性回归的构建与估计方法。不过,少许理论基础将极大地有助于解释其在因果推断中的强大作用。首先,回归解决的是一个理论上的最佳线性预测问题。设 β∗ 为参数向量:
β∗=βargmin,E[(Yi−Xi′β)2] 线性回归寻找能够最小化均方误差(MSE)的参数。
若对其求导并设为零,你会发现该问题的线性解由下式给出: β∗=E[Xi′Xi]−1E[Xi′Yi] 我们可以用样本的形式来估计这个 beta 值,即: β^=(X′X)−1X′Y
证明beta估计式
对于多元线性回归模型: y=Xβ+ε 其中:
- y 是 n×1 的因变量向量,
- X 是 n×p 的设计矩阵(每一行是一个样本,每一列是一个特征,通常第一列是全 1 表示截距项),
- β 是 p×1的回归系数,
- ε是误差项。 我们希望通过观测数据找到最优的 β^\hat{\beta}β^,使得残差平方和(RSS)最小: RSS(β)=∥y−Xβ∥2=(y−Xβ)T(y−Xβ)RSS(β)=∥y−Xβ∥2=(y−Xβ)T(y−Xβ)
对 β\betaβ 求梯度并令其为零:
∂RSS∂β=−2XT(y−Xβ)=0∂β∂RSS=−2XT(y−Xβ)=0∂β∂RSS=−2XT(y−Xβ)=0
化简得到正规方程: XTXβ=XTy 如果矩阵XTX可逆(满秩),则解为:
β^=(XTX)−1XTy
这就是最小二乘估计(OLS)的解析解。regress 函数正是直接实现了这个公式。
上述公式相当通用。然而,仅研究单一回归变量的情形颇具价值。在因果推断中,我们常需估计变量 对结果 的因果影响。因此,我们采用仅含该变量的回归模型来估算这一效应。即便模型中纳入其他变量,这些变量通常仅起辅助作用。添加其他变量有助于我们估计处理的因果效应,但我们对其参数估计并无太大兴趣。
在仅有一个回归变量 T的情况下,与之相关的参数将由 β^1=Var(x)Cov(x,y)
推导过程
第一步:对 β^0 求偏导(找截距)
∂β^0∂S=−2∑i=1n(yi−β^0−β^1xi)=0 化简后得到: ∑yi=nβ^0+β^1∑xi 两边同时除以 n,得到: yˉ=β^0+β^1xˉ⟹β^0=yˉ−β^1xˉ 这说明:回归直线一定经过数据点的重心 (xˉ,yˉ)。
第二步:对 β^1 求偏导(找斜率)
将第一步求得的 β^0 代入函数,或者直接对 β^1 求偏导: ∂β^1∂S=−2∑i=1nxi(yi−β^0−β^1xi)=0 把 β^0=yˉ−β^1xˉ 代入进去,经过代数整理,你会得到: β^1=∑(xi−xˉ)2∑(xi−xˉ)(yi−yˉ) 花间过程用离均差法
多元模型
万物皆可回归
这里我们假设:i为组别号,Y1i is the dealed group i , τ=Y1i−Y0i means the individual treatment effect, and we can knowYi,the result of grouo is:
Yi=Y0i+Ti(τ)因此,目前让我们聚焦于估算平均因果效应这一更简单的任务。基于此,我们既承认不同个体对处理的反应存在差异,也接受无法具体识别哪些个体反应更佳的事实。相反,我们将仅试图从平均意义上验证处理是否有效。
ATE=E[Y1−Y0]注意区分,ate和这个E[Y∣T=1]−E[Y∣T=0]是不一样的。ate指的是同一组的结果差异,因此可以直接相减,而后者并非。后者minus bias才是ate
现在,是时候来看看我们如何用 因果推断的主力工具——线性回归(Linear Regression) 来完成这一切了!可以这样想:如果说简单地比较处理组与对照组的均值是饭后的一颗苹果,那么线性回归就是一份冰凉柔滑的提拉米苏。又或者,如果前者是一片陈旧单调的白面包片,那么线性回归就是一块外壳酥脆、内部松软、由查德·罗伯逊亲手烘焙的乡村酸面包。

回归理论
我并不打算深入探讨线性回归的构建与估计方法。不过,少许理论基础将极大地有助于解释其在因果推断中的强大作用。首先,回归解决的是一个理论上的最佳线性预测问题。设 β∗ 为参数向量:
β∗=βargmin,E[(Yi−Xi′β)2] 线性回归寻找能够最小化均方误差(MSE)的参数。
若对其求导并设为零,你会发现该问题的线性解由下式给出: β∗=E[Xi′Xi]−1E[Xi′Yi] 我们可以用样本的形式来估计这个 beta 值,即: β^=(X′X)−1X′Y
证明beta估计式
对于多元线性回归模型: y=Xβ+ε 其中:
- y 是 n×1 的因变量向量,
- X 是 n×p 的设计矩阵(每一行是一个样本,每一列是一个特征,通常第一列是全 1 表示截距项),
- β 是 p×1的回归系数,
- ε是误差项。 我们希望通过观测数据找到最优的 β^\hat{\beta}β^,使得残差平方和(RSS)最小: RSS(β)=∥y−Xβ∥2=(y−Xβ)T(y−Xβ)RSS(β)=∥y−Xβ∥2=(y−Xβ)T(y−Xβ)
对 β\betaβ 求梯度并令其为零:
∂RSS∂β=−2XT(y−Xβ)=0∂β∂RSS=−2XT(y−Xβ)=0∂β∂RSS=−2XT(y−Xβ)=0
化简得到正规方程: XTXβ=XTy 如果矩阵XTX可逆(满秩),则解为:
β^=(XTX)−1XTy
这就是最小二乘估计(OLS)的解析解。regress 函数正是直接实现了这个公式。
上述公式相当通用。然而,仅研究单一回归变量的情形颇具价值。在因果推断中,我们常需估计变量 对结果 的因果影响。因此,我们采用仅含该变量的回归模型来估算这一效应。即便模型中纳入其他变量,这些变量通常仅起辅助作用。添加其他变量有助于我们估计处理的因果效应,但我们对其参数估计并无太大兴趣。
在仅有一个回归变量 T的情况下,与之相关的参数将由 β^1=Var(x)Cov(x,y)
推导过程
第一步:对 β^0 求偏导(找截距)
∂β^0∂S=−2∑i=1n(yi−β^0−β^1xi)=0 化简后得到: ∑yi=nβ^0+β^1∑xi 两边同时除以 n,得到: yˉ=β^0+β^1xˉ⟹β^0=yˉ−β^1xˉ 这说明:回归直线一定经过数据点的重心 (xˉ,yˉ)。
第二步:对 β^1 求偏导(找斜率)
将第一步求得的 β^0 代入函数,或者直接对 β^1 求偏导: ∂β^1∂S=−2∑i=1nxi(yi−β^0−β^1xi)=0 把 β^0=yˉ−β^1xˉ 代入进去,经过代数整理,你会得到: β^1=∑(xi−xˉ)2∑(xi−xˉ)(yi−yˉ) 花间过程用离均差法