本文探讨了仅使用汇总数据作为协变量的基于模型的 household 级小区域贫困估计为何存在系统性偏差。分析表明,这种偏差源于模型无法捕捉福利在家庭之间的完整差异,因为它们仅依赖于地理级别的汇总数据。通过基于模型的模拟,本文表明这些模型中的偏差在模拟福利的实证变化与区域福利的真实实证方差最接近时最小化。这一发现也对单元级模型的偏差有影响。
本文假设的模型是基于嵌套误差模型的小区域估计,其中每个家庭福利的转换形式与一系列家庭特征线性相关。单元-上下文模型则将家庭福利建模为仅依赖于区域和子区域级别特征的线性函数。由于单元-上下文模型对数据的解释能力较差(R² 通常在 0.15 到 0.25 之间),它们无法充分捕捉家庭之间的福利差异,导致在区域福利的模拟变化与真实变化不一致的区域出现较大偏差。
模拟结果表明,单元-上下文模型在预测模型依赖变量的均值方面表现良好,但在预测原始未转换的等价收入或支出方面存在偏差。偏差的大小与模型模拟的福利总实证变化与每个区域的真实福利变化之间的匹配程度直接相关。在模拟变化与真实变化接近的区域,偏差最小;而在两者差异较大的区域,偏差较大。
研究结论表明,虽然单元-上下文模型在 household 级别普查数据不可用或过时的情况下具有实际优势,但它们在捕捉福利分布方面的固有局限性应予以重视。用户在解释那些模型模拟的福利变化与调查数据中观察到的福利实证方差差异较大的区域的贫困估计时应特别谨慎。未来研究可以探索改进单元-上下文模型中实证方差近似方法或开发诊断工具来识别这些模型最可能产生可靠估计的区域。