您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [世界银行]:融合数据源衡量多维贫困 - 发现报告

融合数据源衡量多维贫困

金融 2026-07-01 世界银行 娱乐而已
报告封面

政策研究工作文件 融合数据源以衡量多维贫困 本·J·布伦克霍斯特 明·C·阮 尼尚·约赞海-安·当 克里斯托夫·拉克纳 政策研究工作文件 11424 摘要 多维贫困指标比货币贫困指标能更全面地反映贫困状况,但其应用受限于数据获取的困难。通常,在同一个调查中,多维贫困衡量标准中的所有维度并不都会被观测到,这导致一些国家被排除在全球衡量标准之外。本研究介绍了一种新的数据融合方法,通过整合多个数据源的综合统计数据来估算多维贫困指标。该方法通过模拟571份家庭调查中典型的缺失数据场景进行验证。 为估计世界银行的多维贫困度量,研究涵盖了112个国家(1989-2024年)。融合方法能够准确预测这些情景下的各种多维贫困指标,即使在存在模拟样本偏差(反映调查设计差异)的情况下也是如此。该方法支持对更多国家进行多维贫困估计,填补时间序列数据空白,并将此前无法纳入全球多维贫困度量的指标和维度纳入其中。 政策研究工作论文系列旨在发布研究进展成果,以促进关于发展问题的思想交流。该系列的一个目标是尽快发布研究成果,即使呈现的内容尚未完全完善。论文会注明作者姓名,并应按此引用。本文表达的观点、解释和结论完全由作者本人负责。这些观点不一定代表国际复兴开发银行/世界银行及其附属机构的观点,也不一定代表世界银行的执行董事或他们所代表政府的观点。 融合数据源以衡量多维贫困 本·J·布伦克霍斯特,明·C·阮,尼尚特·约桑当·海安,洛克纳·克劳斯菲尔德 1 关键词:福利衡量,多维贫困,缺失数据,数据融合,条件独立性,联合分布 JELcodes:I32, C81, C82, C13 1 简介 贫困是多维度的,不仅包括人们所拥有的东西——无论是货币形式还是非货币形式(Stiglitz、Sen和Fitoussi,2009年)——也包括他们获取基本能力水平的能力(Sen,1976年,1993年)。然而,在实践中,贫困主要被衡量为收入或消费的缺乏,这为穷人描绘了一幅不完整的图景。多维贫困衡量标准考虑了多个维度上的剥夺情况,例如健康、教育和基本基础设施的获取情况,以及这些剥夺是如何相互重叠的(Bourguignon和Chakravarty,2003年;Alkire等人,2015年;世界银行,2018年)。 然而,尽管多维贫困度量在概念上具有优势,但由于数据限制,其实际应用仍然有限。与可以从收入或消费的横截面数据构建的货币贫困不同,多维度量要求在同一家庭中同时观测多个货币和非货币指标。现实中,这一数据需求在不同国家和时间上往往无法得到持续满足。例如,世界银行2023年的多维贫困度量(MPM)仅覆盖了全球人口的 two-thirds,而世界银行的货币贫困度量则覆盖了超过85%的人口(Lara Ibarra 等人,2026年,世界银行,2026年)。2 然而,当分别考虑MPM中的每个指标(维度)时,有四分之五的全球人口的信息可用。覆盖范围的大部分差异可以用这些指标并非在同一项调查中联合测量来解释。MPM可用数据也偏向于富裕国家。由于数据可用性有限,现有的全球多维贫困度量仅覆盖了有限数量的国家,且在时间和任何给定国家的维度内部都存在数据缺口。3 这些模式凸显了影响多维贫困测量的核心挑战并非数据本身的缺失,而是指标在数据源中的碎片化。本文采用链式法则,将分别存在于不同、部分重叠数据集中的指标进行组合。为此,我们假设不同数据源之间条件独立,并推导出联合概率的理论界限,以量化该假设引入的不确定性。关键在于,即使两个变量分别在不同调查中收集,只要至少一个变量同时出现在两个调查中,其未观测到的联合分布也能被部分恢复。这些条件变量可能是多维贫困指标的一部分(例如,在两个调查中可能部分观察到获取多种基本服务的剥夺情况),也可能是无关变量,如人口统计信息或 居住地。通过分析世界银行家户(消费或收入)调查数据库中来自100多个国家的近600份调查,我们表明所提出的方法能够合理地恢复多维贫困的真实估计。尽管我们的方法只能处理分类指标(即个人是否处于剥夺状态,或分类严重程度而非持续的剥夺深度),但这一局限性并非主要约束,因为大多数现有的多维衡量指标仅由二元指标组成。 关于调查间插补存在大量相关文献,这些研究在一个数据集上估计模型,然后将未观测变量预测到另一个数据集中。这些研究使用预测回归模型(Christiaensen等人,2012年;Roy和van der Weide,2025年;Dang等人,2026年)、最近邻插补和多重插补(Si等人,2023年;Xia、Zhang和Fuller,2025年)、机器学习(Blumenstock、Cadamuro和On,2015年;Verme,2025年)、变量链接(Meyer和Mittag,2019年;Zheng等人,2025年;Jhamb等人,2025年),或一系列其他统计数据融合技术(Ummel等人,2024年)。相比之下,我们的方法不需要访问微观家庭调查数据。它使用可以从多个数据源推导出的、可建模甚至可来自报告的汇总级统计数据,在国家或人口群体层面估计多维福利指标。因此,与其他插补和模拟方法相比,我们的方法数据密集度较低,使其适用于数据受限和全球监测环境。 我们的论文与 Decerf, Ferrando, & Menyhert (2025) (DFM) 的研究最为密切相关的,后者同样受到不同维度的数据在不同调查中分别观测所带来挑战的启发。这两种方法都聚焦于总体或人口层面的估计,而非针对特定家庭的精准定位。然而,这两篇论文在几个方面存在差异。最重要的是,DFM 提出通过假设未观测维度依赖关系的固定值来估计多维贫困。他们的结果表明,即使关于依赖关系的假设不正确,其表现也比单一调查指标或“混合”指数(后者将每个调查的部分数据简单组合而不考虑依赖关系)更好。他们发现,仅仅假设在不同调查中收集的两个维度是独立的,在其验证数据(包括六个国家的数据以及各种情景的模拟数据)中表现几乎最优。最后,DFM 考虑了与深度敏感相关的贫困指数,而我们仅考虑分类式的剥夺。 与DFM相比,我们的方法基于条件独立性来预测联合分布,以估计多维贫困。这利用了这样一个事实:在不同调查中观察到的维度之间的未观察到的依赖关系可以通过对共同变量进行条件化来部分恢复。此外,我们的方法可以应用于更一般的数据场景(即,来自任意数量数据源的任意数量指标),以估计不同类型的多维指标,并使用人群组水平数据而不是家庭水平的微观数据,从而进一步克服数据限制。 我们的研究表明,概率数据融合即使在关于跨指标依赖的保守假设下,也能从独立的 household surveys 中恢复准确且校准良好的多维贫困估计。在各种验证场景中,随着数据源共享更多共同指标,准确率会系统地提高,这突显了 重叠信息在识别中的核心作用。当指标的重叠有限时,未校正的融合表现出系统性的方向偏差和宽泛的不确定性区间,但基于中位数的简单偏差校正能显著降低误差和区间宽度,且不放松依赖性假设。这些结果表明,在数据稀疏融合场景下,大部分表面上的不确定性反映了可校正的偏差,而非不可消除的信息缺失。 研究发现,融合方式与所使用的数据源同样重要。在更细的子群体人口层面——特别是福利五等分——进行融合,能够持续提高国家级的准确性,因为它提供了更多关于贫困依赖结构的信息。综合来看,这些结果为在多维贫困监测中实施数据融合提供了实践指导:指标间的重叠、子群体层面的融合以及本地化偏差校正共同实现了可靠的推断。最后,在相同的数据情景和条件独立性假设下,融合估计的准确性对多维指标的选择敏感。例如,与构建“任何”或“所有”维度指标相比,从预测的联合分布中构建一个调整后的户计数指标,能够显著限制融合方法引入的偏差。 本文重点在于发展和验证该方法论,而将现有多维测度改进的应用留待未来研究。总之,我们的方法论提供了三种不同方式来实证改进此类多维测度:(i) 扩展国家-年份观测集合,因为多维贫困可以对缺少部分指标或维度的调查进行估计。(ii) 允许纳入核心数据中缺失的额外维度,例如世界银行测度所排除的健康剥夺。(iii) 提高填补多维福利指标时间序列缺口的能力,从而大幅扩展有效国家-年份观测集合,并实现最新家庭调查之外的即时预测。由于低收入和低收入中等收入国家很少进行年度调查,且通常存在调查滞后发布的情况,MPM覆盖范围有限,近年来几乎缺失。我们的概率融合方法可用于插值和外推多维贫困测度。特别是,我们的方法可以将经过缺口填补的汇总剥夺率(例如,使用行政记录数据外推受教育程度)与从具有可用微观数据年份的子集剥夺关系中所提取的条件概率相结合。 以下内容中,第二部分介绍了研究方法,第三部分详细阐述了数据与验证流程,包括一种偏差校正方法,第四部分说明了融合方法与验证流程。第五部分呈现了验证结果。第六部分为结论,并讨论了未来研究的潜在方向。 2 方法 本节介绍了所提出的数据融合方法及基础概率理论。在2.1节中,我们回顾了链式法则和条件独立性假设,这些是当指标来自不同数据源时计算联合剥夺率的必要条件。在2.2节中,我们回顾了当依赖结构无法完全观测时,联合概率分布的理论界限。2.3节介绍了数据融合算法,该算法应用2.1节和2.2节的定理来预测任意数量数据源中任意指标集合的联合概率分布。该算法使用所有观测到的指标依赖关系,并假设条件独立性。2.4节解释了从联合概率分布构建多维贫困指标的方法。2.5节描述了在融合数据源时,多维指标的理论界限计算方法。 2.1 利用链式法则分解联合概率 多维贫困率,即同时缺乏两个指标X1和X2的家庭比例,可以表示为联合概率P(X1, X2)。该联合概率可以使用链式法则表示为条件概率的乘积: 该链式规则分解是许多模型(例如贝叶斯网络)的基础,通常用于将复杂的联合概率分解为更简单的部分。三个指标的联合概率也可以类似地分解为: 请注意,上述条件概率的顺序并不重要。我们同样可以计算三个指标联合概率,如下: 计算多维贫困指标(如MPM)或更正式地说,使用链式法则计算任意指标组合的联合概率,需要了解该表达式中的所有条件概率。在实践中,只有当所有指标在同一调查中对相同家庭或个人进行测量时,这些条件概率才是已知的。当指标在同一调查中不可用时,需要关于指标之间(条件)依赖关系的假设,才能估计它们的联合概率。 假设X和X₁₃仅从两个不同的(全国代表性)调查中获取,这两个调查都收集了关于X的信息。如果我们假设X在给定X₂₁₂的条件下与X₃条件独立,即 | | ( ) ( ) P X X ,X = P X X , 3 1 2 3 2 ,那么这三个指标联合概率可以表示为: 此处,条件独立性意味着,在X2被剥夺的人群中,X被剥夺的概率与是否在X3上被剥夺无关。 当联合分布的完整信息不可用时,我们提出可以合理地假设一定程度的条件独立性来估计多维贫困。经济理论和实证证据表明,贫困的各个维度往往相互关联或受共同潜在因素的影响(例如,参见Alkire & Santos, 2013;Seth & Santos, 2019)。Stojkoski等人(2025)指出,多维贫困网络的结构的跨国相似性以及随时间的稳定性。因此,在合理的精度范围内,当仅知道指标之间部分条件概率且未观察到完整的依赖结构时,有可能恢复剥夺的联合分布。此外,假设条件独立性引入的偏差是系统性的,因此可以用经验数据建模,并有可能进行纠正(参见第3节)。 2.2 计算联合概率的理论界限 在没有先前信息的情况下,假设条件独立性是估计联合概率分布的一个合理起点。这是在假设剥夺之间最小和最大重叠之间的一种折中方法。然而,了解这些极端情况的范围有助于判断何时可以接受地应用融合方法,以及如何解释结果。 联合概率 (P(X₁, X₂)) 的界限由弗雷歇-霍夫丁 (Fréchet-Hoeffding, FH) 不等式给出(例如参见 Ridder 和 Moffit (2007) 以及 Fan 和 Patton (2014) 的研究)。这些界限刻画了所有与 给定边缘分布相一致的联