核心观点与关键数据
数据管理复杂度正呈乘数增长,头部企业面临“看不清、管不住、治理难”的挑战。某头部互联网企业年均数据增长高达60%+,但稳定可用数据不足20%;某头部险企完成重点指标口径盘点高达6000人/日;某头部银行100层以上数据链路上千条。传统数据管理方式已无法应对,需引入更精细、更智能的数据管理手段。
数据管理新范式:主动数据治理
Gartner指出,数据管理正从管理数据内容转向聚焦元数据,主动元数据管理通过持续处理和分析元数据,深度刻画数据,并面向行动提供智能决策建议。BigMeta基于算子级血缘的主动数据治理平台,通过以下方式实现数据管理新范式:
- 算子级血缘:实现复杂数据链路的纤毫毕现,自动且持续地指标盘点及链路保障。
- 主动模型治理:基于算子级血缘实现模型问题自动发现及治理建议,通过多轮扩散发现相似资产,构建疑似问题链路的局部血缘图,生成整改优化方案。
案例实践:基于算子级血缘的指标链路治理
某金融机构数仓数据表规模已达数十万,数据质量问题频发。通过算子级血缘实现:
- 自动盘点:基于算子级血缘的字段口径自动抽取,字段口径跨层溯源,自动梳理指标体系。
- 精准保障:对消费场景进行业务视角的分类分级,沿着精细化血缘向上游进行标签扩散,形成“精细化”的业务基线,指导基线链路上的资产变更和保障工作。
- 影响面分析:用户可以使用标签辅助进行影响面分析,快速定位关注的业务场景或者等级。
研究结论
基于算子级血缘的主动数据治理平台能够有效解决数据管理复杂度激增的问题,实现指标链路和模型的自发现、自治理,提升数据管理效率和质量,降低数据风险和成本。