SuperSQL技术架构及未来展望
SuperSQL技术架构介绍
SuperSQL整体架构
SuperSQL依托腾讯大数据生态,旨在打造完整的大数据极速查询解决方案。其核心目标是:
- 持续完善自适应计算能力
- 实现三网合一的云原生化,减少大型复杂查询的等待痛点
- 构建高性能的融合分布式计算框架,实现引擎层的闭环统一管理
架构设计
SuperSQL采用计算解耦与计算融合的设计理念:
- 计算解耦:快速构建,复用开源计算引擎;轻量级解耦,减少侵入性修改;场景自适应,智能挑选主流执行引擎。
- 计算融合:支持跨源(不同类型/版本数据源)、跨引擎(多类分布式计算引擎)、跨DC(跨集群/地域的SQL编排)。
SuperSQL技术沙盘
SuperSQL自适应计算引擎
- SQL兼容:通过插件式解析模块支持多引擎,将SQL语法分为通用型和独特型,模板化管理,灵活切换。
- 计算引擎自适应:从人工到智能的实践,包括RBO、CBO、HBO和AI预测等引擎选择规则,并支持Failover机制。
新一代实时湖仓融合平台
- 传统实时湖仓一体架构:优点是增量读取,实时性好,稳定性高,但查询性能一般。
- 实时湖仓融合架构:数据实时性更高,接入简单,查询性能更优,但相较于Iceberg等湖格式,支持的能力欠缺。
- 实时/离线数据入仓:包括离线数据入仓和实时数据入仓及降冷。
- 自适应融合查询:通过自适应冷热导流分层,利用分析型存储的datalocality能力对实时热数据进行快速查询处理。
- 完全命中热数据:直接下推到底层系统。
- 部分命中热查询:通过Spark/Presto引擎联邦查询或下推到底层系统。
- 没有命中热数据:按正常流程处理。
- 查询优化:
- SR访问Iceberg性能优化:FE侧优化包括Collect CBO STATS、Join ReOrder、Partition Prune等;BE侧优化包括调度Fragment执行、Fragment MPP pipeline IcebergScanNode向量化实现。
- 引入alluxio缓存metadata:缓解跨集群访问HDFS带来的io开销,将metadata cache到alluxio。
性能测试报告
基于TPC-H标准数据集(100GB)的测试对比:
- SR内表查询性能分别是Presto查询Iceberg的4-65倍,是SR直接查Iceberg表的1-25倍。
- SuperSQL融合查询可提升业务性能约3倍。
未来展望
未来计划
- 完善SuperSQL自适应能力,向更智能迈进。
- 完善湖仓融合平台能力,支持更多数据湖能力。
- 优化计算平台查询数据湖的性能。
- 优化数据湖格式等。