微众银行大数据平台套件与StarRocks应用实践
背景与痛点
当前行内业务方存在用户画像、人群圈选、BI交互看板、用户行为分析等大数据量场景的分析需求。现有计算引擎在处理这些场景时存在以下痛点:
- BI交互看板在大数据量下计算速度缓慢;
- 对较长历史周期的用户行为数据分析效率低下;
- 运营分析中查询频次较高的热数据无法使用预聚合提速;
- 查询无法同时满足高灵活性、大数据量、多维度、高时效性等多样化要求。
由于现有引擎无法满足大数据量级下秒级响应速度和数据时效性要求,需引入高性能OLAP计算引擎StarRocks填补空白。
StarRocks引擎引入计划
为什么选择StarRocks:
- StarRocks在数据存储、湖仓一体化建设和运维功能方面更贴近行内使用场景,提供更丰富的OLAP能力,提升开发和运维效率;
- 行内用户主要使用场景为查询HIVE外表,切换至StarRocks对日常查数效率有显著提升,且支持主流JDBC协议,用户语法切换难度小。
StarRocks集群架构设计:
- 实现同城跨IDC高可用:支持不同IDC内的BE节点配置tag,数据副本均衡分布;
- 集群稳定性:通过机架标签和资源隔离策略确保数据分布可靠性;
- 负载均衡:使用VIP/Nginx实现高可用;
- 集群管理与监控:使用Manager进行日常运维,Prometheus进行监控。
StarRocks在行内业务场景的落地
数据同步支持:
- 对接Exchangis(微众银行自研数据交换平台),支持多种数据源互导、跨集群导数、权限管理等;
- 支持StreamLoad方式写入内表,配置字段映射、压缩算法等。
大数据生态集成:
- Linkis:集成StarRocks数据源管理能力,支持JDBC方式使用;
- DSS Scriptis:支持SQL语句编辑、脚本开发、工作空间管理、UDF函数管理;
- Copilot:提供自然语言辅助编程、作业故障优化、SQL语法转换、指标预定义功能;
- DSS工作流:支持StarRocks相关数据开发,支持网状顺序执行、版本管理、多人协同编辑。
未来规划方向与展望
- 完善StarRocks在行内大数据生态的应用:
- 接入数据质量管理服务Qualitis,支持数据质量检视;
- 接入元数据中间件DataShapis,支持元数据管理和关联分析;
- 行内推广使用,覆盖更多场景如风险控制、客户画像等。
- 部署架构演进:
- 推进容器化部署,降低运维成本;
- 采用云原生部署方式,实现动态扩缩容和资源最大化使用。
关键数据:
- WeDataSphere累计试用中/上生产公司达700+家,社区用户总数达5000+人;
- 用户覆盖电信、金融、互联网、制造、零售、教育等各行各业;
- 政府用户案例含深圳市金融局&银监局、交通部信息中心、航天八院等。