-
百PB规模日志业务挑战及应对
- CLS项目概况:CLS(Cloud Log Service)是腾讯云的一站式日志服务平台,支持数据采集、检索分析、数据清洗、可视化告警等一体化服务,核心能力为海量日志检索与分析,业务规模年增长超100%,总规模超过百PB。
- 挑战与应对:
- 检索能力:CLS时序搜索引擎性能比主流搜索引擎ES提升38倍,入选VLDB2022。
- 分析能力:通过双引擎技术架构、统一计算架构等优化,分析能力从2000万/分钟提升至500亿+/分钟,超越主流大数据分析引擎。
- 成本能力:通过技术优化,单位成本累计下降90%,连续三年获得腾讯云成本优化排行榜第一名。
-
统一资源池重塑云服务规模红利
- 核心观点:CLS降本增效是传统软件改造为云服务过程中释放规模红利的结果,通过统一资源池实现算力资源和IO资源的全局流通。
- IO资源池优化:
- 存算分离:基于对象存储实现存算分离,成本降低至原生ES的10%。
- IO并行化:独家实现对象存储上热数据搜索分析能力。
- 算力资源池优化:
- 联邦分析:通过联邦计算提升分析能力10倍+,解决超大规模分析问题。
- 全局负载均衡:支持轻状态计算迁移,实现地域级全局负载均衡。
- 抢占式分析:优先保障分析时效,进一步优化算力。
- 技术路线讨论:
- 统一资源池VS超大规模集群:统一资源池通过小集群大联邦实现资源共享,但超大规模集群存在故障半径大、恢复时间长等问题。
- 统一资源池VS弹性扩缩容:统一资源池贴近业务需求,挖掘规模红利;弹性扩缩容门槛低但无法利用业务特性。
- 统一资源池+弹性扩缩容:降低扩容必要性,提升扩容效率。
-
方法论:数据驱动·理论模型优化法
- 核心观点:通过数据驱动和理论模型优化探索优化理论边界,CLS连续实现10倍级优化。
- 案例分析:
- 识别主流搜索引擎百倍级性能缺陷:通过理论模型推导发现ES性能缺陷,提出时序搜索引擎,性能提升数十倍。
- 揭示“磁盘型KV必慢于内存型KV”之谬误:理论模型推导磁盘型KV和内存型KV响应速度无实质差别,实现比内存KV更快的磁盘KV。
- 定义优化理论边界:通过理论模型预估优化空间,进一步优化IP地址解析服务,性能提升4倍。
- 数据驱动与理论模型优化:通过数据驱动探索理论最优解,避免思维定式和局部最优解。
- 探索云日志服务各业务领域的理论最优解:持续优化业务场景,实现性能和成本的提升。