去哪儿旅行混合云容器稳定性治理实践总结
一、背景与目标
去哪儿旅行为应对业务复苏后的服务器资源短缺及私有云资源弹性能力差等问题,采用混合云策略以实现降本增效。混合云目标包括:
- 降本:IDC 资源利用率从20%提升至40%-60%,释放本地存储成本。
- 增效:业务自动弹性扩缩容,业务高峰无需人工扩容,稳定性达99.995%。
混合云策略包括业务优先IDC部署,超阈值自动弹公有云,存储上云及冷数据上云。
二、混合云场景下的容器稳定性挑战
混合云环境下,容器稳定性面临多维度挑战:
- 业务视角:关注上公有云价值、应用影响及平滑弹缩。
- 平台视角:需保障公有云应用整体SLA,提供与私有云同等服务体验。
- 具体挑战:可靠性、平滑上云、故障应急链路耗时、体验一致性、平台功能泛化、资源容量、实例交付效率、系统瓶颈、容灾能力等。
三、治理思路
分阶段实施容器稳定性治理:
- 阶段一(低峰期):充分验证公有云观测指标、根因分析与预案推荐、一键快速下云。
- 阶段二:灰度并全量P3、P4应用,然后全量。
- 阶段三:灰度并全量P1、P2应用。
治理思路包括:
- 可靠性保障:公有云可用区failover、私有云应用级多机房failover。
- 系统瓶颈治理:压测评估系统容量、业务流量预测、缩减发布批次、系统优化(应用授权、高配pod减少实例数)。
- 平台功能泛化:增强容器的自助运维能力(重启、debug、流量摘除、重建等),提升一致性体验。
四、治理实践
1. 可靠性保障
- 平滑上云:制定应用上云流程、容器上云流程,分阶段验证。
- 故障应急:
- 完善公有云观测指标,实现秒级监控、分钟级定位与恢复。
- 根因分析准确率达70%,提供预案推荐。
- 容灾能力:私有云应用跨机房部署,公有云AZ可用性巡检与failover。
2. 系统瓶颈治理
- 链路延时影响评估:公有云到私有云延时0.7~1ms,500+ P1/P2应用可上云。
- 资源容量评估:结合业务流量预测(五一经验压测流量2-4倍),调整业务与性能指标。
- 资源交付效率提升:
- 优化启动速度(spring并行初始化效果不大,tomcat秒级初始化)。
- 优化发布时长:高配pod减少实例数,发布时长降低70%,节省20%资源。
- 发布策略支持先缩后扩。
3. 平台功能泛化
- 常用功能支持:容器原地重启、批量重启、远程在线debug、发布终止后不接流量、自助缩容(优先缩公有云实例)。
- 具体实践:
- 容器原地重启:使用OpenKruise ContainerRecreateRequest,定期清理保留pod。
- 远程debug:依赖原地重启功能,保障配置变更持久化。
- 发布终止不接流量:通过vk并发更新annotation/label解决并发覆盖问题。
- 缩容:优先缩公有云实例,利用k8s RS或OpenKruise CloneSet方案。
五、未来规划
- 跨云能力完善:中间件、DB、Redis、监控系统等架构完善,确认上云能力。
- 跨云容灾:实现公有云与私有云互备,机房级别容灾。
- 容器调度优化:支持用户自助上云、下云操作。
- 稳定性目标提升:
- 通过AIGC提升根因分析准确率。
- 提升预案推荐覆盖率和准确率。
- 部分场景自愈。
六、核心观点与结论
去哪儿旅行的混合云容器稳定性治理实践通过分阶段实施、系统性瓶颈治理和平台功能泛化,有效提升了容器稳定性与运维效率。未来将持续完善跨云能力与智能化运维,以实现更高水平的稳定性目标。