腾讯公网网关极端场景可用性挑战与应对策略
腾讯公网网关(TGW)介绍
TGW是腾讯自研的IaaS平台,承担公司自研及腾讯云IDC机房外网出口、负载均衡等功能,其产品包括EIP和CLB。TGW整体架构分为转发平面和管控平面:
- 转发平面:负责数据流通道,核心功能包括转发、调度、健康探测、会话保持等。
- 管控平面:负责规则管理、运营系统、监控平台、调度系统、限速中心等。
现网极端场景案例
案例一:网卡批次BUG
- 问题描述:2019年某集群遭遇畸形包攻击,特定批次网卡bug导致设备hang住,整SET故障,持续46分钟。
- 解决方案:采用带外独立管理网、硬件异构(不同机型、厂商)确保单批次BUG不影响整集群。
案例二:特定包引发程序core
- 问题描述:2022年9月,带扩展头的IPv6报文触发程序core,所有扩容设备均受影响,故障持续50分钟。
- 解决方案:关闭复杂处理逻辑,提供有限服务能力,5分钟内恢复95%服务。
系统化应对极端场景
极端场景假设
极端场景分为硬件故障(制冷、电力、自然灾害等)和软件故障(数据不一致、逻辑bug、程序core等)。
故障感知
- 黑盒监控:模拟真实业务场景进行探测,确保未知异常能被及时发现。
- 监控巡检:定期检查监控有效性,避免告警屏蔽。
制定预案
- 硬件容灾:架构支持多层级容灾(单机、机架、交换机、AZ)。
- 软件预案:数据删除保护与恢复、服务降级、过载防护。
- 未知故障恢复:通过规则拷贝到buffer集群实现快速恢复。
演习验证
- 场景覆盖:模拟真实环境,覆盖所有故障场景。
- 人员覆盖:所有运维人员参与。
- 周期覆盖:定期自动化演练确保预案有效性。
总结
- 核心功能:转发是TGW最核心功能,极端场景主要围绕转发异常展开。
- 关键数据:案例一故障持续46分钟,案例二持续50分钟。
- 应对策略:通过硬件异构、服务降级、规则封禁、预案演练等系统性措施提升可用性。
- 研究结论:极端场景需未雨绸缪,结合监控、预案、演练三方面确保快速恢复。