个人介绍
章清云,中国移动浙江公司SRE负责人,致力于系统连续性保障,熟悉应用维护、稳定性提升、架构治理、灰度发布、流量回放等工作。
运维面临的挑战
- 架构复杂度呈指数级增长
- 云原生演进带来的易变性、不确定性、复杂性、模糊性
运维困局的本质
运维的困局不在于运维本身,而在于数字化时代对运维定位、文化理念、组织架构、协同机制、运营体系的挑战。
运维破局的关键点:SRE
- SRE是云原生演进破局的关键,是最靠近业务的价值引领点
- 拥有SRE的运维团队,定位转变为与开发相互赋能的平行组织
- 自我解放:端到端负责环境管理和连续性管理,士气高涨,自闭环,自演进
- 价值回归
SRE成熟度模型框架
架构设计
- SRE具备架构设计能力,从运维角度思考系统架构的合理性
入网控制
- 入网是生产系统病魔的开始,严格管控入网才能真正降低系统故障率
上线发布
生产突击
- 感知泛化
- 四层定界
- 1分钟发现,5分钟定位,10分钟恢复(1-5-10)
经验分享
- 大约70%的生产事故由部署变更触发(《SRE:Google运维解密》)
- 每一起严重事故背后有29次轻微事故和300起未遂先兆以及1000起事故隐患
SRE工程实践
灰度发布
- 可用区(AvailabilityZone):由一个或多个数据中心构成的逻辑单元,实现数据中心级故障隔离
- 完整的弹性沙箱平面,按需使用统一配置在线管理,灵活管理支持全渠道引流控制,精准及时全局的任务调度框架,有序管控自动的代码发布更新,便捷高效
流量回放测右移
- 云原生加速企业创新,驱动测试右移,提升交付质和效率
- 在生产环境中进行测试,确保产品稳定性和性能
- 从生产实时监控反馈,及时发现缺陷,提升软件实际可用性
- 建立由SRE主导的右移测试,本质是运维研发化转型的重要突破
混沌工程
- 不只是故障注入技术的应用,更考验团队在组织文化、架构能力、故障运营、风险控制等方面的能力
- 架构升维拉动运维转型,运维转型支撑架构升维
演练组织形式
- 实施人员:蓝军为SRE和各专业混编团队,红军为全体生产保障人员,领导组成司令部进行风险管控及决策
- 实施窗口:重大变更窗口、普通变更窗口
- 双向评价标准:
- 红军得分:按实际演练期间故障处理情况,单项满足得100
- 蓝军附加得分:根据实际演练发现的架构问题,评估风险级别
- 评分细则:
- V3分钟内故障感知:10分
- V8分钟内故障定位:50分
- V15分钟内故障恢复:100分
- VF5风险及以下:10分
- Score【红军】=100,则红军胜;Score【红军】<100,则蓝军胜;Score【红军】=100且Score【蓝军】>0,则双赢;Score【红军】<100且Score【蓝军】<0,则双输
- VF4风险:50分
- F3风险及以上:100分
- 若蓝军洁场失败引发故障,为-100
思考
- 故障抢修模式的演进,“1-1-1”
- SRE的泛化程度,如应用安全、研发(代码类)等
- 大模型在运维领域的作用
- Gdevops
- 全球敏捷运维峰会