技术故障的重要性及定义
- 海恩法则:强调事故的渐进性,每一起严重事故背后有29次轻微事故和300起未遂先兆及1000起事故隐患,事故可预防。
- 墨菲定律:任何可能出错的事情最终都会出错,错误具有必然性。
- 故障定义:ITIL中,故障是服务的意外中断或服务质量降低;问题(Problem)是故障原因,已知错误(Known Error)是主动整改措施。
- 问题与故障区分:故障影响用户或业务,需解决以恢复业务;问题需调查分析,制定变通和长期解决办法。
技术故障的全生命周期
- 故障前(未雨绸缪):通过混沌工程、代码审查、应急演练、自动巡检等发现并修复潜在问题。
- 故障中(分秒必争):通过监控手段发现故障,GOC高效协同响应,定位并止血。
- 故障后(亡羊补牢):通过5Why分析法深挖原因,利用技术故障数据洞察改进系统。
如何落地应急协同机制
- 应急“1-5-10”目标:定位、止血、恢复,快速响应。
- 标准先行:制定应急标准、定级标准、定责标准、复盘标准。
- 标准落地障碍及应对:推脱责任、故障不上报、复盘不认级别,需通过明确责任和流程解决。
- 工具平台核心功能:
- 故障前:预警系统、监控系统、容量管理、混沌工程。
- 故障后:5Why分析法、技术故障数据洞察。
小结及展望
- 核心观点:技术故障可预防,需通过全生命周期管理和应急协同机制降低影响。
- 关键数据:海恩法则量化事故渐进过程,应急目标“1-5-10”。
- 研究结论:通过标准流程、工具支撑和责任明确,可提升故障处理效率,增加MTBF(平均无故障时长)并缩短MTTR(平均故障修复时长)。
- 改进原则:面对责任推脱,需明确“雪崩时没有一篇雪花是无辜的”,改进最有效。
- 展望:借鉴扁鹊三兄弟的事前、事中、事后管理思路,持续优化故障管理。