线上质量的重要性
随着互联网和云计算的快速发展,全球出现服务器保有量过100W+台的大规模集群,但集群规模扩张也带来了运营质量挑战,如机器型号多样化、硬件平台迭代快、芯片集中度提升等,导致软件无法运行、部件故障率高、频繁宕机、性能不达标等问题。
线上质量问题的发现来源与根因分布
线上质量问题主要来源于生产质量、新品导入、灰度质量、DOA质量等环节,其中DOA(Dead On Arrival)定义为新到货设备一个月内故障数/自然月内交付机器数,目标是提前暴露并拦截问题。
线上质量体系的建立
建立跨团队的服务器质量工作协同机制,包括运营/交付、研发/固件、质量协同、平台建设、供应链等团队,从源治理和生产质量两方面提升线上质量。
从源治理
- 新品导入:制定测试用例基线、确定研发交付物、监控项评审、DVT评审等。
- 生产质量:看护整机和关键部件的质量指标,处理影响交付进度事件。
- DOA质量:目标是在交付阶段拦截故障,减少挂树交付后再发生质量问题。
过程管控
- 线上质量:监控故障率、质量问题、宕机率,开展重点质量专项优化。
- 故障率分析:监控整机和部件的故障率及换件率,深入分析超基线情况。
- 宕机率分析:对宕机根因进行三级分类(预期/非预期、硬件/软件、CPU/主板/内存等),利用日志分析、图像识别等技术自动判断。
线上质量运营体系
建立线上质量问题的处理流程与关键指标,包括故障率监控、质量问题管理、宕机率监控等,并针对GPU、AOC链路、液冷、DPU、固件等重点机型开展专项优化。
服务器关键部件的趋势
- GPU:快速迭代,NVIDIA新的GPU架构将加速到一年一次迭代,国内AI芯片厂商如华为昇腾910B等陆续推出有竞争力产品。
- 其他“*PU”:DPU、NPU、TPU、APU、IPU等快速涌现,DPU与CPU、GPU并列称为“未来计算三大支柱”,预计5年后每年新发货DPU服务器占比10%。
服务器形态与集群的发展趋势
- 液冷服务器:在高散热需求下,液冷成为服务器温控技术的核心发展方向,预计未来5年每年新发货中液冷服务器占比10%,浸没式液冷占比逐步扩大。
- 业务集群:三个趋势包括GPU快速迭代、更多“*PU”涌现、液冷服务器占比提升。
线上质量管理的挑战
- 精细化质量数据管理与分析:从PN到DC,需要比PN更细颗粒度的分析,如CPU的Date Code。
- 自维保模式下的线上质量管理:线上质量团队需承载更多原由OEM厂商负责的技术分析、资源协调等工作。
- 拥抱AIOps:优化故障预测和自愈,利用大数据分析能力开展硬盘、内存的故障预测和自动修复。
- 定制化的监管控:根据业务特点定制化服务器监管控策略。
- 高效运维社区:DevOps时代需要高效运维社区支持。
研究结论
线上质量体系建设对于大规模服务器集群的稳定运行至关重要,需从源治理、过程管控、运营体系等多方面提升质量水平,并应对GPU快速迭代、液冷服务器占比提升等新趋势带来的挑战,通过精细化数据管理、AIOps、定制化监管控等手段优化线上质量管理。