内容 3 执行前言4 底线突破点停机成本的上升5 11 断电的解剖学17 在人工智能时代构建韧性超越断电23 25 检视行业停机成本27 停机成本的区域差异29 使用Splunk增强您的数字韧性30 研究方法31 参考文献 停机时间不再是一项技术不便,而是一场商业危机。随着数字生态系统日益互联互通,链条中的每一个环节——从第三方供应商到自主AI代理——都引入了新的风险,当事情出错时,这些风险会成倍放大后果。 个董事会都应该警钟长鸣。 组织正在利用人工智能来减少停机时间,但我们调查的每一位技术领导者也都承认,人工智能至少造成了一次故障。然而,前景依然存在。 勃的AI抱负的组织。它们是那些将技术与业务成果相结合、用情境赋能员工,并设计出在压力下能够弯曲而非断裂(但不会崩溃)的系统的组织。 这个故事正变得愈发熟悉:一次数字故障引发头条新闻,扰乱商业运营,有时导致航班停飞,甚至中断政府服务。每一次事件都是对我们数字基础设施脆弱性的一次严峻警示。对于组织而言,这应是一次响亮的警钟——代价沉重。 我们同时发现,停机越来越难以避免。如今,停机事件源于内部漏洞、外部网络威胁、人工智能驱动的复杂性以及第三方服务日益增长的相互依赖性。任何环节的故障都可能引发安全、应用、基础设施和网络层面的连锁反应。难怪组织平均每年要经历60起停机事件。 成本2已高达6000亿美元,短短两年3内飙升了50%。该集团内每家公司平均每年因计划外停机和服务退化损失3亿美元。这是一个危险的新财务门槛。 恢复,转向主动构建数字化韧性基础。这种预测性免疫力将有助于将损失降至最低,创造运营稳定性,并使市场领导者区别于那些苦苦挣扎以跟上步伐的企业。 受损缓慢却具有腐蚀性。这些都是系统恢复运行后长期困扰组织的隐性成本,损害着长期增长和竞争优势。 在线”服务的期望(74%)、事件成本的增加(65%)、网络安全威胁的上升(59%)以及监管压力的加大(53%)。 停机成本的上升 元的冲击波,从服务器机房蔓延至股市,导致罚款、损害品牌信任,并阻碍创新。 停机时间是一个全组织范围的问题。这就是为什么我们收集了来自一线的安全、IT运营和工程领导,以及财务和营销高管(包括首席财务官和首席营销官)的见解——后者近距离地看到了品牌和经济损害。 全球2000企业的停机总成本现已达到6000亿美元——仅两年内就增长了50%。这相当于每家机构每年平均300亿美元。这些费用迅速累积:停机每分钟成本为15,000美元,或每小时超过900万美元。 面上升。收入损失(9500万美元)现已接近2024年的两倍。 5100万美元和4000万美元。对于科技高管而言,监管罚款带来的影响最为严重,有57%的人认为它们具有非常或极端的破坏性。 数字韧性已非可选项 自2023年以来,欧盟《通用数据保护条例》(GDPR)等法规的罚款金额显著提升,这得益于更频繁的执法行动。与此同时,欧盟《数字运营弹性法案》(DORA)为金融机构设定了严格的新标准,并对不合规行为处以严厉处罚。若系统停运导致无法访问关键服务或个人数据,则可能触发巨额罚款。金融机构必须满足关于弹性测试、事件报告和第三方风险管理的新要求。 直接成本:中断问题日益严重困难或不可能。这种战略转变源于对金融的精明,因为威胁行为者现在根据受害者的特定停机成本来计算赎金。与长期中断的成本相比,数百万美元的勒索要求似乎合理。2024年与2026年,认为直接成本具有高度或极端破坏性的技术高管百分比 2024高管将其视为极具破坏性或严重阻碍性的因素。 48%方面,全球2000强公司正勒紧腰带。公关/投资者关系(500万美元)和品牌信任活动(300万美元)的平均支出已大幅下降。Splunk高级副总裁兼总经理Kamal Hathi表示,这很可能是优先处理紧急运营和合规修复。Hathi说:“这是一种高风险策略,”因为它忽视了品牌侵蚀等隐性成本日益增长的影响。“这种损害不仅会延迟恢复,还会摧毁必须从零开始重建的客户信任。” 他们通常会建议CEO不要支付赎金,但勒索软件赎金支付从第八位升至最高直接成本的前三位。40%的金融高管承认他们直接向攻击者支付赎金。 成最大影响和利用价值。攻击者还会提前加密或窃取备份数据,使恢复 停机故障的影响范围正在扩大。 停机会引发整个组织内的连锁反应。 最常遇到的隐性成本 过去一年中至少经历过一次隐性成本的技术高管百分比 当服务中断时,支持队列激增。挫败感溢出到社交媒体上。创新停滞不前,因为安全、IT运营和工程团队都已转入战时状态。CMO正在准备高管发言要点和公开声明,而CEO和CFO则在监控不断下跌的股价。 对客户和员工造成的直接影响,可能将一个技术问题演变成一场全面的企业危机。 务部门必须安抚投资者情绪;市场部门则监测到品牌认知度下降和客户流失率上升。要重建仅在一瞬间丧失的信任,可能需要数月精心沟通和完美服务。 报告称客户支持需求增加;76%的财务高管和74%的市场营销高管也有同感。虽然可以给一次停机定价,但要计算其对组织最宝贵资产——其员工所造成的持续损害,则更难。 停机带来的隐性成本影响更甚 与仅仅两年前相比,技术高管表示,停机事件的隐性成本更为严重。与2024年相比,数据泄露的公开披露带来的破坏性大了三倍以上,而失去客户带来的破坏性也大了两倍以上。发生了什么变化? 2024年与2026年,认为隐性成本具有高度或极端破坏性的技术高管百分比 目睹公司承受以亿计的亏损,使得网络攻击的抽象风险显得触手可及且迫在眉睫。Splunk现场首席技术官彼得·斯普林格 有责任报告安全漏洞。若未能正确履行此责任,他们可能面临财务和法律上的双重处罚。近期的高调网络攻击也证明了安全漏洞可能带来的严重后果。这些事件不仅仅是安全上的失败,更是足以摧毁业务的重大灾难。 容忍度已经变得很薄。在竞争激烈的B2C市场,停机和服务退化会导致客户流失到竞争对手那里。在B2B和受监管的行业,它们会威胁到未来的合同。曾经可能只是对其声誉造成短暂且可恢复的损害,现在却可能直接导致收入损失。组织必须小心翼翼:47%的技术领导者承认,客户通常是第一个发现停机的人。 如今,许多隐性成本的感知损害已激增至类似的高严重程度阈值,表明组织现在将停机视为一种影响所有功能均等的地系统风险。 近20%的市场营销专业人士报告称,在事件得到补救后,品牌健康需要整整一个季度才能恢复。股价也未能幸免。调查揭示,在2024年,停机事件导致股价平均下跌3.4%,而此前平均跌幅为2.5%,这表明投资者将运营韧性视为一个重要的风险因素,而不仅仅是一个IT问题。事实上,49%的技术高管表示,在过去12个月内,股东们对停机表达了担忧,这表明停机现被视为更深层次组织问题的指标,例如风险管理不善、对现代化数字基础设施投资不足以及竞争脆弱性。 生存下来的组织与蓬勃发展的组织之间的差距,将由它们保持韧性的能力来定义。 故障的解剖 数字领域是内部脆弱性、外部威胁和脆弱的第三方依赖的完美风暴。由于停机原因遍及整个技术栈,没有哪个领域能幸免。 组织每年平均面临60起停机和服务质量下降事件,这些事件在整个技术栈中产生——从网络到应用程序和安全。Splunk开发者布道总监格雷格·莱夫勒说:“官方统计是60起,”“但这仅包括组织能够检测到的事件。真实数字很可能要大得多,因为无数小问题未被察觉。” 用程序代码错误——仍然是导致停机的罪魁祸首。“这可能是IT基础设施日益复杂的结果,”思科 ThousandEyes首席解决方案分析师迈克·希克斯表示。“随着环境变得更加错综复杂和分布式,它们会制造更多盲点,引入更多潜在的故障点,并增加导致停机的错误的可能性。” 停机最常见的原因 5 公共云故障 2 安全相关的人为错误 3 软件故障(例如应用程序错误) 1.IT运维相关的人为错误 网设备 IT运维相关第三方停机 安全事件 虽然人为错误最为常见,但网络钓鱼和恶意软件攻击常常是导致最严重非计划停机事件的入口。它们可能引入勒索软件导致系统瘫痪,或允许攻击者破坏基础设施。在初始入侵之后,组织在试图重新加固网络时,往往会经历长时间的停机。 “在处理安全团队申请时,他们必须应对一个复杂的网络,包括云环境、本地环境以及其他他们通常缺乏可见性的基础设施,”Splunk现场首席技术官Peter Sprenger表示。“这个问题因部门分割的拥有权和缺乏对关键依赖关系的可见性而加剧。” 不会区分部门界限,然而调查却仍各自为政。安全、IT运维和工程团队从不同角度、基于不同数据、缺乏共享背景来应对同一危机。一旦发生安全漏洞,这些壁垒就构成了真正的脆弱点。 比,现在近半数(49%)的安全负责人经常或非常频繁地面临这些攻击。在《CISO报告》中,几乎所有CISO(95%)都表示,威胁行为者能力的日益复杂化对他们网络安全战略构成了最大威胁。 承认,停机事件最初常常或非常常被误归类为IT问题。当安全漏洞被误归为IT事件时,这种延误会给攻击者一个关键的先发优势。每一分钟损失都让他们得以更深地渗透网络、提升权限并扩大其立足点,从而指数级地增加事件的成本、范围和复杂性。 极具说服力、个性化的信息,足以欺骗最警惕的员工,并使数字服务陷入停顿。然而,根据思科人工智能准备指数,只有36%的组织高度意识到恶意行为者如何利用人工智能使这些攻击变得更加复杂。 到这种情况。“当问题源于SaaS或第三方 IT运维和工程事故 在人为错误之后,软件故障和第三方服务中断(API、CDN、SaaS)是导致应用程序或基础设施相关停机或服务降级的最常见原因。 第三方对停机越来越负有责任。 2024年与2026年,经常或频繁因第三方原因导致停机的IT运营和工程领导者百分比 工程师们正以前所未有的速度发布代码。“对加速创新的需求给开发团队带来了巨大压力,迫使他们妥协测试,”Splunk开发者布道总监格雷格·莱夫勒(Greg Leffler)表示。“为了赶进度,代码被匆忙投入生产,往往基于‘感觉’而非充分的验证。这种急于部署的做法不可避免地会导致更多软件故障、系统不稳定和更多中断性的停机时间。” ThousandEyes首席解决方案分析师迈克·希克斯的说法,“解决方案是在出问题时能够掌握全局。你越能快速发现因果关系,就能越快解决问题。” 使是看似内部拥有的应用程序,也依赖支付处理、身份验证和AI API等第三方服务。对未拥有网络和外部依赖的可见性,不仅仅是一项“锦上添花”的功能;它是数字弹性的先决条件。 网络事件 Splunk的开发者布道总监格雷格·莱夫勒(Greg Leffler)表示:“传统的监控止步于您的防火墙。端到端的网络可见性则提供整个数字生态系统的地图——从您的基础设施到供应商的数据中心,跨越多个互联网服务提供商,直至最终用户——使团队能够精准判断故障是发生在内部、供应商处,还是两者之间。” 公共云的核心悖论在于,尽管其优势巨大,但其故障带来的痛苦最为深切。在所有网络相关的中断事件中,公共云故障给企业带来的损失最为惨重。 IT运维和工程领导者们表示,由公共云服务故障导致的停机时间造成了最大的财务影响。 云层之外,停机时间也源于SaaS依赖、网络拥塞,以及管理终端和物联网设备激增所面临的挑战。 理也不完全理解的外部服务链上。由于缺乏对这些依赖的可见性或控制权,他们对此毫无察觉,无法预见到潜在的故障。挑战在于将这个外部服务的“黑箱”转变为可以主动监控和管理的事物。 人工智能时代构建韧性 的端到端可见性作为优先事项。虽然人工智能加速了诊断过程,但人类的监督对于真正的数字韧性仍然是必不可少的。 31%的技术领导者承认,尽管在工具上投入了大量资金,但停机时间却更加频繁。对思科 ThousandEyes首席解决方案分析师迈克·希克斯(Mike Hicks)而言,这意味着要么问题是解决方案所能应对的速度在演变,要么组织在韧性方面投资的方法是错误的。 “仅仅增加更多的监控工具并