CrowdStrike 中断:揭秘史上最大的 IT 中断事件
事态急转直下,美国领先的网络安全公司 CrowdStrike 的软件更新引发了史上最大规模的 IT 中断。此次更新本意是增强安全性,但却造成了大范围混乱,扰乱了全球的关键服务。这一事件凸显了我们这个互联数字世界的脆弱性,也引发了我们对中心化技术解决方案的依赖的重要问题。
发生了什么?
造成此次中断的根本原因是 CrowdStrike 的“猎鹰传感器”软件,一款旨在保护 Windows 设备免受恶意攻击。此错误导致灾难性的系统故障,导致 Windows 计算机崩溃并显示臭名昭著的 蓝屏死机(BSOD)。CrowdStrike 很快发现了这个问题,并将其归咎于 Windows 主机的单个内容更新缺陷。重要的是,这个问题 不会影响 Mac 或 Linux 系统。
周五早些时候,CrowdStrike 向客户发出了一条警告,其中包含手动解决方法,建议他们从系统中删除特定文件以缓解此问题。然而,当传达此解决方法时,损失已经造成, 影响全球数百万台设备.

影响范围
此次错误更新的影响是立竿见影且广泛的。此次中断影响了多个行业,包括银行、航空公司、电信公司、广播公司、超市,甚至紧急服务。以下是受影响的一些主要领域:
航空公司和机场
世界各地的机场,包括柏林、巴塞罗那、布里斯班、爱丁堡、阿姆斯特丹、伦敦和墨尔本的主要枢纽机场,都报告了严重的中断。苏黎世机场暂停了所有飞往美国的航班,美国航空、联合航空和达美航空等航空公司也遭遇了严重的运营问题。旅客面临航班延误和取消,手写机票成为暂时的常态。
医疗保健
医院和医疗机构受到严重影响。在美国,麻省总医院、宾夕法尼亚大学医学院和西奈山医疗系统等机构报告了严重的中断。手术被推迟,一些癌症中心暂停了某些治疗。在加泰罗尼亚,健康热线受到影响,当局敦促公民避免拨打非紧急电话。
紧急服务
由于系统离线,纽约、阿拉斯加和亚利桑那等州的紧急救援人员不得不恢复手动记录。这影响了 911 服务,一些地区在系统恢复之前经历了短暂的中断。
电信和广播
Sky News 和 ABC 等主要广播公司出现系统崩溃,导致运营中断。电信公司也面临重大挑战,影响了多个国家的服务。
金融部门
银行和金融机构的系统离线,导致服务和交易中断。这种中断对依赖这些服务进行日常运营的企业和个人产生了连锁反应。
技术细节和恢复工作
该漏洞被追溯到更新中的特定文件,可以手动删除该文件以恢复系统功能。CrowdStrike 的工程师不知疲倦地隔离问题并部署修复程序。尽管付出了这些努力,但恢复过程仍然很慢,许多系统需要手动干预才能重新启动和稳定。

CrowdStrike 首席执行官乔治·库尔茨对此次中断深表遗憾,并向客户保证公司正在尽一切努力恢复正常运营。该公司还通过其网站和支持门户提供持续更新,让客户随时了解恢复进度。
更广泛的影响
此次事件再次提醒我们,我们的数字基础设施本身就存在漏洞。此次中断影响了约 8.5 万台 Windows 设备,凸显了科技行业整合带来的风险。网络安全领域的主要参与者 CrowdStrike 和操作系统领域的主导力量微软共同构成了巨大的“攻击面”。一旦出现问题,后果可能深远而严重。
安德森经济集团首席执行官帕特里克·安德森估计,此次停电造成的损失可能超过 1 亿美元。其中包括生产力损失、服务延迟以及恢复系统所需的大量工作。此次事件还引发了有关对受影响客户进行赔偿的讨论,但目前尚不清楚将如何解决。
经验教训
CrowdStrike 中断凸显了对更具弹性和分散性的 IT 系统的需求。以下是一些关键要点:
分阶段推出
软件更新应分阶段推出,以便在问题蔓延之前发现并解决问题。这可以防止单个错误演变成全球危机。
多样化
依赖单一供应商提供关键服务会增加脆弱性。多元化供应商和解决方案可以增强弹性。
健全的应急计划
组织必须制定全面的应急计划来管理和减轻 IT 故障的影响。这包括手动流程和替代沟通渠道。
透明度和沟通
服务提供商的清晰及时沟通有助于控制断电的影响。让客户了解问题的性质以及解决问题的步骤至关重要。
投资于韧性
随着我们对数字系统的依赖性越来越强,我们也必须加大投资,使这些系统更具弹性。这包括定期测试、更新,以及加入故障保护措施来处理意外问题。
结语
CrowdStrike 中断事件给全球企业、政府和个人敲响了警钟。它暴露了我们互联系统的脆弱性,以及对更强大、更弹性的 IT 基础设施的需求。随着我们驾驭日益数字化的世界,从此类事件中吸取教训对于构建更安全、更稳定的未来至关重要。借助以下创新 RELIANOID 展望未来,我们希望看到一个更具弹性的数字环境,可以更好地抵御未来的挑战。