洞察策略风险,用自然语言提问策略问题。 申请演示 →
Published:
一处简单的配置错误,29 亿用户陷入瘫痪
by FireMon
一次例行维护失误,使 Facebook 的数据中心与互联网断连超过 6 小时
10 月 4 日,Facebook 用户遭遇了一次全面中断,WhatsApp、Instagram 和 Messenger 等所有应用受到影响,持续超过 6 小时。近 29 亿用户不仅使用受阻,在那些以 WhatsApp 作为短信和语音通话主要方式的地区,许多人还失去了关键的通信手段。
人们很快发现,问题根源在于 Facebook 管理数据中心间流量的骨干路由器上一次错误的配置变更。一处简单的配置错误扩散至其整个网络,不仅影响了用户,也波及其自身的工具和系统,削弱了 Facebook 诊断和解决问题的能力。
Facebook 随后发布了更为详细的说明,阐述了事故起因,以及一项例行维护任务如何导致服务彻底中断。一条用于检查容量的错误命令被下发,无意中停用了 Facebook 的边界网关协议(BGP)路由器,实际上切断了其数据中心与互联网的连接。雪上加霜的是,本应发现该错误的审计工具存在缺陷,未能拦截,致使错误在其整个环境中上线部署。
BGP 路由器离线后,Facebook 无法向其网络上的 DNS 服务器通告路由。DNS 服务器是互联网的关键组件,其作用如同电话簿,将 facebook.com 这样的域名解析为 IP 地址。Facebook 的网络拥有自己的 DNS 服务器,维护其所有域名的 IP 地址并在全球互联网范围内共享。在中断期间,用户尝试访问 Facebook 的任何域名时,都会收到没有可导向目标地址的错误提示。
配置错误是服务中断的首要原因之一
长期以来,人为失误一直是网络和服务中断的首要原因之一。复杂的环境会放大出错的可能性,其影响也更为广泛。Gartner 表示,在未来几年内,配置错误将导致 99% 的防火墙安全漏洞。
在 Facebook 这样的案例中,BGP 路由器是原本健康的网络中的关键故障点。对其配置的一处小改动,就使其与互联网的连接中断了数小时。
安全策略配置错误的后果可能更严重
尽管造成了严重干扰,但 Facebook 此次中断不太可能引发任何安全事件。然而情况并非总是如此。一次又一次,微小的变更导致了意料之外的安全漏洞,一旦被发现和利用,组织便面临攻击威胁。
网络安全策略配置错误不仅可能导致大范围服务中断,也是无意中为灾难性安全泄露铺路的最常见途径之一。2019 年 Capital One 数据泄露事件的直接原因,就是一处配置错误的防火墙使其一台云服务器暴露于风险之中,黑客因此得以访问超过 1 亿名客户的敏感数据。
借助 FireMon 识别、消除并加以防护
FireMon 让您洞察基础架构中潜藏的高风险策略和漏洞,并在策略部署前阻止您产生新的风险。实时搜索、持续的安全评估和自动的策略违规检测,为您提供所需的工具,以管理网络安全策略,覆盖从本地数据中心到云端的整个环境。
配置错误不可避免,但 FireMon 可将其危及您网络安全的可能性降至最低。