ポリシーリスクを可視化。自然な言葉でポリシーに関する疑問を解決します。 デモを申し込む →
Published:
単純な設定ミス1つ。29億人の利用者が利用不能に
by FireMon
定例メンテナンスでの操作ミスにより、Facebookのデータセンターが6時間以上にわたりインターネットから切り離される
10月4日、Facebookの利用者は、WhatsApp、Instagram、Messengerを含むすべてのアプリが6時間以上利用できなくなる全面的な障害に見舞われました。約29億人の利用者が不便を強いられただけでなく、WhatsAppがテキストメッセージや音声通話の主要手段となっている地域では、多くの人が重要な連絡手段を失いました。
原因は、データセンター間のトラフィックを管理するFacebookのバックボーンルーターにおける誤った構成変更であることがまもなく判明しました。単純な設定ミスがネットワーク全体に伝播し、利用者に影響を与えただけでなく、自社のツールやシステムにも波及して、Facebookが問題を診断し解決する能力を妨げました。
その後Facebookは、原因と、定例のメンテナンス作業がいかにしてサービスの完全停止に至ったのかを説明する、より詳細な報告を公開しました。容量を確認するために送信された誤ったコマンドが、意図せずFacebookのボーダーゲートウェイプロトコル(BGP)ルーターを無効化し、事実上データセンターをインターネットから切り離しました。さらに問題を大きくしたのは、この誤りを検知するはずだった監査ツールの不具合です。検知が行われなかったため、変更が環境全体に本番展開されてしまいました。
BGPルーターがオフラインになったことで、Facebookは自社ネットワーク上のDNSサーバーへの経路を広告しなくなりました。DNSサーバーは電話帳のような役割を果たす重要なインターネット構成要素であり、facebook.comのようなドメイン名をIPアドレスに変換します。Facebookのネットワークには独自のDNSサーバーがあり、インターネット全体で共有される自社の全ドメインのIPアドレスを保持しています。障害の間、利用者がFacebookのいずれかのドメインにアクセスしようとすると、誘導先のアドレスが存在しないというエラーが表示されました。
設定ミスは障害の主要な原因
ヒューマンエラーがネットワークやサービスの障害の主要な原因であることは、以前から知られています。環境が複雑になるほどミスの発生確率は高まり、その影響範囲も広がります。Gartnerは、今後数年間においてファイアウォールのセキュリティ侵害の99%が設定ミスに起因すると述べています。
Facebookの事例では、それ以外は健全だったネットワークにおいて、BGPルーターが重大な単一障害点となりました。その構成へのわずかな変更が、インターネットとの接続を数時間にわたり断絶させたのです。
セキュリティポリシーの設定ミスはさらに深刻になり得る
混乱は生じたものの、今回のFacebookの障害からセキュリティインシデントが発生する可能性は低いと考えられます。しかし、常にそうとは限りません。小さな変更が意図しないセキュリティ脆弱性につながり、それが発見・悪用された場合に組織を攻撃の脅威にさらしてきた事例は、これまで繰り返し起きています。
ネットワークセキュリティポリシーの設定ミスは、大規模な障害を招くだけでなく、壊滅的なセキュリティ侵害への道を意図せず開いてしまう最も容易な要因の1つでもあります。2019年のCapital Oneの情報漏えいは、設定を誤ったファイアウォールが直接の原因とされ、クラウドサーバーの1台が脆弱な状態に置かれた結果、攻撃者が1億人を超える顧客の機密データにアクセスできる状態となりました。
FireMonによる特定、排除、保護
FireMonは、インフラストラクチャに潜む高リスクなポリシーや脆弱性を可視化し、ポリシーが展開される前に新たなリスクが生まれることを防ぎます。リアルタイム検索、継続的なセキュリティ評価、ポリシー違反の自動検出により、ネットワークセキュリティポリシーをオンプレミスのデータセンターからクラウドまで環境全体にわたって管理するために必要なツールが手に入ります。
設定ミスは避けられませんが、FireMonはそれがネットワークセキュリティを損なう可能性を最小限に抑えます。