เข้าใจความเสี่ยงของ policy สอบถามเรื่อง policy ได้ด้วยภาษาทั่วไป ขอชมการสาธิต →
Published:
การตั้งค่าผิดพลาดเพียงจุดเดียว ผู้ใช้ 2.9 พันล้านรายใช้งานไม่ได้
by FireMon
ความผิดพลาดจากงานบำรุงรักษาตามปกติ ตัดขาดดาต้าเซ็นเตอร์ของ Facebook ออกจากอินเทอร์เน็ตนานกว่า 6 ชั่วโมง
เมื่อวันที่ 4 ตุลาคม ผู้ใช้ Facebook เผชิญเหตุระบบล่มทั้งหมด กระทบทุกแอปพลิเคชันรวมถึง WhatsApp, Instagram และ Messenger เป็นเวลานานกว่า 6 ชั่วโมง ผู้ใช้เกือบ 2.9 พันล้านรายไม่เพียงได้รับความไม่สะดวกเท่านั้น แต่จำนวนมากยังสูญเสียช่องทางการสื่อสารที่สำคัญ ในภูมิภาคที่ใช้ WhatsApp เป็นช่องทางหลักในการส่งข้อความและโทรด้วยเสียง
ไม่นานก็พบว่าต้นเหตุคือการเปลี่ยนแปลงคอนฟิกที่ผิดพลาดบน backbone router ของ Facebook ซึ่งทำหน้าที่จัดการทราฟฟิกระหว่างดาต้าเซ็นเตอร์ การตั้งค่าที่ผิดเพียงจุดเดียวถูกกระจายไปทั่วทั้งเครือข่าย ส่งผลกระทบไม่เพียงต่อผู้ใช้งาน แต่ยังกระทบเครื่องมือและระบบภายในของบริษัทเอง ทำให้ Facebook วิเคราะห์หาสาเหตุและแก้ไขปัญหาได้ยากขึ้น
ต่อมา Facebook ได้เผยแพร่รายละเอียดของปัญหา โดยอธิบายถึงสาเหตุและเหตุผลที่งานบำรุงรักษาตามปกติกลับนำไปสู่การหยุดให้บริการโดยสิ้นเชิง มีการส่งคำสั่งที่ไม่ถูกต้องเพื่อตรวจสอบความจุของระบบ ซึ่งไปปิดการทำงานของ border gateway protocol (BGP) router ของ Facebook โดยไม่ได้ตั้งใจ และตัดขาดดาต้าเซ็นเตอร์ออกจากอินเทอร์เน็ต ปัญหายิ่งซ้ำเติมด้วยบั๊กในเครื่องมือตรวจสอบที่ควรจะดักจับข้อผิดพลาดนี้ได้แต่กลับไม่ทำงาน จึงปล่อยให้คำสั่งดังกล่าวถูกนำไปใช้จริงทั่วทั้งสภาพแวดล้อม
เมื่อ BGP router ออฟไลน์ Facebook จึงไม่ได้ประกาศเส้นทางไปยัง DNS server บนเครือข่ายของตน DNS server เป็นองค์ประกอบสำคัญของอินเทอร์เน็ต ทำหน้าที่คล้ายสมุดโทรศัพท์ โดยแปลงชื่อโดเมนอย่าง facebook.com ให้เป็น IP address เครือข่ายของ Facebook มี DNS server ของตัวเองที่ดูแล IP address ของทุกโดเมน และเผยแพร่ข้อมูลนี้ไปทั่วอินเทอร์เน็ต เมื่อผู้ใช้พยายามเข้าถึงโดเมนใดก็ตามของ Facebook ระหว่างที่ระบบล่ม จึงพบเพียงข้อความแจ้งข้อผิดพลาดว่าไม่มีปลายทางให้เชื่อมต่อไปถึง
การตั้งค่าที่ผิดพลาดคือหนึ่งในสาเหตุหลักของระบบล่ม
เป็นที่ทราบกันมานานแล้วว่าความผิดพลาดของมนุษย์เป็นสาเหตุอันดับต้น ๆ ของเหตุเครือข่ายและบริการล่ม สภาพแวดล้อมที่ซับซ้อนยิ่งเพิ่มโอกาสที่จะเกิดความผิดพลาด และทำให้ผลกระทบลุกลามเป็นวงกว้างมากขึ้น Gartner ระบุว่าในอีกหลายปีข้างหน้า ข้อผิดพลาดจากการตั้งค่าจะเป็นต้นเหตุของการละเมิดความปลอดภัยบน firewall ถึง 99%
ในกรณีของ Facebook BGP router คือจุดวิกฤตที่ทำให้เครือข่ายซึ่งปกติทำงานได้ดีล้มเหลวทั้งระบบ การเปลี่ยนแปลงคอนฟิกเพียงเล็กน้อยกลับตัดขาดการเชื่อมต่อกับอินเทอร์เน็ตนานหลายชั่วโมง
การตั้งค่า security policy ที่ผิดพลาดอาจร้ายแรงยิ่งกว่า
แม้จะสร้างความปั่นป่วน แต่ก็ไม่น่าจะมี security incident ใดเกิดขึ้นจากเหตุระบบล่มของ Facebook ครั้งนี้ อย่างไรก็ตาม สถานการณ์ไม่ได้เป็นเช่นนี้เสมอไป การเปลี่ยนแปลงเล็ก ๆ น้อย ๆ นำไปสู่ช่องโหว่ด้านความปลอดภัยโดยไม่ตั้งใจครั้งแล้วครั้งเล่า และเปิดทางให้องค์กรตกเป็นเป้าการโจมตีหากช่องโหว่เหล่านั้นถูกค้นพบและถูกใช้ประโยชน์
การตั้งค่า network security policy ที่ผิดพลาดไม่เพียงทำให้ระบบล่มเป็นวงกว้างเท่านั้น แต่ยังเป็นหนึ่งในช่องทางที่ง่ายที่สุดในการเปิดทางสู่การละเมิดความปลอดภัยที่สร้างความเสียหายรุนแรง เหตุข้อมูลรั่วไหลของ Capital One ในปี 2019 มีสาเหตุโดยตรงจาก firewall ที่ตั้งค่าไม่ถูกต้อง ซึ่งทำให้เซิร์ฟเวอร์บนคลาวด์เครื่องหนึ่งมีช่องโหว่ และเปิดโอกาสให้แฮกเกอร์เข้าถึงข้อมูลสำคัญของลูกค้ากว่า 100 ล้านราย
ระบุ กำจัด และปกป้องด้วย FireMon
FireMon มอบการมองเห็น policy ความเสี่ยงสูงและช่องโหว่ที่แฝงอยู่ในโครงสร้างพื้นฐานของท่าน พร้อมป้องกันไม่ให้เกิดปัญหาใหม่ตั้งแต่ก่อนนำ policy ไปใช้งานจริง ด้วยการค้นหาแบบเรียลไทม์ การประเมินความปลอดภัยอย่างต่อเนื่อง และการตรวจจับ policy ที่ไม่เป็นไปตามข้อกำหนดโดยอัตโนมัติ ท่านจึงมีเครื่องมือที่จำเป็นในการบริหารจัดการnetwork security policyทั่วทั้งสภาพแวดล้อมของท่าน ตั้งแต่ดาต้าเซ็นเตอร์ภายในองค์กรไปจนถึงคลาวด์
การตั้งค่าที่ผิดพลาดเป็นสิ่งที่เลี่ยงไม่ได้ แต่ FireMon ช่วยลดโอกาสที่ความผิดพลาดเหล่านั้นจะกระทบต่อความปลอดภัยของเครือข่ายของท่าน