11월 18일 클라우드플레어 대규모 네트워크 장애, 왜 일어났나?

2025년 11월 18일 발생한 클라우드플레어 대규모 장애는 전 세계 인터넷 생태계에 큰 충격을 준 사고로 기록될 것 같습니다. 우리나라에서는 18일 저녁 9시부터 자정까지 장애가 발생했습니다. 이 장애로 인해 클라우드플레어 서비스를 이용하는 수많은 사이트들이 접속 불능 상태가 되었고, 클플 서비스를 이용하는 대형 업체들의 서비스(예: 챗GPT, X, 퍼플렉시티 등)도 장애를 겪었습니다.

11월 18일 클라우드플레어 대규모 네트워크 장애, 왜 일어났나?

클라우드플레어(Cloudflare)란?

클라우드플레어는 웹을 잘 모르는 분들에게는 생소할 수 있으나, 사실 전 세계에서 매우 널리 쓰이는 유명한 CDN 및 인터넷 보안 서비스 제공업체입니다.

클라우드플레어는 전 세계 수많은 웹사이트와 온라인 서비스를 빠르고 안전하게 운영할 수 있도록 지원하는 인터넷 인프라 기업입니다. 주요 서비스로는 CDN(콘텐츠 전송 네트워크), 보안 솔루션, 봇 관리, DDoS 방어 등이 있으며, 이용자와 웹사이트 사이에 위치해 트래픽을 효율적으로 분산시키고 위협을 차단합니다. 그러므로 클라우드플레어가 정상적으로 작동하지 않으면 관련된 모든 사이트의 접속이 불안정해질 수 있습니다.

저는 작년 8월과 9월 사이 극심한 디도스 공격을 경험하면서 클라우드플레어 서비스를 일시적으로 이용한 적이 있습니다.

11월 18일, 무슨 일이 있었나?

2025년 11월 18일 오전 11시 20분(UTC 기준, 한국 시간 오후 8시 20분쯤), 클라우드플레어의 네트워크에서 핵심 트래픽 전달에 실패하는 심각한 장애가 발생했습니다. 이로 인해 챗GPT, Perplexity, X.com(구 트위터), Cloudways 등 클라우드플레어 인프라를 사용하는 주요 AI 서비스 및 다양한 글로벌 인터넷 서비스가 동시에 접속 불가 상태에 빠졌습니다.

주요 서비스 뿐만 아니라 수많은 소규모 사이트와 블로그, 게임, 금융, 공공기관까지 영향을 받으며, HTTP 5xx 오류가 대량으로 발생했습니다. 장애 소식이 전해지며 순간적으로 인터넷 이용자들 사이에 큰 혼란과 불편이 일어났습니다.

Cloudflare와 연동하여 서비스를 이용하던 사이트에 방문하면 아래 그림과 같은 ‘Internal server error’ 오류 화면이 표시되었습니다.

클라우드플레어 대규모 장애 발생: 전 세계 웹사이트 접속 불가

챗GPT의 경우 간헐적으로 다음과 같은 화면이 표시되었습니다.

클라우드플레어 장애로 인한 챗GPT 접속 오류

장애 원인: 디도스 공격이 아닌 내부 시스템 변경이 초래한 사건

클라우드플레어는 이번 장애의 직접적 원인으로, 내부 데이터베이스의 권한 변경 및 쿼리 동작 변화에 따른 “feature file” 문제를 지목했습니다. Bot Management(봇 관리) 시스템에서 머신러닝 모델이 사용하는 이 설정 파일이 원래 크기의 두 배 이상으로 커지면서 네트워크 전체에 배포되었고, 각 서버의 소프트웨어가 처리할 수 있는 한도를 넘어섰습니다.

그 결과, 클라우드플레어의 핵심 코어 프록시 서버는 5xx 에러를 대량 발생시키며 트래픽 처리가 멈췄습니다. 장애 발생 시 처음에는 대규모 트래픽 증가로 인해 대규모 디도스(DDoS) 공격으로 의심되기도 했으나, 세밀한 조사를 거쳐 내부 시스템 변경이 진짜 원인임이 밝혀졌습니다.

장애가 미친 영향 범위

장애는 클라우드플레어의 핵심 CDN 서비스, 봇 관리, 서버리스 데이터베이스 서비스(Workers KV), 인증 시스템(Access), 그리고 내부 대시보드와 Turnstile 로그인 시스템에 광범위하게 영향을 미쳤습니다. 덕분에 챗GPT, Perplexity, X.com, Cloudways 등 대표적인 디지털 서비스들이 약 6시간 가량 접속 장애를 겪었습니다.

수많은 글로벌 서비스 이용자들이 접속 불가를 경험했고, 온라인 쇼핑, 금융 거래, 게임 플레이 등에도 크고 작은 차질이 발생했습니다. 인터넷 전반에 퍼진 대규모 연쇄 장애로 많은 기업과 개인 사용자가 어려움을 겪었습니다.

복구 과정과 향후 대책

클라우드플레어는 문제 발생 직후 문제의 원인을 신속히 파악하고, 잘못 배포된 설정 파일의 전파를 즉시 중단했습니다. 손상된 파일을 정상 버전으로 수동 복구하며, 오후 2시 30분(UTC 기준, 우리나라 시각으로 오후 11시 30분)부터 트래픽이 서서히 정상화되기 시작했습니다. 이후 서비스 시스템 재가동과 모니터링으로 오후 5시 6분(한국 시각으로 19일 오전 2시 6분)경 모든 서비스를 완전히 복구했습니다.

장애 후 클라우드플레어는 시스템의 안정성과 신뢰성 강화를 위해 노력하며, 구성 파일 검증 강화, 전역 킬스위치 도입, 그리고 에러 상황에서 자동으로 시스템 자원을 보호하는 대책 등을 약속했습니다. 클라우드플레어 CEO는 이번 장애가 지난 6년간의 기간 중에서 최악의 사례이며, 단 한 번의 다운타임도 용납할 수 없다고 사과와 함께 강조했습니다.

마치며

이번 클라우드플레어 장애는 우리 인터넷 생태계가 얼마나 서로 연결되어 있는지, 한 곳의 문제가 어떻게 광범위한 파장을 일으킬 수 있는지 명확하게 보여준 사건입니다. 수많은 사이트가 CDN과 같은 인프라에 의존하는 현실에서, 그 기반 시설의 신뢰성과 안정성은 인터넷 사용자와 서비스 제공자 모두에게 절대적인 가치임을 다시 한번 깨닫게 해주었습니다.

보안이나 트래픽 분산 때문에 클라우드플레어 이용을 고려하는 분들이 계실 것입니다. 트래픽이 몰리거나 디도스 공격이 잦은 경우 클라우드플레어가 좋은 옵션 같습니다.

클라우드플레어 연동은 그리 어렵지 않습니다. 워드프레스 관련 네이버 카페에 케미클라우드 워드프레스 호스팅에서 클라우드플레어 사용에 대한 질문이 올라온 적이 있는데요. cPanel에서 Cloudflare 활성화가 가능합니다.

11월 18일 클라우드플레어 대규모 네트워크 장애, 왜 일어났나? 1

케미클라우드는 블루호스트, 패스트코멧 등과 비슷한 레벨의 가성비 좋은 해외호스팅으로, 특히 서울 서버를 도입하여 우리나라에서 빠른 속도를 제공하면서 사용자 수가 증가하고 있습니다.😄

참고

댓글 남기기

워드프레스 가이드에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기