サーバーが落ちるとは?

「LINEで送れない」「Xが開かない」「ゲームのログイン画面で止まる」——SNSで「障害」「サーバー落ちた」とトレンド入りする日があります。サーバーが落ちるとは、いったい何が起きているのか。原因と仕組みを解説します。

そもそも「サーバーが落ちる」とは

サーバーが落ちる、とは「サーバーが応答しなくなった状態」のこと。エラーで停止する場合もあれば、リクエストが多すぎて処理が間に合わずに反応できない場合もあります。原因は1つではなく、いくつかのパターンに分かれます。

「サーバーが落ちた」と言っても、実際にはいくつかの段階があります。サーバー本体が止まる場合、ネットワークだけがつながらない場合、ログイン機能だけが使えない場合、画像だけが読み込めない場合などです。利用者からは同じ「使えない」に見えても、エンジニアはどの部分が止まっているかを切り分けながら復旧します。

サーバーが落ちる主な原因

サーバーダウンの4原因:頻度・予防難度・復旧時間 出典:Atlassian『Status Page Index』/Uptime Institute Annual Outage Analysis 2024 原因 発生頻度 予防難度 復旧時間 ①アクセス集中(負荷) 最頻 ★★☆ 数分〜1時間 ②バグ・設定ミス 頻発 ★★★ 数十分〜数時間 ③サイバー攻撃(DDoS等) 月数件 ★★☆ 数時間(CDN対策時は数分) ④物理的問題(停電・故障) 稀 ★☆☆ 数時間〜数日 ★ 半数以上は「アクセス集中+バグ」のコンボ。新機能リリース直後の障害が定番パターン
図1:4原因のうち①と②が最頻。新機能リリース直後の「想定外アクセス+潜在バグ」が定番

多くの障害は「アクセス集中」と「バグ」の組み合わせ。新しい機能を出した瞬間にアクセスが急増し、テストでは見つからなかったバグが本番で発火する、というパターンが定番です。

過去の有名なサーバーダウン

過去の大規模サーバー障害8事例:停止時間と影響規模 出典:各社プレスリリース・総務省『電気通信事故報告』・報道各社 障害名 停止時間 影響規模 原因 KDDI(2022年7月) 39時間 3,900万人 設備不具合 Meta(2021年10月) 6時間 35億人 DNS設定ミス AWS S3(2017年2月) 4時間 米東部全Web 人為ミス みずほ銀行(2021年) 複数回・延べ数十時間 ATM全国 基幹系バグ CrowdStrike(2024年7月) 数時間〜1日 世界850万台 ソフト更新ミス PSN(2011年4月) 23日 7,700万人 サイバー攻撃 YouTube(2020年12月) 1〜2時間 世界中 認証バグ X/Twitter(2023年・複数回) 数時間×複数 数億人 人員削減後 ★ 世界トップ企業も毎年数回はダウン。完全無敵のサービスは存在しない
図2:世界トップ企業も毎年ダウン。完全無敵のサービスはなく「障害が起きる前提」で設計するのが現代の常識

2024年7月のCrowdStrike障害は、世界中のWindows PC約850万台が同時にブルースクリーンになる、史上最大級の障害として記憶に残っています。空港・銀行・病院が同時に止まり、社会インフラのIT依存度の高さを浮き彫りにしました。

知っておきたい対処法

「ゲームができない」「LINEが送れない」と焦ったら、まず「自分側の問題か、サービス側の問題か」を見分けます。X(Twitter)でサービス名を検索すると、同じ症状の投稿があふれているなら、サービス側のサーバー障害です。「Downdetector」というサイトでも、世界中のサービスの稼働状況がリアルタイムで確認できます。

サーバー側の問題なら、自分でできることはありません。復旧を待つしかないので、別のことをして待ちます。「自分側の問題」(Wi-Fi切断、PC再起動の必要など)の場合のみ、対処に動きます。

自分側かどうかを見るときは、順番を決めると落ち着いて確認できます。まず別のサイトが開けるかを見る。次に同じWi-Fiの家族の端末でも起きているかを見る。モバイル回線に切り替えて変わるかを見る。最後に公式ステータスページや公式SNSを見る。この順番なら、むやみにアプリを再インストールしたり、アカウント設定をいじったりする前に原因を絞れます。

気をつけたい落とし穴

サーバー障害時に注意すること
  • 「ハッキングされた」とは限らない。多くは内部のバグや設定ミスが原因
  • SNSのデマに注意。「アカウントが消えた」「データが流出した」など根拠のない情報が広がりやすい
  • 復旧したからといって全データが戻るとは限らない。普段からバックアップを取る習慣が必要

将来どう役立つ?

サーバーが落ちないように設計・監視する仕事は「SRE(Site Reliability Engineer)」と呼ばれます。SREは、サーバーの台数を増やす、異常を検知する、障害時に別のサーバーへ切り替える、復旧手順を整えるなど、サービスの信頼性を守る役割です。サーバーが落ちるパターンを理解しておくと、エンジニアになったときに障害対応・予防設計の考え方へ入りやすくなります。

今日からできること

3ステップで始めよう
  1. 「Downdetector」のサイトをブックマークしておく
  2. 使っているサービスのステータスページ(status.〇〇.com)を1つ探してみる
  3. 過去のIT大規模障害(KDDI、Meta、CrowdStrike)について調べてみる

まとめ

サーバーが落ちる原因は、アクセス集中・バグ・サイバー攻撃・物理的な問題の4つに大別されます。完全無敵のサービスは存在せず、世界の巨大企業ですら年に数回はダウンします。「自分側の問題か、サービス側の問題か」を見分ける習慣をつけておくと、無駄な操作で状況を悪化させずに済みます。

確認 「サーバーが落ちた」は何が起きた?