そもそも「サーバーが落ちる」とは
サーバーが落ちる、とは「サーバーが応答しなくなった状態」のこと。エラーで停止する場合もあれば、リクエストが多すぎて処理が間に合わずに反応できない場合もあります。原因は1つではなく、いくつかのパターンに分かれます。
「サーバーが落ちた」と言っても、実際にはいくつかの段階があります。サーバー本体が止まる場合、ネットワークだけがつながらない場合、ログイン機能だけが使えない場合、画像だけが読み込めない場合などです。利用者からは同じ「使えない」に見えても、エンジニアはどの部分が止まっているかを切り分けながら復旧します。
サーバーが落ちる主な原因
多くの障害は「アクセス集中」と「バグ」の組み合わせ。新しい機能を出した瞬間にアクセスが急増し、テストでは見つからなかったバグが本番で発火する、というパターンが定番です。
過去の有名なサーバーダウン
2024年7月のCrowdStrike障害は、世界中のWindows PC約850万台が同時にブルースクリーンになる、史上最大級の障害として記憶に残っています。空港・銀行・病院が同時に止まり、社会インフラのIT依存度の高さを浮き彫りにしました。
知っておきたい対処法
「ゲームができない」「LINEが送れない」と焦ったら、まず「自分側の問題か、サービス側の問題か」を見分けます。X(Twitter)でサービス名を検索すると、同じ症状の投稿があふれているなら、サービス側のサーバー障害です。「Downdetector」というサイトでも、世界中のサービスの稼働状況がリアルタイムで確認できます。
サーバー側の問題なら、自分でできることはありません。復旧を待つしかないので、別のことをして待ちます。「自分側の問題」(Wi-Fi切断、PC再起動の必要など)の場合のみ、対処に動きます。
自分側かどうかを見るときは、順番を決めると落ち着いて確認できます。まず別のサイトが開けるかを見る。次に同じWi-Fiの家族の端末でも起きているかを見る。モバイル回線に切り替えて変わるかを見る。最後に公式ステータスページや公式SNSを見る。この順番なら、むやみにアプリを再インストールしたり、アカウント設定をいじったりする前に原因を絞れます。
気をつけたい落とし穴
- 「ハッキングされた」とは限らない。多くは内部のバグや設定ミスが原因
- SNSのデマに注意。「アカウントが消えた」「データが流出した」など根拠のない情報が広がりやすい
- 復旧したからといって全データが戻るとは限らない。普段からバックアップを取る習慣が必要
将来どう役立つ?
サーバーが落ちないように設計・監視する仕事は「SRE(Site Reliability Engineer)」と呼ばれます。SREは、サーバーの台数を増やす、異常を検知する、障害時に別のサーバーへ切り替える、復旧手順を整えるなど、サービスの信頼性を守る役割です。サーバーが落ちるパターンを理解しておくと、エンジニアになったときに障害対応・予防設計の考え方へ入りやすくなります。
今日からできること
- 「Downdetector」のサイトをブックマークしておく
- 使っているサービスのステータスページ(status.〇〇.com)を1つ探してみる
- 過去のIT大規模障害(KDDI、Meta、CrowdStrike)について調べてみる
まとめ
確認 「サーバーが落ちた」は何が起きた?