ガイド

「稼働時間監視とは何ですか? Web チームと SRE のための完全ガイド」

「稼働時間の監視の仕組み、SLA 可用性の割合の計算方法、ダウンタイムの誤検出アラートの防止方法、およびマルチリージョン チェックの構成方法を学びます。」
「 SimpleOps エンジニアリング」 著「ハリ」 によってレビューされました2026-07-25 でレビュー済み

稼働時間の監視は、Web サイト、Web アプリケーション、API マイクロサービスが世界中のユーザーにとってアクセス可能で、応答性があり、機能し続けていることを継続的に検証する基本的な運用規律です。

最新のクラウド コンピューティングでは、Web サイトのダウンタイムが直接ビジネスの収益に悪影響を及ぼし、ブランドの評判にダメージを与え、検索エンジンのランキングを低下させ、顧客離れにつながります。この包括的なガイドでは、自動稼働時間監視の仕組み、サービス レベル アグリーメント (SLA) の可用性パーセンテージの計算方法、誤検知アラートを排除する方法、および運用監視ワークフローを構築する方法について説明します。

回答優先のまとめ

稼働時間の監視は、地理的に分散されたプローブ サーバーからのスケジュールされた HTTP/HTTPS ping を介して、Web エンドポイントの継続的なテストを自動化します。HTTP 応答ステータス コード (2xx/3xx)、DNS 解決時間、TCP 接続ハンドシェイク、および TLS 証明書の有効性を検証します。高可用性システムは、「スリー ナイン」(稼働時間 99.9% = ダウンタイム最大 8.76 時間/年) や「フォー ナイン」(稼働時間 99.99% = ダウンタイム最大 52.6 分/年) などの SLA 目標をターゲットとしています。誤検知アラートを防ぐために、SimpleOps などの最新のモニターは、Slack、Telegram、電子メール、または Webhook 経由で通知をディスパッチする前に、マルチリージョン プローブのコンセンサスを強制します。

稼働時間監視の仕組み: 内部

自動稼働時間モニタリングは、非同期の分散テレメトリ システムとして動作します。

  1. スケジュールされたプローブ ディスパッチ: 分散監視プローブ ワーカー ノードは、登録されたターゲット URL に対して HTTP/HTTPS リクエストを一定の時間間隔 (60 秒ごとなど) で実行します。
  2. 多層応答検証: 各プローブ ノードは複数のプロトコル層を検査します。
    • DNS 解決: ドメイン ネーム サーバーがドメインを IP アドレスに解決するために必要な遅延を測定します。
    • TCP ハンドシェイク: ネットワーク接続の確立時間を計測します。
    • TLS/SSL ハンドシェイク: 証明書の有効性、暗号スイートのネゴシエーション、および有効期限を検査します。
    • HTTP 応答ステータス コード: サーバーが予期された 2xx 成功または 3xx リダイレクト ステータス コード (4xx クライアント エラーと 5xx サーバー エラーのフラグを立てる) を返すことを検証します。
    • レスポンス ペイロード マッチング: 主要なページ要素が正しく表示されることを確認するためのオプションのキーワード マッチング。
  3. マルチリージョン障害コンセンサス: プライマリ チェック ノードが HTTP エラーまたは接続タイムアウトを検出すると、世界のさまざまな地理的地域 (北米、ヨーロッパ、アジア太平洋など) にあるセカンダリ プローブ ノードに再検証タスクをディスパッチします。複数の独立したノードで障害が確認された場合、正式なインシデントが開始されます。
  4. アラート通知のディスパッチ: インスタント通知は、Slack、Telegram、電子メール、Webhook、または PagerDuty 経由でオンコール エンジニアリング チームにルーティングされます。

稼働時間可用性 SLA と「9 レベル」のスケール

稼働時間の可用性は、特定の測定枠 (月ごとまたは年ごと) における合計稼働時間の割合として表されます。

$$\text{稼働時間 (%)} = \frac{\text{合計時間} - \text{合計ダウンタイム}}{\text{合計時間}} \times 100$$

業界標準の「9 レベル」スケールでは、可用性目標が運用レベルに分類されます。

SLA 可用性ターゲット年間最大許容ダウンタイム月間許容最大ダウンタイム典型的な使用例
99.0% (「トゥー ナインズ」)3日と15時間39分7時間18分開発環境、内部ステージング サイト。
99.5%1日19時間49分3時間39分重要ではないブログ、マーケティング用ランディング ページ。
99.9% (「スリーナインズ」)8時間45分57秒43分49秒標準的な SaaS 製品、商用 Web アプリ。
99.99% (「フォーナインズ」)52分35秒4分23秒電子商取引チェックアウト API、支払いゲートウェイ。
99.999% (「ファイブナイン」)5分15秒25.9秒電気通信、金融取引プラットフォーム。

誤検知のダウンタイムアラートの防止

誤検知アラートは、実際のサービス障害を表すものではない機能停止 (単一のプローブとターゲット サイト間の一時的なネットワーク障害など) を監視ツールが報告したときに発生します。誤検知はアラート疲れを引き起こし、オンコールエンジニアが正当な緊急通知を無視する原因になります。

誤検知アラートを防ぐために、SimpleOps は 3 つの防御策を適用します。

  1. 地理的マルチリージョンのコンセンサス: 単一のプローブ ノードの障害に基づいてアラートがトリガーされることはありません。異なるグローバル領域にある少なくとも 2 つの異なるプローブ ノードが独立して障害を確認する必要があります。
  2. 連続障害しきい値: 優先度の高いエスカレーションをトリガーする前に、複数の連続するチェック サイクル (60 秒チェックが 2 回連続して失敗するなど) にわたって停止が継続する必要があります。
  3. スマートな再試行ロジック: プローブは、ネットワーク タイムアウトが発生すると即時再試行を実行し、一時的なパケット損失と実際のサーバーのダウンタイムを区別します。

稼働時間とパフォーマンスの監視

稼働時間モニタリングは、Web サーバーが実行中であり、HTTP 200 OK 応答を返していることを確認しますが、実際のユーザーが Web サイトの速度や使いやすさを感じるかどうかは評価しません。

Web サイトは、非圧縮画像、メインスレッドの JavaScript 実行ロック、または遅い Core Web Vitals (LCP、INP、CLS) が原因で使用できないままでも、HTTP 稼働時間が 100% になることがあります。このため、最新のエンジニアリング チームは、HTTP 稼働時間の監視と合成 Lighthouse 監査、および SimpleOps での実際のユーザー フィールドの追跡を組み合わせています。

SimpleOps を使用した自動稼働時間監視の実装

SimpleOps は、開発者と DevOps チームが 2 分以内にグローバルな 60 秒の稼働時間チェックを設定できるゼロコード稼働時間監視プラットフォームを提供します。

  • 15 個以上のグローバル チェック ノード: 北米、ヨーロッパ、アジア太平洋、南米全体の可用性を監視します。
  • マルチチャネル アラート: 通知を Slack、Telegram、電子メール、またはカスタム Webhook に即座にルーティングします。
  • 統合された SSL 有効期限追跡: すぐに使用できる HTTPS 証明書の有効期限と信頼チェーンを監視します。
  • パブリック ステータス ページ: リアルタイムのシステム ステータスと過去の稼働時間 SLA メトリクスを顧客や関係者と共有します。

よくある質問

このトピックに関するよくある質問

24時間365日の自動Webサイト監視

ウェブサイトの高速性と操作性を確保

SimpleOps は、15 を超えるグローバル チェック リージョンから稼働時間、SSL セキュリティ証明書、API エンドポイント、および Core Web Vitals を 60 秒ごとに継続的に監視します。