合成稼働時間とパフォーマンスの診断監査について
合成稼働時間の監視には、リモート プローブ サーバーからの自動化されたスケジュールされた HTTP/HTTPS プロトコル リクエストの実行が含まれ、ターゲットの Web アプリケーション、API、およびネットワーク インフラストラクチャが正常で、アクセス可能で、応答性が維持されていることを確認します。
従来の監視ツールは内部サーバー エージェントのメトリクス (CPU 使用率やディスク I/O など) に依存しますが、合成外部チェックはパブリック インターネット全体でエンドユーザーの観点から可用性を評価します。このマルチリージョンの観点により、内部エージェントのメトリクスが見逃すネットワーク ルーティングの異常、DNS 伝播エラー、CDN エッジ キャッシュ エラー、およびクラウド ゲートウェイのタイムアウトが検出されます。
主要なネットワーク遅延コンポーネントの分解
単一の HTTP Web チェックで、複数の連続したネットワーク プロトコル フェーズを測定します。これらのコンポーネントを理解すると、エンジニアリング チームがパフォーマンス低下時のボトルネックを正確に特定するのに役立ちます。
- DNS ルックアップ期間: プローブ サーバーがドメイン ネーム システム (DNS) リゾルバーにクエリを実行し、ドメイン名を IP アドレスに変換するのに必要な時間。DNS 遅延が長い場合は、DNS プロバイダーのボトルネックまたは TTL 設定がキャッシュされていないことを示します。
- TCP 接続ハンドシェイク: プローブ ノードとターゲット オリジン サーバーの間にネットワーク ソケットを確立する最初の 3 ウェイ TCP ハンドシェイク (SYN、SYN-ACK、ACK) の期間。
- TLS ネゴシエーション時間: 暗号化された HTTPS 接続の場合、TLS 暗号化ハンドシェイクの実行、セキュリティ証明書の交換、安全な暗号スイートの確立に必要な時間。
- 最初のバイトまでの時間 (TTFB): HTTP GET リクエストを送信してから、プローブがサーバーから応答データの最初のバイトを受信するまでの経過時間。TTFB が高い場合は、バックエンド アプリケーションの処理が遅いか、インデックスが作成されていないデータベース クエリを示します。
マルチリージョンコンセンサスにより誤検知アラートが排除される理由
誤検知の停止アラートは、DevOps チームやオンコール エンジニアリング チームにとってアラート疲労の主な原因です。単一のプローブ ノードとオリジン サーバー間の一時的な局所的な ISP ルーティングの不具合や一時的なネットワークの輻輳は、必ずしも Web サイトの真の機能停止を構成するわけではありません。
SimpleOps は、マルチリージョンのコンセンサス検証を実装することで誤ったアラートを排除します。プライマリ チェック ノードが 2xx 以外の HTTP ステータス コードまたは接続タイムアウトを検出すると、隣接する地理的領域にあるセカンダリ プローブ ノードが即座に並列検証チェックを実行します。公式の停止アラートは、マルチリージョンの合意により障害が確認された場合にのみトリガーされます。
よくある質問
このトピックに関するよくある質問
24時間365日の継続的な監視が必要ですか?
1 回限りのチェックは、ある瞬間だけをテストします。SimpleOps は、15 か所以上のグローバル チェック ロケーションからエンドポイントを 60 秒ごとに継続的に監視し、停止が発生した場合には Slack、Telegram、PagerDuty、または電子メールを介して即時に通知を送信します。