Przewodniki

„Co to jest monitorowanie czasu pracy? Kompletny przewodnik dla zespołów internetowych i SRE”

„Dowiedz się, jak działa monitorowanie czasu pracy, jak obliczyć procent dostępności SLA, zapobiegać fałszywym alarmom o przestojach i konfigurować kontrole w wielu regionach”.
Autor: „ SimpleOps Inżynieria”Oceniony przez „Hari”Zrecenzowano w dniu 2026-07-25

Monitorowanie czasu pracy to podstawowa dyscyplina operacyjna polegająca na ciągłym sprawdzaniu, czy strony internetowe, aplikacje internetowe i mikrousługi API pozostają dostępne, responsywne i funkcjonalne dla użytkowników na całym świecie.

We współczesnej chmurze obliczeniowej przestoje w działaniu witryny bezpośrednio szkodzą przychodom firmy, reputacji marki, pogarszają rankingi wyszukiwarek i prowadzą do rezygnacji klientów.W tym obszernym przewodniku opisano, jak działa automatyczne monitorowanie czasu pracy, jak obliczać procent dostępności w ramach umowy o gwarantowanym poziomie usług (SLA), jak eliminować fałszywe alarmy pozytywne i jak organizować przepływy pracy związane z monitorowaniem produkcji.

Podsumowanie w pierwszej kolejności

Monitorowanie czasu działania automatyzuje ciągłe testowanie internetowych punktów końcowych za pomocą zaplanowanych pingów HTTP/HTTPS z geograficznie rozproszonych serwerów sondujących.Weryfikuje kody stanu odpowiedzi HTTP (2xx/3xx), czas rozpoznawania DNS, uzgodnienia połączenia TCP i ważność certyfikatu TLS.Systemy o wysokiej dostępności są ukierunkowane na cele SLA, takie jak „trzy dziewiątki” (99,9% czasu sprawności = maksymalnie 8,76 godzin przestojów/rok) lub „Cztery Dziewiątki” (99,99% czasu sprawności = maksymalnie 52,6 minut przestojów/rok).Aby zapobiec fałszywym alarmom, nowoczesne monitory, takie jak SimpleOps, wymuszają konsensus sondowania w wielu regionach przed wysłaniem powiadomień za pośrednictwem Slacka, Telegramu, poczty e-mail lub elementów Webhook.

Jak działa monitorowanie czasu pracy: od podstaw

Zautomatyzowane monitorowanie czasu pracy działa jako asynchroniczny, rozproszony system telemetryczny:

  1. Zaplanowane wysyłanie sond: rozproszone węzły robocze sond monitorujących wykonują żądania HTTP/HTTPS względem zarejestrowanych docelowych adresów URL w ustalonych odstępach czasu (np. co 60 sekund).
  2. Weryfikacja odpowiedzi wielowarstwowej: Każdy węzeł sondy sprawdza wiele warstw protokołu:
    • Rozdzielczość DNS: Mierzy opóźnienie wymagane przez serwery nazw domen do rozpoznania domeny na adres IP.
    • TCP Handshake: Czas trwania ustanawiania połączenia sieciowego.
    • Uzgadnianie TLS/SSL: sprawdza ważność certyfikatu, negocjacje zestawu szyfrów i datę wygaśnięcia.
    • Kod stanu odpowiedzi HTTP: Sprawdza, czy serwer zwrócił oczekiwany kod stanu 2xx Sukces lub 3xx Przekierowanie (oznaczenie błędów klienta 4xx i błędów serwera 5xx).
    • Dopasowanie ładunku odpowiedzi: Opcjonalne dopasowanie słowa kluczowego w celu sprawdzenia, czy kluczowe elementy strony są renderowane poprawnie.
  3. Konsensus dotyczący awarii w wielu regionach: Gdy główny węzeł kontrolny wykryje błąd HTTP lub przekroczono limit czasu połączenia, wysyła zadania ponownej weryfikacji do dodatkowych węzłów sondujących w różnych globalnych regionach geograficznych (np. Ameryka Północna, Europa, Azja i Pacyfik).Jeśli wiele niezależnych węzłów potwierdzi awarię, zostanie otwarte oficjalne zgłoszenie.
  4. Wysyłanie powiadomień o alertach: Natychmiastowe powiadomienia są kierowane do dyżurujących zespołów inżynieryjnych za pośrednictwem aplikacji Slack, Telegram, e-mail, Webhooks lub PagerDuty.

Umowy SLA dotyczące dostępności i skala „dziewiątek”.

Dostępność czasu sprawności wyrażona jest jako procent całkowitego czasu pracy w danym oknie pomiarowym (miesięcznym lub rocznym):

$$\text{Dostępność czasu działania (%)} = \frac{\text{Całkowity czas} - \text{Całkowity czas przestoju}}{\text{Całkowity czas}} \times 100$$

Standardowa w branży skala „Dziewięć” dzieli cele dostępności na poziomy operacyjne:

Docelowa dostępność umowy SLAMaksymalny dozwolony roczny przestójMaksymalny dozwolony miesięczny przestójTypowy przypadek użycia
99,0% („Dwie dziewiątki”)3 dni, 15 godzin, 39 minut7 godzin, 18 minutŚrodowiska programistyczne, wewnętrzne miejsca testowe.
99,5%1 dzień, 19 godzin, 49 minut3 godziny, 39 minutBlogi niekrytyczne, marketingowe strony docelowe.
99,9% („Trzy dziewiątki”)8 godzin, 45 minut, 57 sekund43 minuty, 49 sekundStandardowe produkty SaaS, komercyjne aplikacje internetowe.
99,99% („Cztery Dziewiątki”)52 minuty, 35 sekund4 minuty, 23 sekundyInterfejsy API realizacji transakcji w handlu elektronicznym, bramki płatnicze.
99,999% („Pięć dziewiątek”)5 minut, 15 sekund25,9 sekundyTelekomunikacja, platformy handlu finansowego.

Zapobieganie fałszywym alarmom o przestojach

Fałszywie pozytywne alerty występują, gdy narzędzie monitorujące zgłasza awarię, która nie oznacza rzeczywistej awarii usługi (np. tymczasowa przerwa w sieci między pojedynczą sondą a lokalizacją docelową).Fałszywe alarmy powodują zmęczenie czujnością, powodując, że dyżurujący inżynierowie ignorują uzasadnione powiadomienia o sytuacjach awaryjnych.

Aby zapobiec fałszywym alarmom, SimpleOps wymusza trzy zabezpieczenia:

  1. Konsensus geograficzny dotyczący wielu regionów: Alert nigdy nie jest wyzwalany z powodu awarii pojedynczego węzła sondy.Co najmniej dwa różne węzły sondy w różnych regionach świata muszą niezależnie potwierdzić awarię.
  2. Progi kolejnych awarii: Awarie muszą trwać przez wiele kolejnych cykli kontroli (np. 2 kolejne nieudane kontrole trwające 60 sekund), zanim wyzwolą eskalację o wysokim priorytecie.
  3. Smart Retry Logic: Sondy wykonują natychmiastowe, natychmiastowe ponowne próby po napotkaniu przekroczenia limitu czasu sieci, aby odróżnić przejściową utratę pakietów od rzeczywistego przestoju serwera.

Monitorowanie czasu sprawności i wydajności

Chociaż monitorowanie czasu pracy sprawdza, czy Twój serwer internetowy działa i zwraca odpowiedzi HTTP 200 OK, nie ocenia, jak szybka i użyteczna jest Twoja witryna internetowa dla prawdziwych użytkowników.

Witryna może mieć 100% czasu działania protokołu HTTP, a jednocześnie nie nadawać się do użytku z powodu nieskompresowanych obrazów, blokad wykonywania głównego wątku JavaScript lub wolnych podstawowych wskaźników internetowych (LCP, INP, CLS).Z tego powodu nowoczesne zespoły inżynierów łączą monitorowanie czasu pracy HTTP z syntetycznymi audytami Lighthouse i śledzeniem pola rzeczywistych użytkowników w SimpleOps.

Wdrażanie automatycznego monitorowania czasu pracy za pomocą SimpleOps

SimpleOps zapewnia platformę monitorowania czasu pracy bez użycia kodu, która umożliwia programistom i zespołom DevOps skonfigurowanie globalnej kontroli dostępności w ciągu 60 sekund w czasie krótszym niż dwie minuty:

  • Ponad 15 globalnych węzłów kontrolnych: Monitoruj dostępność w Ameryce Północnej, Europie, regionie Azji i Pacyfiku oraz Ameryce Południowej.
  • Powiadamianie wielokanałowe: Natychmiast kieruj powiadomienia do Slacka, Telegramu, e-maila lub niestandardowych webhooków.
  • Zintegrowane śledzenie wygaśnięcia protokołu SSL: Monitoruj daty wygaśnięcia certyfikatów HTTPS i łańcuchy zaufania od razu po wyjęciu z pudełka.
  • Publiczne strony stanu: udostępniaj klientom i zainteresowanym stronom stan systemu w czasie rzeczywistym i historyczne wskaźniki SLA.

Często zadawane pytania

Często zadawane pytania na ten temat

Zautomatyzowane monitorowanie witryny internetowej 24 godziny na dobę, 7 dni w tygodniu

Upewnij się, że Twoja witryna internetowa pozostaje szybka i funkcjonalna

SimpleOps stale monitoruje czas pracy, certyfikaty bezpieczeństwa SSL, punkty końcowe API i podstawowe wskaźniki internetowe co 60 sekund z ponad 15 globalnych regionów kontroli.