Kompleksowy przewodnik po umowach dotyczących poziomu usług (SLA)
Umowa dotycząca poziomu usług (SLA) to formalne zobowiązanie pomiędzy dostawcą usług a jego klientami, które określa mierzalne wskaźniki wydajności, progi dostępności i obowiązki.W nowoczesnej architekturze chmury dostępność czasu działania wyrażana jest jako procent całkowitego czasu, przez który witryna internetowa, punkt końcowy API lub usługa infrastrukturalna pozostaje w pełni funkcjonalna i dostępna dla użytkowników końcowych.
Osiągnięcie wysokiej dostępności wymaga zrównoważenia odporności systemu, nadmiarowości infrastruktury, automatyzacji wdrażania i możliwości monitorowania z inwestycjami finansowymi.W miarę wzrostu wymagań SLA z „trzech dziewiątek” (99,9%) do „pięciu dziewiątek” (99,999%) dopuszczalny czas przestoju zmniejsza się z godzin rocznie do zaledwie minut.
Wyjaśnienie standardowych poziomów dostępności
Standardy branżowe dzielą docelowe poziomy dostępności na odrębne poziomy „Dziewiątki” w oparciu o maksymalny dozwolony czas przestoju:
| Dostępność Poziom SLA | Dzienny dozwolony przestój | Miesięczny dozwolony przestój | Roczny dozwolony przestój | Profil infrastruktury |
|---|---|---|---|---|
Krytyczne różnice między SLA, SLO i SLI
Zespoły inżynieryjne często mylą umowy SLA, cele poziomu usług (SLO) i wskaźniki poziomu usług (SLI).Zrozumienie tych rozróżnień jest niezbędne dla niezawodności działania:
- Wskaźnik poziomu usług (SLI): rzeczywista, zmierzona empirycznie wydajność śledzenia metryk w czasie rzeczywistym (na przykład „99,94% żądań HTTP zwróciło 200 OK w ciągu ostatnich 30 dni”).
- Cel poziomu usług (SLO): Wewnętrzny docelowy próg ustalony przez zespoły inżynieryjne w celu utrzymania marginesu bezpieczeństwa powyżej umowy prawnej (na przykład „Utrzymuj wewnętrznie czas sprawności na poziomie 99,95%, abyśmy nigdy nie naruszali naszej umowy z klientem na poziomie 99,9%)”.
- Umowa dotycząca poziomu usług (SLA): Umowa umowna z klientami określająca kary finansowe, kredyty za usługę lub środki zaradcze w przypadku, gdy usługa nie osiągnie uzgodnionych celów w zakresie czasu sprawności.
Jak obliczyć dostępność umowy SLA
Wzór matematyczny na obliczenie procentu dostępności w danym oknie pomiarowym to:
Na przykład w standardowym 30-dniowym miesiącu rozliczeniowym (30 x 24 x 3600 = 2 592 000 sekund) całkowity czas przestoju wynoszący 43 minuty i 12 sekund (2592 sekundy) daje:
Najlepsze praktyki dotyczące utrzymywania dostępności na poziomie 99,99%.
- Wdrażaj nadmiarowość w wielu regionach: unikaj wdrożeń w jednym punkcie awarii, dystrybuując ruch w wielu strefach dostępności chmury i regionach geograficznych.
- Automatyzuj sprawdzanie stanu i routing alertów: wdrażaj wieloregionowe sondy syntetyczne z 1-minutowymi interwałami sprawdzania, aby natychmiast wychwytywać awarie.
- Oddziel podstawowe usługi aplikacyjne: korzystaj z asynchronicznego przetwarzania kolejek i wzorców wyłączników automatycznych, aby zapobiegać awariom całych systemów spowodowanych zlokalizowanymi awariami komponentów.
- Przeprowadzaj regularne ćwiczenia w zakresie odtwarzania po awarii: wykonuj automatyczne testy przełączania awaryjnego, aby zapewnić bezproblemową promocję replik dodatkowej bazy danych podczas awarii węzła głównego.
Często zadawane pytania
Często zadawane pytania na ten temat
Nigdy nie przegap ostrzeżenia o naruszeniu umowy SLA
Obliczenie progów przestoju SLA to dopiero pierwszy krok.SimpleOps stale monitoruje punkty końcowe Twojej witryny 24 godziny na dobę, 7 dni w tygodniu z ponad 15 globalnych lokalizacji kontrolnych, powiadamiając Twój zespół za pośrednictwem Slacka, telegramu lub e-maila, zanim przestój naruszy docelową umowę SLA.