Guide complet des accords de niveau de service (SLA)
Un accord de niveau de service (SLA) est un engagement formel entre un fournisseur de services et ses clients qui définit des mesures de performances mesurables, des seuils de disponibilité et des responsabilités.Dans l'architecture cloud moderne, la disponibilité est exprimée en pourcentage de la durée totale pendant laquelle un site Web, un point de terminaison d'API ou un service d'infrastructure reste pleinement opérationnel et accessible aux utilisateurs finaux.
Pour atteindre une haute disponibilité, il faut équilibrer la résilience du système, la redondance de l'infrastructure, l'automatisation du déploiement et les capacités de surveillance par rapport à l'investissement financier.À mesure que les exigences SLA augmentent de « Trois Neuf » (99,9 %) à « Cinq Neuf » (99,999 %), les temps d'arrêt autorisés passent d'heures par an à quelques minutes seulement.
Explication des niveaux de disponibilité standard
Les normes du secteur classent les objectifs de disponibilité en niveaux « neuf » distincts en fonction du temps d'arrêt maximum autorisé :
| Niveau SLA de disponibilité | Temps d'arrêt quotidien autorisé | Temps d'arrêt mensuel autorisé | Temps d'arrêt annuel autorisé | Profil d'infrastructure |
|---|---|---|---|---|
Les différences critiques entre SLA, SLO et SLI
Les équipes d'ingénierie confondent souvent les SLA, les objectifs de niveau de service (SLO) et les indicateurs de niveau de service (SLI).Comprendre ces distinctions est essentiel pour la fiabilité opérationnelle :
- Indicateur de niveau de service (SLI) : performances de suivi des métriques réelles, mesurées empiriquement en temps réel (par exemple, « 99,94 % des requêtes HTTP ont renvoyé 200 OK au cours des 30 derniers jours »).
- Objectif de niveau de service (SLO) : seuil cible interne fixé par les équipes d'ingénierie pour maintenir une marge de sécurité supérieure au contrat légal (par exemple, « Maintenir une disponibilité de 99,95 % en interne afin que nous ne violions jamais notre accord client de 99,9 % »).
- Accord de niveau de service (SLA) : accord contractuel avec les clients spécifiant des pénalités financières, des crédits de service ou des recours si le service ne parvient pas à atteindre les objectifs de disponibilité convenus.
Comment calculer la disponibilité du SLA
La formule mathématique pour calculer le pourcentage de disponibilité sur une fenêtre de mesure donnée est :
Par exemple, au cours d'un mois de facturation standard de 30 jours (30 x 24 x 3 600 = 2 592 000 secondes), une durée totale d'indisponibilité de 43 minutes et 12 secondes (2 592 secondes) donne :
Meilleures pratiques pour maintenir une disponibilité de 99,99 %
- Implémentez une redondance multirégionale : évitez les déploiements à point de défaillance unique en distribuant le trafic sur plusieurs zones de disponibilité cloud et régions géographiques.
- Automatisez la vérification de l'état et le routage des alertes : déployez des sondes synthétiques multirégionales avec des intervalles de vérification d'une minute pour détecter immédiatement les pannes.
- Découplez les services d'application de base : utilisez le traitement de file d'attente asynchrone et les modèles de disjoncteurs pour empêcher les pannes localisées de composants de faire tomber des systèmes entiers.
- Effectuez régulièrement des exercices de reprise après sinistre : effectuez des tests de basculement automatisés pour garantir que les répliques de bases de données secondaires sont promues de manière transparente pendant les pannes du nœud principal.
Foire aux questions
Questions courantes sur ce sujet
Ne manquez jamais un avertissement de violation du SLA
Le calcul des seuils de temps d’arrêt des SLA n’est que la première étape.SimpleOps surveille en permanence les points de terminaison de votre site Web 24 heures sur 24 et 7 jours sur 7 à partir de plus de 15 emplacements de contrôle mondiaux, alertant votre équipe via Slack, Telegram ou e-mail avant qu'un temps d'arrêt ne viole votre SLA cible.