Guia abrangente para acordos de nível de serviço (SLAs)
Um Acordo de Nível de Serviço (SLA) é um compromisso formal entre um provedor de serviços e seus clientes que define métricas de desempenho mensuráveis, limites de disponibilidade e responsabilidades.Na arquitetura de nuvem moderna, a disponibilidade do tempo de atividade é expressa como uma porcentagem do tempo total que um site, endpoint de API ou serviço de infraestrutura permanece totalmente operacional e acessível aos usuários finais.
Alcançar alta disponibilidade requer equilibrar a resiliência do sistema, a redundância da infraestrutura, a automação da implantação e os recursos de monitoramento em relação ao investimento financeiro.À medida que os requisitos de SLA aumentam de “Três Noves” (99,9%) para “Cinco Noves” (99,999%), o tempo de inatividade permitido diminui de horas por ano para meros minutos.
Níveis de disponibilidade padrão explicados
Os padrões da indústria categorizam as metas de disponibilidade em níveis distintos de "Noves" com base no tempo de inatividade máximo permitido:
| Nível de SLA de disponibilidade | Tempo de inatividade diário permitido | Tempo de inatividade permitido mensalmente | Tempo de inatividade anual permitido | Perfil de infraestrutura |
|---|---|---|---|---|
As diferenças críticas entre SLA, SLO e SLI
As equipes de engenharia frequentemente confundem SLAs, Objetivos de Nível de Serviço (SLOs) e Indicadores de Nível de Serviço (SLIs).Compreender essas distinções é essencial para a confiabilidade operacional:
- Indicador de nível de serviço (SLI): a métrica real medida empiricamente do desempenho de rastreamento em tempo real (por exemplo, "99,94% das solicitações HTTP retornaram 200 OK nos últimos 30 dias").
- Objetivo de nível de serviço (SLO): o limite interno definido pelas equipes de engenharia para manter a margem de segurança acima do contrato legal (por exemplo, "Manter 99,95% de tempo de atividade internamente para que nunca violamos nosso acordo de 99,9% com o cliente").
- Acordo de Nível de Serviço (SLA): O acordo contratual com os clientes especificando penalidades financeiras, créditos de serviço ou soluções se o serviço não cumprir as metas de tempo de atividade acordadas.
Como calcular a disponibilidade do SLA
A fórmula matemática para calcular a porcentagem de disponibilidade em uma determinada janela de medição é:
Por exemplo, em um mês de faturamento padrão de 30 dias (30 x 24 x 3.600 = 2.592.000 segundos), uma duração total de inatividade de 43 minutos e 12 segundos (2.592 segundos) produz:
Melhores práticas para manter 99,99% de disponibilidade
- Implemente redundância multirregional: evite implantações de ponto único de falha distribuindo o tráfego em diversas zonas de disponibilidade de nuvem e regiões geográficas.
- Automatize a verificação de integridade e o roteamento de alertas: implante sondagens sintéticas multirregionais com intervalos de verificação de 1 minuto para detectar interrupções imediatamente.
- Desacople os principais serviços de aplicativos: use processamento de filas assíncronas e padrões de disjuntores para evitar que falhas localizadas de componentes derrubem sistemas inteiros.
- Realize exercícios regulares de recuperação de desastres: execute testes automatizados de failover para garantir que as réplicas de bancos de dados secundários sejam promovidas perfeitamente durante interrupções do nó primário.
Perguntas frequentes
Perguntas comuns sobre este tópico
Nunca perca um aviso de violação de SLA
Calcular os limites de tempo de inatividade do SLA é apenas a primeira etapa.SimpleOps monitora continuamente os endpoints do seu site 24 horas por dia, 7 dias por semana, a partir de mais de 15 locais de verificação globais, alertando sua equipe via Slack, Telegram ou e-mail antes que o tempo de inatividade viole seu SLA alvo.