Uma das maiores contribuições do Site Reliability Engineering (SRE) para a Excelência Operacional é transformar a confiabilidade em algo mensurável.
Muitas empresas afirmam que desejam sistemas “altamente disponíveis” ou “muito estáveis”, mas o que isso significa na prática?
É aqui que entram três conceitos fundamentais:
- SLI (Service Level Indicator)
- SLO (Service Level Objective)
- Error Budget
Esses conceitos permitem que decisões técnicas deixem de ser baseadas em opiniões e passem a ser guiadas por métricas reais.
O que é um SLI?
SLI (Service Level Indicator) é uma métrica que representa a qualidade percebida pelo usuário. Em outras palavras, é aquilo que realmente importa para quem utiliza o sistema. Exemplos de SLIs:
- Disponibilidade da aplicação
- Tempo de resposta das APIs
- Taxa de erros HTTP 5xx
- Tempo de processamento de pedidos
- Latência de consultas ao banco de dados
Imagine uma API que recebe 1 milhão de requisições por dia, se 999 mil forem processadas com sucesso, o SLI de disponibilidade será de 999.000 ÷ 1.000.000 = 99,9%. Assim o SLI é apenas a medição, ele mostra a realidade atual do serviço.
O que é um SLO?
SLO (Service Level Objective) é a meta que você define para o SLI, se o SLI mede a realidade, o SLO define qual resultado é considerado aceitável.:Um exemplo
- SLI: Disponibilidade da API
- SLO: 99,9% de disponibilidade mensal
Isso significa que a equipe aceita até 0,1% de indisponibilidade durante o período.
Outro exemplo
- SLI: Tempo de resposta
- SLO: 95% das requisições devem responder em menos de 300 ms
Perceba que o objetivo não é alcançar 100%. Buscar disponibilidade absoluta geralmente gera custos muito altos e pouca vantagem para o negócio. O segredo está em encontrar o equilíbrio adequado.
O que é Error Budget?
Error Budget é o conceito que conecta confiabilidade e inovação, representa a quantidade de falhas que o sistema pode ter sem violar o SLO definido.
Vamos usar um exemplo simples.
SLO: 99,9% de disponibilidade mensal; um mês possui aproximadamente: 30 dias = 43.200 minutos 0,1% de indisponibilidade permitida: 43.200 × 0,001 = 43,2 minutos. Seu Error Budget é de aproximadamente 43 minutos por mês.
Isso significa que a aplicação pode ficar indisponível por até 43 minutos sem descumprir o objetivo estabelecido.
O que é importante no Error Budget?
Muitas organizações enfrentam um conflito constante como: equipe de Produto quer lançar novas funcionalidades; equipe de Operações quer evitar riscos. E o Error Budget cria uma forma objetiva de tomar decisões.
Cenário 1: Budget saudável
Se o sistema está operando bem e consumiu apenas 5 minutos do orçamento de erro, existe espaço para assumir mais riscos e acelerar entregas.
Cenário 2: Budget quase esgotado
Se já foram consumidos 40 dos 43 minutos disponíveis, talvez seja o momento de reduzir mudanças e focar em estabilidade.
Assim, as decisões deixam de ser emocionais e passam a ser baseadas em dados
E como isso se conecta ao AWS Well-Architected?
O pilar de Excelência Operacional incentiva organizações a:
- Medir resultados
- Aprender continuamente
- Melhorar processos
- Automatizar operações
SLIs, SLOs e Error Budgets fornecem exatamente os indicadores necessários para avaliar se a operação está realmente funcionando como esperado, além disso, essas métricas podem ser acompanhadas utilizando serviços da AWS como:
- Amazon CloudWatch
- AWS X-Ray
- Amazon Managed Grafana
- Amazon OpenSearch Service
- AWS Health Dashboard
Conclusão
Uma operação madura não busca simplesmente “não falhar”. Ela entende quanto pode falhar sem impactar significativamente seus usuários e utiliza essa informação para equilibrar inovação e confiabilidade.
Assim SLIs mostram o desempenho atual; SLOs definem o objetivo; Error Budgets determinam quanto risco pode ser assumido. Juntos, esses três conceitos formam uma das bases mais importantes da cultura SRE e da Excelência Operacional moderna.
Conte com a nossa ajuda para todos esses conceitos.