O que é Engenharia do caos
Teste de resiliência através de falhas
Engenharia do Caos
Chaos Engineering — a disciplina de introduzir falhas intencionalmente em um sistema para verificar sua resiliência e capacidades de recuperação.
Princípios do Chaos Engineering
| Princípio | Descrição | |-----------|-----------| | Hipótese | Formular comportamento esperado | | Raio de explosão mínimo | Limitar escopo do experimento | | Produção primeiro | Testar em ambiente real | | Automação | Experimentos contínuos |
Tipos de Experimentos
- Falha de serviço — matar pod/container
- Falhas de rede — latência, perda de pacotes
- Restrições de recursos — estresse CPU/memória
- Falha de zona de disponibilidade — falha AZ
Ferramentas
- Chaos Monkey (Netflix) — clássico do caos
- Gremlin — plataforma enterprise
- Litmus — nativo do Kubernetes
- Chaos Mesh — projeto CNCF
Processo do Experimento
- Definir estado estável
- Formular hipótese
- Injetar falha
- Observar resultados
- Melhorar sistema