What is Chaos Engineering
Testing resilience through failures
Chaos Engineering
Chaos Engineering — the discipline of intentionally introducing failures into a system to verify its resilience and recovery capabilities.
Chaos Engineering Principles
| Principle | Description | |-----------|-------------| | Hypothesis | Formulate expected behavior | | Minimal blast radius | Limit experiment scope | | Production first | Test in real environment | | Automation | Continuous experiments |
Experiment Types
- Service failure — kill pod/container
- Network failures — latency, packet loss
- Resource constraints — CPU/memory stress
- Availability zone failure — AZ failure
Tools
- Chaos Monkey (Netflix) — chaos classic
- Gremlin — enterprise platform
- Litmus — Kubernetes-native
- Chaos Mesh — CNCF project
Experiment Process
- Define steady state
- Formulate hypothesis
- Inject failure
- Observe results
- Improve system