Was ist Chaos Engineering
Resilienztests durch Ausfälle
Chaos Engineering
Chaos Engineering — die Disziplin des absichtlichen Einführens von Fehlern in ein System, um seine Resilienz und Wiederherstellungsfähigkeiten zu überprüfen.
Chaos Engineering Prinzipien
| Prinzip | Beschreibung | |---------|--------------| | Hypothese | Erwartetes Verhalten formulieren | | Minimaler Blast-Radius | Experimentumfang begrenzen | | Production first | In echter Umgebung testen | | Automatisierung | Kontinuierliche Experimente |
Experimenttypen
- Dienstausfall — Pod/Container beenden
- Netzwerkfehler — Latenz, Paketverlust
- Ressourcenbeschränkungen — CPU/Speicher-Stress
- Verfügbarkeitszonenausfall — AZ-Ausfall
Tools
- Chaos Monkey (Netflix) — Chaos-Klassiker
- Gremlin — Enterprise-Plattform
- Litmus — Kubernetes-nativ
- Chaos Mesh — CNCF-Projekt
Experimentprozess
- Stabilen Zustand definieren
- Hypothese formulieren
- Fehler einschleusen
- Ergebnisse beobachten
- System verbessern