Was ist SRE
Site Reliability Engineering — Systemzuverlässigkeit
SRE (Site Reliability Engineering) ist eine Ingenieurdisziplin, die Entwicklung und Betrieb kombiniert, um Zuverlässigkeit, Skalierbarkeit und Leistung von Systemen sicherzustellen.
Kernprinzipien
- Error Budget — akzeptables Fehlerniveau
- SLI/SLO/SLA — Service-Level-Metriken und -Vereinbarungen
- Toil Reduction — Automatisierung von Routineaufgaben
- Postmortem-Kultur — Vorfallanalyse ohne Schuldzuweisung
Schlüsselpraktiken
- Monitoring und Alerting
- Incident Management (On-Call)
- Kapazitätsplanung
- Chaos Engineering
- Release-Automatisierung
SRE-Metriken
- Availability — Service-Verfügbarkeit
- Latency — Antwortzeit
- Error Rate — Fehlerhäufigkeit
- MTTR — mittlere Wiederherstellungszeit
Tools
- Prometheus + Grafana
- PagerDuty / Opsgenie
- Kubernetes
- Terraform