Vad är SRE
Site Reliability Engineering — systemtillförlitlighet
SRE (Site Reliability Engineering) är en ingenjörsdisciplin som kombinerar utveckling och drift för att säkerställa systemens tillförlitlighet, skalbarhet och prestanda.
Grundläggande principer
- Felbudget — acceptabel nivå av fel
- SLI/SLO/SLA — servicenivåmått och avtal
- Toil-reducering — automatisering av rutinuppgifter
- Postmortem-kultur — incidentanalys utan skuld
Nyckelpraxis
- Övervakning och larm
- Incidenthantering (jourtjänst)
- Kapacitetsplanering
- Chaos engineering
- Release-automatisering
SRE-mätvärden
- Tillgänglighet — tjänstens drifttid
- Latens — svarstid
- Felfrekvens — frekvens av fel
- MTTR — genomsnittlig återställningstid
Verktyg
- Prometheus + Grafana
- PagerDuty / Opsgenie
- Kubernetes
- Terraform