Hva er SRE
Site Reliability Engineering — systempålitelighet
SRE (Site Reliability Engineering) er en ingeniørdisiplin som kombinerer utvikling og drift for å sikre pålitelighet, skalerbarhet og ytelse i systemer.
Grunnleggende prinsipper
- Feilbudsjett — akseptabelt nivå av feil
- SLI/SLO/SLA — tjenestenivåmålinger og avtaler
- Toil-reduksjon — automatisering av rutineoppgaver
- Postmortem-kultur — hendelsesanalyse uten skyld
Nøkkelpraksiser
- Overvåking og varsling
- Hendelseshåndtering (vakt)
- Kapasitetsplanlegging
- Chaos engineering
- Release-automatisering
SRE-målinger
- Tilgjengelighet — tjenestens oppetid
- Forsinkelse — responstid
- Feilrate — feilfrekvens
- MTTR — gjennomsnittlig gjenopprettingstid
Verktøy
- Prometheus + Grafana
- PagerDuty / Opsgenie
- Kubernetes
- Terraform