Что такое SRE
Site Reliability Engineering — надёжность систем
SRE (Site Reliability Engineering) — инженерная дисциплина, объединяющая разработку и эксплуатацию для обеспечения надёжности, масштабируемости и производительности систем.
Основные принципы
- Бюджет ошибок — допустимый уровень сбоев
- SLI/SLO/SLA — метрики и соглашения об уровне сервиса
- Toil reduction — автоматизация рутинных задач
- Postmortem культура — анализ инцидентов без поиска виновных
Ключевые практики
- Мониторинг и алертинг
- Управление инцидентами (on-call)
- Планирование ёмкости
- Chaos engineering
- Автоматизация релизов
Метрики SRE
- Availability — доступность сервиса
- Latency — время отклика
- Error rate — частота ошибок
- MTTR — среднее время восстановления
Инструменты
- Prometheus + Grafana
- PagerDuty / Opsgenie
- Kubernetes
- Terraform