Qu'est-ce que SRE
Ingénierie de Fiabilité de Site — fiabilité des systèmes
SRE (Site Reliability Engineering) est une discipline d'ingénierie combinant développement et opérations pour assurer la fiabilité, l'évolutivité et les performances des systèmes.
Principes fondamentaux
- Budget d'erreur — niveau acceptable de défaillances
- SLI/SLO/SLA — métriques et accords de niveau de service
- Réduction du toil — automatisation des tâches routinières
- Culture postmortem — analyse d'incidents sans recherche de coupables
Pratiques clés
- Monitoring et alerting
- Gestion des incidents (astreinte)
- Planification de capacité
- Chaos engineering
- Automatisation des releases
Métriques SRE
- Disponibilité — temps de fonctionnement du service
- Latence — temps de réponse
- Taux d'erreur — fréquence des erreurs
- MTTR — temps moyen de récupération
Outils
- Prometheus + Grafana
- PagerDuty / Opsgenie
- Kubernetes
- Terraform