Des incidents réels, erreurs comprises
Chaque étude suit le même format : problème, symptômes, diagnostic, hypothèses, outils, décision, correction, retour arrière, test, résultat mesuré, apprentissage. Quand une cause n'est pas prouvée, c'est écrit.
Une porte dérobée fermée… et une remédiation qui a éteint 16 VM
Un compte administrateur caché a été trouvé et supprimé. La commande de nettoyage a elle-même provoqué la panne la plus lourde du mois.
2 hypothèses · 1 infirmée · erreur documentée
La copie de sauvegarde était morte depuis 4 semaines, et l'alerte ne voyait rien
Le dépôt de copie était plein à 100 %. Les alertes d'espace existaient, mais la métrique qu'elles lisaient ne contenait pas ce dépôt.
3 hypothèses · 2 infirmées
39,6 heures sans alerte : quand la métrique disparaît
Une ligne en trop dans un fichier de métriques a fait rejeter tout le fichier. Les alertes « valeur > 0 » évaluaient un vide et restaient silencieuses.
2 hypothèses · 1 infirmée
Un gel matériel dont la cause n'est pas prouvée, et c'est écrit
L'hôte s'est arrêté net pendant 28 minutes. Plutôt que d'inventer une cause, l'incident a produit des détecteurs, une hypothèse testable et une échéance.
3 hypothèses · 1 infirmée · erreur documentée
Deux déploiements du site en erreur 502, retour arrière en moins de 2 minutes
Le nouveau site ne démarrait pas dans son conteneur en lecture seule. Chaque échec a été annulé immédiatement, et la cause prouvée avant de réessayer.
2 hypothèses · 0 infirmée · erreur documentée
La porte dérobée est revenue : neuf jours sans alerte, puis un détecteur
Douze jours après sa fermeture, la même porte dérobée a été retrouvée par hasard. Cette fois : preuves conservées, confinement sans interruption, cause établie par la mesure, et un détecteur testé.
3 hypothèses · 1 infirmée · erreur documentée