La copie de sauvegarde était morte depuis 4 semaines, et l'alerte ne voyait rien
Le dépôt de copie était plein à 100 %. Les alertes d'espace existaient, mais la métrique qu'elles lisaient ne contenait pas ce dépôt.
Symptômes
- Tâche de copie en échec : « No space left on device »
- 7 VM sur 15 sans copie de secours depuis le 14 août
- Alertes d'espace disque restées inactives
Hypothèses
- Droits insuffisants du compte de supervisioninfirmée
- Fichiers de métriques absents sur le serveurinfirmée
- Cause racine du défaut de l'exporteurnon prouvée
Problème
Le seul des trois dépôts sans règle de rétention avait accumulé 176 instantanés jusqu'à saturation.
Diagnostic
L'exporteur de métriques ne renvoyait qu'un dépôt sur trois : les règles d'alerte étaient correctes mais évaluaient un vide.
Décision
Aucune purge destructive sans accord explicite : le dépôt saturé est figé en archive froide, la redondance est portée par une autre copie.
Correction
Copie quotidienne de tous les invités vers un dépôt sur le SSD interne, vérifiée et restaurée pour de vrai ; nouvelle métrique d'espace qui lit la configuration réelle des dépôts plutôt qu'une liste supposée.
Retour arrière
La nouvelle métrique est indépendante ; elle se retire sans toucher aux règles existantes. Le dépôt figé reste intact.
Test
Validé sur un cas réel : l'alerte critique s'est déclenchée sur le dépôt plein.
Résultat mesuré
Redondance rétablie sur un autre dépôt ; les trois dépôts visibles par la supervision. La purge de l'archive froide attend toujours un accord.
Apprentissage
Vérifier qu'une alerte voit réellement toutes ses cibles, pas seulement qu'elle existe. Une cause racine non élucidée reste une dette ouverte, jamais « résolue ».