Aller au contenu
Étude de cas · 2026-09-11

La copie de sauvegarde était morte depuis 4 semaines, et l'alerte ne voyait rien

Le dépôt de copie était plein à 100 %. Les alertes d'espace existaient, mais la métrique qu'elles lisaient ne contenait pas ce dépôt.

Symptômes

  • Tâche de copie en échec : « No space left on device »
  • 7 VM sur 15 sans copie de secours depuis le 14 août
  • Alertes d'espace disque restées inactives

Hypothèses

  • Droits insuffisants du compte de supervisioninfirmée
  • Fichiers de métriques absents sur le serveurinfirmée
  • Cause racine du défaut de l'exporteurnon prouvée

Problème

Le seul des trois dépôts sans règle de rétention avait accumulé 176 instantanés jusqu'à saturation.

Diagnostic

L'exporteur de métriques ne renvoyait qu'un dépôt sur trois : les règles d'alerte étaient correctes mais évaluaient un vide.

Décision

Aucune purge destructive sans accord explicite : le dépôt saturé est figé en archive froide, la redondance est portée par une autre copie.

Correction

Copie quotidienne de tous les invités vers un dépôt sur le SSD interne, vérifiée et restaurée pour de vrai ; nouvelle métrique d'espace qui lit la configuration réelle des dépôts plutôt qu'une liste supposée.

Retour arrière

La nouvelle métrique est indépendante ; elle se retire sans toucher aux règles existantes. Le dépôt figé reste intact.

Test

Validé sur un cas réel : l'alerte critique s'est déclenchée sur le dépôt plein.

Résultat mesuré

Redondance rétablie sur un autre dépôt ; les trois dépôts visibles par la supervision. La purge de l'archive froide attend toujours un accord.

Apprentissage

Vérifier qu'une alerte voit réellement toutes ses cibles, pas seulement qu'elle existe. Une cause racine non élucidée reste une dette ouverte, jamais « résolue ».