Aller au contenu
Étude de cas · 2026-09-23

Un gel matériel dont la cause n'est pas prouvée, et c'est écrit

L'hôte s'est arrêté net pendant 28 minutes. Plutôt que d'inventer une cause, l'incident a produit des détecteurs, une hypothèse testable et une échéance.

Symptômes

  • Journal coupé net
  • Aucune trace de panique, de manque mémoire ou d'erreur matérielle
  • Température normale au dernier relevé

Hypothèses

  • Coupure électrique généraleinfirmée
  • Blocage du SSD système (gestion d'énergie SATA)non prouvée
  • Alimentation de l'hôtenon prouvée

Problème

Arrêt non propre de l'hôte de virtualisation, sans panique noyau ni message d'erreur.

Diagnostic

Le registre de réinitialisation du chipset n'indique ni bouton, ni surchauffe, ni chien de garde : un cycle d'alimentation sans action humaine connue.

Décision

Ne rien déclarer résolu ; installer de quoi prouver la cause à la prochaine occurrence.

Correction

Sentinelle noyau (5 min) avec alertes, enregistreur d'incident au démarrage non propre avec copie hors SSD, témoin externe, redémarrage automatique en cas de panique, gestion d'énergie SATA passée en performance.

Retour arrière

Chaque mesure est indépendante et réversible via la chaîne de changement.

Test

Rejeu sur les journaux réels : la sentinelle aurait alerté 11 h avant le gel.

Résultat mesuré

Cause toujours non prouvée. Échéance fixée au 23/10/2026 : 0 erreur SATA en 30 jours renforcera l'hypothèse du SSD.

Ce qui a été mal fait

Une fausse alerte critique (bannière d'un pilote lue comme une erreur) et des valeurs SMART mal lues dans la première version de l'analyseur, corrigées le jour même.

Apprentissage

Une hypothèse écrite n'est pas une hypothèse testée : la piste SSD avait été notée deux fois en août, sans test ni alerte.