Dans un cluster, accumuler des métriques ne suffit pas. Une bonne chaîne d’observabilité relie la santé des nœuds, les files Slurm, la pression mémoire, l’activité GPU et les incidents utilisateurs.
La priorité est de rendre chaque alerte actionnable : propriétaire, seuil explicite, contexte, procédure et moyen de vérifier le retour à la normale.