Tous les projets

PROJECT / DETAIL · Observabilité

HexaMonitoring

Métriques, tableaux de bord et preuves runtime pour les plateformes HPC.

Runtime prouvé

HexaMonitoring intègre Prometheus, Grafana, les exporteurs système et Slurm, l’alerting, la PKI et les contrôles mTLS. Son objectif est de relier chaque état opérationnel à des signaux vérifiables.

ENGINEERING / CASE STUDY

Du problème aux preuves.

PROBLEM

Transformer les états Linux et HPC en signaux vérifiables, actionnables et protégés de bout en bout.

ARCHITECTURE
PrometheusGrafanaLinux exportersSlurm exporterAlertingPKImTLS
ENGINEERING / CHALLENGES

Éviter les alertes sans décision ni propriétaire.

Observer Slurm sans confondre symptômes, politique et capacité.

Sécuriser la collecte entre composants.

VALIDATION / EVIDENCE

Cibles et règles vérifiées au runtime.

Dashboards reliés à des requêtes reproductibles.

Contrôles mTLS et scénarios négatifs de connexion.

METRICSétat mesurablemTLStransport authentifiéRUNBOOKalerte actionnable
LESSONS / LEARNED

Une alerte doit annoncer un symptôme et une décision attendue.

La preuve runtime doit rester lisible hors du tableau de bord.