V5.3 / INTERACTIVE LABS
Terminal, validation réelle, progression prouvée. Guided pour apprendre, Challenge pour démontrer. Le terminal reste indisponible tant que le gateway isolé n’a pas confirmé une session éphémère.
GUIDED PROTOCOLS / 40
Protocoles de pratique documentée COMPÉTENCE Toutes LNX · Fondations Linux OPS · Administration Linux AUT · Bash & automatisation NET · Réseaux Linux STO · Stockage & reprise SEC · Sécurité Linux CTR · Virtualisation & conteneurs OBS · Observabilité & SRE HPC · Architecture HPC SLM · Administration Slurm MPI · Calcul parallèle GPU · GPU & infrastructure IA IAC · Git, CI/CD & IaC NIVEAU Tous beginner intermediate advanced expert 40 résultats
LAB-LNX-001 BEGINNER · 75 MIN Établir la carte d’identité vérifiable d’un hôte Linux Distinguer noyau, distribution, architecture, init et environnement sans confondre fichier déclaratif et état effectif.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire LAB-AUT-001 INTERMEDIATE · 105 MIN Transformer un script Bash fragile en outil d’exploitation Ajouter validation des entrées, arrêt explicite, journal, dry-run et nettoyage fiable.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire LAB-AUT-004 ADVANCED · 130 MIN Concevoir une promotion canary avec arrêt automatique Relier version immuable, préflight, canary, métriques et décision GO/NO-GO.
0%
Ouvrir le laboratoire LAB-NET-001 BEGINNER · 80 MIN Tracer une résolution DNS de bout en bout Distinguer configuration locale, cache, autorité, transport et réponse applicative.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire LAB-STO-002 ADVANCED · 115 MIN Diagnostiquer une latence I/O sans accuser le disque trop tôt Relier latence, file, saturation, taille de requête, processus et couche de stockage.
0%
Ouvrir le laboratoire LAB-STO-003 INTERMEDIATE · 105 MIN Prouver une restauration de sauvegarde 3-2-1 Valider intégrité, permissions, application et temps de reprise, pas seulement la copie de fichiers.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire LAB-HPC-002 ADVANCED · 125 MIN Construire un benchmark HPC qui mesure ce qu’il annonce Contrôler échauffement, affinité, données, répétitions et bruit avant de comparer.
0%
Ouvrir le laboratoire LAB-SLM-001 INTERMEDIATE · 95 MIN Expliquer pourquoi un job Slurm reste en attente Relier reason code, demande, association, partition et disponibilité sans annuler ni modifier le job.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire ENVIRONNEMENT Cluster Slurm de laboratoire ou sorties synthétiques explicitement marquées, sans modification de politique globale.
Les commandes sont en lecture seule. Toute correction est décrite puis testée dans un clone ou une configuration temporaire. 01 Exporter QoS et associations dans un format relisible.
sacctmgr show qos format=name,priority,flags,grptres,maxtresperuser,maxtresperjob,maxwallPreuve : Matrice limite / portée / utilisateurs affectés. 02 Classer limites par portée et unité TRES.
sacctmgr show assoc tree format=cluster,account,user,partition,qos,shares,grptresPreuve : Tests `--test-only` conservés. 03 Rejouer trois demandes synthétiques sans les soumettre.
scontrol show config | grep -E 'PriorityType|AccountingStorageTRES'Preuve : Exception bornée avec rollback administratif. 04 Identifier effets d’une modification sur les autres associations.
sbatch --test-only --qos=gpu --gres=gpu:1 lab-job.sh05 Proposer exception ciblée, durée et date de revue.
CARNET DU LAB Ouvrir le laboratoire Ouvrir le laboratoire ENVIRONNEMENT Cluster Slurm de laboratoire ou sorties synthétiques explicitement marquées, sans modification de politique globale.
Les commandes sont en lecture seule. Toute correction est décrite puis testée dans un clone ou une configuration temporaire. 01 Définir le job, les steps et la fenêtre UTC.
sacct -X -j 8291 -o jobid,jobname,state,start,end,elapsed,reqtres,alloctres,exitcodePreuve : Chronologie job/step/ingestion. 02 Comparer `squeue`, `sacct` et `scontrol` pendant le cycle de vie.
sstat -j 8291.batch -o jobid,avecpu,averss,maxrssPreuve : Champs comparés avec définition officielle. 03 Lire état de slurmdbd et latence de la base.
systemctl status slurmdbd --no-pager -lPreuve : Aucune correction de base proposée sans sauvegarde. 04 Contrôler TRES demandés, alloués et consommés.
sacctmgr show cluster format=cluster,controlhost,controlport,rpc05 Écrire verdict PASS, DELAYED, PARTIAL ou LOST avec preuve.
CARNET DU LAB LAB-MPI-001 INTERMEDIATE · 105 MIN Diagnostiquer un lancement MPI qui échoue avant le calcul Séparer allocation Slurm, runtime MPI, transport, bibliothèques et application.
0%
Ouvrir le laboratoire Ouvrir le laboratoire LAB-OBS-001 INTERMEDIATE · 95 MIN Diagnostiquer une cible Prometheus DOWN Distinguer découverte, DNS, TLS, transport, endpoint et exposition de métriques.
0%
Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire LAB-GPU-001 INTERMEDIATE · 90 MIN Qualifier la disponibilité réelle d’un GPU Distinguer présence PCIe, pilote chargé, device, runtime CUDA et allocation Slurm.
0%
Ouvrir le laboratoire ENVIRONNEMENT Nœud GPU de laboratoire ; si aucun GPU n’est disponible, utiliser les sorties fournies et marquer SIMULATED.
Les commandes sont en lecture seule. Toute correction est décrite puis testée dans un clone ou une configuration temporaire. 01 Vérifier périphérique PCIe et module noyau.
lspci -nn | grep -i 'vga|3d|nvidia'Preuve : Chaîne PCIe → pilote → device → runtime. 02 Lire version pilote, état GPU et erreurs récentes.
lsmod | grep '^nvidia'Preuve : Aucun résultat matériel inventé. 03 Comparer devices visibles sur l’hôte et dans le job.
nvidia-smi --query-gpu=index,name,uuid,driver_version,memory.total,memory.used --format=csvPreuve : Verdict et périmètre horodatés. 04 Exécuter une requête runtime minimale, pas un benchmark.
journalctl -k --since '-1 hour' | grep -iE 'nvrm|xid|gpu' | tail -5005 Produire verdict AVAILABLE, ALLOCATED, DEGRADED ou BLOCKED.
python3 -c 'import torch; print(torch.cuda.is_available(), torch.cuda.device_count())'CARNET DU LAB LAB-GPU-002 ADVANCED · 110 MIN Diagnostiquer un OOM GPU sans confondre capacité et fuite Relier allocation du job, processus, VRAM, fragmentation et forme de la charge.
0%
Ouvrir le laboratoire ENVIRONNEMENT Job IA synthétique de laboratoire ou journaux anonymisés fournis.
Les commandes sont en lecture seule. Toute correction est décrite puis testée dans un clone ou une configuration temporaire. 01 Figer batch, précision, modèle et versions.
nvidia-smi pmon -c 1Preuve : Courbe mémoire par itération. 02 Comparer mémoire au repos, au pic et après itérations.
nvidia-smi --query-compute-apps=pid,process_name,used_memory,gpu_uuid --format=csvPreuve : Correspondance PID/job/GPU. 03 Associer processus GPU et job Slurm.
sstat -j 8291.batch -o jobid,maxrss,avecpuPreuve : Une variation à la fois et aucun gain inventé. 04 Distinguer croissance continue, pic attendu et fragmentation.
python3 gpu-memory-report.py --iterations 1005 Comparer une seule variation contrôlée, par exemple le batch.
CARNET DU LAB Ouvrir le laboratoire Ouvrir le laboratoire Ouvrir le laboratoire