Case 13 · 128-GPU Cluster K8s + Slurm Hybrid · Utilization 32% → 71% · Training Queue -60%¶
TL;DR: 128-GPU Cluster K8s + Slurm Hybrid · Utilization 32% → 71% · Training Queue -60%. Direction: AI + DevOps. Scale: 128 GPUs (A800 + 4090), 12 teams. Hard KPI: GPU utilization 32% → 71%, training queue time -60%. Tech: K8s (online inference) + Slurm 22 (offline training), NVIDIA GPU Operator, DCGM. My role: platform architecture, K8s+Slurm fusion, hardware selection, load test, SLA. Client name anonymized under NDA.
- Direction: AI + DevOps
- Industry: AI-research-institute
- Scale: 128 GPUs (A800 + 4090), 12 teams
- Hard KPI: GPU utilization 32% → 71%, training queue time -60%
Problem¶
AI research institute with 12 teams sharing cluster, GPU utilization only 32%, training tasks queued 3-7 days.
Solution¶
K8s (online inference / short tasks / elastic) + Slurm (offline training / long tasks / preemptible) hybrid orchestration, unified GPU resource pool at bottom.
Tech Stack¶
K8s (online inference) + Slurm 22 (offline training), NVIDIA GPU Operator, DCGM
Result (Hard KPIs)¶
GPU utilization 32% → 71%, training queue time -60%
My Role¶
platform architecture, K8s+Slurm fusion, hardware selection, load test, SLA
Related¶
Next: Download PDF · 30-min alignment
Client name anonymized · KPIs verified · Real client name disclosable under NDA.