案例 13 · 128 卡 GPU 集群 K8s + Slurm 混编 · 利用率 32% → 71% · 排队 -60%¶
TL;DR: 128 卡 GPU 集群 K8s + Slurm 混编 · 利用率 32% → 71% · 排队 -60%. 方向: AI + DevOps. 业务规模: 128 GPUs (A800 + 4090), 12 teams. 关键硬指标: GPU utilization 32% → 71%, training queue time -60%. 技术栈: K8s (online inference) + Slurm 22 (offline training), NVIDIA GPU Operator, DCGM. 我的角色: platform architecture, K8s+Slurm fusion, hardware selection, load test, SLA. 客户名已隐去 (NDA).
- 方向: AI + DevOps
- 行业: AI-research-institute
- 业务规模: 128 GPUs (A800 + 4090), 12 teams
- 硬指标: GPU utilization 32% → 71%, training queue time -60%
Problem (业务问题)¶
AI 研究院 12 个团队共用集群, GPU 利用率仅 32%, 训练任务排队 3-7 天.
Solution (解决方案)¶
K8s (在线推理 / 短任务 / 弹性) + Slurm (离线训练 / 长任务 / 可抢占) 混编, 底层统一 GPU 资源池.
Tech Stack¶
K8s (online inference) + Slurm 22 (offline training), NVIDIA GPU Operator, DCGM
Result (硬指标)¶
GPU utilization 32% → 71%, training queue time -60%
My Role (我的角色)¶
platform architecture, K8s+Slurm fusion, hardware selection, load test, SLA
相关¶
客户名已隐去 · 硬指标真实 · NDA 下可披露真实客户.