Lesson 03 · 训练 + 推理共集群不隔离 → 生产推理被训练挤停

Problem

AI 研究院 / 大集团 AI 中台常见: 12 团队共享 128 GPU. 上线后: - 训练任务一跑, 推理服务响应飙到 30s+ (SLA 3s 直接挂) - SRE 半夜被叫醒去 kill 训练任务 - 训练团队抱怨"跑一半被杀" - 推理团队抱怨"上线就挂" - 集群利用率反而只有 30%

Root Cause

训练 + 推理不能共 GPU 不隔离. 两个工作负载的时间尺度、抢占容忍度、VRAM 模式完全不同.

纯 K8s 或纯 Slurm 都不好: - 纯 K8s: 训练体验差 (无 gang scheduling · 无 batch queue · 长任务被 pod evict) - 纯 Slurm: 推理弹性差 (启动慢 · 无 auto-scale · 无 sidecar)

Fix

我们的 K8s + Slurm 混编方案:

How to Avoid


避坑成本估算: 集群不隔离 = 生产事故上升到 CTO + 团队互相不信任, 6 个月才能恢复.

下一步: 30 min 集群设计对齐