方向 5 · AI + DevOps (AIOps · MLOps · CI/CD)¶
AI 系统的生产化 = 观测 + 压测 + 兜底 + 熔断 + 回滚. 不是"上线跑通就完事". 3 个代表案例 + 交付关键动作.
核心能力¶
- GPU 集群: K8s + Slurm 混合 · NVIDIA GPU Operator · MIG · DCGM
- 观测: Prometheus · Grafana · OpenTelemetry · ClickHouse · Loki
- CI/CD: GitLab / GitHub Actions · LLM Code Review · 单测生成
- AIOps: 日志 + Metric + Trace 三源融合 · LLM 根因关联
- 存储: NFS · Ceph · Lustre · GPU 直通 · checkpoint 分层
3 个代表案例¶
Case 01 · GPU 集群混合调度 (K8s + Slurm) 128 卡训练平台¶
- 业务问题: 12 个 AI 团队共享集群, GPU 利用率仅 32%, 训练排队常达 3-7 天
- 技术栈: K8s (在线推理) + Slurm 22 (离线训练) 混合编排, NVIDIA GPU Operator, DCGM
- 关键工程: 抢占策略 · 混部隔离 · GPU 直通 · 显存碎片 · checkpoint 分层 · 优先级队列
- 硬指标: GPU 利用率 32% → 71% · 训练排队时长 -60% · 12 个团队接入
- 我的角色: 平台架构 · K8s+Slurm 融合 · 硬件选型 · 压测 · SLA
Case 02 · AIOps 告警根因分析 (日志 + Metric + Trace 融合)¶
- 业务问题: 400+ 微服务, 告警 5000+/天, 根因定位靠资深 SRE 手工关联
- 技术栈: OpenTelemetry 采集 · ClickHouse 存储 · LLM 根因关联 · SRE 反馈闭环
- 算法: 三源时间对齐 · LLM 关联假设 · 候选根因 Top-3 排序 · SRE 反馈重训
- 硬指标: MTTR 45min → 12min · 告警疲劳减半 · SRE 团队从救火转向稳定性工程
- 我的角色: 数据流架构 · LLM 关联工程 · SRE 联调
Case 03 · CI/CD AI 代码审查 + 单测自动生成¶
- 业务问题: 200+ 工程师, 50k commits/月, Code Review 排队 P50 24 小时
- 技术栈: GitLab webhook · LLM router (成本敏感 → DeepSeek, 复杂逻辑 → GPT-4o) · 单测生成
- 策略: 静态分析 + 关联最近 commit + 规则库匹配, 高风险人审, 中低风险自动通过
- 硬指标: Code Review P50 24h → 1h · 缺陷逃逸双位数下降 · 工程师满意度 +30%
- 我的角色: 平台架构 · CI/CD 插件 · 模型路由 · 效果验收
交付关键动作¶
- 硬件选型前置: 128 卡 = 峰值并发 · p95 延迟 · 训练 shape · 存储 IO 全部量化后再选
- 观测三层: DCGM (GPU) + Prometheus (系统) + LLM API 成本追踪
- 压测: 168h 稳定性 + 峰值 3× 冲击, 不做一次性验收
- 失效兜底: 单机 · 网络 · 存储 · 模型热切换, 每种失效有明确 SOP
- 成本封顶: 部门 quota + 单任务上限 + 日预算熔断, 3 层结合
常见错配¶
- ❌ 上了 K8s + GPU 但没 GPU Operator, GPU 分不出去
- ❌ 训练 checkpoint 都放本地 NFS, IO 打爆
- ❌ Prometheus 只监控 CPU/内存, GPU 温度/显存不监, 硬件报废
- ❌ CI/CD 用 GPT-4 但无 quota, 单次 review 花掉 5 美金
相关阅读¶
下一步: 下载 PDF · 30 min 集群/AIOps 方案对齐