Lesson 01 · 先买 A800 再想并发 → 30-60% GPU 浪费¶
Problem¶
大企业 CIO / 采购一激动, 拍板买 8-16×A800 服务器. 硬件到货 3 个月后 IT 团队才发现: - 实际峰值并发只用了 2×A800 的资源 - 任务形态是短问答 (低 VRAM), 但买的是训练推理混合配置 - 生产利用率 30-60% - 采购部追问 ROI, IT 团队没法解释
Root Cause¶
硬件决策先于场景决策.
常见触发: - 上层"AI 转型"KPI 压力大, 觉得先把 GPU 买了"以后不缺" - 供应商销售话术: "先囤 A800, 涨价前抢" - 没有区分训练 vs 推理 vs 长文 vs 多租户四类工作负载 - 没算清楚峰值并发 (不是平均)
Fix¶
我们进场后必做的 sizing 6 步 (在批 GPU 之前):
- 量化峰值并发 — peak QPS + parallel long-context sessions + 时长分布. 不是平均, 是峰值.
- 冻结 p95 延迟目标 — 对话 2-3s / 语音 800ms / 产线视觉 100ms. 先定, 后选硬件.
- 画清任务形态 — 短问答 vs 长 RAG vs 长上下文 (标书/合同 200-500 页) vs 训练. VRAM / 吞吐 / context 都不同.
- 选定模型+嵌入+rerank 三件套 — 不单独选模型.
- 存储 IO 提前算好 — 索引 × 3-5 倍冗余. checkpoint 分层 (NFS 热 + Ceph 冷).
- 成本封顶提前设 — 部门 Token 配额 + 月度断路器. 生产 6 个月内成本膨胀 3-10× 是常态.
只有以上 6 步都过, 才能决定硬件 (A800 vs 4090 vs H20).
How to Avoid¶
- 把 sizing 通过作为硬件 PO 的前置条件, 写进采购制度
- 每个 AI 项目立项文档必须有 sizing 6 步的结论表
- 采购流程增加"AI 硬件评审"环节, 3 人组 (业务 + IT + 财务) 联合审核
- 供应商竞标必须提供 sizing 报告 (不给 = 不入围)
Related cases¶
- Case 01 · 三甲医院 AW36-72B — sizing 走完才决定 4×A800
- Case 13 · 128 GPU K8s+Slurm — 128 GPU 混编把利用率从 32% 拉到 71%
- Case 02 · 车间断网 — sizing 结论是单 4090, 而不是集群
Related how-tos¶
- Private AI Sizing · 6 Steps — 完整方法论
避坑成本估算: 每台 A800 服务器 ¥50-80w, 半年闲置 = ¥300w+ 直接损失 + IT 团队信誉损失.