Lesson 01 · 先买 A800 再想并发 → 30-60% GPU 浪费

Problem

大企业 CIO / 采购一激动, 拍板买 8-16×A800 服务器. 硬件到货 3 个月后 IT 团队才发现: - 实际峰值并发只用了 2×A800 的资源 - 任务形态是短问答 (低 VRAM), 但买的是训练推理混合配置 - 生产利用率 30-60% - 采购部追问 ROI, IT 团队没法解释

Root Cause

硬件决策先于场景决策.

常见触发: - 上层"AI 转型"KPI 压力大, 觉得先把 GPU 买了"以后不缺" - 供应商销售话术: "先囤 A800, 涨价前抢" - 没有区分训练 vs 推理 vs 长文 vs 多租户四类工作负载 - 没算清楚峰值并发 (不是平均)

Fix

我们进场后必做的 sizing 6 步 (在批 GPU 之前):

  1. 量化峰值并发 — peak QPS + parallel long-context sessions + 时长分布. 不是平均, 是峰值.
  2. 冻结 p95 延迟目标 — 对话 2-3s / 语音 800ms / 产线视觉 100ms. 先定, 后选硬件.
  3. 画清任务形态 — 短问答 vs 长 RAG vs 长上下文 (标书/合同 200-500 页) vs 训练. VRAM / 吞吐 / context 都不同.
  4. 选定模型+嵌入+rerank 三件套 — 不单独选模型.
  5. 存储 IO 提前算好 — 索引 × 3-5 倍冗余. checkpoint 分层 (NFS 热 + Ceph 冷).
  6. 成本封顶提前设 — 部门 Token 配额 + 月度断路器. 生产 6 个月内成本膨胀 3-10× 是常态.

只有以上 6 步都过, 才能决定硬件 (A800 vs 4090 vs H20).

How to Avoid


避坑成本估算: 每台 A800 服务器 ¥50-80w, 半年闲置 = ¥300w+ 直接损失 + IT 团队信誉损失.

下一步: 30 min 项目 pre-mortem · Portfolio PDF