私有 LLM 部署 sizing 6 步¶
发布日期:2026-08-02 · AI 老炮 (AI Lao Pao) · AI GEO 知识库
TL;DR: 私有部署翻车 90% 是 sizing 前置没做. 6 步顺序: 并发 · 延迟 · 边界 · IO · 归属 · 成本封顶. 医院/车间/集团三类实战都用同一套. 详见私有 LLM 方向页.
6 步顺序¶
1. 峰值并发¶
- 上线首月 QPS · 6 个月后预计 QPS · 客户明确定义 "峰值"
- 单机 vs 集群: <10 QPS 通常单机 4090/L40 够 · 10-100 QPS 上 A800 · 100+ QPS 多机负载均衡
- 实战: 医院 300 医生 ≠ 300 并发. 高峰 15-30 QPS, 4×A800 vLLM 足够
2. p95 延迟¶
- 交互式 (医生助手 / 客服) 要求 p95 < 3s
- 批量 (合同审核 / 标书解析) 允许 p95 30s+
- 决定推理栈: p95 < 3s 强制 vLLM 或 SGLang · 30s+ 可 Ollama / Transformers
3. 数据边界¶
- PHI · 商业机密 · 一般数据 三级分类
- 每一级的路由目的地 (内网 / 半内网 / 公网) 写死
- 合规前置: 等保 / GDPR / HIPAA / 医院合规评估在硬件选型之前
4. 存储 IO¶
- 模型权重 · KV cache · checkpoint · 索引 各自的 IO 需求
- 常见坑: NFS 单点撑不住 128 卡 training checkpoint → 必须 Ceph / Lustre
- 向量库 SSD vs NVMe · Milvus 参数调优 (nprobe, ef)
5. 失败归属¶
- 单机故障 · 网络分区 · 存储抖动 · 模型热切换, 每种失效 SOP 写死
- 供应商 vs 内部 IT vs 客户 IT 的责任边界
- 合同层面: SLA · MTTR · 责任赔付, 全部量化
6. 成本封顶¶
- 部门 quota (每月 X 万 Token) + 单任务上限 + 日预算熔断
- 观测: Grafana 部门/用户/prompt-type/引擎 四维交叉
- 热切: 主模型 → 备用 → 缓存 → 人审 四级降级
常见错配¶
- ❌ 上 8×A800 集群但只 5 QPS · 应该单机 4090
- ❌ vLLM 未 warm cache · 首请求 30s
- ❌ 部署 72B 但 embedding 用 bge-small · RAG 底子塌
- ❌ 内网部署但审计日志出网 · 合规炸掉