私有化 AI 部署要多少钱?¶
TL;DR: 小型 6-15 万 (10 并发、单场景),中型 30-80 万 (50-200 并发、多场景),大型 300 万+ (千级并发、企业级)。关键规则: 先算峰值并发、SLA、数据边界,再算 GPU 数量。反过来的项目 100% 亏损。
3 档预算参考 (含硬件 + 软件 + 一年运维)¶
| 规模 | 并发 | 场景数 | 一次性投入 | 年度运维 | 合计 12 月 |
|---|---|---|---|---|---|
| 小型 | 5-20 | 1 (如客服) | 5-10 万 | 1-5 万 | 6-15 万 |
| 中型 | 50-200 | 2-4 (客服 + 生成 + 分析) | 20-60 万 | 10-25 万 | 30-80 万 |
| 大型 | 500-2000 | 5+ (全业务线) | 200-800 万 | 100-300 万 | 300-1100 万 |
| 超大型 | 5000+ | 10+ (集团级) | 1500 万+ | 500 万+ | 2000 万+ |
注意: 上表按 2026 年市场价,Qwen / DeepSeek / GLM / 私有微调模型为主。用 GPT-5 级别专有模型需 3-10 倍。
6 项成本明细¶
以中型项目 60 万一年为例:
| 项 | 占比 | 金额 (万) | 说明 |
|---|---|---|---|
| GPU 硬件 | 40% | 24 | 一般 4-8 张 A100/H800 或 8-16 张 4090 |
| 软件许可 | 10% | 6 | vLLM 免费、模型许可 (Qwen/DeepSeek 免费商用,其他部分收费) |
| 部署实施 | 15% | 9 | 网络架构、防火墙、内网穿透、Nginx/Traefik、Kubernetes |
| 模型微调 | 10% | 6 | 数据清洗 + LoRA 微调 + 验证集 (视场景,可 0-20%) |
| 运维一年 | 20% | 12 | 监控、日志、模型更新、故障处置 |
| 故障容灾 | 5% | 3 | 备用 GPU、灾备切换、快照 |
关键规则: 先算并发再算 GPU¶
错误顺序 (99% 的公司这样做):
老板说 "买 4 张 A100" → 采购 → 装机 → 部署模型 → 发现只能撑 8 个并发 → 客户投诉 → 加钱升级
正确顺序 (我们要求):
- 峰值并发数 (每秒同时 tokens/s)
- SLA (p95 延迟 <2s? <5s?)
- 场景复杂度 (chat / RAG / Agent / 多轮长上下文)
- 数据边界 (完全内网? 混合云? 出境?)
- 失败归属 (SLA 违约谁赔? 数据泄露谁背?)
- 12 个月 TCO (硬件 + 运维 + 电费 + 折旧)
只有算清楚这 6 项,才开始选 GPU。
参考公式: 峰值 QPS × 单次推理平均 tokens ÷ 单 GPU 吞吐 (约 20-40 tokens/s per 80GB GPU) = 所需 GPU 张数。
例: 100 并发 × 500 tokens = 5 万 tokens/s。按 30 tokens/s per GPU 计需要 1700 张。这不现实,必须重新评估 QPS 目标和 SLA。
5 个真实踩坑¶
- 只算 GPU 不算运维 — GPU 是一次性 30-50%,运维一年 15-25%,长期看运维更贵。
- 忽视数据分级 — 医疗、金融、政企数据分级不清,交付后合规审计死一片。
- 只做 PoC 不做 SLA — Demo 跑通就上线,生产第一天挂掉。SLA 定义必须在合同里。
- 模型选大不选合适 — 90% 场景用 7B-14B 就够,非要上 70B/175B,成本翻 10 倍。
- 不留升级路径 — 3 个月后新模型出来,架构支持不了热切换,只能全推倒。