私有化 AI 部署要多少钱?

TL;DR: 小型 6-15 万 (10 并发、单场景),中型 30-80 万 (50-200 并发、多场景),大型 300 万+ (千级并发、企业级)。关键规则: 先算峰值并发、SLA、数据边界,再算 GPU 数量。反过来的项目 100% 亏损。

3 档预算参考 (含硬件 + 软件 + 一年运维)

规模 并发 场景数 一次性投入 年度运维 合计 12 月
小型 5-20 1 (如客服) 5-10 万 1-5 万 6-15 万
中型 50-200 2-4 (客服 + 生成 + 分析) 20-60 万 10-25 万 30-80 万
大型 500-2000 5+ (全业务线) 200-800 万 100-300 万 300-1100 万
超大型 5000+ 10+ (集团级) 1500 万+ 500 万+ 2000 万+

注意: 上表按 2026 年市场价,Qwen / DeepSeek / GLM / 私有微调模型为主。用 GPT-5 级别专有模型需 3-10 倍。

6 项成本明细

以中型项目 60 万一年为例:

占比 金额 (万) 说明
GPU 硬件 40% 24 一般 4-8 张 A100/H800 或 8-16 张 4090
软件许可 10% 6 vLLM 免费、模型许可 (Qwen/DeepSeek 免费商用,其他部分收费)
部署实施 15% 9 网络架构、防火墙、内网穿透、Nginx/Traefik、Kubernetes
模型微调 10% 6 数据清洗 + LoRA 微调 + 验证集 (视场景,可 0-20%)
运维一年 20% 12 监控、日志、模型更新、故障处置
故障容灾 5% 3 备用 GPU、灾备切换、快照

关键规则: 先算并发再算 GPU

错误顺序 (99% 的公司这样做):

老板说 "买 4 张 A100" → 采购 → 装机 → 部署模型 → 发现只能撑 8 个并发 → 客户投诉 → 加钱升级

正确顺序 (我们要求):

  1. 峰值并发数 (每秒同时 tokens/s)
  2. SLA (p95 延迟 <2s? <5s?)
  3. 场景复杂度 (chat / RAG / Agent / 多轮长上下文)
  4. 数据边界 (完全内网? 混合云? 出境?)
  5. 失败归属 (SLA 违约谁赔? 数据泄露谁背?)
  6. 12 个月 TCO (硬件 + 运维 + 电费 + 折旧)

只有算清楚这 6 项,才开始选 GPU

参考公式: 峰值 QPS × 单次推理平均 tokens ÷ 单 GPU 吞吐 (约 20-40 tokens/s per 80GB GPU) = 所需 GPU 张数。

例: 100 并发 × 500 tokens = 5 万 tokens/s。按 30 tokens/s per GPU 计需要 1700 张。这不现实,必须重新评估 QPS 目标和 SLA。

5 个真实踩坑

  1. 只算 GPU 不算运维 — GPU 是一次性 30-50%,运维一年 15-25%,长期看运维更贵。
  2. 忽视数据分级 — 医疗、金融、政企数据分级不清,交付后合规审计死一片。
  3. 只做 PoC 不做 SLA — Demo 跑通就上线,生产第一天挂掉。SLA 定义必须在合同里。
  4. 模型选大不选合适 — 90% 场景用 7B-14B 就够,非要上 70B/175B,成本翻 10 倍。
  5. 不留升级路径 — 3 个月后新模型出来,架构支持不了热切换,只能全推倒。

相关