方向 1 · 私有 LLM 部署 (含 AW36 私有模型)¶
私有 LLM 部署 = 总成本 + 数据边界 + 失败归属 三件事. 不是 GPU 问题. 3 个代表案例 + 交付关键动作.
核心能力¶
- 硬件选型: A800 · 4090 · H20 · L40 · 消费卡 vs 专业卡的取舍
- 推理栈: vLLM · Transformers · Ollama · SGLang · TGI 对比选型
- 模型选型: 开源 (Qwen · DeepSeek · Llama) · 商用 API · 私有模型 AW36
- 存储: Milvus · Qdrant · Chroma · pgvector · 版本化索引
- 网络: 内网 · 半内网 · air-gapped · 混合云 · 数据出网检测
3 个代表案例¶
Case 01 · 三甲医院 AW36-72B 私有部署 + 医生助手¶
- 业务问题: 医生查临床指南 / 药物相互作用 / 病历规范 平均 8-15 分钟
- 技术栈: AW36-72B on 4 × A800 · vLLM · Milvus · bge-large · BGE-reranker
- 数据边界: 全部 PHI 留院内网 · 无公网出口 · 院内审计日志
- 硬指标: 查询 8-15 min → 45s · 300+ 日活医生 · 出院小结起草效率 +50% · 通过等保三级复核
- 我的角色: 架构 · 硬件选型 · vLLM 生产化 · 院内网络对接 · 压测 · SLA
Case 02 · 制造业车间断网离线大模型¶
- 业务问题: 车间气密隔离, 20+ 年老师傅要退休, 徒弟遇到罕见故障没人问
- 技术栈: AW36-14B on 单机 4090 · Ollama · 本地向量库 · 车间平板/台机双端
- 数据边界: 断网可用 · 无公网出口 · 现场同步知识
- 硬指标: 事故排查耗时 -45% · 断网可用 · 未来接班师傅有可查工具
- 我的角色: 硬件选型 (为什么 4090 而非 A800) · 边缘部署脚本 · 车间实施
Case 03 · 集团级多租户 LLM 网关 (20+ 业务线共用)¶
- 业务问题: 大集团 20+ 业务线各自 AI 需求, Token 成本失控, 合规参差
- 技术栈: OpenAI-compatible gateway · Redis 计量 · 部门级 quota · 审计日志
- 路由: 内网 AW36-72B (敏感) + DeepSeek-V2 (通用) + 选择性公网
- 硬指标: 20+ 业务线共用 · 部门 Token 成本封顶 · 大集团合规通过
- 我的角色: 网关架构 · Token 计量 · 多租户隔离 · SLA
交付关键动作¶
- Sizing 前置: 峰值并发 · p95 延迟 · 数据边界 · 存储 IO · 故障归属 · 成本封顶, 6 项量化后再选硬件
- 推理栈选型: 高吞吐 → vLLM; 边缘单机 → Ollama; 定制化 → Transformers 手写
- 观测就绪: Token/秒 · p50/p95/p99 延迟 · GPU 利用率 · 显存碎片 · 失败率, 5 项 dashboard
- 热切换: 模型版本 · Prompt 版本 · 索引版本, 三者独立回滚
- 人审兜底: 高风险场景 (医疗诊断辅助 / 法务终稿 / 金融决策) 保留人审通道
常见错配¶
- ❌ 上了 A800 集群但只有 5 QPS → 应该单机 4090
- ❌ 用了 vLLM 但没 warm cache → 首个请求 30s
- ❌ 部署了 72B 但 embedding 用 bge-small → RAG 底子塌了
- ❌ 内网部署但审计日志出网 → 合规炸掉
相关阅读¶
- 私有 AI 部署 sizing 规则 (6 步)
- 完整 20 案例清单 · PDF
- 验收清单 8 条硬指标
- 相关方向: RAG 知识库 · 多模型调度
下一步: 下载 PDF · 30 min 私有部署对齐