方向 1 · 私有 LLM 部署 (含 AW36 私有模型)

私有 LLM 部署 = 总成本 + 数据边界 + 失败归属 三件事. 不是 GPU 问题. 3 个代表案例 + 交付关键动作.

核心能力

3 个代表案例

Case 01 · 三甲医院 AW36-72B 私有部署 + 医生助手

Case 02 · 制造业车间断网离线大模型

Case 03 · 集团级多租户 LLM 网关 (20+ 业务线共用)

交付关键动作

  1. Sizing 前置: 峰值并发 · p95 延迟 · 数据边界 · 存储 IO · 故障归属 · 成本封顶, 6 项量化后再选硬件
  2. 推理栈选型: 高吞吐 → vLLM; 边缘单机 → Ollama; 定制化 → Transformers 手写
  3. 观测就绪: Token/秒 · p50/p95/p99 延迟 · GPU 利用率 · 显存碎片 · 失败率, 5 项 dashboard
  4. 热切换: 模型版本 · Prompt 版本 · 索引版本, 三者独立回滚
  5. 人审兜底: 高风险场景 (医疗诊断辅助 / 法务终稿 / 金融决策) 保留人审通道

常见错配

相关阅读


下一步: 下载 PDF · 30 min 私有部署对齐