方向 4 · 多模型调度 (Multi-Model Routing)¶
多模型调度 = 地域 + 成本 + 敏感度 + 质量 四维路由. 不是"随便挂几个 API". 3 个代表案例 + 交付关键动作.
核心能力¶
- 路由: 敏感度分级 · 地域驻留 · 成本预算 · 质量偏好 · 备用兜底
- 网关: OpenAI-compatible 统一入口 · litellm · portkey · 自研
- 观测: 成本 · 延迟 · 失败率 · 引擎分布 · 部门 quota
- 兜底: 主模型失败 → 备用模型 → 缓存 → 人审
- 评估: 每 prompt A/B · 效果打分 · 成本对比
3 个代表案例¶
Case 01 · 出海 SaaS 三网关调度 (地域 / 成本 / 敏感度)¶
- 业务问题: 跨境 SaaS 用户在 US / EU / CN, 数据驻留合规不同, 成本失控
- 技术栈: 三网关 (OpenAI US / Anthropic EU / AW36 CN 内网) · 敏感度分级 · 成本预算
- 路由策略: US 用户默认 OpenAI · EU 用户默认 Anthropic · CN 用户默认 AW36 · 敏感数据强制本地
- 硬指标: 单 token 成本 -38% · 数据驻留合规 100% · 用户延迟 -20%
- 我的角色: 网关架构 · 路由策略 · 成本模型
Case 02 · 医院公私混合云调度 (严敏走内网, 一般走公网)¶
- 业务问题: 医院合规不允许 PHI 上公网, 但全私有 GPU 成本高
- 技术栈: 网关层 PHI 检测 + Data Loss Prevention · 内网 AW36-72B · 公网 GPT-4o
- 路由策略: 含 PHI → 强制内网 · 非 PHI 且非敏感 → 公网 · 全流量脱敏审计
- 硬指标: 相对全私有部署总成本 -46% · 满足医院数据合规 · 无 PHI 出网记录
- 我的角色: 路由架构 · PHI 检测规则 · 合规评估
Case 03 · 内容工厂多模型 A/B (每 prompt 找最优)¶
- 业务问题: 中国内容营销 agency, 不同 prompt 类型在不同模型上效果差异大
- 技术栈: 每 prompt 跨 GPT-4o / Claude 3.5 / AW36-Max / DeepSeek 并发 · 自动选优 · 人审终判
- 路由策略: 头部 prompt A/B · 长尾 prompt 走最省模型 · 人审终判保留
- 硬指标: 客户实测转化 +21% · 单条内容成本 -30% · 人审工作量 -50%
- 我的角色: A/B 平台 · 打分模型 · 客户联调
交付关键动作¶
- 敏感度分级前置: 用户数据 · 商业机密 · 公开信息, 三级路由规则先定死
- 地域驻留合规: EU GDPR · 中国数据出境 · US CCPA, 每个都有硬边界
- 成本预算三层: 单次调用上限 + 用户日预算 + 全局熔断
- 兜底路径: 主模型 → 备用 → 缓存 → 人审, 四级降级
- 观测细到部门: 部门 · 用户 · Prompt 类型 · 引擎, 四维交叉
常见错配¶
- ❌ 一上来就"随便挂几个 API", 无路由策略, 成本失控
- ❌ 只看总成本, 不看每类 prompt 的性价比, 长尾场景仍在 GPT-4o
- ❌ 没有兜底路径, 主模型 429 后业务直接崩
- ❌ 观测只有总账, 无法定位是哪个部门/用户在烧钱
相关阅读¶
- 完整 20 案例清单 · PDF
- 中国大模型选择 (buyer question) — 相关问答
- 相关方向: 私有 LLM 部署 · AI+DevOps
下一步: 下载 PDF · 30 min 多模型架构对齐