已有 Agent PoC, 怎么上生产?¶
TL;DR: 5 步,总周期 4-12 周。权限最小化 + 成本封顶 + 观测就绪 这三步做完,上线失败率从 40% 降到 5%。
前置检查¶
在 PoC 通过后、开始生产化前,先确认这 3 件事:
- 业务闭环: Agent 输出结果 → 谁消费? 消费后干什么? 有没有闭环反馈?
- 异常兜底: Agent 失败/超时/幻觉时,业务怎么办? (人工兜底? 默认响应? 直接失败?)
- 责任归属: Agent 出错 (误发邮件、误改数据),谁负责? 内部 IT? 供应商? 老板?
3 项都答不上来 = 不要上生产。回去补答案。
5 步生产化 (每步 1-2 周)¶
第 1 步: 定业务闭环 (1 周)¶
产出: - Agent Job Description (200 字): 做什么 + 不做什么 - 输入格式规范 (schema) - 输出格式规范 (schema) - 异常兜底流程图
验收: 拿 5 个真实业务场景演练,Agent 都能正确识别"在职责内 or 越界"。
第 2 步: 权限最小化 (1-2 周)¶
产出: - Agent 权限清单 (读/写/外呼三级) - 高风险动作清单 (需要人审) - 权限申请/审批工作流
验收: - 用 5 个恶意输入尝试越权 (提示注入、越界指令), Agent 不能越权 - 高风险动作 100% 触发人审 - 看 Agent 权限最小化
第 3 步: 成本封顶 (1 周)¶
产出: - 单次调用最大 tokens 上限 (超即截断) - 用户日预算 (超即拒绝新请求) - 全局月预算 (超 80% 告警、100% 熔断) - 成本 dashboard
验收: - 人为制造死循环 Agent, 3 分钟内熔断 - 单个恶意用户 1 小时内触发日预算限制 - 看 成本记账笔记
第 4 步: 观测就绪 (1-2 周)¶
产出 5 项 dashboard:
| 指标 | 目标 | 阈值告警 |
|---|---|---|
| 幻觉率 | < 3% | > 5% |
| 失败率 | < 1% | > 3% |
| 单次成本 | < 0.03 元 | > 0.05 元 |
| p95 延迟 | < 3s | > 5s |
| 超时率 | < 0.5% | > 2% |
验收: 人为触发 5 类异常, dashboard 都能秒级反应 + 告警。
第 5 步: 灰度上线 (2-4 周)¶
流量分配:
| 周 | 流量比 | 观察重点 |
|---|---|---|
| 第 1 周 | 5% | 幻觉率 + 失败率 |
| 第 2 周 | 20% | 成本 + 延迟 |
| 第 3 周 | 50% | 用户投诉 + NPS |
| 第 4 周 | 100% | 稳定性 |
回滚开关: 任何一档发现问题, 1 分钟内切回旧版 (人工客服 or 无 Agent 模式)。
4 类项目周期参考¶
| 复杂度 | 场景 | 总周期 |
|---|---|---|
| 简单 | 单一场景 chat、无外呼 | 4-6 周 |
| 中等 | 多轮 chat + RAG | 6-8 周 |
| 复杂 | 多 Agent 协作 + 外呼 | 8-12 周 |
| 极复杂 | 跨多系统、涉及支付/合规 | 12-24 周 |
注: 上表按项目团队 2-4 人、有 AI 交付经验的节奏。新手团队 × 1.5 倍。
3 个常被忽视的细节¶
- prompt 版本化: prompt 是代码, 必须 Git 管理 + Code Review + A/B。别把 prompt 硬编码。
- 上下文管理: 长对话上下文 > 4k tokens 会开始劣化。用上下文摘要机制 (每 5 轮压缩一次)。
- 降级路径: LLM 挂了怎么办? 应该有规则引擎或FAQ 匹配兜底, 不能完全依赖 LLM。