模块 11综合实战与故障案例
Agent 平台演进
阶段 0:识别 Demo 债务
- 密钥散落、Provider 直连和无成本归因
- Tool/Prompt 重复、无 Owner 和无版本
- 没有 Trace、Eval、权限和发布门禁
- 无法回答有哪些 Agent 在生产以及谁负责
阶段 1:先统一可见性与接入底线
- AI Gateway、身份、配额和成本
- 统一 Trace 语义与 Run ID
- Tool 契约和安全基线
- 最小 Golden Dataset 与发布检查
阶段 2:沉淀生产 Runtime 和 Golden Path
- 状态、事件、重试、审批和恢复
- SDK/模板/参考应用
- SLO、Runbook 和事故流程
- 代表性业务团队共建并验证开发体验
阶段 3:形成自助控制面
- 模型/Tool/Skill/Agent Registry
- 评测、灰度、策略和配额自助配置
- 多租户、数据域和组织权限
- 平台 Scorecard 与例外管理
阶段 4:按证据扩展高级能力
- Durable、多 Agent、跨协议与高级 RAG
- 质量飞轮、动态路由和成本优化
- 区域韧性和企业级运营
- 不因热点默认引入复杂组件
迁移现有 Agent 而非只建新平台
- 资产盘点、风险和业务优先级
- Adapter/Sidecar/网关先接入观测和身份
- 按波次迁移状态、Tool 和发布流程
- 兼容窗口、回滚和停用旧路径
组织能力随平台演进
- 中央平台、领域团队和 Enabling 角色
- 平台 SLO 与业务 Agent SLO 责任
- 社区、评审和事故复盘传播经验
- 减少中央瓶颈,保留架构底线
每阶段有继续投资的证据
- 生产用例数和采用率
- 交付时间、质量、事故和单位成本
- 业务团队逃逸原因与支持负担
- 达不到复用或治理价值时调整平台边界