模块 11综合实战与故障案例

Agent 平台演进

阶段 0:识别 Demo 债务

  • 密钥散落、Provider 直连和无成本归因
  • Tool/Prompt 重复、无 Owner 和无版本
  • 没有 Trace、Eval、权限和发布门禁
  • 无法回答有哪些 Agent 在生产以及谁负责

阶段 1:先统一可见性与接入底线

  • AI Gateway、身份、配额和成本
  • 统一 Trace 语义与 Run ID
  • Tool 契约和安全基线
  • 最小 Golden Dataset 与发布检查

阶段 2:沉淀生产 Runtime 和 Golden Path

  • 状态、事件、重试、审批和恢复
  • SDK/模板/参考应用
  • SLO、Runbook 和事故流程
  • 代表性业务团队共建并验证开发体验

阶段 3:形成自助控制面

  • 模型/Tool/Skill/Agent Registry
  • 评测、灰度、策略和配额自助配置
  • 多租户、数据域和组织权限
  • 平台 Scorecard 与例外管理

阶段 4:按证据扩展高级能力

  • Durable、多 Agent、跨协议与高级 RAG
  • 质量飞轮、动态路由和成本优化
  • 区域韧性和企业级运营
  • 不因热点默认引入复杂组件

迁移现有 Agent 而非只建新平台

  • 资产盘点、风险和业务优先级
  • Adapter/Sidecar/网关先接入观测和身份
  • 按波次迁移状态、Tool 和发布流程
  • 兼容窗口、回滚和停用旧路径

组织能力随平台演进

  • 中央平台、领域团队和 Enabling 角色
  • 平台 SLO 与业务 Agent SLO 责任
  • 社区、评审和事故复盘传播经验
  • 减少中央瓶颈,保留架构底线

每阶段有继续投资的证据

  • 生产用例数和采用率
  • 交付时间、质量、事故和单位成本
  • 业务团队逃逸原因与支持负担
  • 达不到复用或治理价值时调整平台边界