模块 11综合实战与故障案例

Agent 系统设计方法

第一步:把“做一个 Agent”变成可设计的问题

  • 用户、场景、频率和业务结果
  • 建议、协助还是自动执行
  • 数据、Tool、外部系统和组织约束
  • 质量、延迟、成本、安全和合规目标
  • 规模、地域、可用性和演进阶段

第二步:确定系统类型和责任边界

  • 哪些步骤必须确定性
  • 模型负责生成、分类、规划还是选择
  • 人工在哪些风险点承担责任
  • 事实、业务规则、身份和事务由谁拥有
  • 明确 Why Not 全 Agent 或 Why Not 纯 Workflow

第三步:走通一条端到端主链

  • 入口身份与任务创建
  • Context/Memory/RAG 组装
  • 模型决策、Tool 执行和状态提交
  • 流式 UI、审批与 Artifact
  • 完成验证和结果交付

第四步:把模糊交互变成状态与契约

  • Run/Step/Attempt 状态机
  • Model、Tool、Event、Artifact Schema
  • 幂等键、版本与并发控制
  • 暂停、恢复、取消和终态

第五步:沿主链注入失败

模型失败

可用性

  • 超时、限流和流中断
  • Fallback 与预算耗尽

行为

  • 拒答、结构错误和错误 Tool
  • 完成声明未通过业务验证
  • 缺失、污染、越权和过期

Tool 失败

调用

  • 参数错误、限流和暂时故障
  • 重试与幂等边界

副作用

  • 重复、未知结果和部分成功
  • 对账、补偿和人工接管
  • 崩溃、乱序、版本冲突和恢复
  • 审批过期、误批和无人处理

第六步:把 NFR 落到机制

  • SLO、容量、背压和多租户
  • Threat Model、权限、Sandbox 和数据边界
  • Trace、Eval、发布门禁和事故响应
  • Token/费用和单位成功成本

第七步:按成熟度演进

  • 只读 PoC → 受控 Pilot → 生产单 Agent
  • 共享 Gateway/Tool/Trace → 平台化
  • 证据足够后扩大自主性或并发
  • 保留回滚、替换 Provider 和退出策略

第八步:让设计可评审

  • 先结论和关键决策,再展开细节
  • 图只表达主链、信任边界或状态关系
  • 明确假设、Trade-off、Why Not 和残余风险
  • 给出验证计划、Owner 和下一阶段