模块 11综合实战与故障案例
Agent 系统设计方法
第一步:把“做一个 Agent”变成可设计的问题
- 用户、场景、频率和业务结果
- 建议、协助还是自动执行
- 数据、Tool、外部系统和组织约束
- 质量、延迟、成本、安全和合规目标
- 规模、地域、可用性和演进阶段
第二步:确定系统类型和责任边界
- 哪些步骤必须确定性
- 模型负责生成、分类、规划还是选择
- 人工在哪些风险点承担责任
- 事实、业务规则、身份和事务由谁拥有
- 明确 Why Not 全 Agent 或 Why Not 纯 Workflow
第三步:走通一条端到端主链
- 入口身份与任务创建
- Context/Memory/RAG 组装
- 模型决策、Tool 执行和状态提交
- 流式 UI、审批与 Artifact
- 完成验证和结果交付
第四步:把模糊交互变成状态与契约
- Run/Step/Attempt 状态机
- Model、Tool、Event、Artifact Schema
- 幂等键、版本与并发控制
- 暂停、恢复、取消和终态
第五步:沿主链注入失败
模型失败
可用性
- 超时、限流和流中断
- Fallback 与预算耗尽
行为
- 拒答、结构错误和错误 Tool
- 完成声明未通过业务验证
- 缺失、污染、越权和过期
Tool 失败
调用
- 参数错误、限流和暂时故障
- 重试与幂等边界
副作用
- 重复、未知结果和部分成功
- 对账、补偿和人工接管
- 崩溃、乱序、版本冲突和恢复
- 审批过期、误批和无人处理
第六步:把 NFR 落到机制
- SLO、容量、背压和多租户
- Threat Model、权限、Sandbox 和数据边界
- Trace、Eval、发布门禁和事故响应
- Token/费用和单位成功成本
第七步:按成熟度演进
- 只读 PoC → 受控 Pilot → 生产单 Agent
- 共享 Gateway/Tool/Trace → 平台化
- 证据足够后扩大自主性或并发
- 保留回滚、替换 Provider 和退出策略
第八步:让设计可评审
- 先结论和关键决策,再展开细节
- 图只表达主链、信任边界或状态关系
- 明确假设、Trade-off、Why Not 和残余风险
- 给出验证计划、Owner 和下一阶段