模块 11综合实战与故障案例

故障演练与复盘

演练验证具体系统假设

  • 能否及时发现
  • 能否限制影响和停止副作用
  • 能否恢复 Run 与对账外部状态
  • 人员是否知道谁决策、如何沟通
  • 不要以“成功触发错误”作为演练成功

构造跨层故障场景

  • Provider 限流、版本漂移、长延迟和错误 Tool 选择
  • 索引过期、越权召回和引用错误
  • 成功响应丢失、重复执行、下游部分成功
  • Worker 崩溃、乱序事件、检查点不兼容和队列积压
  • 审批误批/超时、注入、凭据撤销和数据外传

演练自身不能制造真实事故

  • 隔离环境或限制租户/流量/权限
  • 明确开始、终止和紧急停止条件
  • 预先通知相关方但保留观察真实性
  • 重要数据备份与副作用模拟

同时观察技术和组织响应

  • SLI、告警和首个检测时间
  • Trace、日志、状态与外部回执是否能还原因果
  • Runbook 是否可执行、信息是否过时
  • 决策、升级、沟通和客户影响判断

复盘聚焦控制为何失效

  • 影响、时间线和事实证据
  • 触发因素与促成条件
  • 检测、缓解、恢复和沟通的缺口
  • 避免只归因于模型“幻觉”或个人失误
  • 哪些防线本应阻止或降低影响

行动项必须可验收

  • 代码/配置/架构控制
  • Golden Case、门禁、告警或 Runbook
  • Owner、优先级、截止时间和完成证据
  • 区分立即止血与长期结构修复

验证改进真正生效

  • 重跑同一场景和邻近变体
  • 监控线上同类信号是否下降
  • 更新威胁模型、SLO 和培训
  • 跨团队传播机制,不泄露敏感事故细节

把演练转成可信的资深能力证据

  • 明确这是演练/案例而非虚构生产经历
  • 讲清你设计的假设、观察和决策
  • 说明失败、意外发现和 Trade-off
  • 用产物和复验结果支撑结论