模块 11综合实战与故障案例
故障演练与复盘
演练验证具体系统假设
- 能否及时发现
- 能否限制影响和停止副作用
- 能否恢复 Run 与对账外部状态
- 人员是否知道谁决策、如何沟通
- 不要以“成功触发错误”作为演练成功
构造跨层故障场景
- Provider 限流、版本漂移、长延迟和错误 Tool 选择
- 索引过期、越权召回和引用错误
- 成功响应丢失、重复执行、下游部分成功
- Worker 崩溃、乱序事件、检查点不兼容和队列积压
- 审批误批/超时、注入、凭据撤销和数据外传
演练自身不能制造真实事故
- 隔离环境或限制租户/流量/权限
- 明确开始、终止和紧急停止条件
- 预先通知相关方但保留观察真实性
- 重要数据备份与副作用模拟
同时观察技术和组织响应
- SLI、告警和首个检测时间
- Trace、日志、状态与外部回执是否能还原因果
- Runbook 是否可执行、信息是否过时
- 决策、升级、沟通和客户影响判断
复盘聚焦控制为何失效
- 影响、时间线和事实证据
- 触发因素与促成条件
- 检测、缓解、恢复和沟通的缺口
- 避免只归因于模型“幻觉”或个人失误
- 哪些防线本应阻止或降低影响
行动项必须可验收
- 代码/配置/架构控制
- Golden Case、门禁、告警或 Runbook
- Owner、优先级、截止时间和完成证据
- 区分立即止血与长期结构修复
验证改进真正生效
- 重跑同一场景和邻近变体
- 监控线上同类信号是否下降
- 更新威胁模型、SLO 和培训
- 跨团队传播机制,不泄露敏感事故细节
把演练转成可信的资深能力证据
- 明确这是演练/案例而非虚构生产经历
- 讲清你设计的假设、观察和决策
- 说明失败、意外发现和 Trade-off
- 用产物和复验结果支撑结论