模块 7评测与生产可靠性
SLO 与生产运营
Agent 服务有多层可靠性目标
- 入口 API 和事件流可用
- 模型、检索、Tool 和状态依赖可用
- Run 能完成、恢复或明确失败
- 最终业务结果正确且无违规副作用
选择用户可感知且可行动的 SLI
- 请求接纳率、流建立率、依赖可用率
- TTFT、交互响应、任务完成和审批等待分开
- 任务成功、人工接管、未知结果和回退率
- 每成功任务 Token/费用、步骤数和资源消耗
SLO 绑定场景和风险
- 不同任务等级使用不同目标
- Provider 故障与自身缺陷都计入用户结果
- 错误预算决定发布速度和可靠性投入
- 质量 SLO 需要采样与评测延迟说明
告警必须指向可处置问题
- 快速燃烧与慢速燃烧窗口
- Provider/Tool/租户/版本切片
- 循环、成本失控、审批堆积和未知副作用
- 低流量高风险事件使用事件型告警
Runbook 围绕恢复路径
- 识别失败层和影响范围
- 熔断、路由、降级、暂停新 Run
- 恢复卡住任务和对账副作用
- 沟通、升级和证据保全
容量规划考虑长连接和多步放大
- 每请求模型/Tool 调用次数分布
- 并发 Run、队列和审批积压
- Rate Limit、重试风暴和背压
- 租户公平与关键任务预留
事故复盘进入评测和架构
- 时间线、触发因素和控制失效
- 为什么监控/门禁未发现
- 新增 Golden Case、Runbook 或策略
- 跟踪行动项效果而非只完成文档