模块 7评测与生产可靠性

SLO 与生产运营

Agent 服务有多层可靠性目标

  • 入口 API 和事件流可用
  • 模型、检索、Tool 和状态依赖可用
  • Run 能完成、恢复或明确失败
  • 最终业务结果正确且无违规副作用

选择用户可感知且可行动的 SLI

  • 请求接纳率、流建立率、依赖可用率
  • TTFT、交互响应、任务完成和审批等待分开
  • 任务成功、人工接管、未知结果和回退率
  • 每成功任务 Token/费用、步骤数和资源消耗

SLO 绑定场景和风险

  • 不同任务等级使用不同目标
  • Provider 故障与自身缺陷都计入用户结果
  • 错误预算决定发布速度和可靠性投入
  • 质量 SLO 需要采样与评测延迟说明

告警必须指向可处置问题

  • 快速燃烧与慢速燃烧窗口
  • Provider/Tool/租户/版本切片
  • 循环、成本失控、审批堆积和未知副作用
  • 低流量高风险事件使用事件型告警

Runbook 围绕恢复路径

  • 识别失败层和影响范围
  • 熔断、路由、降级、暂停新 Run
  • 恢复卡住任务和对账副作用
  • 沟通、升级和证据保全

容量规划考虑长连接和多步放大

  • 每请求模型/Tool 调用次数分布
  • 并发 Run、队列和审批积压
  • Rate Limit、重试风暴和背压
  • 租户公平与关键任务预留

事故复盘进入评测和架构

  • 时间线、触发因素和控制失效
  • 为什么监控/门禁未发现
  • 新增 Golden Case、Runbook 或策略
  • 跟踪行动项效果而非只完成文档