模块 7评测与生产可靠性

反馈数据与质量飞轮

反馈不仅是点赞/点踩

  • 用户纠正、编辑、撤销和重新提问
  • Tool 失败、人工接管与审批修改
  • 业务结果和后续状态
  • 运营抽检、事故与投诉
  • 显式反馈可能稀少且有选择偏差

反馈事件必须能关联上下文与结果

  • Run/Step/Artifact/版本 ID
  • 反馈主体、时间、界面与任务阶段
  • 原始动作和纠正后的动作
  • 授权用途、敏感级别和保留期

行为信号不能直接等同标签

  • 重试可能来自网络,不一定回答错误
  • 用户接受可能只是没有时间检查
  • 编辑需要区分风格偏好和事实修正
  • 业务结果可能受 Agent 之外因素影响

先分类失败,再选择改进杠杆

  • 数据/检索、模型/Prompt、Tool、Runtime、UX、政策和业务流程
  • 频率、影响、可检测性和修复成本
  • 高风险低频问题优先级可能高于高频小问题
  • 同一问题聚类减少重复标注

从线上样本到 Golden Case 的门槛

  • 去敏、授权和代表性审查
  • 重放所需状态与 Tool 环境可获得
  • 专家给出期望结果和证据
  • 避免把临时故障或用户误操作固化为标准

每次改进都形成可验证实验

  • 建立基线和目标切片
  • 选择 Prompt、RAG、Tool、Workflow、模型或 UX 杠杆
  • 离线回归后 Shadow/Canary
  • 线上观察净收益、成本和新失败

质量飞轮同样受数据与组织治理

  • 数据 Owner、标注 Owner、模型/产品 Owner 的 RACI
  • 用户选择退出、删除与用途限制
  • 防止团队只优化容易测量的指标
  • 闭环周期、积压和行动项完成效果可见