模块 7评测与生产可靠性
反馈数据与质量飞轮
反馈不仅是点赞/点踩
- 用户纠正、编辑、撤销和重新提问
- Tool 失败、人工接管与审批修改
- 业务结果和后续状态
- 运营抽检、事故与投诉
- 显式反馈可能稀少且有选择偏差
反馈事件必须能关联上下文与结果
- Run/Step/Artifact/版本 ID
- 反馈主体、时间、界面与任务阶段
- 原始动作和纠正后的动作
- 授权用途、敏感级别和保留期
行为信号不能直接等同标签
- 重试可能来自网络,不一定回答错误
- 用户接受可能只是没有时间检查
- 编辑需要区分风格偏好和事实修正
- 业务结果可能受 Agent 之外因素影响
先分类失败,再选择改进杠杆
- 数据/检索、模型/Prompt、Tool、Runtime、UX、政策和业务流程
- 频率、影响、可检测性和修复成本
- 高风险低频问题优先级可能高于高频小问题
- 同一问题聚类减少重复标注
从线上样本到 Golden Case 的门槛
- 去敏、授权和代表性审查
- 重放所需状态与 Tool 环境可获得
- 专家给出期望结果和证据
- 避免把临时故障或用户误操作固化为标准
每次改进都形成可验证实验
- 建立基线和目标切片
- 选择 Prompt、RAG、Tool、Workflow、模型或 UX 杠杆
- 离线回归后 Shadow/Canary
- 线上观察净收益、成本和新失败
质量飞轮同样受数据与组织治理
- 数据 Owner、标注 Owner、模型/产品 Owner 的 RACI
- 用户选择退出、删除与用途限制
- 防止团队只优化容易测量的指标
- 闭环周期、积压和行动项完成效果可见