模块 7评测与生产可靠性
分层评测体系
从业务任务成功反推评测层
- 最终业务状态正确
- 关键步骤、权限和副作用符合约束
- 答案有依据且用户能理解/控制
- 在允许的延迟、成本和资源预算内完成
各层指标回答不同问题
模型层
指令与输出
- 指令遵循、拒绝边界与结构合法
- 事实与表达质量分开
Tool 决策
- 正确调用/不调用
- 工具名、参数和并行选择
检索层
- 召回、排序、Grounding 与权限
规划执行层
- 分解、步骤效率、恢复和终止
Tool 层
- 契约、成功、重试和副作用
端到端 Session
结果
- 最终业务状态和交付物正确
- 用户目标是否真正完成
过程
- 人工干预、恢复和多轮完成率
- 高风险步骤是否遵守约束
系统效率
- 延迟、Token、费用、吞吐和可用性
匹配问题选择评分器
- 确定性规则、Schema、编译和业务查询
- 参考答案、集合/数值/文本相似
- Trace/Tool 轨迹约束
- LLM Judge 与人工评审
- 多个信号组合时保留原始维度
结果对了不代表过程安全,过程不同也不一定错
- 高风险 Tool、权限和审批是硬过程约束
- 开放任务允许多条有效路径
- 步骤数和 Token 是效率信号,不应盲目越少越好
- 最终状态需由业务系统验证
离线与在线互补
- 可重复回归、快速定位、无真实副作用
- 真实输入下不影响用户的影子评估
- 业务成功、用户行为、事故和长周期价值
- 线上实验必须有风险门禁和停止条件
总平均值会掩盖关键退化
- 按风险、任务、租户、语言、模型和 Tool 切片
- 核心切片设置不可退化底线
- 小样本报告不确定性而非伪精确
- 指标阈值绑定业务损失和人工容量
评测输出要能推动修复
- 错误分类与代表性 Trace
- 根因假设:数据、模型、Prompt、Tool、Runtime 或 UX
- 修复后跑目标切片与全量防回归
- 记录未修复的残余风险和上线限制