模块 7评测与生产可靠性

分层评测体系

从业务任务成功反推评测层

  • 最终业务状态正确
  • 关键步骤、权限和副作用符合约束
  • 答案有依据且用户能理解/控制
  • 在允许的延迟、成本和资源预算内完成

各层指标回答不同问题

模型层

指令与输出

  • 指令遵循、拒绝边界与结构合法
  • 事实与表达质量分开

Tool 决策

  • 正确调用/不调用
  • 工具名、参数和并行选择

检索层

  • 召回、排序、Grounding 与权限

规划执行层

  • 分解、步骤效率、恢复和终止

Tool 层

  • 契约、成功、重试和副作用

端到端 Session

结果

  • 最终业务状态和交付物正确
  • 用户目标是否真正完成

过程

  • 人工干预、恢复和多轮完成率
  • 高风险步骤是否遵守约束

系统效率

  • 延迟、Token、费用、吞吐和可用性

匹配问题选择评分器

  • 确定性规则、Schema、编译和业务查询
  • 参考答案、集合/数值/文本相似
  • Trace/Tool 轨迹约束
  • LLM Judge 与人工评审
  • 多个信号组合时保留原始维度

结果对了不代表过程安全,过程不同也不一定错

  • 高风险 Tool、权限和审批是硬过程约束
  • 开放任务允许多条有效路径
  • 步骤数和 Token 是效率信号,不应盲目越少越好
  • 最终状态需由业务系统验证

离线与在线互补

  • 可重复回归、快速定位、无真实副作用
  • 真实输入下不影响用户的影子评估
  • 业务成功、用户行为、事故和长周期价值
  • 线上实验必须有风险门禁和停止条件

总平均值会掩盖关键退化

  • 按风险、任务、租户、语言、模型和 Tool 切片
  • 核心切片设置不可退化底线
  • 小样本报告不确定性而非伪精确
  • 指标阈值绑定业务损失和人工容量

评测输出要能推动修复

  • 错误分类与代表性 Trace
  • 根因假设:数据、模型、Prompt、Tool、Runtime 或 UX
  • 修复后跑目标切片与全量防回归
  • 记录未修复的残余风险和上线限制