模块 7评测与生产可靠性

LLM-as-Judge

只在难以确定性判定的维度使用 Judge

  • 开放文本的正确性、完整性和表达质量
  • 多种有效答案间的相对偏好
  • 基于证据的主张支持度
  • Schema、计算、权限和业务状态优先用确定性验证

Rubric 要把抽象质量拆成可观察标准

  • 每个维度定义通过、部分通过和失败
  • 提供边界例和反例
  • 证据不足允许“不确定”
  • 避免把长度、语气和模型偏好误当正确性

Pointwise、Pairwise 与参考答案

  • 适合阈值和单候选,但分数校准困难
  • 适合比较版本,但受顺序和位置偏置
  • 有 Gold 时提高约束,但参考答案也可能不完整
  • 多 Judge 可估计分歧,但不是自动真相

主动测试 Judge 偏置

  • 自我偏好、模型家族偏好
  • 位置、长度、格式和权威语气偏置
  • 提示注入操纵评分
  • 对特定语言、领域和文化表达的不稳定

用人工 Gold 校准而非看起来合理

  • 盲评并测量一致率、相关性和误判类型
  • 按关键切片分别校准
  • 不一致样本由专家仲裁并改 Rubric
  • 设置人工复核和低置信区间

Judge 也要版本、预算与观测

  • 固定模型快照、Prompt 和解码设置
  • 记录输入、评分、理由和 Usage
  • 缓存和批处理降低成本
  • 模型升级先做 Shadow 对比

被评输出是不可信输入

  • 隔离候选中的“忽略评分规则”等注入
  • Judge 不获得不必要的 Tool 和权限
  • 敏感数据脱敏与访问控制
  • 高风险发布不能由单一 Judge 自动批准