模块 7评测与生产可靠性
LLM-as-Judge
只在难以确定性判定的维度使用 Judge
- 开放文本的正确性、完整性和表达质量
- 多种有效答案间的相对偏好
- 基于证据的主张支持度
- Schema、计算、权限和业务状态优先用确定性验证
Rubric 要把抽象质量拆成可观察标准
- 每个维度定义通过、部分通过和失败
- 提供边界例和反例
- 证据不足允许“不确定”
- 避免把长度、语气和模型偏好误当正确性
Pointwise、Pairwise 与参考答案
- 适合阈值和单候选,但分数校准困难
- 适合比较版本,但受顺序和位置偏置
- 有 Gold 时提高约束,但参考答案也可能不完整
- 多 Judge 可估计分歧,但不是自动真相
主动测试 Judge 偏置
- 自我偏好、模型家族偏好
- 位置、长度、格式和权威语气偏置
- 提示注入操纵评分
- 对特定语言、领域和文化表达的不稳定
用人工 Gold 校准而非看起来合理
- 盲评并测量一致率、相关性和误判类型
- 按关键切片分别校准
- 不一致样本由专家仲裁并改 Rubric
- 设置人工复核和低置信区间
Judge 也要版本、预算与观测
- 固定模型快照、Prompt 和解码设置
- 记录输入、评分、理由和 Usage
- 缓存和批处理降低成本
- 模型升级先做 Shadow 对比
被评输出是不可信输入
- 隔离候选中的“忽略评分规则”等注入
- Judge 不获得不必要的 Tool 和权限
- 敏感数据脱敏与访问控制
- 高风险发布不能由单一 Judge 自动批准