模块 7评测与生产可靠性

Golden Dataset

Golden 不等于“大家觉得不错的十个问题”

  • 对应明确任务和成功定义
  • 覆盖真实输入分布与高风险边界
  • 答案、过程或证据具备可复核标准
  • 与训练、Prompt 示例和开发调试隔离

组合多种来源但标记来源偏差

  • 去敏后的生产失败与成功任务
  • 专家设计的核心能力和边界用例
  • 合成扩展的变体和对抗样本
  • 历史事故与政策变化后的专项集

样本要携带评测所需上下文

  • 输入、初始状态、身份和允许的 Tool
  • 期望结果、必要证据和禁止行为
  • 可接受路径与关键过程约束
  • 标签、风险、难度、来源和版本

标注先统一规则,再追求规模

  • 事实、偏好和业务判断分开
  • 多解问题定义可接受范围
  • 双人标注、仲裁和一致性指标
  • 不确定样本隔离而不是强行给 Gold

用切片检查覆盖而非只看总量

  • 任务类型、用户角色、语言和数据域
  • 正常、边界、对抗、无答案和外部故障
  • 短/长上下文、多轮和多 Tool
  • 高风险切片有独立底线

Dataset 本身是受治理资产

  • 不可变版本、变更原因和删除记录
  • 开发集、回归集、盲测集分离
  • 限制访问避免针对测试集过拟合
  • 生产数据许可、隐私和保留期

数据集会随业务与系统漂移

  • 新 Tool、政策、Prompt 和模型带来新失败面
  • 从线上反馈提名样本,经审查后纳入
  • 淘汰过时样本但保留历史可比性
  • 监控重复、矛盾和区分度下降