模块 7评测与生产可靠性
Golden Dataset
Golden 不等于“大家觉得不错的十个问题”
- 对应明确任务和成功定义
- 覆盖真实输入分布与高风险边界
- 答案、过程或证据具备可复核标准
- 与训练、Prompt 示例和开发调试隔离
组合多种来源但标记来源偏差
- 去敏后的生产失败与成功任务
- 专家设计的核心能力和边界用例
- 合成扩展的变体和对抗样本
- 历史事故与政策变化后的专项集
样本要携带评测所需上下文
- 输入、初始状态、身份和允许的 Tool
- 期望结果、必要证据和禁止行为
- 可接受路径与关键过程约束
- 标签、风险、难度、来源和版本
标注先统一规则,再追求规模
- 事实、偏好和业务判断分开
- 多解问题定义可接受范围
- 双人标注、仲裁和一致性指标
- 不确定样本隔离而不是强行给 Gold
用切片检查覆盖而非只看总量
- 任务类型、用户角色、语言和数据域
- 正常、边界、对抗、无答案和外部故障
- 短/长上下文、多轮和多 Tool
- 高风险切片有独立底线
Dataset 本身是受治理资产
- 不可变版本、变更原因和删除记录
- 开发集、回归集、盲测集分离
- 限制访问避免针对测试集过拟合
- 生产数据许可、隐私和保留期
数据集会随业务与系统漂移
- 新 Tool、政策、Prompt 和模型带来新失败面
- 从线上反馈提名样本,经审查后纳入
- 淘汰过时样本但保留历史可比性
- 监控重复、矛盾和区分度下降