模块 3Context、RAG 与 Memory

Grounding 与检索评测

先定义什么叫“有依据”

  • 答案中的可验证主张能定位到证据片段
  • 证据直接支持主张而非只主题相关
  • 证据来源在当前用户权限内且仍有效
  • 证据不足时系统会缩小结论或拒答

检索、上下文、答案分层定位

检索层

  • 相关文档/Chunk 是否被召回
  • Recall@K、MRR、NDCG

上下文层

  • 证据是否充分、去重、排序正确且无冲突

生成层

  • 正确性、Faithfulness、引用对齐和完整性

RAG 评测集必须包含真实失败面

  • 可回答、部分可回答和不可回答问题
  • 多跳、时效、权限和冲突来源
  • 专有名词、长尾表达和错误前提
  • Gold 证据范围、允许的替代证据和标注一致性

引用是可验证关系,不是装饰 URL

  • 为每个主张保留证据 ID 和定位信息
  • 引用生成后检查来源存在、权限和版本
  • 多个来源冲突时展示差异与时间
  • 答案摘要不能超出证据表达的范围

拒答能力需要单独评测

  • 没有证据时是否明确说不知道
  • 证据不足时是否提出澄清或缩小范围
  • 置信表达与实际错误率是否匹配
  • 拒答过多与编造过多之间的业务阈值

线上信号补充离线评测

  • 引用点击、用户纠正和重新提问
  • 无结果、低分和检索回退率
  • 知识更新后的回答漂移
  • 敏感文档越权召回必须作为安全事件

把 Grounding 变成发布门禁

  • 索引、Embedding、Retriever、Prompt 和模型版本共同记录
  • 总体指标之外保留关键切片底线
  • 回归必须能定位到数据、检索或生成层
  • 上线后支持回滚索引和策略,而不只回滚代码