模块 3Context、RAG 与 Memory
Grounding 与检索评测
先定义什么叫“有依据”
- 答案中的可验证主张能定位到证据片段
- 证据直接支持主张而非只主题相关
- 证据来源在当前用户权限内且仍有效
- 证据不足时系统会缩小结论或拒答
检索、上下文、答案分层定位
检索层
- 相关文档/Chunk 是否被召回
- Recall@K、MRR、NDCG
上下文层
- 证据是否充分、去重、排序正确且无冲突
生成层
- 正确性、Faithfulness、引用对齐和完整性
RAG 评测集必须包含真实失败面
- 可回答、部分可回答和不可回答问题
- 多跳、时效、权限和冲突来源
- 专有名词、长尾表达和错误前提
- Gold 证据范围、允许的替代证据和标注一致性
引用是可验证关系,不是装饰 URL
- 为每个主张保留证据 ID 和定位信息
- 引用生成后检查来源存在、权限和版本
- 多个来源冲突时展示差异与时间
- 答案摘要不能超出证据表达的范围
拒答能力需要单独评测
- 没有证据时是否明确说不知道
- 证据不足时是否提出澄清或缩小范围
- 置信表达与实际错误率是否匹配
- 拒答过多与编造过多之间的业务阈值
线上信号补充离线评测
- 引用点击、用户纠正和重新提问
- 无结果、低分和检索回退率
- 知识更新后的回答漂移
- 敏感文档越权召回必须作为安全事件
把 Grounding 变成发布门禁
- 索引、Embedding、Retriever、Prompt 和模型版本共同记录
- 总体指标之外保留关键切片底线
- 回归必须能定位到数据、检索或生成层
- 上线后支持回滚索引和策略,而不只回滚代码