模块 3Context、RAG 与 Memory

RAG 数据链路

RAG 从数据源契约开始

  • 内容 Owner、访问方式和更新频率
  • 格式、语言、结构和附件
  • 权限、许可、敏感级别和删除要求
  • 源 ID、版本和 Last Modified 作为血缘基础

采集与解析要保留文档结构

不同格式需要不同解析策略

HTML、Markdown 与 Office

  • 保留标题、列表、链接和批注
  • 去除导航、页眉和模板噪声

PDF 与扫描件

  • 区分文本层、布局与 OCR
  • 保留页码、区域和 OCR 置信

表格与代码

  • 维持行列/文件结构
  • 避免按普通段落切碎语义
  • 标题层级、列表、表格、代码、页码和引用关系
  • 乱码、OCR 置信、重复页、导航噪声和附件缺失
  • 无法可靠解析的内容隔离而不是静默入库

Chunking 由查询和答案粒度决定

  • 固定长度、递归字符和语义切分的适用边界
  • 标题路径与父子结构保留
  • Overlap 的召回收益与重复噪声
  • 表格、代码和问答对需要专门策略
  • 为 Parent/Child 与摘要索引预留关联

索引前补充可过滤元数据

  • 来源、作者、时间、产品、地域和语言
  • 租户、ACL、数据分类和保留期
  • 实体、关键词和内容类型
  • 元数据自动抽取必须标记置信与来源

索引服务不同召回路径

向量索引

  • Embedding 模型与维度
  • 距离度量和版本

倒排/BM25

  • 专有名词、ID、错误码和精确短语
  • 按语言、权限、数据域或热度分区
  • 原文/大对象存储与索引引用分离

更新与删除必须端到端传播

  • 幂等采集、内容哈希与增量重建
  • 源文档修改后的旧 Chunk 失效
  • Embedding 模型升级的双索引迁移
  • 权限变化和删除对缓存、索引、摘要与评测数据的影响

数据链路也需要 SLO

  • 采集延迟、解析成功率和索引新鲜度
  • Chunk 数量、重复率和权限缺失率
  • 从检索结果回溯源文档与流水线版本
  • 抽样人工检查与异常趋势告警