模块 3Context、RAG 与 Memory
RAG 数据链路
RAG 从数据源契约开始
- 内容 Owner、访问方式和更新频率
- 格式、语言、结构和附件
- 权限、许可、敏感级别和删除要求
- 源 ID、版本和 Last Modified 作为血缘基础
采集与解析要保留文档结构
不同格式需要不同解析策略
HTML、Markdown 与 Office
- 保留标题、列表、链接和批注
- 去除导航、页眉和模板噪声
PDF 与扫描件
- 区分文本层、布局与 OCR
- 保留页码、区域和 OCR 置信
表格与代码
- 维持行列/文件结构
- 避免按普通段落切碎语义
- 标题层级、列表、表格、代码、页码和引用关系
- 乱码、OCR 置信、重复页、导航噪声和附件缺失
- 无法可靠解析的内容隔离而不是静默入库
Chunking 由查询和答案粒度决定
- 固定长度、递归字符和语义切分的适用边界
- 标题路径与父子结构保留
- Overlap 的召回收益与重复噪声
- 表格、代码和问答对需要专门策略
- 为 Parent/Child 与摘要索引预留关联
索引前补充可过滤元数据
- 来源、作者、时间、产品、地域和语言
- 租户、ACL、数据分类和保留期
- 实体、关键词和内容类型
- 元数据自动抽取必须标记置信与来源
索引服务不同召回路径
向量索引
- Embedding 模型与维度
- 距离度量和版本
倒排/BM25
- 专有名词、ID、错误码和精确短语
- 按语言、权限、数据域或热度分区
- 原文/大对象存储与索引引用分离
更新与删除必须端到端传播
- 幂等采集、内容哈希与增量重建
- 源文档修改后的旧 Chunk 失效
- Embedding 模型升级的双索引迁移
- 权限变化和删除对缓存、索引、摘要与评测数据的影响
数据链路也需要 SLO
- 采集延迟、解析成功率和索引新鲜度
- Chunk 数量、重复率和权限缺失率
- 从检索结果回溯源文档与流水线版本
- 抽样人工检查与异常趋势告警