数据存储地图
数据存储不是“会写 SQL”或“会接向量库”。高级岗位需要对数据模型、正确性、性能、恢复和治理负责,并理解不同存储系统之间不可替代的边界。
内容状态:规划中。 当前页面先定义学习范围与交付标准,正式文章尚未完整上线。
六个能力域
| 能力域 | 关键判断 |
|---|---|
| 关系型数据库 | 数据建模、索引、执行计划、事务、锁与隔离级别 |
| 缓存 | 缓存模式、失效、一致性、热点、穿透与雪崩 |
| 搜索与文档存储 | 倒排索引、相关性、Mapping、聚合与更新成本 |
| 向量与 AI 数据 | Embedding、切分、过滤、混合检索和版本管理 |
| 数据链路 | CDC、消息、批流处理、幂等、顺序与最终一致性 |
| 治理与恢复 | 迁移、备份、恢复演练、保留策略、权限和审计 |
选型原则
- 先从访问模式、一致性和恢复目标出发,再选择存储产品。
- 向量数据库不能替代业务事实库;RAG 索引必须能够追溯到来源与版本。
- 缓存提升读取效率,但会引入失效、并发和一致性成本。
- 性能优化必须基于执行计划、指标和负载证据,不能只依赖经验规则。
完成标准
- 为贯穿项目设计业务数据、文档元数据和检索索引的边界;
- 解释事务隔离、缓存一致性和消息语义对业务正确性的影响;
- 用数据证明一次慢查询或检索质量问题的原因与改进;
- 制定可执行的数据迁移、回滚、备份和恢复方案。