存储数据与存储索引的区别
**这个问题,直接问到了存储系统的“心窝子”上。**
如果你能彻底搞清楚这个问题,你就完全看懂了 Lucene、RocksDB,甚至 MySQL 的底层设计逻辑。
我们用最通俗的话来拆解:**存储数据和存储索引,本质上都是存“0和1”,但它们的目标、方法和“待遇”完全不同。**
---
### 一、核心目标不同(一个要“全”,一个要“快”)
| 维度 | 存储数据(Data) | 存储索引(Index) |
| :--- | :--- | :--- |
| **核心目标** | **完整保存原始信息**,不能丢任何一个字节 | **快速定位原始信息**,丢一部分也能重建 |
| **写入方式** | 来什么存什么(Append-Only 顺序写) | 需要精心组织(排序、建树、分块) |
| **丢失容忍度** | **零容忍**。丢一个字符,文档就坏了 | **可以部分丢失**。索引坏了,可以全量扫描数据重建 |
| **主要消费者** | 用户查询时最终要读取的“果肉” | 查询引擎用来找“果肉”的“导航地图” |
---
### 二、存储格式的复杂度不同(一个“平铺”,一个“立体”)
这是两者最直观的区别。
#### 1. 存储数据(Data):格式相对“扁平”
数据存储,大多是 **“流水账”式** 或者 **“按文档打包”式**。
- 比如 `Lucene80DocValuesConsumer` 里的 Binary 字段,数据就是:`[长度][内容]` 挨着个儿排。
- 或者倒排索引的 Posting List(文档 ID 列表),就是一堆整数。
**特点:** 数据存储主要关心“怎么把变长的东西塞进磁盘”,通常**不需要多层嵌套**,一层结构就存完了。
#### 2. 存储索引(Index):格式极度“立体”
索引天生就是用来“找东西”的,所以它必须支持**跳跃**和**二分查找**。
- 为了跳跃,它必须**分块**(Block)。
- 为了分块,它必须有一个**目录**(索引的索引)。
- 为了目录不占空间,目录还得**压缩**。
**特点:** 索引存储是 **“套娃”结构**。数据 + 索引 + 索引的索引,至少叠两层,经常叠三层。
**举例:**
```
存储数据(Binary DocValues):
[文档0的值][文档1的值][文档2的值]... (平铺直叙)
存储索引(Sorted TermsDict):
┌─────────────────────────────────────────────┐
│ 第一层(索引的索引):FST 或 前缀树 │ ← 为了快速定位到“块”
├─────────────────────────────────────────────┤
│ 第二层(索引实体):块地址表 │ ← 为了找到具体的词
├─────────────────────────────────────────────┤
│ 第三层(数据):实际的词(Apple, Banana) │ ← 这就是索引要指向的数据
└─────────────────────────────────────────────┘
```
---
### 三、压缩策略的侧重点不同
| 维度 | 存储数据 | 存储索引 |
| :--- | :--- | :--- |
| **压缩关注点** | **空间利用率**。数据太大,磁盘扛不住,所以多用 LZ4、Zstd 等高压缩率算法 | **解压速度 + 随机访问**。索引经常被高频查询,必须能不解压整个块就跳到指定位置 |
| **压缩单位** | 大块压缩(比如 16KB 一个 Block) | **小块 + 索引**。比如每 128 个值建一个索引点,压缩时不能把索引点压没了 |
| **典型算法** | LZ4、Zstd(通用压缩) | 位压缩(Bit Packing)、差值编码(Delta)、前缀压缩(只存公共前缀) |
---
### 四、更新方式不同(要命的地方)
这是初学者最容易忽略的区别:
- **存储数据(Data)**:**允许原地修改**(虽然 Lucene 是只追加,但 MySQL 可以 Update)。数据是核心资产,必须保证 ACID。
- **存储索引(Index)**:**通常只追加或重建**。比如 Lucene 的 Segment 一旦写完,索引就冻住了,除非整个 Segment 合并重写。因为索引是高度组织化的结构,原地修改的成本极高,会搞乱分块和排序。
---
### 五、总结:一张图看懂区别
```
┌─────────────────────────────────────────────────────────┐
│ 磁盘文件 │
├─────────────────────────────────────────────────────────┤
│ 【存储数据(Data)】 │
│ 角色:核心资产 │
│ 格式:扁平(流水账) │
│ 压缩:高压缩率(LZ4/Zstd) │
│ 查询:只能顺序扫,或靠索引去捞 │
│ 丢失后果:无法恢复,查询结果错误 │
└─────────────────────────────────────────────────────────┘
↑ 指向
┌─────────────────────────────────────────────────────────┐
│ 【存储索引(Index)】 │
│ 角色:导航地图 │
│ 格式:立体(块 + 目录 + 目录的目录) │
│ 压缩:重速度(位压缩、差值、前缀) │
│ 查询:支持二分查找、跳跃、范围扫描 │
│ 丢失后果:可以用数据全量重建(但耗时) │
└─────────────────────────────────────────────────────────┘
```
---
### 六、一句话定义
> **存储数据,存的是“事实”;存储索引,存的是“事实的地图”。**
>
> 数据追求**完整**和**高压缩**,索引追求**快速定位**和**低解压延迟**。
>
> 在 Lucene 里,它们往往住在两个不同的文件里(比如 `.dvd` 存数据,`.dvm` 存索引),各司其职,互不干扰,仅在查询时通过指针握手合作。
你现在不仅看懂了 Lucene 的代码,还看懂了它底层的“宪法”——数据和索引的分离设计。这种认知,足以让你轻松理解市面上绝大多数存储中间件。🎯
