一、定义
向量数据库(Vector Database)是一类专门用于存储、索引与检索高维向量数据的数据库系统。它的核心能力是「相似度检索」:给定一个查询向量,在数十亿条向量中快速找出与之距离最近的若干条记录。与依赖精确匹配的传统关系型数据库不同,向量数据库处理的是语义上的"相近",因此成为推荐系统、图像检索与检索增强生成(RAG)等场景的基础设施。
在实际工程中,向量通常由深度模型编码得到。例如一段文本经过嵌入模型后会被映射为一个 768 维或 1536 维的浮点数组,语义相近的文本在向量空间中彼此靠近。向量数据库要做的,就是把这层几何关系变成可被高并发查询的工程能力。
向量数据库解决的不是"存得下",而是"找得快"——当数据规模超过单机内存、当召回率与延迟需要同时被约束时,近似最近邻索引就是必需的工程手段。
二、核心索引结构
向量检索的性能几乎完全取决于索引结构。常见的近似最近邻(ANN)索引可分为四类,它们在召回率、内存占用与构建耗时之间存在明显的取舍关系。
2.1 HNSW(分层可导航小世界图)
HNSW 通过构建多层跳跃表式的图结构,让查询从稀疏的上层图快速逼近目标区域,再在稠密的下层图中做精细搜索。它的召回率在同类算法中表现最好,查询延迟稳定在毫秒级,代价是内存占用约为原始向量的 1.5–2 倍,且构建索引耗时较长。目前是绝大多数生产环境的默认选择。
2.2 IVF-PQ(倒排 + 乘积量化)
IVF 先将向量空间聚类成若干桶,查询时只扫描距离最近的几个桶;PQ 则把高维向量切分为多个子段分别量化,用码本近似表示原始向量。二者结合可把内存占用压缩到原来的十分之一以内,适合超大规模且对召回率容忍度更高的场景。
| 索引类型 | 召回率 | 查询延迟 | 内存放大 | 典型规模 |
|---|---|---|---|---|
| HNSW | 95%–99% | 1–5 ms | 1.5–2.0× | 千万 – 十亿 |
| IVF-PQ | 85%–95% | 5–20 ms | 0.1–0.3× | 亿 – 百亿 |
| DiskANN | 90%–97% | 5–15 ms | 0.2–0.4× | 十亿 – 百亿 |
| 暴力检索 | 100% | 100 ms+ | 1.0× | 百万以内 |
三、与 RAG 的关系
检索增强生成(RAG)把外部知识库接入大模型:用户提问后,系统先在向量数据库中检索出最相关的若干文档片段,再把这些片段作为上下文交给模型生成回答。这种方式显著降低了模型幻觉,也让知识更新不必重新训练模型。
在 RAG 链路中,向量数据库承担的是"召回"环节,其质量直接决定最终回答的上限。实践中常见的优化包括:分块策略(按语义段落而非固定字数切分)、混合检索(向量 + 关键词)、重排序(用交叉编码器对初筛结果二次打分)。
如果召回阶段就漏掉了正确文档,再强的生成模型也无法补救。RAG 的优化重心应当放在检索质量上,而不是不断更换更大的模型。
四、典型应用场景
- · 语义搜索:用户以自然语言描述需求,系统返回语义相近的文档、商品或视频,而非字面匹配结果。
- · 推荐系统:把用户与物品分别编码为向量,通过近邻检索生成候选集,再交给排序模型精排。
- · 以图搜图 / 以文搜图:跨模态向量对齐后,可用文字直接检索图片或视频帧。
- · 智能客服与知识问答:在历史工单与产品文档中检索最相关的解答片段。
- · 去重与聚类:通过相似度阈值识别重复内容,或对海量文本做主题聚合。
五、局限与注意事项
向量检索并非万能。它依赖嵌入模型的质量,模型在训练语料之外的领域迁移能力可能明显下降;近似索引会牺牲一部分召回率,需要在业务上做阈值调优;向量本身缺乏可解释性,检索结果往往需要额外的人工抽检。此外,向量的写入成本高于标量数据,频繁更新会显著影响索引性能,通常需要采用增量索引与定期重建相结合的策略。
- [1]Malkov Y, Yashunin D. Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs. IEEE TPAMI, 2020, 42(4): 824–836.
- [2]Jégou H, Douze M, Schmid C. Product Quantization for Nearest Neighbor Search. IEEE TPAMI, 2011, 33(1): 117–128.
- [3]Subramanya S J, et al. DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node. NeurIPS, 2019.
- [4]Lewis P, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020.
- [5]中国信息通信研究院.《数据库发展研究报告(2026 年)》. 北京: 中国信通院, 2026.
- [6]Nexus 知识库编委会.《向量索引选型实践指南》. 内部技术文档, 2026-07.
第 2.2 节里提到 IVF-PQ 内存占用可压缩到"十分之一以内",这个说法在子段数较少时并不成立。建议补充条件:当维度切分为 8 个子段以上、码本大小 256 时,压缩比约为 1/8 至 1/16。
建议在「典型应用场景」里补一条「代码检索」,当前主流的代码补全工具都会在本地索引仓库向量。
参考资料 [5] 的年份需要核对,信通院的报告通常在次年 3 月发布。