🧊 前沿科技知识库
全部 / 人工智能(AI)

检索深入:稀疏、稠密、混合检索与向量搜索(Retrieval & Vector Search)

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·提示、Agent 与应用 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

现代检索栈(尤其是 RAG 场景)通常由三层构成:候选召回(稀疏词法检索、稠密语义检索或两者混合)、重排序(reranking)与向量索引(ANN)。TREC RAG 2025 的参赛报告把混合检索系统描述为"融合稀疏检索、稠密语义匹配与交叉编码器重排",并指出该组合在多数指标上取得最佳表现(NITATREC at TREC RAG 2025)。一项面向文本—表格文档的基准研究也给出相同的工程结论:以混合检索(BM25 + 稠密,RRF 融合)为基线,加交叉编码器重排带来最大单次质量提升,再在索引时加入 contextual retrieval 可获得稳定但中等的增益(From BM25 to Corrective RAG)。

最新进展(2025–2026)

混合检索成为默认基线。企业内网结构化数据的研究采用 all-mpnet-base-v2 稠密检索与 BM25 稀疏检索,按 0.6 : 0.4 的权重融合,以兼顾语义深度与词法准确性,并配合结构感知分块(文本按递归字符分块、约 700 token)(Advancing Retrieval-Augmented Generation for Structured Enterprise and Internal Data)。科学 RAG 的实证研究比较了三种系统——稠密(BGE-M3 + 向量搜索)、稀疏(BM25)与混合(RRF 融合),结论是混合检索比仅稀疏或仅稠密都更鲁棒(SciRet)。多跳检索评测数据集 StratRAG 也采用混合评分:把 BM25 与稠密分数各自 min-max 归一化到 [0,1] 后等权(α=0.5)相加,编码器使用 all-MiniLM-L6-v2(StratRAG: A Multi-Hop Retrieval Evaluation Dataset)。

ColBERT 与延迟交互(late interaction)继续演进。ColBERT 用 BERT 分别编码查询与文档,通过 token 级向量的细粒度交互(MaxSim:对每个查询 token 取最近的文档 token 并求和)计算相似度,文档多向量表示可离线预计算(Incorporating Token Importance in Multi-Vector Retrieval)。围绕延迟交互模型的训练与检索工具链也在完善,如 PyLate 提供 MaxSim 评分与重排 API(PyLate)。2026 年出现若干面向效率与效果的改进:Col-Bandit 把重排建模为"有限总体 Top-K 识别"问题,用带不确定性上界的查询时剪枝只揭示必要的 (document, query token) MaxSim 条目(Col-Bandit);PLAID-PRF 在 PLAID 索引上引入伪相关反馈的质心式 token(PLAID-PRF);ColBERT-AW 则用属性感知的查询 token 加权增强延迟交互效果(ColBERT-AW)。TREC 2025 的多阶段层级检索管线把 ColBERTv2.0 作为延迟交互模型与 Contriever 等双编码器组合使用(Single-Turn LLM Reformulation Powered Multi-Stage Hybrid Re-Ranking)。

向量数据库与索引工程优化。Pinterest 的 Manas 平台从内存占用的 HNSW 演进到量化 SPANN:据报告,乘积量化(PQ)可把 HNSW 索引压缩约 74%、IVF 索引压缩约 93%,召回落在 70–80% 区间;标量量化(SQ)可把 HNSW 索引压缩约 59%、IVF 约 75%,且在各负载下稳定保持 90% 以上召回(From Memory-Hungry HNSW to Quantized SPANN — InfoQ)。厂商层面的索引竞争也在加剧,Qdrant 于 2026 年 7 月发布基准称其在吞吐、延迟与算力上优于 Elastic 的磁盘索引 DiskBBQ(Qdrant Beats Elastic's DiskBBQ)。

GraphRAG 与图增强的混合检索。工程界把 GraphRAG 描述为向量库之外的"知识图谱层":检索变成两阶段操作——先用向量库找到语义相关的文本片段,再用知识图谱探索并验证这些片段中所提实体之间的关系(GraphRAG Is the Future of Enterprise Knowledge Management)。由于图遍历的单次查询成本高于向量检索、且在单跳事实检索上表现更弱,生产实现通常引入 hybrid router,按查询类型在"图遍历(关系型问题)"与"向量检索(事实型问题)"之间路由(GraphRAG 2026;Your Agent's Memory Problem Is a Retrieval Architecture Problem)。Towards Practical GraphRAG 则用 RRF 融合稠密向量检索与 1-hop 图遍历结果,以兼顾语义相似与结构关系(Towards Practical GraphRAG)。

核心技术与关键概念

稀疏检索(BM25):基于词频与逆文档频率的词法匹配,对精确术语与专有名词强,但缺乏语义泛化。

稠密检索:用嵌入向量做语义相似度,需配套 ANN 索引。常用嵌入模型包括 BGE-M3,MTEB 多语言榜单中亦有 gemini-embedding-001、Qwen3-Embedding-8B 等(见下文评测)。

学习型稀疏检索(SPLADE):SPLADE 通过预训练语言模型的 MLM 头直接学习高维稀疏表示,实现查询与文档的联合词项扩展与重新加权,并配以稀疏正则化;后续版本(如 SPLADE-v3)强调更强的难负样本挖掘与蒸馏损失(Mistral-SPLADE: LLMs for better Learned Sparse Retrieval)。在 SemEval-2026 的多轮 RAG 任务中,参赛系统常用 SPLADE-v3 作为稀疏召回以增强实体中心与精确匹配类查询的词法锚定,再与稠密召回经 RRF 融合(Sifei at SemEval-2026 Task 8;IIMAS-RAG at SemEval-2026 Task 8)。

混合检索与融合:常见做法是 RRF(Reciprocal Rank Fusion)融合 BM25 与稠密的排名列表,或按权重线性融合(From BM25 to Corrective RAG;Advancing RAG…)。

重排序:交叉编码器(cross-encoder)对候选做逐对精排,质量提升最大,但其分数缺乏可解释性,难以据此设定过滤阈值(A Model and Package for German ColBERT)。

延迟交互与多向量:延迟交互模型(COLBERT、XTR)把文档表示为 token 级向量集合,通过 MaxSim 让每个查询 token 与每个文档 token 交互,效果接近 SOTA,但穷举检索在算力上不可行,因此常被用作重排而非全量召回(Multivector Reranking in the Era of Strong First-Stage Retrievers)。

ANN 索引:核心概念为 HNSW(分层的可导航小世界图,主流 ANN 索引,参数 M、efConstruction、efSearch)、IVF(倒排文件,先聚类再搜索,参数 nlist、nprobe)与量化(PQ 乘积量化、SQ 标量量化、BQ 二值量化,用于压缩向量降低内存);评测关注 Recall、QPS、延迟(Vector Database Selection in Practice)。

嵌入微调与评测:MTEB(Massive Text Embedding Benchmark)是主流评测框架,覆盖检索、重排、对分类、聚类、分类与语义相似度等任务类型,并有按语言划分的子榜(MTEB Benchmark Overview);MMTEB 把评测扩展到多语言(MMTEB)。2026 年出现的 MTEB(LLM) 则专门评测把 LLM 直接当嵌入模型用于推理密集型检索的表现(The Embedder's Dilemma)。

代表性项目 / 产品

关键数据与评测结果

趋势与争议

一是"混合 + 重排"是否已足够:多项 2025–2026 研究把混合检索 + 交叉编码器重排视作性价比最高的组合,但重排带来延迟与算力开销,且交叉编码器分数不可解释、阈值难定(From BM25 to Corrective RAG;German ColBERT)。二是多向量 vs 单向量:ColBERT 式延迟交互保留了 token 级细粒度,代价是存储与 MaxSim 计算更重,因此常被用作重排而非全量召回,并催生查询时剪枝(Col-Bandit)等降本手段(Multivector Reranking;Col-Bandit)。三是索引与内存的权衡:量化能显著降低内存,但召回损失明显,需要按场景选择 SQ/ BQ/ PQ(InfoQ),厂商基准(如 Qdrant 对 Elastic DiskBBQ)也需谨慎看待,因由各自发布(Qdrant)。四是榜单口径陷阱:MTEB 存在 English v1、Multilingual、MMTEB、MTEB(LLM) 等多个版本与子榜,模型分数与排名会随口径变化,选型时需对齐同一榜单(对比 MTEB — AI Wiki 与 Embedding Model Leaderboard)。

参考来源

  1. NITATREC at TREC RAG 2025: Exploring Sparse, Dense, and Hybrid Retrieval
  2. From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents
  3. Advancing Retrieval-Augmented Generation for Structured Enterprise and Internal Data
  4. SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG
  5. Incorporating Token Importance in Multi-Vector Retrieval
  6. PyLate: Flexible Training and Retrieval for Late Interaction Models
  7. Single-Turn LLM Reformulation Powered Multi-Stage Hybrid Re-Ranking (TREC 2025)
  8. From Memory-Hungry HNSW to Quantized SPANN: Pinterest's Manas Platform — InfoQ
  9. A Comprehensive Empirical Evaluation of Vector Database Systems for ANN Search
  10. 性能测试报告:百亿级 DINO 向量数据集 — 阿里云 PolarDB
  11. Enterprise Vector Database 2026: Qdrant vs Milvus vs pgvector vs Pinecone
  12. Vector Database Selection in Practice: Deep Comparison of 5 Distributed Vector Databases
  13. MTEB (Massive Text Embedding Benchmark) — AI Wiki
  14. Best Embedding Models 2025: MTEB Scores & Leaderboard
  15. MTEB Benchmark Overview — Hugging Face Space
  16. MMTEB: Massive Multilingual Text Embedding Benchmark
  17. Qwen 3 Embedding
  18. A Model and Package for German ColBERT
  19. StratRAG: A Multi-Hop Retrieval Evaluation Dataset
  20. Col-Bandit: Zero-Shot Query-Time Pruning for Late-Interaction Retrieval
  21. PLAID-PRF: Pseudo-Relevance Feedback with Centroid-like Tokens in PLAID
  22. Multivector Reranking in the Era of Strong First-Stage Retrievers
  23. ColBERT-AW: Enhancing Late Interaction Retrieval With Attribute-Aware Query Token Weighting
  24. Qdrant Beats Elastic's DiskBBQ at 2x Throughput
  25. Embedding Model Leaderboard: MTEB Rankings April 2026
  26. The Embedder's Dilemma: LLMs Are Better, but at What Cost?
  27. MTEB leaderboard — Codesota
  28. グラフ型ベクトル検索の包括的実験評価(HNSW・DiskANN・RoarGraph・ACORN)
  29. Mistral-SPLADE: LLMs for better Learned Sparse Retrieval
  30. Sifei at SemEval-2026 Task 8: Hybrid Retrieval and Query Rewriting for Multi-Turn RAG
  31. IIMAS-RAG at SemEval-2026 Task 8: Hybrid Sparse-Dense Retrieval and Answerability-Conditioned Generation
  32. Naver Labs Europe @ WSDM CUP | Multilingual Retrieval
  33. GraphRAG Is the Future of Enterprise Knowledge Management
  34. GraphRAG 2026 : Knowledge Graphs, Neo4j et Architecture RAG
  35. Your Agent's Memory Problem Is a Retrieval Architecture Problem — FalkorDB
  36. Towards Practical GraphRAG: Efficient Knowledge Graph Construction and Hybrid Retrieval at Scale
← 强化学习前沿合成数据与数据引擎 →