当前位置: 首页 > news >正文

倒排索引初步认识

RAG分词器的相关知识:

倒排索引:

倒排索引就是建立“ 词 → 包含这个词的文档 ”的映射,从而让搜索系统能够快速找到相关文档

可以理解为字典的反向查找表

正常来讲是先去找文档,然后看文档里面有什么词,但这样操作在文档数量少的时候还行,一旦文档数量非常多的时候,例如1000万篇文档,这个时候一篇一篇文档去查找关键词,效率会非常低,所以也就用到了倒排索引

之所以叫倒排,就是因为它是通过去比对关键词,找出这个词所归属的文档,从而快速锁定关键词所在的文档,这种就属于稀疏检索。

例如成都 -> [doc1, doc2, doc4],旅游 -> [doc2],当用户同时问到成都和旅游,还可以做交集,得知doc2为既包含成都也包含旅游的文档就实现快速精准的检索

说到这里,联系一下稠密检索中的向量检索,这里的倒排索引和BM25这种都属于稀疏检索,根据关键词来检索出相关文档,只会搜索出包含一模一样的关键词在内的文档,有一个字不一样都会被过滤。

而向量检索则是根据语义来检索,例如用户问我今天想去蓉城玩,而如果词库中只有成都,没有蓉城,BM25没有找到包含蓉城的文档,就会失效。而向量检索会分析语义,判断出蓉城 == 成都,所以就会检索出成都相关的文档。

http://www.jsqmd.com/news/1370241/

相关文章:

  • 突破复杂场景通信瓶颈:低功耗广域网(LPWAN)LoRa技术选型与工程实战
  • 2026年8月大连全封闭减肥训练营/大连运动训练营哪家管理严格_大连跃动乐健身训练营 - 品牌宣传支持者
  • NX/UG二次开发:PK的方式判断一个圆柱面是否是完整的
  • NumPy数组创建全攻略:从底层原理到七大核心方法实践
  • 大文件分片上传与断点续传:Spring Boot + MinIO 实战指南
  • AI 写的中文为什么都是同一张脸?AI领域知名博主卡兹克把根治方法开源了!
  • C++ vector动态数组:从核心原理到高效编程实战指南
  • AI Agent缓存架构革新:从黑盒循环到结构化可缓存工作流设计
  • Visual Studio 2019添加bits/stdc++.h万能头文件:两种配置方案详解
  • 【金仓数据库征文】AI Agent SQL 执行超时与资源保护——在线问数不能把数据库当成“无限工具”
  • Spring WebFlux网关Connection reset by peer故障排查与Reactor Netty连接池优化
  • Unity Timeline代码控制实战:动态绑定、资源管理与性能优化
  • 保研全流程拆解——从大二到大四,每个节点该做什么
  • Photoshop下载安装教程(2025最全图文版)PS下载、安装步骤、配置与常见问题一篇搞定
  • PHP.d目录配置管理与优化实践指南
  • 稀疏注意力与长上下文:AI模型从规模竞赛到实用化的关键技术突破
  • 央视视频链接怎么获取?不同平台获取方法详解
  • 2026南昌优秀的AI 提升系统公司解惑:云搜数智(南昌办事处) - 热点品牌推荐
  • 《信念的灯塔》:一首歌如何给低谷听众方向感
  • 比亚迪ATTO3三相逆变器深度拆解:从FOC算法到SVPWM硬件实现
  • Visual Studio 2019企业版离线安装包制作与部署全攻略
  • 5分钟免费iOS激活锁绕过指南:Applera1n解锁iPhone 6s-X完整方案
  • Triton语言cos函数实现与GPU优化实践
  • 从OpenGL到Unity:深入理解渲染管线与Shader编写实战
  • 2026平航杯内存取证(StarMem)
  • Python音频剪辑工具HzChopGUI:本地化GUI实现与批量处理实践
  • 基于腾讯云微搭低代码的MBA订单管理系统实践
  • 字符串里扒数据:从“假 list“到“一堆 Document“的两种正确姿势
  • 2026 年至今,新晃侗族自治知名的防火墙制造企业深度剖析,你每天用的东西,竟悄悄成了阻挡真相的无形壁垒? - 企业信息推荐-2
  • 【Java核心高阶进阶】22-happens-before与内存屏障