返回全部动态
分层 BM25:十亿文档规模的词汇搜索
原标题:Hierarchical BM25: Lexical Search at Billion-Document Scale
AI 摘要
arXiv 上发布了一篇关于分层 BM25 的论文,提出了一种在十亿文档规模下进行词汇搜索的新方法。该方法通过粗粒度索引选择文档组,将内存占用固定为约 4.4 GB,查询延迟降至约 300 毫秒,同时保证返回分数与扁平索引一致。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
Computer Science > Information Retrieval Title:Hierarchical BM25: Lexical Search at Billion-Document Scale View PDF HTML (experimental) Abstract:A flat BM25 index over one billion documents occupies about 400 GB. Holding it in memory requires DRAM proportional to corpus size. Serving it from disk takes 4-12 seconds per query. Exact top-k lexical retrieval at this scale is therefore impractical within an interactive latency budget. Hierarchical BM25 gives up exact ranking in exchange
发布时间:2026-08-04 12:00
抓取时间:2026-08-04 12:57
来源机构:arXiv