Qdrant(@qdrant_engine)
BM25 scoring relies on IDF (Inverse Document Frequency). In simple terms, the rarer a word is in you...
8.5内容质量

TL;DR · AI 摘要
Qdrant 1.19版本改进BM25评分,通过按租户独立计算IDF提升多租户环境下的搜索准确性。
核心要点
- Qdrant 1.19支持按租户独立计算IDF统计,避免跨租户数据混合
- 旧版跨租户IDF计算导致罕见词被稀释,影响BM25相关性排序
- 新版本无需创建独立集合即可实现租户级精准搜索
结构提纲
按章节快速跳转。
解释BM25评分依赖逆文档频率(IDF)的基本原理
传统IDF计算跨租户混合导致统计失真
实现租户级IDF独立计算,提升搜索准确性
- ·技术影响
无需分离集合即可获得租户专属搜索精度
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- BM25与多租户改进
- 旧版问题
- 跨租户IDF混合导致统计失真
- 1.19改进
- 租户级IDF独立计算
- 无需分离集合
- 效果
- 提升搜索准确性
金句 / Highlights
值得收藏与分享的关键句。
IDF计算跨租户混合导致罕见词被稀释,影响BM25相关性排序
Qdrant 1.19实现租户级IDF独立计算,提升搜索准确性
新版本无需创建独立集合即可实现租户级精准搜索
#BM25#Qdrant#搜索技术#多租户
打开原文Qdrant在X上的推文:"BM25评分依赖于IDF(逆文档频率)。简单来说,数据中某个词出现的频率越低,在搜索时其重要性就越高。在多租户集合中,此前IDF是基于所有租户的数据统一计算的。这意味着如果租户A和租户B使用了截然不同的词汇,它们的统计信息会被混合在一起。结果是,某个租户中罕见的词可能不会被认定为罕见,导致BM25评分准确性下降。Qdrant 1.19版本解决了这个问题。现在可以按租户单独计算IDF统计信息,而不是针对整个集合统一计算。现在每个租户的BM25评分仅基于其自身的数据,从而在无需创建独立集合的情况下实现更精准的词汇搜索。完整发布信息请参见:"
@qdrant_engine
BM25评分依赖于IDF(逆文档频率)。简单来说,数据中某个词出现的频率越低,在搜索时其重要性就越高。在多租户集合中,此前IDF是基于所有租户的数据统一计算的。这意味着如果租户A和租户B使用了截然不同的词汇,它们的统计信息会被混合在一起。结果是,某个租户中罕见的词可能不会被认定为罕见,导致BM25评分准确性下降。Qdrant 1.19版本解决了这个问题。现在可以按租户单独计算IDF统计信息,而不是针对整个集合统一计算。现在每个租户的BM25评分仅基于其自身的数据,从而在无需创建独立集合的情况下实现更精准的词汇搜索。完整发布信息请参见:
qdrant.tech/blog/qdrant-1.…
下午3:29 · 2026年8月10日
1500
次浏览
6
31
10