RAG效果差?90%的人第一步就错了!优化语块划分,性能提升2.3倍

导语:RAG效果差?可能是第一步的文本切分就埋下了祸根。优化语块划分,无需更换模型,即可大幅提升性能。

如果你以为 RAG 做不好,是因为检索算法不够强、reranker 不够聪明、embedding 模型不够先进,那你可能一开始就盯错了地方。

现在有一种新的做法,可以把语料库规模缩小 40 倍,把每次查询消耗的 token 降低 3 倍,还能让向量搜索相关性提升 2.3 倍。

更关键的是,它不改你的检索算法,不换你的 reranker,也不碰你的 embedding 模型。

它只修了一个几乎没人认真检查的上游问题。

几乎所有 RAG 流水线,都默认了一件事:一段文本 chunk,就是最适合被 embedding 的知识单元。

但这个假设,很少被真正质疑。

而大量检索失败,恰恰就从这里开始。

为什么 chunk 本身就不靠谱?

所谓 chunk,本质上只是一个结构中立的文本容器。它并不知道:

一条观点从哪里开始,又在哪里结束; 它来自文档的哪个版本; 谁有权限看到它。

因为 chunk 没有“观点边界”,所以切分器只能按 token 数往下切。字数到了,就一刀下去。

© 版权声明

相关文章

暂无评论

none
暂无评论...