RAG效果差?90%的人第一步就错了!优化语块划分,性能提升2.3倍
导语:RAG效果差?可能是第一步的文本切分就埋下了祸根。优化语块划分,无需更换模型,即可大幅提升性能。
如果你以为 RAG 做不好,是因为检索算法不够强、reranker 不够聪明、embedding 模型不够先进,那你可能一开始就盯错了地方。
现在有一种新的做法,可以把语料库规模缩小 40 倍,把每次查询消耗的 token 降低 3 倍,还能让向量搜索相关性提升 2.3 倍。
更关键的是,它不改你的检索算法,不换你的 reranker,也不碰你的 embedding 模型。
它只修了一个几乎没人认真检查的上游问题。
几乎所有 RAG 流水线,都默认了一件事:一段文本 chunk,就是最适合被 embedding 的知识单元。
但这个假设,很少被真正质疑。
而大量检索失败,恰恰就从这里开始。
为什么 chunk 本身就不靠谱?
所谓 chunk,本质上只是一个结构中立的文本容器。它并不知道:
一条观点从哪里开始,又在哪里结束; 它来自文档的哪个版本; 谁有权限看到它。
因为 chunk 没有“观点边界”,所以切分器只能按 token 数往下切。字数到了,就一刀下去。
© 版权声明
本文部分内容、图片整理自互联网公开渠道,版权归原作者所有。ACGFav 仅负责对信息进行整理、翻译或排版优化,不代表本站完全赞同其观点。若文中内容涉及版权问题,请通过本站“关于我们”页面联系站长,我们将尽快核实并处理。
相关文章
暂无评论...