2024 年下半年,几乎每个做 AI 产品的团队都在搭知识库问答。企业资料太多、模型记不住,RAG(检索增强生成)看起来是标准答案。但真正动手做才发现,RAG 不是银弹,它是一堆工程细节的集合。

四个最容易翻车的地方

1. 分块

文档切多大切怎么切,直接影响检索质量。切小了丢失上下文,切大了噪声太多。表格、代码、PDF 里的图片,每一种格式都有各自的坑。没有万能参数,只有对着评测集一点点调。

2. 检索

向量检索只解决「语义相近」,不解决「答案正确」。经常出现的情况:关键词完全匹配的文档排在后面,语义相似的废话排在最前。后来我们加上重排序(rerank),效果才有明显提升。

3. 幻觉

模型会一本正经地编造。尤其是「知识库里没有」的问题,它宁可编一个答案,也不肯说不知道。我们在提示词里反复强调「没有依据就直说」,又加了引用溯源,才把幻觉压到可接受范围。

4. 评测

最难的其实是评测。一千个问题的人工标注,一次要花两周。没有评测集,你就不知道改了一行参数到底是变好还是变坏。

那时候团队里流传一句话:RAG 的上限是模型决定的,下限是工程决定的。而大多数产品,拼的是下限。

给我的教训

知识库问答这个赛道,2024 年就有无数团队在做,最后跑出来的没几个。差距不在「会不会用大模型」,而在检索质量、评测体系、对垂直场景的理解这些笨功夫上。

这个结论后来一直影响我:AI 产品的壁垒,往往不在模型,而在模型外面那一圈工程。