科普
进阶
🗓 2025-05-06
⏱ 阅读需约 25 分钟
RAG:检索增强生成实战
向量数据库怎么选、召回策略怎么搭、重排序什么时候该上——一份偏工程的 RAG 落地清单与常见坑点。
RAG 解决什么问题
让模型在回答前先“查资料”:把相关文档检索出来塞进上下文,从而降低幻觉、引入私域知识、且无需重新训练模型。
三个关键环节
切分(Chunking)
切得太大,召回不精准;切得太小,语义被割裂。按语义边界切、并保留适度重叠,通常比固定字数切分效果更好。
召回(Retrieval)
纯向量召回会漏掉关键词精确匹配的场景,向量 + 关键词的混合检索往往更稳。
重排序(Rerank)
先用便宜的方式粗召回一批,再用更强的 reranker 精排前几条。这一步对最终质量的提升常被低估。
RAG 的上限,多半不在模型,而在检索质量。
常见坑
评测缺位是最大的坑——没有一套固定的问答评测集,任何调整都只是“感觉变好了”。先把评测建起来,再谈优化。