为什么要 RAG#
大模型的知识有截止日期,也无法覆盖私有文档。检索增强生成(RAG) 先从知识库检索相关内容,再让模型基于这些内容作答,显著减少幻觉。
工作流程#
- 离线索引:把文档切块(chunk)、向量化(embedding)、存入向量库
- 在线检索:把用户问题向量化,在向量库中检索最相似的片段
- 生成回答:把检索结果作为上下文拼进提示词,交给 LLM 生成
关键点#
- 切块策略:块大小与重叠影响检索质量
- 混合检索:向量 + 关键词(BM25)互补
- 重排序(Rerank):精排提升答案相关性
- 评估:用 RAGAS 等指标持续衡量
小结#
RAG 让 LLM 从"泛泛而谈"变成"言之有据"。它是企业落地大模型最常见的模式之一。

