一句话理解

RAG(Retrieval-Augmented Generation,检索增强生成)是在模型回答问题前,先从指定知识库检索相关内容,再把这些内容作为上下文交给模型生成回答。

解决什么问题

语言模型的参数知识可能过时,也可能不了解某个私有文档。RAG 通过外部检索补充上下文,让回答更贴近指定资料,并且更容易追溯来源。

工作流程

flowchart LR
  A[用户问题] --> B[查询改写]
  B --> C[检索知识库]
  C --> D[拼接上下文]
  D --> E[模型生成]
  E --> F[引用与回答]

实际示例

一个最小的 RAG 原型通常包含四个部分:文档切分、向量化、相似度检索和提示词组装。检索结果不是答案本身,而是供模型参考的证据。

常见误区

  • 只接入向量数据库并不等于 RAG 质量好。
  • 检索数量越多不一定越好,过多的噪声会降低回答质量。
  • RAG 不能自动保证事实正确,仍然需要评估检索召回和生成结果。

我的理解

RAG 的核心不是“让模型记住更多内容”,而是把回答时需要的证据临时放到模型的上下文中,并让这条证据链可检查。

相关笔记