AI 技能百科 English

检索增强生成(RAG)

AI 技能百科AI 工程 · 最后更新: 2026-07-28

定义

检索增强生成(Retrieval-Augmented Generation,RAG)是一种在提问时先从外部知识库检索相关文档、再将其注入大语言模型(LLM)上下文的架构。模型不再只依赖训练时记住的知识,而是实时搜索你自己的数据(Wiki、PDF、工单、代码等),并基于这些来源作答。这能显著减少幻觉,且无需重新训练就能保持答案时效性。

为什么对 AI 求职重要

RAG 是当前工业界最主流的生产级 LLM 架构。几乎所有企业 AI 助手、内部知识问答机器人和“与文档对话”产品都是 RAG 系统。OpenAI、Anthropic、Cohere 等公司的 AI 工程师和 Forward Deployed Engineer 职位普遍把生产级 RAG 经验列为核心要求,因为它考察完整的技术栈:数据管道、向量化、向量数据库、提示词构建和效果评估。

核心概念

  • 分块(Chunking)——把文档切分为可检索的段落;块大小和重叠率对效果影响很大。
  • 向量嵌入(Embeddings)——用于语义相似度检索的稠密向量表示。
  • 向量检索——在 pgvector、Pinecone、Qdrant 等向量库中做近似最近邻(ANN)查找。
  • 混合检索——向量相似度 + 关键词(BM25)结合,提升召回率。
  • 重排序(Reranking)——用二阶段模型(如 Cohere Rerank、cross-encoder)按真实相关性重新排序检索结果。
  • 有据可依的生成与引用——约束模型只基于检索到的上下文作答并标注来源。
  • RAG 评估——衡量检索召回、答案忠实度与相关性(如 Ragas 或自建评测集)。

学习路径

  1. 不用框架、手写一个最小 RAG 管道:加载文档 → 分块 → 调用嵌入 API → 存入 Postgres + pgvector → 取 top-k → 拼提示词让 LLM 作答。
  2. 加入混合检索(BM25 + 向量)和重排序,在小规模标注问题集上对比检索质量变化。
  3. 建立评估:从语料中构造 30–50 个问答对,每次改动都跟踪检索命中率和答案忠实度。
  4. 工程化:增量索引、元数据过滤、权限控制、缓存与延迟预算。
  5. 做一个可展示的作品项目,例如部署在云上、带监控的“与我的简历/Wiki 对话”应用。

资源链接