RAG(Retrieval-Augmented Generation,检索增强生成)是当前企业落地大模型最主流的架构范式——让 AI 在回答用户问题前,先从知识库/文档库/搜索引擎中检索相关内容,把检索结果连同原始问题一并交给大模型生成答案。RAG 解决的是大模型的三大固疾:知识过期(训练数据有截止日期)、专业领域深度不足(通用模型不懂公司内部数据)、幻觉编造(模型会自信地说错信息)。通过让模型"开卷考试",RAG 把大模型从"凭记忆答题"变成"可以引用证据的 AI 同事"。
一、工作流程拆解
一个标准 RAG 系统按以下步骤运行:
- 文档预处理:把企业文档(PDF、Word、Notion、数据库表等)按段落切分成 300-1000 字符的 chunk
- 向量化:用 Embedding 模型(如 BGE、OpenAI text-embedding-3)把每段文本转成 768/1024/4096 维的浮点数向量,存入向量数据库(Milvus、Qdrant、PGvector、Chroma 等)
- 检索:用户提问同样向量化,在向量库中做相似度搜索(通常用 cosine 或内积),返回最相关的 K 个片段(Top-K,常 K=5~20)
- 重排(可选但推荐):用 Rerank 模型(如 BGE Reranker、Cohere Rerank)对 Top-K 再精排,把最相关的 3-5 个片段推前,显著提升答案质量
- 生成:把"问题 + 检索片段"组装成 prompt 喂给大模型,生成带依据的答案;优秀实现会在答案中标注引用来源
二、传统 RAG 的局限与 2025 年的演进
朴素 RAG 在处理复杂查询时力不从心——比如"对比 A 和 B 产品在不同地区的销售策略"需要跨文档多跳推理,单次向量检索只能返回局部片段。2025 年起,RAG 进入"RAG 2.0"阶段:
- GraphRAG(微软):用大模型自动提取实体关系构建知识图谱,跨文档多跳推理;适合分析型企业数据
- Agentic RAG:AI Agent 自主决定"要不要查、查几次、查哪个库",迭代式检索直到拼出完整答案;适合开放性问答
- Hybrid RAG:向量检索 + 关键词/全文检索(BM25)+ 结构化查询(SQL)混合,兼顾语义与精确匹配
- RAG + 微微调混合:把高频专业知识微调进模型参数(改变模型"本能"),长尾知识走检索(外挂"图书馆"),两者协同
- Self-RAG:让模型自己判断"这个检索结果是否有用",拒绝无关片段,进一步降低幻觉
三、典型应用场景
- 企业知识库问答:飞书/钉钉机器人、内网 Wiki 智能助手,新员工培训资料秒查
- 客服系统:电商退换货政策咨询、银行产品说明、技术支持 1 線
- 法律/医疗/金融:法规检索、文献综述、研究报告写作——这些领域对答案溯源要求极高,RAG 的可引用性是核心价值
- 代码库问答:Cursor 的 @codebase、GitHub Copilot Workspace 本质是 RAG——在大型 monorepo 里精准定位相关代码
- 个人第二大脑:Obsidian + Smart Connections、Notion Q&A,把个人笔记/文档变可对话的知识库
四、技术选型与快速搭建
零代码用户首选 Dify、FastGPT、扣子(Coze):上传文档即得知识库机器人,30 分钟可上线原型。开发者主流方案:LangChain/LlamaIndex 编排 + Milvus/Qdrant 向量库 + GPT-4/Claude/DeepSeek 大模型。企业级落地还需关注:权限隔离(不同部门看不同文档)、审计日志(谁问了什么查了什么)、更新机制(文档新增自动向量化)、评测体系(答案准确率与幻觉率的可量化监测)。
五、常见问答
Q:RAG 和微调怎么选?——知识频繁更新/需要溯源/合规要求高选 RAG;改变模型行为风格/对话模式/领域推理范式选微调;预算与人力充足就两者协同——RAG 处理长尾知识,微调固化核心能力。
Q:RAG 多久能上线?——零代码平台(FastGPT/Dify)1-3 天可上线 MVP;自研方案含数据接入、向量库选型、prompt 调优至少 2-4 周;企业级含权限/审计/评测通常 1-3 个月。
Q:能完全消除幻觉吗?——不能完全消除,但能显著降低(权威数据从 70%+ 降至 5-10%)。核心约束是检索质量——如果知识库本身没答案,模型仍可能编造。
词条信息基于 2026 年 8 月公开资料整理,由 AI智库(ai-zhiku.com)编辑团队维护。
辽公网安备21021102001760号