是什么
检索增强生成(Retrieval-Augmented Generation,RAG)是一种让大模型「带着资料答题」的技术。它在模型生成回答之前,先根据用户的问题,从外部知识库(文档、网页、数据库等,通常以向量检索实现)里找出最相关的若干片段,再把这些片段连同问题一起喂给模型,让模型基于这些材料来作答,而不是只靠训练时记住的知识。
为什么重要
大模型的知识止于训练截止日期,也记不住企业内部的私有资料,还容易在不知道时「一本正经地编造」。RAG 把模型与一个可随时更新的外部知识库连起来,既补上了时效与私域知识的盲区,又能把答案锚定到真实出处、降低编造。它是企业把大模型接入自家文档、做问答与客服的最主流落地方式之一。
2026 年的最新进展
2026 年,RAG 里「自己搭」的成分在下降:Google 在 Gemini API 中提供托管的 File Search 工具(文档 2026 年 9 月 2 日更新),自动完成切块、向量索引与语义检索并返回带页码的引用;存储与查询时的 embedding 免费,只按 gemini-embedding-2 的价格收一次性索引费,配额从免费档的 1 GB 到最高档的 1 TB。另一条路是把检索直接做成模型的服务端工具:截至 2026 年 9 月,Claude API 的联网搜索按每 1000 次搜索 10 美元计费,网页抓取则不额外收费。与此同时,作为对照路线的长上下文也在变便宜——Claude 4.6 及之后的模型把完整 100 万 token 窗口按标准价计费、超过 20 万 token 不再收溢价,两条路线的成本账因此需要重算。
在 AI 产业链中的位置
RAG 是 AI 产业链应用层的架构模式,它把模型层的通用能力与企业自己的数据接合起来,中间往往还要用到向量数据库等基础设施层组件。相比训练或微调一个专有模型,RAG 改动小、更新快,是多数应用接入私域知识时的首选路径。