是什麼
檢索增強生成(Retrieval-Augmented Generation,RAG)是一種讓大模型「帶著資料答題」的技術。它在模型生成回答之前,先根據使用者的問題,從外部知識庫(文件、網頁、資料庫等,通常以向量檢索實現)裡找出最相關的若干片段,再把這些片段連同問題一起餵給模型,讓模型基於這些材料來作答,而不是隻靠訓練時記住的知識。
為什麼重要
大模型的知識止於訓練截止日期,也記不住企業內部的私有資料,還容易在不知道時「一本正經地編造」。RAG 把模型與一個可隨時更新的外部知識庫連起來,既補上了時效與私域知識的盲區,又能把答案錨定到真實出處、降低編造。它是企業把大模型接入自家文件、做問答與客服的最主流落地方式之一。
2026 年的最新進展
2026 年,RAG 裡「自己搭」的成分在下降:Google 在 Gemini API 中提供託管的 File Search 工具(文件 2026 年 9 月 2 日更新),自動完成切塊、向量索引與語義檢索並返回帶頁碼的引用;儲存與查詢時的 embedding 免費,只按 gemini-embedding-2 的價格收一次性索引費,配額從免費檔的 1 GB 到最高檔的 1 TB。另一條路是把檢索直接做成模型的服務端工具:截至 2026 年 9 月,Claude API 的聯網搜尋按每 1000 次搜尋 10 美元計費,網頁抓取則不額外收費。與此同時,作為對照路線的長上下文也在變便宜——Claude 4.6 及之後的模型把完整 100 萬 token 視窗按標準價計費、超過 20 萬 token 不再收溢價,兩條路線的成本賬因此需要重算。
在 AI 產業鏈中的位置
RAG 是 AI 產業鏈應用層的架構模式,它把模型層的通用能力與企業自己的資料接合起來,中間往往還要用到向量資料庫等基礎設施層元件。相比訓練或微調一個專有模型,RAG 改動小、更新快,是多數應用接入私域知識時的首選路徑。