RAG(Retrieval-Augmented Generation,检索增强生成)是一种让语言模型在回复前先查找资料以给出更好答案的方法。首先,系统将用户问题转为搜索查询,扫描知识源(如文档集或数据库),取回最相关段落(称为「retrievals」)。接着,语言模型阅读这些段落,结合自有训练知识撰写最终答案。搜索与生成的结合帮助模型保持时效、减少臆测并引用真实事实。因可按需添加外部信息,RAG 通常需要较少 fine-tuning,且能处理基础模型训练时未见过的主题。