RAG(Retrieval-Augmented Generation)让 AI 智能体每次回答时从存储数据拉取事实。数据存放在 vector database 中,每段文本转为称为 vector 的数字列表,相似概念产生彼此靠近的 vector,智能体可快速找到相关片段。用户提问时,智能体将问题转为 vector、查找最近片段并阅读,然后撰写混合新 prompt 与这些片段的回复。因数据存储可容纳大量过往聊天、文档或笔记,此过程为智能体提供工作记忆而无需将所有内容塞入 prompt,降低 token 成本、保持答案切题,并允许记忆随时间增长。