RAG(Retrieval-Augmented Generation)agent 混合搜索与语言生成,用新鲜可靠的事实回答问题。用户发送查询后,智能体先将查询转为 embedding(捕获含义的数字列表),在存有网页、PDF 等文本段落的 vector database 中查找相似 embedding,最佳匹配段落作为 context 返回。智能体将原始问题与这些段落放入大语言模型,模型撰写最终回复,每句话 grounded 于检索文本。此设置保持模型较小、减少错误猜测,且只需向 database 添加新文档即可更新知识。构建 RAG agent 的常用工具包括 embedding model、FAISS 或 Pinecone 等 vector store,以及通过 LangChain 或 LlamaIndex 等 framework 连接的 LLM。