Context window(上下文窗口)是大语言模型一次能读取的文本块,以 token(词片段)计量。若模型拥有 4,000 token 的窗口,在必须遗忘或截断较早内容之前,它只能「查看」约 3,000 个单词。新 token 会将旧 token 挤出,如同在文本上滑动的窗口。窗口大小对 prompt、聊天历史或文档的长度设定了硬性上限。小窗口迫使你保持输入简短或拆分内容,而大窗口让模型能跟踪更长的叙述并保留更多事实。选择合适的窗口大小,是在成本、速度与模型能同时记住的细节量之间取得平衡。
RAG(Retrieval-Augmented Generation,检索增强生成)和 long-context transformer(如 Claude 3、Gemini 1.5)等新技术,旨在在不直接触及模型上限的情况下扩展可用上下文。