上下文窗口模型一次能处理的最大 token 数,超出部分会被截断或遗忘。现代模型的窗口从约 8K 到超过 100 万 token 不等。更大的窗口可传入整份文档或代码库,但填满它成本更高、也可能分散模型注意力,因此只发送相关内容。