上下文窗口(Context Window)

基础概念

上下文窗口是模型单次能处理的 Token 上限,包含系统提示词、全部对话历史和输出。超出窗口的内容对模型来说等于不存在。

#窗口里装了什么

每一次请求,模型看到的都是完整的上下文:系统提示词 + 全部历史轮次 + 当前问题。窗口大小从早期模型的 4K、8K 发展到如今普遍的 128K 甚至更长,但"能装下"不等于"用得好"——多数模型在窗口接近上限时对中间内容的召回能力会下降(所谓 lost in the middle)。

#窗口与显存的关系

本地部署时,上下文长度直接影响显存占用:KV Cache 随 Token 数线性增长,把上下文从 4K 拉到 32K,显存占用可能翻倍。跑本地模型时给多大的 ctx 参数,要在"能记住多少"和"还剩多少显存"之间权衡。

#关于「上下文窗口(Context Window)」的常见问题

上下文窗口是模型单次能处理的 Token 上限,包含系统提示词、全部对话历史和输出。超出窗口的内容对模型来说等于不存在。

本词条属于基础概念分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具