← 人工智能 · 上下文窗口原理

📊 主流大模型参数规模 × 上下文窗口全景

GPT · Claude · Gemini · 通义千问 Qwen · DeepSeek · 智谱 GLM · 豆包 Doubao —— 各版本参数量级、上下文窗口、最大输入/输出,以及「到底相当于什么级别」的形象感知。数据截至 2026-09。

🧮

参数量级

从端侧 0.6B 到旗舰 MoE 1.6T,差 2600 多倍。MoE 模型要看「总参数 / 激活参数」。

🪟

上下文窗口

主流从 32K1M(1024K)。2026 年 1M 已成第一梯队标配。

↔️

输入 ≠ 输出

窗口是「输入 + 输出」总和。输出常被单独限在 64K–256K,远小于窗口。

📚

1M 相当于

2500 页 A4 / 60–80 万汉字 / 一个 5 万行代码库。

1先搞清三个常被混为一谈的概念

🧮

参数量(Parameters)

模型「大脑」里可学习的权重总数。单位 B = 十亿(1B = 10⁹),T = 万亿(1T = 1000B)。参数越多通常能力上限越高,但算力/显存开销也越大。

🪟

上下文窗口(Context Window)

模型一次能「看到」的 token 总量上限,= 你输入的 + 模型产出的 + 中间思考(含思维链)。超出就要裁剪/摘要。

📤

最大输入 / 最大输出

最大输入:单次请求能塞多少 token;最大输出:模型单次最多生成多少 token。两者加起来 ≤ 上下文窗口。

关于 MoE(混合专家):现代大模型(Qwen3-235B、DeepSeek、GLM、Doubao 旗舰)普遍用 MoE 架构。它有两套数字——总参数(所有专家权重之和,决定「知识容量」)与 激活参数(每次推理实际唤醒的专家,决定「单次推理成本/速度」)。比如 DeepSeek-V4-Pro = 1.6T 总 / 49B 激活,意味着它「肚子里装了 1.6 万亿参数,但每次只调动 490 亿来答题」。
⚠️ 参数量「不公开」是常态:OpenAI(GPT 系列)、Anthropic(Claude)、Google(Gemini)、字节(Doubao)均不公开具体参数量。下表凡标「未公开」均非遗漏,而是厂商确实未披露——这不影响上下文窗口等可用指标的对比。

2主流模型参数 × 上下文窗口总表

下表按「家族 → 代表版本」罗列。上下文/输入/输出单位均为 K = 1024 token。标「—」表示官方按场景/计划不同未单列,或随版本浮动。

家族 / 代表版本 参数量级 上下文窗口 最大输入 最大输出 一句话定位
OpenAI · GPT-5 / 5 mini / 5 nano未公开400K272K128K总窗口 400K = 输入272K + 输出128K
OpenAI · GPT-5.2(Thinking)未公开400K+/compact 扩展272K128K256K 内检索近 100% 准确
Anthropic · Claude Opus 5 / 4.8未公开1Mbeta~1Mcompact 扩展长程 Agent,1M 上下文
Anthropic · Claude Sonnet 4.6未公开1Mbeta~1M高性价比长上下文
Google · Gemini 3 / 3.1 Pro未公开1M1M64K输入 1M / 输出 64K
通义千问 · Qwen3-0.6B0.6B32K32K~8K可扩端侧/嵌入式
通义千问 · Qwen3-8B8B128K128K~8K可扩本地部署甜点
通义千问 · Qwen3-32B32B128K128K~8K可扩单卡可跑的强模型
通义千问 · Qwen3-235B-A22B235B / 22B128K128K~8K可扩开源 MoE 旗舰(总/激活)
通义千问 · Qwen3-Max(API)大 MoE·未公开256K256K通义 API 最强
通义千问 · Qwen3-Coder-480B-A35B480B / 35B256K原生 · 1M 外推256K~32K可扩代码/Agent 专用
DeepSeek · V3 / V3.1671B / 37B128K128K~8K可扩开源 MoE 标杆
DeepSeek · V4-Pro1.6T / 49B1M1M2026-04 开源,百万上下文
DeepSeek · V4-Flash284B / 13B1M1M便宜快,简单任务≈Pro
智谱 · GLM-4.5355B / 32B128K128K~8K可扩开源 Coding 基座
智谱 · GLM-5.2 / 5.3开源·未公开1MSolid1M128K长程任务/生产级代码
豆包 · Doubao-lite-32k小·未公开32K32K低延迟轻量
豆包 · Doubao-pro-128k大·未公开128K128K通用生产级
豆包 · Doubao-Seed-2.1-pro/turbo大·未公开256K256K64KCoding/Agent 旗舰
豆包 · Doubao-Seed-Evolving大·未公开1024K1024K256K1M 超长上下文,周级演进

说明:Qwen3 系列原生最大输出多为 8K(可经 API 上调);Claude 长文靠 compact 摘要扩展有效窗口;DeepSeek/Gemini 输出上限以官方 API 为准。数值随套餐/区域/时间可能浮动,详见第 8 节来源

3上下文窗口量级:一张条形图看差距

横条长度 正比于上下文窗口(线性,满格 = 1M)。注意最左边 32K 几乎只是一道缝——这正是「小窗口」与「百万窗口」差 32 倍的直观体现。

Doubao-lite / Qwen3-0.6B
32K
Qwen3-8B/32B · GLM-4.5 · DeepSeek-V3
128K
Claude Opus 4.5 档(旧)
200K
Qwen3-Max · Doubao-Seed-2.1
256K
GPT-5 全系
400K
Claude 4.6+ · Gemini 3 · GLM-5 · DeepSeek-V4 · Doubao-Evolving
1M
32K
128K
400K
1M

2026 年第一梯队(Claude / Gemini / GLM-5 / DeepSeek-V4 / Doubao-Evolving)已把 1M 上下文做成标配;GPT-5 系仍停在 400K 总窗口(但靠 /compact 等机制可扩展「有效」长度)。

4参数量级:对数刻度下的「体量天梯」

参数从 0.6B 到 1.6T 跨越 3 个数量级,线性条会完全看不清小模型,故用对数刻度(满格 = 1T)。每个刻度差 10 倍。

Qwen3-8B(稠密)
8B
Qwen3-32B(稠密)
32B
Qwen3-235B-A22B(总)
235B
GLM-4.5(总)
355B
DeepSeek-V4-Flash(总)
284B
Qwen3-Coder-480B(总)
480B
DeepSeek-V3(总)
671B
DeepSeek-V4-Pro(总)
1.6T
1B
10B
100B
1T
体积 ≠ 单次成本:MoE 模型「总参数」决定知识容量,「激活参数」才决定每次推理贵不贵。例如 Qwen3-235B-A22B 总参数 235B,但每次只激活 22B——推理成本接近一个 22B 稠密模型,能力却接近 235B。所以比参数大小时,一定看「激活参数」才公平

5最容易踩的坑:输入上限 ≠ 输出上限

「上下文窗口」是输入 + 输出的总和预算。很多模型窗口很大,但单次输出被单独卡住——你塞得进 1M,模型却一次只吐 64K~256K。下面用 GPT-5(400K 窗口)示意拆分:

GPT-5 总窗口 = 400K token 输入 272K(68%) 输出 128K(32%) 关键洞察:输出被锁在窗口的约 1/3,想一次生成超长内容(如整本书)会被截断。
🔒

输出是短板

1M 窗口模型,输出常限 64K(Gemini)/ 128K(GLM-5)/ 256K(Doubao-Evolving)。长文生成要靠「流式续写」或分块。

🧠

思维链也占输出

推理模型(o 系 / GPT-5 Thinking / DeepSeek 思考模式)的「思考过程」算进输出额度,真答案反而更短。

📐

输入可很满

把整本书/代码库当上下文喂进去没问题(只要 ≤ 窗口),难点在「模型能否在这么长里不迷路」。

6「相当于什么级别」——把 token 换成你能感知的东西

约定:1 个 A4 页 ≈ 400~500 token ≈ 300~400 汉字;中文 1 token ≈ 1~1.5 个汉字(不同分词器有差)。下面这张「尺子」把各档窗口对应到现实体量。

32K 128K 200K 256K 400K 1M ~80页 ~300页 ~500页 ~640页 ~1000页 ~2500页

横轴线性表示 token 数;柱高表示「能装下多少页」。32K 到 1M 差 32 倍,视觉上一目了然。

上下文窗口约多少汉字约多少 A4 页现实等价物
32K2~5 万~80 页一篇公众号长文 / 一份周报
128K8~18 万~300 页一本中篇书 / 一篇硕士论文 / 100 页 PDF
200K12~28 万~500 页一部长篇小说单册(如《三体》)
256K16~35 万~640 页两本专著 / 一个中小型代码库
400K25~55 万~1000 页一整套教材 / 百页技术文档全集
1M60~80 万~2500 页一部长篇全集 / 5 万行代码库 / 整季剧集字幕
一句话感知:把窗口想成「模型的工作桌」。32K 是张便签纸,128K 是一本书,1M 是一整面墙的书架——你能在桌上摊开多少材料,直接决定它「记得住多长的上下文、处理得了多大的任务」。

7怎么选:根据任务挑窗口与体量

💬

聊天 / 短问答 / 分类

32K~128K 足够。优先看激活参数与性价比,小模型(Qwen3-8B/32B、Doubao-lite)本地即可跑。

📄

长文档阅读 / 总结 / RAG

128K~256K 起步。要整本文档进窗口就选 256K+(Qwen3-Max、Doubao-Seed-2.1)。

🤖

长程 Agent / 代码仓库级任务

直接上 1M 档:Claude 4.6+、Gemini 3、GLM-5.2/5.3、DeepSeek-V4、Doubao-Seed-Evolving。配 compact 可跑数天任务。

✍️

超长内容生成

最大输出而非窗口:GLM-5(128K 输出)、Doubao-Evolving(256K 输出)更擅长一次写长;否则用流式续写。

8数据说明与来源

数据截至 2026-09,版本迭代极快。大模型窗口/输出上限随套餐、区域、API 版本频繁变动,本表为「标称上限」整理,生产前请以官方文档为准
诚信提示:标「未公开」的参数量(GPT / Claude / Gemini / Doubao)是厂商确未披露,并非本表遗漏;MoE 模型的「总/激活」拆分以官方技术报告为准,部分数值随开源版本更新可能微调。