GPT · Claude · Gemini · 通义千问 Qwen · DeepSeek · 智谱 GLM · 豆包 Doubao —— 各版本参数量级、上下文窗口、最大输入/输出,以及「到底相当于什么级别」的形象感知。数据截至 2026-09。
从端侧 0.6B 到旗舰 MoE 1.6T,差 2600 多倍。MoE 模型要看「总参数 / 激活参数」。
主流从 32K 到 1M(1024K)。2026 年 1M 已成第一梯队标配。
窗口是「输入 + 输出」总和。输出常被单独限在 64K–256K,远小于窗口。
约 2500 页 A4 / 60–80 万汉字 / 一个 5 万行代码库。
模型「大脑」里可学习的权重总数。单位 B = 十亿(1B = 10⁹),T = 万亿(1T = 1000B)。参数越多通常能力上限越高,但算力/显存开销也越大。
模型一次能「看到」的 token 总量上限,= 你输入的 + 模型产出的 + 中间思考(含思维链)。超出就要裁剪/摘要。
最大输入:单次请求能塞多少 token;最大输出:模型单次最多生成多少 token。两者加起来 ≤ 上下文窗口。
下表按「家族 → 代表版本」罗列。上下文/输入/输出单位均为 K = 1024 token。标「—」表示官方按场景/计划不同未单列,或随版本浮动。
| 家族 / 代表版本 | 参数量级 | 上下文窗口 | 最大输入 | 最大输出 | 一句话定位 |
|---|---|---|---|---|---|
| OpenAI · GPT-5 / 5 mini / 5 nano | 未公开 | 400K | 272K | 128K | 总窗口 400K = 输入272K + 输出128K |
| OpenAI · GPT-5.2(Thinking) | 未公开 | 400K+/compact 扩展 | 272K | 128K | 256K 内检索近 100% 准确 |
| Anthropic · Claude Opus 5 / 4.8 | 未公开 | 1Mbeta | ~1M | —compact 扩展 | 长程 Agent,1M 上下文 |
| Anthropic · Claude Sonnet 4.6 | 未公开 | 1Mbeta | ~1M | — | 高性价比长上下文 |
| Google · Gemini 3 / 3.1 Pro | 未公开 | 1M | 1M | 64K | 输入 1M / 输出 64K |
| 通义千问 · Qwen3-0.6B | 0.6B | 32K | 32K | ~8K可扩 | 端侧/嵌入式 |
| 通义千问 · Qwen3-8B | 8B | 128K | 128K | ~8K可扩 | 本地部署甜点 |
| 通义千问 · Qwen3-32B | 32B | 128K | 128K | ~8K可扩 | 单卡可跑的强模型 |
| 通义千问 · Qwen3-235B-A22B | 235B / 22B | 128K | 128K | ~8K可扩 | 开源 MoE 旗舰(总/激活) |
| 通义千问 · Qwen3-Max(API) | 大 MoE·未公开 | 256K | 256K | — | 通义 API 最强 |
| 通义千问 · Qwen3-Coder-480B-A35B | 480B / 35B | 256K原生 · 1M 外推 | 256K | ~32K可扩 | 代码/Agent 专用 |
| DeepSeek · V3 / V3.1 | 671B / 37B | 128K | 128K | ~8K可扩 | 开源 MoE 标杆 |
| DeepSeek · V4-Pro | 1.6T / 49B | 1M | 1M | — | 2026-04 开源,百万上下文 |
| DeepSeek · V4-Flash | 284B / 13B | 1M | 1M | — | 便宜快,简单任务≈Pro |
| 智谱 · GLM-4.5 | 355B / 32B | 128K | 128K | ~8K可扩 | 开源 Coding 基座 |
| 智谱 · GLM-5.2 / 5.3 | 开源·未公开 | 1MSolid | 1M | 128K | 长程任务/生产级代码 |
| 豆包 · Doubao-lite-32k | 小·未公开 | 32K | 32K | — | 低延迟轻量 |
| 豆包 · Doubao-pro-128k | 大·未公开 | 128K | 128K | — | 通用生产级 |
| 豆包 · Doubao-Seed-2.1-pro/turbo | 大·未公开 | 256K | 256K | 64K | Coding/Agent 旗舰 |
| 豆包 · Doubao-Seed-Evolving | 大·未公开 | 1024K | 1024K | 256K | 1M 超长上下文,周级演进 |
说明:Qwen3 系列原生最大输出多为 8K(可经 API 上调);Claude 长文靠 compact 摘要扩展有效窗口;DeepSeek/Gemini 输出上限以官方 API 为准。数值随套餐/区域/时间可能浮动,详见第 8 节来源。
横条长度 正比于上下文窗口(线性,满格 = 1M)。注意最左边 32K 几乎只是一道缝——这正是「小窗口」与「百万窗口」差 32 倍的直观体现。
2026 年第一梯队(Claude / Gemini / GLM-5 / DeepSeek-V4 / Doubao-Evolving)已把 1M 上下文做成标配;GPT-5 系仍停在 400K 总窗口(但靠 /compact 等机制可扩展「有效」长度)。
参数从 0.6B 到 1.6T 跨越 3 个数量级,线性条会完全看不清小模型,故用对数刻度(满格 = 1T)。每个刻度差 10 倍。
「上下文窗口」是输入 + 输出的总和预算。很多模型窗口很大,但单次输出被单独卡住——你塞得进 1M,模型却一次只吐 64K~256K。下面用 GPT-5(400K 窗口)示意拆分:
1M 窗口模型,输出常限 64K(Gemini)/ 128K(GLM-5)/ 256K(Doubao-Evolving)。长文生成要靠「流式续写」或分块。
推理模型(o 系 / GPT-5 Thinking / DeepSeek 思考模式)的「思考过程」算进输出额度,真答案反而更短。
把整本书/代码库当上下文喂进去没问题(只要 ≤ 窗口),难点在「模型能否在这么长里不迷路」。
约定:1 个 A4 页 ≈ 400~500 token ≈ 300~400 汉字;中文 1 token ≈ 1~1.5 个汉字(不同分词器有差)。下面这张「尺子」把各档窗口对应到现实体量。
横轴线性表示 token 数;柱高表示「能装下多少页」。32K 到 1M 差 32 倍,视觉上一目了然。
| 上下文窗口 | 约多少汉字 | 约多少 A4 页 | 现实等价物 |
|---|---|---|---|
| 32K | 2~5 万 | ~80 页 | 一篇公众号长文 / 一份周报 |
| 128K | 8~18 万 | ~300 页 | 一本中篇书 / 一篇硕士论文 / 100 页 PDF |
| 200K | 12~28 万 | ~500 页 | 一部长篇小说单册(如《三体》) |
| 256K | 16~35 万 | ~640 页 | 两本专著 / 一个中小型代码库 |
| 400K | 25~55 万 | ~1000 页 | 一整套教材 / 百页技术文档全集 |
| 1M | 60~80 万 | ~2500 页 | 一部长篇全集 / 5 万行代码库 / 整季剧集字幕 |
32K~128K 足够。优先看激活参数与性价比,小模型(Qwen3-8B/32B、Doubao-lite)本地即可跑。
128K~256K 起步。要整本文档进窗口就选 256K+(Qwen3-Max、Doubao-Seed-2.1)。
直接上 1M 档:Claude 4.6+、Gemini 3、GLM-5.2/5.3、DeepSeek-V4、Doubao-Seed-Evolving。配 compact 可跑数天任务。
看最大输出而非窗口:GLM-5(128K 输出)、Doubao-Evolving(256K 输出)更擅长一次写长;否则用流式续写。