这里跟大家说一下大语言模型里面 Context Window 跟 Max tokens 究竟有什么差别。

我们上次测了小米的 MiMo 2.6 Pro,测试时说这个 128K 的 Max tokens 爆了,导致输出没法完成,Pi 那边报错 “response was truncated before completion”,即输出在完成之前被截断了。当时有粉丝留言说:你懂不懂啊,小米那个 Context Window 是 1M,不是 128K。

实际上,Context Window 是你多轮对话能容纳的总窗口,包含历史对话和系统提示词,是所有内容能丢进去的最大窗口。而 Max tokens,也叫 Max output tokens,是你单次输出包含思维链(thinking)和最终输出的总长度,不包含历史记录,是一次性的。

两者完全是两回事。在 thinking 思考阶段爆 Max tokens,在各种 Harness 里,包括 Claude Code、Codex、Deepseek Harness,你连压缩(compact)的机会都没有。

希望看了这个视频,大家能了解到大语言模型的一些基本概念,不要自己不懂还喜欢在评论区乱说。反正评论也是对我的支持吧。