372K 像高速上临时多开的一段车道,很多人以为 OpenAI 给 Codex 换了更大的脑子;272K 一收回,大家又喊它变笨。我的判断正相反:**272K 首先是计费线,不是智力线。**它更像收费站往前挪了 100 公里,不是司机突然少了半个脑回路。

2026年7月13日,Codex 团队公开解释这次回滚,理由不是“模型推理退化”,而是把产品里的 GPT-5.6 Sol 上下文从 272K 提到 372K 后,计费的使用量超出了预期,所以先退回 272K。话说得很客气,骨头却很硬:这次动作先碰到的不是智力天花板,而是预算地板。

这事再往前看一眼,就更露骨了。2026年4月2日起,Codex 已经改成按 token(模型计费时用的文本单位)收费,不再按“差不多一条消息值多少钱”那种含糊算法来估。官方模型页一边写 GPT-5.6 Sol 有 1.05M 的原始上下文能力,一边又把 272K 明写成加价门槛:超过 272K 输入,整次请求按更高倍率收费。你看,实验室告诉你“这车理论上能跑多远”,定价页告诉你“跑到哪儿开始加钱”,产品层再决定“订阅用户平时让你开到哪儿”。三句话摆在一起,戏法就拆完了。

长上下文在论文里叫能力,进了订阅制先叫成本。

周六凌晨一点,杭州拱墅区一套出租房里,一个独立开发者把需求文档、报错日志、数据库表、上周提交记录,全塞进同一条 Codex 线程。372K 的时候,他像把一整车杂货推进电梯;272K 的时候,电梯没坏,搬运工也没换,只是物业先把称重器搬到了门口。于是他最先感到的,不是答案突然变蠢,而是用量条掉得像漏水,压缩来得更早,来回搬运的次数更多。

你以为自己在买更长的记忆,其实平台先卖给你一段更长的计价跑道。

周一早上九点半,上海张江一间四人会议室里,一个平台主管盯着团队的消耗曲线发愣。同样一轮代码审查、自动修复、再跑测试,上周还能撑到下午,这周午饭前就见红。要是把这理解成“模型智商下滑”,就像把停车费涨价理解成发动机故障。真正变的,不一定是车的性能,而是收费规则更早渗进了驾驶体验。

AI 一旦从神龛搬到工位,第一位同事不是工程师,是财务。

周三晚上,广州天河一个前端接手老项目:导航条颜色对不上,支付页埋点缺字段,苹果浏览器里还偶发白屏。线程一长,系统比他更早紧张,先压缩上下文,再继续干活。于是他骂“AI 失忆了”。其实更准确的说法是:病历先被人装箱入库了,医生只剩一张摘要。你当然会觉得它没先前灵光,可这里先发生的并不是智力坍塌,而是记忆预算被管制。

模型窗口缩短,不一定先伤脑子,往往先护账本。

这就是最反常识的地方。大家总以为上下文大小是一条智力线,越长越聪明,越短越愚蠢。错。所谓上下文,说白了就是模型这一回合能带多少材料一起进屋;而对产品公司来说,这个数先是一根成本杠杆。它决定一次任务能吃进去多少材料,会不会更早触发压缩,会不会更快撞上额度,会不会把本来藏在后台的算力开销,像老鼠尾巴一样拖到前台来。

AI 产品最会演的一件事,就是把商业阈值打扮成技术天赋。

更有意思的是,Codex 团队早在今年 1 月就公开解释过 272K 这条线的产品逻辑:总窗口 400K,还要给最多 128K 输出留座位,所以输入端先卡在 272K,宁可保守,也不愿让会话溢出后直接终止。这个解释很工程,也很世故。工程上,它叫稳定性;商业上,它等于把最坏情况预先写进了成本模型。等到 372K 一上,发现“哎呀,用量怎么烧得比预想快”,立刻又退回 272K,这不正说明那条线本来就不只是智力边界,而是产品、计费、负载三者拧出来的一道闸门。

如果 272K 真是智力线,回滚的理由应该是答错更多、推理更浅、代码更烂。可公开说法偏偏不是这些,而是“用量超预期”。这句话像财务报表里掉出来的一枚钉子,正好钉穿了神话。

所以我真正想说的,不是 OpenAI 不该这么做。恰恰相反,一旦模型变成基础设施,它迟早要这么做。实验室可以炫耀 105 万上下文,产品部却必须盘算:多少人会把一整座仓库推进来,多少线程会被拖成长尾,多少“更长一点点”会在订阅世界里变成“贵很多”。问题不在于它做了权衡,问题在于它常把这种权衡包装成天赋,把定价伪装成能力,把运营阈值涂成模型性格。

当智力开始按套餐售卖,最该透明的就不是名字,而是闸机装在哪儿。

别再把 272K 当成测智商的尺子了。它更像一张地铁闸机卡,决定你这次能带多少行李进站,走几站开始加钱,什么时候被迫换乘。至于车厢里的司机有没有变笨,那是另一回事,得看推理质量、错误恢复、长任务一致性,不能拿收费站的位置去冒充脑容量的深浅。

我这判断,不是从情绪里抠出来的:2026年7月13日的公开说明见 Tibo 的 X 帖子,OpenAI 官方的 GPT-5.6 Sol 模型页 把 272K 写成加价门槛,Codex rate card 写明 2026年4月2日起按 token 计费,而 Codex 团队在 GitHub 的 #9429 讨论 也早说过 272K 是产品设计里的保守阈值。把这几块拼图拼起来,答案其实很直:272K 首先是计费线,不是智力线。


别人聊 AI,我们测 AI——每个结论都能下载原始数据自己复算。 🔗 官网 👉 https://crawdpad.com