⚠️ 这篇就是写给平时拿 Claude 当聊天和写代码助手、看到大新闻就想知道自己会不会吃亏的人。你最容易误判的,不是没看懂参数,而是先按“它又变强了”去理解这类发布。我现在更认同一句硬话:2小时之后,对齐先写权限表,不先训人格。长程模型的安全边界,主要写在权限表里。[C002]
具体场景很简单:你刷到一条升级消息,本来只想确认以后让它改几段代码、查点资料、顺手跑几个工具会不会更省事。结果真正先撞上的,往往不是能力上限,而是“它能不能自己接着做”“做到哪一步要你点头”“出事能不能立刻停”。如果只看宣传,你会以为自己买到的是更强版本,实际却可能先撞到更严格的限制。
所以这类发布最值得看的,常常不是它多强,而是它为什么先把边界收紧。更隐性的代价,是你会一直围着表面热闹转,却看不到真正改变日常使用体验的那一步。最会引发讨论的,从来不是模型又强了,而是最强的那个为什么没直接端上来。
我原来以为,对齐就是把模型训得更听话,少乱来。后来才发现,那个想法只够应付几分钟对话。英文里有句原话叫 Safety and alignment in an era of long-horizon models,意思可以直白一点理解成:模型一旦能连续干很久,安全和对齐就不能只盯它说什么,还得盯它被允许做什么。[C001] 尤其当它能自己开浏览器、碰终端、接外部工具时,真正决定事故上限的,就是权限表、审批闸门和停机能力。
证据也很直接。2026-05-08,公开评测机构 METR 给 GPT-5 代理做测试,测出 50% 任务时长大约是 2 小时 17 分。[C003] 这句话的重点不是“又强了一点”,而是“长程”已经从分钟级跨到小时级。时间一拉长,风险就不只是答错一句话,而是它会连续点、连续搜、连续改。
接着 2026-05-19,METR 又写到,最强公开代理在软件任务上已经超过 2 个全职工作日,甚至能做掉人类要几周的任务。[C004] 到了 2026-06-18,DeepMind 直接把思路讲明白:传统对齐之外,还要加系统层安全,而且权限只能按“已验证行为”一点点放。[C005] 这其实就是在说:先别急着把最强能力全端出来,先把它能做什么、做到哪一步、谁来刹车写清楚。
所以以后再看这类大新闻,我会先问三件事:它能不能自己连续做下去;做到哪一步还要我点头;一旦跑偏能不能马上停。能回答这三件事,再谈“强不强”才不容易吃亏。要转发,也更适合转给那种平时拿 Claude、GPT 写代码,一看到升级就想先确认自己会不会被边界改到的人。
🤔 你现在选本地模型,会先看总榜,还是先看自己机器的 VRAM?