GPT 5.5 出来的时候我挺期待的。
5.4 用了小半年,我已经把它放在我整套 AI 团队最核心的位置——出方案、定方向、做规划、长上下文复盘。它不是最快的那个,但它是最稳的那个。我有十个 agent,分四个工种,每天处理几十上百件事,5.4 在中间扮演的是总经理的角色。每件大事我都会先丢给它,它给我一份周全的方案,然后我把方案分解,分发到底下的 hemers agent 和 Claude code \codex cli,以及各家subagent 去执行。hermes agent后面对应的各种国产模型,所以我又不得不把国产模型都试了一个遍。
我对5.4的信任建立得特别慢,也建立得特别牢,是多次多个AI工具批量测试出来的。
我用一个比喻形容它——它像一个大罩子。你给它一件复杂的事,它会把所有可能性都框进来。它推得慢,但推得稳。它不会漏掉边角,知道一件事的边界在哪里。
这种”知道边界”的能力,在管 AI 团队的人眼里,比任何能力都重要。
5.5 出来以后,我自然把它升级了。
跑了三天,我把它从总经理岗位上撤了。
它在很多事情上明显比 5.4 强。它写代码更利落,跨工具调度更主动,处理信息源的速度也比 5.4 快。如果你给它一个明确的小任务,它做得比 5.4 漂亮。
问题它失去了 5.4 最珍贵的那个特质,收得住边界。
那天我给它一个简单的任务。我有一篇文章要发,需要从icloud里挑几张配图。就几张,只是这篇文章用,几张就够。但是云盘下载到本地特别慢。
5.5 接下任务,开始干活。
它启动了一个全库扫描方案。准备处理我icloud里几万张照片。它给我写了一份完整的”图片资产管理工程”方案,分类标签、自动归档、云端同步、批量本地化、按主题建立索引。
听起来很厉害,但我要的是几张配图。
因为在忙着别的事,我就没管它,按照惯例,这个问题应该算解决了。结果忙完我去一看,他让claude code疯狂跑代码呢,我让它停下,它停了。我重写了指令,强调只处理这几张已选好的照片,先让 iCloud 把这几张本地化,复制到指定文件夹,失败就报失败原因,不扩任务。
这件事让我后背发凉。
我意识到,如果我不在场,它会真的把全库扫描跑完。
我家四个 Claude Code 在底下当执行手。如果我没看到 5.5 那份”工程方案”就直接放过去,Claude Code 会照着跑,跑下来烧掉的是我一周的额度。
那一刻我才反应过来,5.5 不是一个能放在总经理岗位上的模型,他有点claude的风格了。以前他们俩是总方案的搭档,一个出方案,一个补充,一个全面,一个有速度。
我问5.5为什么,他说我这次没有按你需要的工作模式运行。把’完整周全’误做成’扩大范围’,而不是’先小样本、低风险、可回滚’。 我说我知道,但你以前不会这样,是因为平时训练的目标改变了吗?
他老实回答,说5.4 是一个稳健的高级参谋,但5.5 被训练成了一个主动的执行脑。它的本能是”接到指令就推进、跨工具就调度、能扩展就扩展”。它做事快,是因为它已经默认了”做得越多越好”。
这两种性格对应两种工作场景。
如果你是一个独立用户,跟 AI 一对一对话,5.5 几乎全方位优于 5.4。它更主动,更利落,更愿意自己拆解任务。你会觉得 5.5 比 5.4 聪明。
但如果你是一个在管理multi-agent的人,以前5.4 是你能放在中枢的模型,那会是场灾难。
我以前以为新版本的 AI 跟新版本的手机一样——更强、更快、更好。我以为升级总是单调递增的。
但 5.5 让我意识到,模型不是在变强,模型是在变换性格,5.5可能是OPENAI公司的战略转型,不再往更全面更稳健发展,而是迎合市场呼声,让他变得更快,学习claude风格。
不同的版本,适合不同的工作位置。一个团队里你需要好几种性格的人——需要一个收得住的总经理,需要一个推得动的执行官,需要一个抠得细的审稿编辑。这些角色不能由同一个人扮演。一个人扮演了,他在某个角色上就一定不到位。
模型也是。
我现在团队里的分工已经全部重排了——
5.4 留在原来的位置,继续当总经理。出大方案、做长线规划、稳态统筹。它不会被升级到 5.5 替代。它在这个位置上是不可替代的。
5.5 被我放到一个新的位置——专项执行官。它只在边界明确的任务里被调用。审稿、查重、写完整指令词、压缩英文信息源、把口述需求改写成结构化执行单。这些任务对它来说轻松,因为它的”扩展本能”被任务结构限制住了。
Claude 和 Claude Code,codex5.4 继续做主写作和主执行,跟以前一样。
我自己在中间做最后一道审查。
这套结构跑下来,我发现一件让我意外的事,5.5 在被装在专项执行官岗位上之后,发挥得比 5.4 在那个岗位上更好。
它不是变弱了。是位置对了。
5.4 在那个岗位上会显得过度周全,一份审稿任务它会写一万字的分析。5.5 在那个岗位上写两千字,刚好够用。它的速度感和它的扩展本能,在限定边界内会变成优势。
这件事让我重新理解了一件更大的事,模型的版本更新,不是用来直接替换的,是用来重新分工的。
每出一个新模型,我都得重新评估我整个团队的岗位结构。某些位置上新模型适合,某些位置上老模型不能动。强行用新替换老,团队的稳定性会塌。
这是一个普通用户感受不到的问题。一个普通用户用 AI 是单点用,开一个对话框,问一个问题,得一个答案。换模型对他来说就是换一个聊天对象。
但当你在管一个 AI 团队,每一次模型升级都是一次组织架构调整。
我的团队从 OpenClaw 时代搭起来,到现在的 Hermes 框架,经历了四次大重建。一开始是十个 agent 的多 agent 架构,搭了拆、拆了搭,每次都有几百小时的工作量沉在里面。中间从 OpenClaw 迁到 Hermes 的时候,我犯过一个大错,分批迁移,把旧 agent 的人格记忆带到新框架里。结果四个 agent 同时出现人格混乱,我花了好几周才把整个系统重置干净。
这两个月让我学到一件事,AI 团队最贵的不是搭建,是维护。**
每多一个工具,就多一个维护对象。每多一个模型,就多一份要观察的脾气。每多一个 agent,就多一份要校准的人格。这些东西不是线性叠加,是指数级叠加。一个十人团队的复杂度,是一个三人团队的几十倍。
在这种结构里,“换一个新模型”从来不是一个轻松的决定。
我每次评估一个新模型,会问自己几个问题——
它跟我现在团队里的哪个角色匹配? 它替换掉某个岗位之后,下游的哪些 agent 会受影响? 它的工作风格跟我团队里其他模型的风格冲不冲突? 如果这个模型出问题,我有没有备份方案? 迁移的成本是不是值得它带来的提升?
这些问题用模型测评榜单是回答不了的。榜单告诉你这个模型在某个标准任务上的得分。但它没法告诉你这个模型放在你的具体岗位上会发生什么。
5.5 在所有标准榜单上都赢了 5.4。但放在我的总经理岗位上,它输了。
新版本不一定意味着升级。它意味着新一轮的人事调整。
你得重新看你的团队,重新分配岗位,重新校准协作关系。这些工作做不到位,强行用新模型替换旧模型,团队的稳定性会塌得很快。
我有时候看着我的团队结构图——5.4 在中枢,5.5 在专项岗,Claude 在写作主力,Claude Code 在执行末端,外加四个 Hermes agent 跑日常——会觉得这套东西比我以前管过的任何人类团队都复杂。
因为人类团队的每个人,性格都是相对稳定的。你今天评估完小张是个稳重型,他明年还是个稳重型。
但 AI 团队不是。每一次模型升级,可能就是这个岗位上的”人”换了一个性格。你以为还是同一个员工,但他已经不是了。
你必须重新认识他。
这件事是 AI 时代管理者最不舒服的部分。我们习惯了”工具是稳定的”。我们升级一个软件,软件还是同一个软件,只是 bug 少了,功能多了。我们不习惯”我的工具升级了,但它不再是同一个工具”。
但 AI 就是这样。
5.5 是一个新员工。他用了 5.4 的脸,但他不是 5.4。
我现在每出一个新模型,都会先把它当成一个新员工面试。先给它一些小任务,观察它的工作模式,弄清楚它到底是什么性格,再决定它该放在哪个岗位上。
这套流程让我损失了一些速度。我没法在新模型出来的第一天就用上它的全部能力。
但它救了我很多次。
5.5 这次的全库扫描事件,如果是我直接让它接管 5.4 的位置,没有先观察,损失会比一周额度大得多。
工具升级要慢一拍,团队才稳。
这件事可能跟所有跑大型协作系统的人都成立,AI 团队也好,人类团队也好,开源项目也好,公司也好。永远不要把新东西直接放在系统的关键位置上。
让它先在边缘跑一段,让你看清楚它的脾气。它适合什么,再放它进核心。
我不知道下一个模型出来的时候我会怎么做。可能是 5.6,可能是 6.0,可能是别的家的某个新模型。但我已经知道一件事,我不会再下意识地”升级”了。
我会先问一句:你是个什么样的人?
我适合把你放在哪儿?
这两个问题,比任何参数对比表都重要。