AI 效率成长 · 2026/04/30

AI-018|GPT 5.5 出来三天,我已经把它从总经理岗位上撤了

GPT 5.5 出来的时候我挺期待的。

AI

GPT 5.5 出来的时候我挺期待的。

5.4 用了小半年,我已经把它放在我整套 AI 团队最核心的位置——出方案、定方向、做规划、长上下文复盘。它不是最快的那个,但它是最稳的那个。我有十个 agent,分四个工种,每天处理几十上百件事,5.4 在中间扮演的是总经理的角色。每件大事我都会先丢给它,它给我一份周全的方案,然后我把方案分解,分发到底下的 hemers agent 和 Claude code \codex cli,以及各家subagent 去执行。hermes agent后面对应的各种国产模型,所以我又不得不把国产模型都试了一个遍。

我对5.4的信任建立得特别慢,也建立得特别牢,是多次多个AI工具批量测试出来的。

我用一个比喻形容它——它像一个大罩子。你给它一件复杂的事,它会把所有可能性都框进来。它推得慢,但推得稳。它不会漏掉边角,知道一件事的边界在哪里。

这种”知道边界”的能力,在管 AI 团队的人眼里,比任何能力都重要。

5.5 出来以后,我自然把它升级了。

跑了三天,我把它从总经理岗位上撤了。

它在很多事情上明显比 5.4 强。它写代码更利落,跨工具调度更主动,处理信息源的速度也比 5.4 快。如果你给它一个明确的小任务,它做得比 5.4 漂亮。

问题它失去了 5.4 最珍贵的那个特质,收得住边界。

那天我给它一个简单的任务。我有一篇文章要发,需要从icloud里挑几张配图。就几张,只是这篇文章用,几张就够。但是云盘下载到本地特别慢。

5.5 接下任务,开始干活。

它启动了一个全库扫描方案。准备处理我icloud里几万张照片。它给我写了一份完整的”图片资产管理工程”方案,分类标签、自动归档、云端同步、批量本地化、按主题建立索引。

听起来很厉害,但我要的是几张配图。

因为在忙着别的事,我就没管它,按照惯例,这个问题应该算解决了。结果忙完我去一看,他让claude code疯狂跑代码呢,我让它停下,它停了。我重写了指令,强调只处理这几张已选好的照片,先让 iCloud 把这几张本地化,复制到指定文件夹,失败就报失败原因,不扩任务。

这件事让我后背发凉。

我意识到,如果我不在场,它会真的把全库扫描跑完。

我家四个 Claude Code 在底下当执行手。如果我没看到 5.5 那份”工程方案”就直接放过去,Claude Code 会照着跑,跑下来烧掉的是我一周的额度。

那一刻我才反应过来,5.5 不是一个能放在总经理岗位上的模型,他有点claude的风格了。以前他们俩是总方案的搭档,一个出方案,一个补充,一个全面,一个有速度。

我问5.5为什么,他说我这次没有按你需要的工作模式运行。把’完整周全’误做成’扩大范围’,而不是’先小样本、低风险、可回滚’。 我说我知道,但你以前不会这样,是因为平时训练的目标改变了吗?

他老实回答,说5.4 是一个稳健的高级参谋,但5.5 被训练成了一个主动的执行脑。它的本能是”接到指令就推进、跨工具就调度、能扩展就扩展”。它做事快,是因为它已经默认了”做得越多越好”。

这两种性格对应两种工作场景。

如果你是一个独立用户,跟 AI 一对一对话,5.5 几乎全方位优于 5.4。它更主动,更利落,更愿意自己拆解任务。你会觉得 5.5 比 5.4 聪明。

但如果你是一个在管理multi-agent的人,以前5.4 是你能放在中枢的模型,那会是场灾难。

我以前以为新版本的 AI 跟新版本的手机一样——更强、更快、更好。我以为升级总是单调递增的。

但 5.5 让我意识到,模型不是在变强,模型是在变换性格,5.5可能是OPENAI公司的战略转型,不再往更全面更稳健发展,而是迎合市场呼声,让他变得更快,学习claude风格。

不同的版本,适合不同的工作位置。一个团队里你需要好几种性格的人——需要一个收得住的总经理,需要一个推得动的执行官,需要一个抠得细的审稿编辑。这些角色不能由同一个人扮演。一个人扮演了,他在某个角色上就一定不到位。

模型也是。

我现在团队里的分工已经全部重排了——

5.4 留在原来的位置,继续当总经理。出大方案、做长线规划、稳态统筹。它不会被升级到 5.5 替代。它在这个位置上是不可替代的。

5.5 被我放到一个新的位置——专项执行官。它只在边界明确的任务里被调用。审稿、查重、写完整指令词、压缩英文信息源、把口述需求改写成结构化执行单。这些任务对它来说轻松,因为它的”扩展本能”被任务结构限制住了。

Claude 和 Claude Code,codex5.4 继续做主写作和主执行,跟以前一样。

我自己在中间做最后一道审查。

这套结构跑下来,我发现一件让我意外的事,5.5 在被装在专项执行官岗位上之后,发挥得比 5.4 在那个岗位上更好。

它不是变弱了。是位置对了。

5.4 在那个岗位上会显得过度周全,一份审稿任务它会写一万字的分析。5.5 在那个岗位上写两千字,刚好够用。它的速度感和它的扩展本能,在限定边界内会变成优势。

这件事让我重新理解了一件更大的事,模型的版本更新,不是用来直接替换的,是用来重新分工的。

每出一个新模型,我都得重新评估我整个团队的岗位结构。某些位置上新模型适合,某些位置上老模型不能动。强行用新替换老,团队的稳定性会塌。

这是一个普通用户感受不到的问题。一个普通用户用 AI 是单点用,开一个对话框,问一个问题,得一个答案。换模型对他来说就是换一个聊天对象。

但当你在管一个 AI 团队,每一次模型升级都是一次组织架构调整。

我的团队从 OpenClaw 时代搭起来,到现在的 Hermes 框架,经历了四次大重建。一开始是十个 agent 的多 agent 架构,搭了拆、拆了搭,每次都有几百小时的工作量沉在里面。中间从 OpenClaw 迁到 Hermes 的时候,我犯过一个大错,分批迁移,把旧 agent 的人格记忆带到新框架里。结果四个 agent 同时出现人格混乱,我花了好几周才把整个系统重置干净。

这两个月让我学到一件事,AI 团队最贵的不是搭建,是维护。**

每多一个工具,就多一个维护对象。每多一个模型,就多一份要观察的脾气。每多一个 agent,就多一份要校准的人格。这些东西不是线性叠加,是指数级叠加。一个十人团队的复杂度,是一个三人团队的几十倍。

在这种结构里,“换一个新模型”从来不是一个轻松的决定。

我每次评估一个新模型,会问自己几个问题——

它跟我现在团队里的哪个角色匹配? 它替换掉某个岗位之后,下游的哪些 agent 会受影响? 它的工作风格跟我团队里其他模型的风格冲不冲突? 如果这个模型出问题,我有没有备份方案? 迁移的成本是不是值得它带来的提升?

这些问题用模型测评榜单是回答不了的。榜单告诉你这个模型在某个标准任务上的得分。但它没法告诉你这个模型放在你的具体岗位上会发生什么。

5.5 在所有标准榜单上都赢了 5.4。但放在我的总经理岗位上,它输了。

新版本不一定意味着升级。它意味着新一轮的人事调整。

你得重新看你的团队,重新分配岗位,重新校准协作关系。这些工作做不到位,强行用新模型替换旧模型,团队的稳定性会塌得很快。

我有时候看着我的团队结构图——5.4 在中枢,5.5 在专项岗,Claude 在写作主力,Claude Code 在执行末端,外加四个 Hermes agent 跑日常——会觉得这套东西比我以前管过的任何人类团队都复杂。

因为人类团队的每个人,性格都是相对稳定的。你今天评估完小张是个稳重型,他明年还是个稳重型。

但 AI 团队不是。每一次模型升级,可能就是这个岗位上的”人”换了一个性格。你以为还是同一个员工,但他已经不是了。

你必须重新认识他。

这件事是 AI 时代管理者最不舒服的部分。我们习惯了”工具是稳定的”。我们升级一个软件,软件还是同一个软件,只是 bug 少了,功能多了。我们不习惯”我的工具升级了,但它不再是同一个工具”。

但 AI 就是这样。

5.5 是一个新员工。他用了 5.4 的脸,但他不是 5.4。

我现在每出一个新模型,都会先把它当成一个新员工面试。先给它一些小任务,观察它的工作模式,弄清楚它到底是什么性格,再决定它该放在哪个岗位上。

这套流程让我损失了一些速度。我没法在新模型出来的第一天就用上它的全部能力。

但它救了我很多次。

5.5 这次的全库扫描事件,如果是我直接让它接管 5.4 的位置,没有先观察,损失会比一周额度大得多。

工具升级要慢一拍,团队才稳。

这件事可能跟所有跑大型协作系统的人都成立,AI 团队也好,人类团队也好,开源项目也好,公司也好。永远不要把新东西直接放在系统的关键位置上。

让它先在边缘跑一段,让你看清楚它的脾气。它适合什么,再放它进核心。

我不知道下一个模型出来的时候我会怎么做。可能是 5.6,可能是 6.0,可能是别的家的某个新模型。但我已经知道一件事,我不会再下意识地”升级”了。

我会先问一句:你是个什么样的人?

我适合把你放在哪儿?

这两个问题,比任何参数对比表都重要。


Private Domain

把下一篇文章发到你的邮箱

订阅后只发送确认过的内容更新、资料包和系统复盘,不做垃圾邮件。