AI 效率成长 · 2026/04/21

AI-002|小红书 先说结论 AI 越强,你越要保留自己做 research 的能力。

先说结论:AI 越强,你越要保留自己做 research 的能力。

AI

先说结论:AI 越强,你越要保留自己做 research 的能力。

这不是一句漂亮话,是我这周差点装错模型、折腾一圈之后,真切学到的教训。

用了 Hermes 之后,越发发现底层模型的重要性,想本地部署一个模型跑它,问 GLM5.1 推荐。

它秒回一套完整方案:

Harmonic-Hermes-9B,基于 Qwen,中文最强,名字还带 Hermes,最适合你的 Hermes 系统!

配套还给了 Ollama 安装、Chatbox 配置、零成本部署教程。

我差点就照做了。

第一个 AI:GLM5.1 —— 方向对,判断太激进

随手把 GLM 的方案扔给我 Hermes 里当前用的 codex,让它看一眼。

codex 直接打了 6.5 分,指出两个问题:

一,GLM 把”更聪明""更适合 Hermes""显存分界”都说得太绝对。

二,9B 本地小模型在长上下文稳定性、工具调用、任务跟进、整体可靠性上,跟 Claude/GPT 不是一档。

codex 给了个更务实的判断:如果你要本地便宜中文顺手,Harmonic-Hermes-9B 可以试;但要当 Hermes Agent 的主力,它不够,最多当执行层或离线备用。

这个分层判断,后面证明是整个讨论里最靠谱的一句话。

第二个 AI:Hermes 里的 codex —— 分层对,例子错

codex 解释为什么 9B 不适合当主力时,判断依据跑偏了:

“Hermes 模型”是训练风格/人设取向,偏聊天、助理感;“Hermes 框架”要的是长期稳定、多轮任务、工具调用。名字叫 Hermes,不代表最适合跑 Hermes。

听着很机灵。但我后来去 HuggingFace 查了——Harmonic-Hermes-9B 恰恰就是专门为 Hermes Agent 训练的 agentic 微调模型,作者是多伦多大学一个 PhD 学生,训练数据是 3,679 条 Hermes agent traces,重点就是工具调用和多轮 agent 工作流。

codex 把它归到”聊天人设模型”这一类是错的。它的训练数据里可能没见过这个新模型,就按旧类别套了。

但 codex 的分层思路没错。 Harmonic-Hermes-9B 确实有硬伤——9B 参数、上下文窗口只有 8K。Hermes Agent 跑长任务,8K 一两轮就满了。所以 codex “不能当主力”的结论方向对,只是例子举偏了。

第三个 AI:Claude —— 最离谱,凭印象瞎判断

我后来把整件事和 Claude 讨论。第一次他居然说 “Harmonic-Hermes-9B 这个模型,GLM 大概率是编的。”

这是最严重的错误。claude一边指控 GLM 幻觉,一边自己在幻觉。这个模型真实存在,Apache 2.0 开源,HuggingFace 上挂着。

被骂了一顿之后,Claude 才老实去联网搜,才发现:

  1. Harmonic-Hermes-9B 真实存在,而且真的是为 Hermes Agent 训练的

  2. 但 8K 上下文是硬伤,确实当不了主力

  3. Nous Research 官方其实有更合适的方案,只是没人推荐

三个 AI 都没给我最优解之后,我去 Nous Research 官网翻了翻,看到了 Hermes-4 家族。

里面有三个尺寸:14B、70B、405B。还有一个更新的 Hermes-4.3-36B,512K 超长上下文。

我一开始看中 36B——512K 上下文、能力接近 70B、官方为本地部署设计,看起来完美。

然后我让 Claude 对照我的硬件查一遍,发现我根本跑不动

现实检查:硬件是最后一道筛子

我的机器:

  • CPU:Intel i5-14400F

  • 内存:16GB(当前可用仅 1.7GB)

  • 显卡:RTX 4060 Ti 8GB(可用约 6.4GB)

Hermes-4.3-36B Q4 量化要 20GB 显存——跑不动。

Hermes-4-14B Q4 量化要 8-9GB——显存也紧张,内存更是硬墙。

Harmonic-Hermes-9B 虽然能塞进去,但 8K 上下文撑不起 Hermes Agent 的长任务。

最终落点:

  • Hermes-4-14B 是最适合的模型(Nous 官方出品、工具调用/JSON 结构化输出齐全、混合推理模式、消费级硬件可跑)

  • 但我得先加一根 16GB 内存条升到 32GB,才能让它跑得动

  • 主力继续用云端 codex,本地 14B 做短任务和离线备用

  • 想跑 36B 要再换 16GB 显存的显卡;想跑 70B 得 RTX 4090 级别

所以先花几百块加内存,跑起来验证流程,再决定要不要升级显卡。不用一步到位,先把路打通。

复盘:三个 AI 都错在哪

| GLM5.1 | 选对了模型方向 | 太绝对化,没提 9B+8K 上限,也没搜到 Hermes-4 家族 |

| Hermes 里的 codex | 分层思路对,点出 9B 天花板 | 举错例子,把 Harmonic-Hermes-9B 归错类别 |

| Claude Opus4.7| 帮我对硬件、定方案、做 research | 没查就敢下判断,第一次说”这个模型是编的”——纯幻觉 |

所以最后真正的答案不是任何一个 AI 给的,是我在三方碰撞里、自己去官网 research 出来的。

真正的方法论

很多博主讲”让 AI 互审”,结论是”AI 更靠谱了”。

我这次经历的结论相反

让 AI 互审不是让 AI 们投票选出真相,是逼你自己去做最后一轮 research。

三个 AI 都有盲区:

  • GLM 的盲区:训练时没见过的新模型不会推

  • codex 的盲区:新模型按旧类别套,会归错

  • Claude 的盲区:不查就敢下判断,会自己编

你的判断力,才是最后一道防线。

AI 越多、越强,越要警惕自己把决策外包出去。三个自信的 AI 叠在一起,不会自动产生正确答案——只会让你更容易以为自己已经够谨慎了。

如果你也要本地部署 Hermes Agent,建议

主力用云端(Claude / GPT / codex 任选一个)

-本地装 Hermes-4-14B(Q4_K_M 量化,Ollama 或 LM Studio 直接拉)

-内存至少 32GB,显存至少 8GB

  • 官方模型页:huggingface.co/NousResearch/Hermes-4-14B

别信任何一个 AI 给的”完美方案”。自己去模型页看一眼硬件要求、看一眼上下文窗口、看一眼更新日期,比什么都强。

#AI工作流 #Hermes #AI避坑 #本地部署 #OpenClaw

Private Domain

把下一篇文章发到你的邮箱

订阅后只发送确认过的内容更新、资料包和系统复盘,不做垃圾邮件。