先说结论:AI 越强,你越要保留自己做 research 的能力。
这不是一句漂亮话,是我这周差点装错模型、折腾一圈之后,真切学到的教训。
用了 Hermes 之后,越发发现底层模型的重要性,想本地部署一个模型跑它,问 GLM5.1 推荐。
它秒回一套完整方案:
Harmonic-Hermes-9B,基于 Qwen,中文最强,名字还带 Hermes,最适合你的 Hermes 系统!
配套还给了 Ollama 安装、Chatbox 配置、零成本部署教程。
我差点就照做了。
第一个 AI:GLM5.1 —— 方向对,判断太激进
随手把 GLM 的方案扔给我 Hermes 里当前用的 codex,让它看一眼。
codex 直接打了 6.5 分,指出两个问题:
一,GLM 把”更聪明""更适合 Hermes""显存分界”都说得太绝对。
二,9B 本地小模型在长上下文稳定性、工具调用、任务跟进、整体可靠性上,跟 Claude/GPT 不是一档。
codex 给了个更务实的判断:如果你要本地便宜中文顺手,Harmonic-Hermes-9B 可以试;但要当 Hermes Agent 的主力,它不够,最多当执行层或离线备用。
这个分层判断,后面证明是整个讨论里最靠谱的一句话。
第二个 AI:Hermes 里的 codex —— 分层对,例子错
codex 解释为什么 9B 不适合当主力时,判断依据跑偏了:
“Hermes 模型”是训练风格/人设取向,偏聊天、助理感;“Hermes 框架”要的是长期稳定、多轮任务、工具调用。名字叫 Hermes,不代表最适合跑 Hermes。
听着很机灵。但我后来去 HuggingFace 查了——Harmonic-Hermes-9B 恰恰就是专门为 Hermes Agent 训练的 agentic 微调模型,作者是多伦多大学一个 PhD 学生,训练数据是 3,679 条 Hermes agent traces,重点就是工具调用和多轮 agent 工作流。
codex 把它归到”聊天人设模型”这一类是错的。它的训练数据里可能没见过这个新模型,就按旧类别套了。
但 codex 的分层思路没错。 Harmonic-Hermes-9B 确实有硬伤——9B 参数、上下文窗口只有 8K。Hermes Agent 跑长任务,8K 一两轮就满了。所以 codex “不能当主力”的结论方向对,只是例子举偏了。
第三个 AI:Claude —— 最离谱,凭印象瞎判断
我后来把整件事和 Claude 讨论。第一次他居然说 “Harmonic-Hermes-9B 这个模型,GLM 大概率是编的。”
这是最严重的错误。claude一边指控 GLM 幻觉,一边自己在幻觉。这个模型真实存在,Apache 2.0 开源,HuggingFace 上挂着。
被骂了一顿之后,Claude 才老实去联网搜,才发现:
-
Harmonic-Hermes-9B 真实存在,而且真的是为 Hermes Agent 训练的
-
但 8K 上下文是硬伤,确实当不了主力
-
Nous Research 官方其实有更合适的方案,只是没人推荐
三个 AI 都没给我最优解之后,我去 Nous Research 官网翻了翻,看到了 Hermes-4 家族。
里面有三个尺寸:14B、70B、405B。还有一个更新的 Hermes-4.3-36B,512K 超长上下文。
我一开始看中 36B——512K 上下文、能力接近 70B、官方为本地部署设计,看起来完美。
然后我让 Claude 对照我的硬件查一遍,发现我根本跑不动。
现实检查:硬件是最后一道筛子
我的机器:
-
CPU:Intel i5-14400F
-
内存:16GB(当前可用仅 1.7GB)
-
显卡:RTX 4060 Ti 8GB(可用约 6.4GB)
Hermes-4.3-36B Q4 量化要 20GB 显存——跑不动。
Hermes-4-14B Q4 量化要 8-9GB——显存也紧张,内存更是硬墙。
Harmonic-Hermes-9B 虽然能塞进去,但 8K 上下文撑不起 Hermes Agent 的长任务。
最终落点:
-
Hermes-4-14B 是最适合的模型(Nous 官方出品、工具调用/JSON 结构化输出齐全、混合推理模式、消费级硬件可跑)
-
但我得先加一根 16GB 内存条升到 32GB,才能让它跑得动
-
主力继续用云端 codex,本地 14B 做短任务和离线备用
-
想跑 36B 要再换 16GB 显存的显卡;想跑 70B 得 RTX 4090 级别
所以先花几百块加内存,跑起来验证流程,再决定要不要升级显卡。不用一步到位,先把路打通。
复盘:三个 AI 都错在哪
| GLM5.1 | 选对了模型方向 | 太绝对化,没提 9B+8K 上限,也没搜到 Hermes-4 家族 |
| Hermes 里的 codex | 分层思路对,点出 9B 天花板 | 举错例子,把 Harmonic-Hermes-9B 归错类别 |
| Claude Opus4.7| 帮我对硬件、定方案、做 research | 没查就敢下判断,第一次说”这个模型是编的”——纯幻觉 |
所以最后真正的答案不是任何一个 AI 给的,是我在三方碰撞里、自己去官网 research 出来的。
真正的方法论
很多博主讲”让 AI 互审”,结论是”AI 更靠谱了”。
我这次经历的结论相反
让 AI 互审不是让 AI 们投票选出真相,是逼你自己去做最后一轮 research。
三个 AI 都有盲区:
-
GLM 的盲区:训练时没见过的新模型不会推
-
codex 的盲区:新模型按旧类别套,会归错
-
Claude 的盲区:不查就敢下判断,会自己编
你的判断力,才是最后一道防线。
AI 越多、越强,越要警惕自己把决策外包出去。三个自信的 AI 叠在一起,不会自动产生正确答案——只会让你更容易以为自己已经够谨慎了。
如果你也要本地部署 Hermes Agent,建议
主力用云端(Claude / GPT / codex 任选一个)
-本地装 Hermes-4-14B(Q4_K_M 量化,Ollama 或 LM Studio 直接拉)
-内存至少 32GB,显存至少 8GB
- 官方模型页:huggingface.co/NousResearch/Hermes-4-14B
别信任何一个 AI 给的”完美方案”。自己去模型页看一眼硬件要求、看一眼上下文窗口、看一眼更新日期,比什么都强。
#AI工作流 #Hermes #AI避坑 #本地部署 #OpenClaw