只能每天摸索,如果可以烧Claude API,那啥也不说,可不是烧不起嘛。在各种国产廉价大模型里,deepseek,千问3.6Plus ,GLM-5,KIMI2.5,挨个试,hermes毕竟是要能执行和调用各种工具的大家伙。昨天冲了199元阿里云token plan,根据各模型的特点给不同任务的agent搭配好,今天一看还剩31%。烧API也差不多这样吧。还不如买个5倍的chatgpt plus,老老实实用GPT5.4,解决问题高效,省心,省钱。实际体感,我用openclaw的原班人马转到Hermes,用了这些国产大模型,只能说很失望,完全没有新生hermes-GPT5.4的飞跃感觉,想当初他给我的感觉,就是翻盖按键手机直接升级成苹果,丝滑的不行。结果这几个也就比minimax强一点,强不了多少。我以为是openclaw污染信息源,旧上下文污染他们的记忆,删删改改,整个做了一套新模板,试了之后还是不行,自主性各方面都不如GPT5.4当初给我的惊艳。于是变量就成了要彻底新制的hermes才行。
又搞了一套大动作。全部二手hermes封装起来。重置一批全新的hermes。只有模型和GPT5.4当初新生不同。没想到不是失望,是失望到家了。hermes如果不缩减启动步骤,就是会很费token,但是也不至于1天多烧了69%的月额度。关键过程中他们表现也很莽撞,每个人物都有很多基础错误,跌跌撞撞,GLM-5在所有模型表现中垫底,遇事往后躲,爱吹牛。虽然没有openclaw那么离谱,但是长程任务质量很不高,那就还不如minimax。龙虾写脚本的工作没有那么多,但是对于工具调用和综合运用,对于很多workflow的理解和变通,对上下文的快速理解反应,都会让用户感受差异特别大。只是过程公开透明稍微好一点,但是看到GLM-5连API是什么样都不知道我还是很吃惊。这得培训到猴年马月。
模型不对,一下子就被打回人间。还是别妄想用自己人力填补对抗原生的大模型训练。
制了十几只龙虾和hermes,加上一直用codex cli /claude code,很奇怪,龙虾/hermes-GPT5.4比codex cli 更好用,国产的则相反,所以到底哪个更适配,还是要看自己的场景和调试过程。#hermes[话题]# #LLM[话题]# #chatgpt[话题]# #GLM[话题]#