Claude Code、Codex 与 Hermes 深度对比:成品 Agent 与开源底座的两条路
量子道
量子道 · 扫码阅读
微信 · 浏览器扫码
在手机上获得更好的阅读体验
Claude Code、Codex 与 Hermes 深度对比:成品 Agent 与开源底座的两条路
当我们把 Claude Code、OpenAI Codex 和 Nous Research 的 Hermes 放在一张桌子上比较时,第一反应往往是”它们都能帮我写代码”。但这其实是个误会。前两者是别人替你造好的、开箱即用的智能编程产品;而 Hermes 是一块开源的模型底座——它本身不是工具,而是你用来造工具的原料。理解这个根本差异,比记住任何一项跑分都重要。
这篇文章不打算做一张”谁赢了”的排行榜。我想带你看清楚的是:在”AI 辅助编程”这个赛道上,存在着两条哲学上完全不同的路,而你站在哪条路上,决定了你该关心什么。
一、先把三者归位:它们根本不是同一类东西
很多对比文章一上来就堆参数,但如果连”被比较的对象属于什么物种”都没分清,后面的数字都是空中楼阁。我们先做一件最朴素的事——归类。
AI 辅助编程生态的两层结构
┌─────────────────────────────────────────────┐
│ 应用层(成品 Agent):你直接使用的工具 │
│ │
│ • Claude Code —— Anthropic 的终端编程 Agent │
│ • OpenAI Codex —— OpenAI 的 CLI / 云端 Agent │
└─────────────────────────────────────────────┘
▲
│ 调用 / 依赖
│
┌─────────────────────────────────────────────┐
│ 模型层(底座):驱动一切的"发动机" │
│ │
│ • Claude 系列模型(闭源,仅 API 可用) │
│ • GPT 系列模型(闭源,仅 API 可用) │
│ • Hermes 系列模型(开源,可下载、可自部署) │
└─────────────────────────────────────────────┘
看清这张图,你就明白了:
- Claude Code 和 Codex 活在应用层。它们是面向终端用户的完整产品,背后绑定的是各自闭源的旗舰模型。你买的是”服务”,不是”模型”。
- Hermes 活在模型层。它是 Nous Research 基于 Meta 的 Llama 等开源基座微调出来的一系列模型,本身只是一个会聊天、会推理、会调用工具的”大脑”。要让它变成一个能改你代码库的 Agent,还需要你自己(或借助开源框架)给它套上手脚。
关键洞察:把 Hermes 和 Claude Code 直接比”谁写代码更强”,就像把”一台发动机”和”一辆已经能上路的整车”比”谁跑得快”——发动机需要先被装进车里。真正的可比对象,是”基于 Hermes 自建的编程 Agent” vs “Claude Code / Codex 这两台整车”。
二、三者画像:定位、出身与面向人群
| 维度 | Claude Code | OpenAI Codex | Hermes 系列 |
|---|---|---|---|
| 出品方 | Anthropic | OpenAI | Nous Research |
| 物种 | 闭源成品 Agent | 闭源成品 Agent | 开源模型(权重可下载) |
| 底层模型 | Claude 旗舰系列(闭源) | GPT 旗舰系列(闭源) | 基于 Llama 等开源基座微调 |
| 核心形态 | 终端 CLI 为主 | CLI + 云端 Agent 双线 | 模型权重 / API |
| 开放程度 | 闭源,按用量/订阅付费 | 闭源,按用量/订阅付费 | 开源权重,可本地部署 |
| 面向人群 | 重度命令行开发者 | OpenAI 生态内的开发者 | 想自建 Agent、要数据私有化的团队与研究者 |
| 你买到的东西 | 一个能干活的助手 | 一个能干活的助手 | 一块能自由改造的大脑 |
2.1 Claude Code:把 Agent 装进你的终端
Claude Code 是 Anthropic 推出的、以命令行终端为主战场的编程 Agent。它的产品哲学非常鲜明:不抢占你的 IDE、不做花哨的图形界面,而是作为一个常驻终端的智能体,直接在你的真实项目目录里读文件、改代码、跑命令、提交 PR。
它最打动重度开发者的,是那种”贴着代码库工作”的临场感——你不需要把上下文复制粘贴到对话框,它就生活在你的工程里。Anthropic 自家的 Claude 模型在”长任务可靠性”和”代码理解”上的口碑,是 Claude Code 体验的根基。
2.2 OpenAI Codex:一个名字,两条产品线
“Codex”这个名字容易让人困惑,因为它在 OpenAI 的历史上指代过不同的东西。在 2025—2026 这一轮,Codex 已经重生为一套现代化的编程 Agent 产品,而且走的是”双形态”路线:
- 本地 CLI 形态:类似 Claude Code,在你的终端里干活,适合”我在我的机器上、我的代码里”的场景。
- 云端 Agent 形态:你把任务丢给它,它在云端的沙箱环境里异步地、并行地跑——你可以同时派好几个任务出去,自己去喝杯咖啡,回来收结果。
这条”云端异步”路线是 Codex 区别于纯 CLI 工具的关键体验。它把编程 Agent 从”陪你坐在电脑前的副驾”,往”你能批量委派的远程同事”方向推了一步。
2.3 Hermes:开源世界里”听话又能打”的那一个
Hermes 是 Nous Research 维护的开源模型系列(Hermes 3、Hermes 4 等),通常基于 Meta 的 Llama 系列等开源基座做指令微调与对齐。它在开源社区的口碑集中在几个词上:
- 强可控(steerability):相比一些被”安全对齐”管得很死的模型,Hermes 以”更听话、更少拒绝、更尊重系统提示”著称,这对需要精细控制 Agent 行为的开发者很有吸引力。
- 结构化输出与工具调用:支持函数调用 / 工具调用范式,这是它能被装进”编程 Agent”的前提。
- 可推理:较新的版本强化了显式推理能力,缩小了与闭源旗舰在复杂任务上的差距。
- 真·开源可自托管:权重公开,你可以下载到自己的服务器,用 vLLM 等推理框架跑起来,数据完全不出门。
一句话定位:Claude Code 和 Codex 卖给你”省心”,Hermes 给你”自由”。前者你交钱、交数据、换效率;后者你交时间、交运维、换掌控权。
三、交互形态与上手门槛:从”装好就能用”到”先搭一套环境”
这是「产品定位与体验」差异最直观的地方。我们用一个新人”从零到第一次让 AI 改动我的代码”需要跨过的台阶来衡量。
上手路径对比(台阶越多,门槛越高)
Claude Code
装 CLI → 登录/配密钥 → 进项目目录 → 开聊 ✅(分钟级)
OpenAI Codex(CLI 形态)
装 CLI → 登录/配密钥 → 进项目目录 → 开聊 ✅(分钟级)
OpenAI Codex(云端形态)
网页/控制台 → 连代码仓库 → 派任务 → 收 PR ✅(分钟级)
基于 Hermes 自建 Agent
选模型尺寸 → 备好 GPU/租云 → 部署 vLLM 等推理服务
→ 接 Agent 框架(OpenHands / SWE-agent / Aider 等)
→ 配工具调用与沙箱 → 调提示词 → 终于能跑 ⚙️(小时到天级)
差距一目了然:
- Claude Code / Codex:本质是”消费级体验”。装好、登录、进目录,几分钟就能让 AI 帮你干活。心智负担极低,你只需要关心”我要它做什么”。
- Hermes:本质是”工程级搭建”。Hermes 本身只是模型,你得自己解决三件事——算力(够大的模型要够强的 GPU)、推理服务(用 vLLM 之类把模型跑成一个 OpenAI 兼容的接口)、Agent 外壳(找一个开源 Agent 框架来负责”读文件、跑命令、循环修正”这套动作)。
好消息是,开源生态已经把”Agent 外壳”这块做得相当成熟:Aider、OpenHands、SWE-agent 这类项目,大多支持接入任何”OpenAI 兼容接口”的模型。也就是说,你完全可以把自建的 Hermes 服务,喂给这些现成的编程 Agent 框架,从而拼装出一个属于自己的、数据不出门的”私有版 Claude Code”。
体验本质:买 Claude Code / Codex,你买的是”别人已经把发动机、底盘、方向盘都装好的整车”;用 Hermes,你买的是”一台好发动机,外加一份自己组装整车的自由和工作量”。
四、开放程度与数据主权:这才是真正的分水岭
如果说前面的对比还停留在”好不好用”,那这一节就是”敢不敢用”的问题——尤其对企业。
| 关注点 | 闭源成品(Claude Code / Codex) | 开源底座(Hermes 自建) |
|---|---|---|
| 代码是否出门 | 需上传到厂商服务器处理 | 可完全本地,代码不出内网 |
| 模型可否离线 | 否,依赖厂商 API 在线 | 是,断网也能跑 |
| 能否定制模型 | 否,只能用厂商给的 | 是,可微调成你领域的专家 |
| 长期成本结构 | 按用量/席位持续付费 | 前期投入硬件,边际成本低 |
| 被”卡脖子”风险 | 受厂商政策、价格、合规约束 | 权重在手,主动权在自己 |
| 合规与审计 | 取决于厂商承诺 | 全链路自控,易满足强监管 |
对绝大多数个人开发者和初创团队,闭源成品的便利性碾压一切——你的代码大概率没那么敏感,省下来的时间远比那点订阅费值钱。
但当场景切换到金融、政务、军工、医疗,或任何对”代码与数据绝不能离开内网”有硬约束的环境,天平就倒过来了。这时候 Hermes 这类开源模型几乎是唯一解:你可以把它部署在完全隔离的内网里,跑一个能力不俗、还能按你的代码规范微调的私有编程 Agent。这不是”省钱”问题,而是”能不能用”的问题。
关键洞察:开源与闭源之争,在编程 Agent 这里最终落到一个朴素的问题上——你的代码愿不愿意交给别人的服务器? 愿意,就享受成品的丝滑;不愿意,就接受自建的麻烦。没有标准答案,只有场景答案。
五、能力与跑分:该怎么理性地看待 SWE-bench
聊 AI 编程,绕不开 SWE-bench 这类基准——它用真实 GitHub 仓库里的 issue 来考模型”能不能真的修好一个 bug”。但我必须给你打几个预防针:
- 跑分主体不对等。SWE-bench 上常见的成绩,往往是”某个 Agent 框架 + 某个模型”的组合得分,而不是模型裸分。Claude Code、Codex 的强,既有模型的功劳,也有产品工程(上下文管理、工具编排、错误重试)的功劳——这部分恰恰是闭源产品花大力气打磨的护城河。
- 数字变化极快。这个领域几乎每隔几周就刷新榜单,任何写死的具体百分比都会迅速过期。
- 榜单 ≠ 你的体验。基准测的是标准化任务,而你的真实项目有它独特的脏活累活。榜单高一两个点,未必对应你日常体验的差异。
就大方向而言,可以稳妥地说:
- 闭源旗舰(Claude / GPT)驱动的成品 Agent,目前在”复杂、长链条、需要强推理”的编程任务上仍处在第一梯队,这是它们高定价的底气。
- 开源模型(含 Hermes)整体在快速追赶,在很多中等复杂度任务上已经”足够好用”;它们最大的价值不在于”分数超过闭源”,而在于”以可接受的能力,换来了完全的掌控权”。
建议:把 SWE-bench 当成”方向性参考”而非”购买依据”。真正靠谱的评估,是拿你自己仓库里几个有代表性的真实任务,让候选工具各跑一遍——你的代码库才是最诚实的裁判。
六、定价与可获取性:三种付费哲学
⚠️ 时效提醒:以下为”机制层面”的对比。AI 工具的具体价格、套餐、版本号变动极快,请务必以三家官网当下的页面为准,本文不锁定任何具体数字。
三种付费哲学
Claude Code ──► 订阅 / 按 token 用量计费
「为省心和顶级模型付费」
OpenAI Codex ──► 绑定 OpenAI 套餐 / 按用量计费
「为生态一体化和云端并行付费」
Hermes 自建 ──► 模型免费,成本在硬件与运维
「前期重投入,长期边际成本趋零」
- Claude Code:通常与 Anthropic 的订阅或 API 用量挂钩,定位偏”专业生产力工具”,为高质量模型与流畅体验付费。
- OpenAI Codex:与 OpenAI 的订阅体系/用量计费绑定,优势是和 OpenAI 其余能力打通,云端并行是其差异化卖点。
- Hermes:模型权重本身免费获取,但”免费”会转移到别处——你要为 GPU、电力、运维人力买单。当使用量大到一定规模,自建的边际成本优势才会显现;用量很小的时候,反而是闭源 API 更划算。
经济学直觉:闭源 API 像”打车”,上车即走、按里程付费、用得越多越贵;自建 Hermes 像”买车”,前期一笔大投入,之后每公里都便宜,但你得自己加油、保养、找车位。通勤距离决定了哪种更划算。
七、到底该怎么选:四个场景对号入座
抛开立场,回到”你是谁、你要干嘛”:
场景决策树
你的代码/数据能上厂商服务器吗?
│
├─ 能 ──► 你主要在终端 + 单机工作?
│ ├─ 是 ──► Claude Code(终端原生体验极佳)
│ └─ 否,想云端批量派任务 ──► OpenAI Codex(云端异步并行)
│
└─ 不能(强合规/内网隔离)──► 基于 Hermes 自建私有 Agent
(配 OpenHands / Aider / SWE-agent)
具体来说:
- 个人开发者 / 独立黑客:直接选 Claude Code 或 Codex,怎么省事怎么来。时间比订阅费贵得多。
- 重命令行的资深工程师:Claude Code 的”终端原生 + 贴着代码库”体验大概率最对胃口。
- 要批量委派、做云端自动化的团队:Codex 的云端异步 Agent 值得重点试。
- 金融/政务/医疗等强监管,或坚持数据主权的团队:认真投入 Hermes 自建路线,把可控性当成第一优先级。
八、结语:不是”谁更强”,而是”你站哪条路”
回到开头那个比喻。Claude Code 和 Codex 是两台精心调校、开箱即走的整车——它们替你做完了所有脏活,你只管踩油门。Hermes 是一台开源的好发动机——它什么都不替你决定,但把所有决定权还给了你。
便利 ◄──────────────────────────► 掌控
Claude Code / Codex 基于 Hermes 自建
(交出数据,换取省心) (扛起运维,换取自由)
这三者之争,表面是产品之争,里子是两种价值观之争:你是更愿意相信”专业的人把工具做到极致、我拿来即用”,还是更愿意相信”核心能力必须握在自己手里、麻烦点也认了”?
智能时代真正稀缺的从来不是工具本身,而是清楚知道自己要什么、并为之做出取舍的判断力。看懂了这三者代表的两条路,你就不会再问”哪个最好”——你会问”我现在站在哪条路上,这条路要我付出什么、又给我什么”。
而这,恰恰是这篇对比最想留给你的东西。
写作说明:本文聚焦三者在产品定位、交互形态、开放程度与适用场景上的结构性差异,这些判断是稳定且经得起推敲的。涉及具体价格、版本号、SWE-bench 分数等快速变动的信息,请以三家官方页面的实时数据为准——在 AI 工具这个赛道,“今天的数字明天就旧”是常态,但”成品 Agent vs 开源底座”这条主线,短期内不会变。