终端 agent 怎么选:九个工具,三个族,和一个决定性的问题

所有对比表长得都差不多,因为决定不在表里。写给必须做选择的人,不是写给收集选项的人。

更新于 2026-09-04

每一篇终端 agent 对比都从功能表开始,而每一张功能表看起来都差不多:它们都能读仓库、跨文件改代码、执行命令、根据输出继续动作。就能力而言,头部产品之间的差距比宣传口径小得多。

所以决定不在那张表里。真正做决定的是一个大多数对比从不问的问题:

工具和模型厂商,允许是同一个决定吗?

先回答这个,九个选项立刻塌缩成三族,问题就好办多了。

九个工具汇入一个闸门——工具与模型厂商允许是同一个决定吗。三条泳道从中分出:随订阅附带(Claude Code、Codex CLI),代价是完全绑定;不绑定模型(opencode、goose、Crush),代价是提示词没人调过、要花一个晚上配置;免费额度优先(Gemini CLI),额度是最先会变的东西。每条泳道最后落到谁该选它。
九个塌缩成三个的那一步,以及每一族各自的代价。打开可交互版本可以走完四条引导视图。

三个族

一、随你已经在付的订阅附带

Claude CodeCodex CLI 随订阅附带,而那份订阅你可能本来就有。智能体不是另一笔账,提示词由训练该模型的同一批人调过,配置成本接近于零。

你买的是模型。工具只是交付方式,并且不可迁移——离开这家厂商就意味着连工具一起换。

二、不绑定模型,自带 key

opencodegooseCrush 提供智能体循环,模型由你指定。开源协议、本地执行,没有哪个厂商能在你脚下改条款。

代价是真实存在但很少被说出来的:没有人替你选的那个模型调过提示词。 不同配置之间的质量差异比第一方工具大,而且你要花一些在别处不必花的配置时间。

三、免费额度优先

Gemini CLI 是个异类。它绑定个人账号的免费额度大到能做真实任务而不只是跑演示,因此是「搞清楚这个品类适不适合自己」成本最低的路径。

把它的定位就理解成这个。这种量级的免费额度历来是最先变的东西——它是评估通道和第二意见,不是团队标准化要用的那个。

顺便说说编辑器那一侧

CursorGitHub CopilotDevin Desktop(原 Windsurf) 出现在对比里是因为总有人问,但它们回答的是另一个问题。它们把智能放在你编辑代码或监督智能体工作的地方,终端 agent 把智能放在你执行东西的地方。

诚实的分界:如果工作是敲代码,编辑器类工具在延迟和上下文上赢;如果工作是做一处改动并验证它能跑,终端 agent 赢,因为它能跑测试并读输出。多数人最后是各用一个,而不是二选一。

真正的差异在哪

订阅附带 不绑定模型 免费额度优先
配置耗时 几分钟 一个晚上 几分钟
开箱质量 最高 取决于你接的模型
厂商绑定 完全绑定 完全绑定
成本模型 固定订阅 按量计费,预算自理 先免费,后计费
谁负责控成本 厂商
生态规模 opencode 最大 较小

五条真正影响决定的标准

一、你们有没有「不依赖单一厂商」的政策? 如果有,第二族是唯一选项,本文其余部分对你只是参考。如果没有,别为一份你永远不会行使的自由去付配置税。

二、账单出问题时谁负责? 订阅附带的工具在你和计价器之间放了一个厂商。自带 key 意味着团队里得有人负责模型选型和支出——这个人必须在采用之前就存在。

三、你每天要盯着它工作几小时? 这条听起来无关紧要,其实不是。连着几小时读一个排版糟糕的智能体会话,体验确实更差——这就是 Crush 的全部论据,而且它成立。

四、它能不能跑在工作真正发生的地方? 远程主机和 CI 会改变答案。只能在你笔记本上交互式运行的智能体,排除掉了一大类工作。

五、它出错时会怎样? 这里每一个都会偶尔在需要再看一眼的工作上报告成功。换工具改变不了这件事,改变它的是你的检查习惯和沙箱。

它们都解决不了的事

值得挑明,因为这个品类是靠「自主性」卖的:

  • 验证仍然是你的活,而且时间都花在那里。一个会跑测试的智能体闭合了一个环,不是所有环。
  • 成本随执行步数增长,而不是提问次数。 一次长时间自主运行的花费,和一次聊天不是一个量级。
  • 它们需要对你的文件和 shell 有实质权限。 这不是缺陷,正是它们有用的原因——但也意味着一次错误动作的影响面比补全类工具大。
  • 步骤固定可重复的任务,写成脚本更便宜。 如果你能把步骤写下来,那就写脚本。

推荐

如果你是 从这个开始
已经在付 Claude 或 ChatGPT 你已经在付的那个——Claude CodeCodex CLI
受「不依赖单一厂商」政策约束 opencode,不绑定模型这一族里生态最大的
零预算评估这个品类 Gemini CLI,摸清需求后再换
做的是环境搭建而不只是改代码 goose,放在沙箱里
整天在读智能体输出 Crush
主要是在编辑器里敲代码 编辑器类工具,不是终端 agent

选定一个、并且开始同时跑两三个之后,会冒出本页没有回答的第二个问题:它们跑在哪里,以及你怎么知道哪一个在等你。那是另一场对比——herdr 对比 tmux 与 Zellij

关于这篇怎么写成的

定价、开源协议和能力按上述日期的厂商文档与官方仓库核对。「谁该选什么」属于判断,形成于公开资料与各产品的设计取向;如果某个条目尚未经过长期实际使用验证,它的详情页里会写明。

在你真正投入之前,请到厂商自己的网站确认当前定价。这个品类的变化速度快过任何目录能追上的程度。

图由上文那三个族群的结构化规范编译而来,因此它不会多出正文没有用文字说过的主张。

本文涉及的工具