终端 agent 怎么选:九个工具,三个族,和一个决定性的问题
所有对比表长得都差不多,因为决定不在表里。写给必须做选择的人,不是写给收集选项的人。
每一篇终端 agent 对比都从功能表开始,而每一张功能表看起来都差不多:它们都能读仓库、跨文件改代码、执行命令、根据输出继续动作。就能力而言,头部产品之间的差距比宣传口径小得多。
所以决定不在那张表里。真正做决定的是一个大多数对比从不问的问题:
工具和模型厂商,允许是同一个决定吗?
先回答这个,九个选项立刻塌缩成三族,问题就好办多了。
三个族
一、随你已经在付的订阅附带
Claude Code 和 Codex CLI 随订阅附带,而那份订阅你可能本来就有。智能体不是另一笔账,提示词由训练该模型的同一批人调过,配置成本接近于零。
你买的是模型。工具只是交付方式,并且不可迁移——离开这家厂商就意味着连工具一起换。
二、不绑定模型,自带 key
opencode、goose 和 Crush 提供智能体循环,模型由你指定。开源协议、本地执行,没有哪个厂商能在你脚下改条款。
代价是真实存在但很少被说出来的:没有人替你选的那个模型调过提示词。 不同配置之间的质量差异比第一方工具大,而且你要花一些在别处不必花的配置时间。
三、免费额度优先
Gemini CLI 是个异类。它绑定个人账号的免费额度大到能做真实任务而不只是跑演示,因此是「搞清楚这个品类适不适合自己」成本最低的路径。
把它的定位就理解成这个。这种量级的免费额度历来是最先变的东西——它是评估通道和第二意见,不是团队标准化要用的那个。
顺便说说编辑器那一侧
Cursor、GitHub Copilot 和 Devin Desktop(原 Windsurf) 出现在对比里是因为总有人问,但它们回答的是另一个问题。它们把智能放在你编辑代码或监督智能体工作的地方,终端 agent 把智能放在你执行东西的地方。
诚实的分界:如果工作是敲代码,编辑器类工具在延迟和上下文上赢;如果工作是做一处改动并验证它能跑,终端 agent 赢,因为它能跑测试并读输出。多数人最后是各用一个,而不是二选一。
真正的差异在哪
| 订阅附带 | 不绑定模型 | 免费额度优先 | |
|---|---|---|---|
| 配置耗时 | 几分钟 | 一个晚上 | 几分钟 |
| 开箱质量 | 最高 | 取决于你接的模型 | 高 |
| 厂商绑定 | 完全绑定 | 无 | 完全绑定 |
| 成本模型 | 固定订阅 | 按量计费,预算自理 | 先免费,后计费 |
| 谁负责控成本 | 厂商 | 你 | 你 |
| 生态规模 | 大 | opencode 最大 | 较小 |
五条真正影响决定的标准
一、你们有没有「不依赖单一厂商」的政策? 如果有,第二族是唯一选项,本文其余部分对你只是参考。如果没有,别为一份你永远不会行使的自由去付配置税。
二、账单出问题时谁负责? 订阅附带的工具在你和计价器之间放了一个厂商。自带 key 意味着团队里得有人负责模型选型和支出——这个人必须在采用之前就存在。
三、你每天要盯着它工作几小时? 这条听起来无关紧要,其实不是。连着几小时读一个排版糟糕的智能体会话,体验确实更差——这就是 Crush 的全部论据,而且它成立。
四、它能不能跑在工作真正发生的地方? 远程主机和 CI 会改变答案。只能在你笔记本上交互式运行的智能体,排除掉了一大类工作。
五、它出错时会怎样? 这里每一个都会偶尔在需要再看一眼的工作上报告成功。换工具改变不了这件事,改变它的是你的检查习惯和沙箱。
它们都解决不了的事
值得挑明,因为这个品类是靠「自主性」卖的:
- 验证仍然是你的活,而且时间都花在那里。一个会跑测试的智能体闭合了一个环,不是所有环。
- 成本随执行步数增长,而不是提问次数。 一次长时间自主运行的花费,和一次聊天不是一个量级。
- 它们需要对你的文件和 shell 有实质权限。 这不是缺陷,正是它们有用的原因——但也意味着一次错误动作的影响面比补全类工具大。
- 步骤固定可重复的任务,写成脚本更便宜。 如果你能把步骤写下来,那就写脚本。
推荐
| 如果你是 | 从这个开始 |
|---|---|
| 已经在付 Claude 或 ChatGPT | 你已经在付的那个——Claude Code 或 Codex CLI |
| 受「不依赖单一厂商」政策约束 | opencode,不绑定模型这一族里生态最大的 |
| 零预算评估这个品类 | Gemini CLI,摸清需求后再换 |
| 做的是环境搭建而不只是改代码 | goose,放在沙箱里 |
| 整天在读智能体输出 | Crush |
| 主要是在编辑器里敲代码 | 编辑器类工具,不是终端 agent |
选定一个、并且开始同时跑两三个之后,会冒出本页没有回答的第二个问题:它们跑在哪里,以及你怎么知道哪一个在等你。那是另一场对比——herdr 对比 tmux 与 Zellij。
关于这篇怎么写成的
定价、开源协议和能力按上述日期的厂商文档与官方仓库核对。「谁该选什么」属于判断,形成于公开资料与各产品的设计取向;如果某个条目尚未经过长期实际使用验证,它的详情页里会写明。
在你真正投入之前,请到厂商自己的网站确认当前定价。这个品类的变化速度快过任何目录能追上的程度。
图由上文那三个族群的结构化规范编译而来,因此它不会多出正文没有用文字说过的主张。
本文涉及的工具
- Claude Code运行在终端里的编程智能体,可直接执行命令和修改文件。
- Codex CLIOpenAI 的开源终端编程智能体,已用 Rust 重写。
- opencode开源终端编程智能体,你指向哪个模型它就用哪个。
- Gemini CLIGoogle 的开源终端智能体,免费额度是这一类里最实用的。
- goose开源智能体,能安装、执行、测试,而不只是给代码建议。
- Crush出自「把终端界面做好看」那支团队的终端编程智能体。
- Cursor围绕 AI 构建的编辑器,具备全代码库上下文,而非单文件补全。
- GitHub Copilot部署最广的编程助手,主流编辑器几乎都支持。
- Devin Desktop (Windsurf)Windsurf 更名后的产品,把完整 IDE 与编码智能体指挥中心放在一起。