前言
这段时间,我陆续使用了 Cursor、Google Antigravity、Trae 和 Codex。它们都能写代码,但真正拉开体验差距的,不只是“模型够不够聪明”,还有速度、稳定性、额度以及长任务的连续性。
先说结论:
- Google Antigravity 的模型选择和 Agent 能力都不错,但我后期经常遇到额度紧张和任务意外终止,使用节奏容易被打断。
- Trae 响应快、上手门槛低,适合处理重复性任务;但在我的使用中,复杂代码的质量不够稳定。
- Codex 目前更符合我的工作方式:它更适合围绕一个仓库持续修改、执行命令并验证结果。
这不是严格的跑分或横评,只是我在自己项目里的真实体验。不同版本、模型和账号套餐的结果可能不同。
我在意哪些体验
我选 AI 编程工具时,主要看四点:
- 代码质量:是否真正理解上下文,而不是只生成一段“看起来能用”的代码。
- 执行速度:简单任务是否能快速完成,会不会长时间排队。
- 任务连续性:一次修改涉及多个文件时,能不能坚持做完并自己验证。
- 成本和额度:不只看价格,也看额度是否够用、超限后会不会立即打断当前任务。
Google Antigravity:能力不错,但连续性影响体验
我刚开始使用 Google Antigravity 时,免费额度比较充足。配合我当时能用的 Google AI Pro 权益,Claude Opus 和 Gemini Pro 都有不错的体验。
真正让我不舒服的是任务连续性。后来我遇到的额度限制更明显,偶尔还会出现 Agent terminated due to error。对于只改一个小函数的任务,这个问题还能接受;但一旦进入跨文件重构,中途断掉会非常影响节奏。
频繁确认终端命令怎么办
如果每条命令都要手动确认,可以在 Settings → Agent 中查看两项设置:
- Terminal Command Auto Execution:控制终端命令是请求确认,还是自动执行。
- Artifact Review Policy:控制 Agent 执行计划或代码修改前是否停下来请求审核。
把它们设为 Always Proceed 可以减少确认次数,但不建议在不熟悉的仓库里直接全部放行。更稳妥的做法是:
- 只对
npm run build、npm test、git status等低风险命令设置允许规则。 - 保留对
sudo、删除文件、改动工作区之外文件等操作的人工确认。 - 重要项目先提交 Git,或者使用独立分支再让 Agent 执行。
Google 官方文档也将 Request Review 标记为推荐选项,因此“少弹窗”和“更安全”之间需要自己取舍。设置项名称可能会随版本变化,以 Antigravity 官方设置说明 为准。
Trae:快、门槛低,适合处理“脏活累活”
Trae 给我的第一印象是快。安装、上手和执行简单任务都比较顺手,但部分高性能模型偶尔需要排队。
它很适合帮我处理这些事情:
- 批量改命名或替换格式。
- 生成重复性强的样板代码。
- 给旧代码补注释、类型和简单测试。
- 快速做一个可运行的原型。
不过,对于复杂重构或边界条件较多的业务逻辑,我不会直接接受它给出的结果。省下的是编码时间,但代码审查、测试和验证仍然不能省。
Codex:目前最适合我的工作方式
Codex 是 OpenAI 的编程 Agent,可以理解代码、修改文件、执行命令、审查代码并调试问题。相比单纯的“聊天生成代码”,我更喜欢它围绕整个仓库完成任务的方式。
对我来说,它的优点主要有三个:
- 任务更完整:不只是给出代码片段,还能继续改文件、跑测试和修复问题。
- 当前任务不会被粗暴截断:官方说明提到,如果在一次正在执行的任务中触及额度,Agent 仍可在合理使用限制内完成当前轮次。
- 工作方式灵活:我可以让它先读项目、拟定方案,再修改和验证,更适合相对完整的开发任务。
截至本文更新时,Codex 可以通过免费套餐体验,付费套餐则提供更多可用量。套餐、模型和额度都可能调整,所以我不在这里写死价格,具体以 Codex 官方定价与额度说明 为准。
它也不是没有问题。对话过长、日志和文件太多时,上下文会越来越臃肿,效率和稳定性都可能受影响。我现在会把大任务拆成几个明确阶段,阶段完成后让它总结已做的修改;必要时开新对话,只带上结论和下一步目标。
简单对比
| 工具 | 我感受到的优点 | 我遇到的问题 | 更适合的场景 |
|---|---|---|---|
| Google Antigravity | 模型选择丰富,Agent 能力完整 | 额度和稳定性偶尔打断任务 | 需要多模型选择的 Agent 任务 |
| Trae | 响应快,上手门槛低 | 复杂代码的质量不够稳定 | 原型、样板和批量修改 |
| Codex | 长任务的完整性较好,便于修改后继续验证 | 长对话可能导致上下文臃肿 | 仓库级修改、调试、审查和重构 |
我现在怎么用
我并不会把所有任务都丢给同一个工具,而是按任务选:
- 快速原型、重复性修改:优先用 Trae。
- 需要不同模型进行对比或尝试:用 Google Antigravity。
- 涉及多文件、需要运行测试和反复修正的完整任务:用 Codex。
无论用哪个工具,我都会要求它完成三件事:先说清楚准备怎么改,改完后运行测试,最后列出改动和未解决的风险。工具只是放大效率,不会替我承担代码质量。
总结
如果只看“会不会生成代码”,这几个工具都能用。但在真实开发中,我更在意它能不能读懂现有项目、顺利做完任务,并且在修改后给出可验证的结果。
按我现在的需求,Codex 是综合体验最合适的选择;Trae 适合快速完成重复性工作;Google Antigravity 的能力不差,但我希望它在额度和稳定性上有更好的表现。
最后还是那句话:适合自己工作方式的工具,才是最好的工具。
发现错误,或想补充改进这篇文章?
在 GitHub 上编辑此文