核心信息
一项新的智能体基准测试在 29 个挑战性任务上运行了 GPT-6 Astra,对比了 6 种编码智能体工具。Command Code 在速度、成本、性能和准确性上进入第一梯队;其他工具失败时消耗的 token 最多高出 3–5 倍。
要点
- 测试对象:Codex、Claude Code、OpenCode、Hermes Agent、Pi Agent 和 Command Code。
- 多数工具成功率相近,但失败时的 token 消耗差异明显,某些工具多用 3–5 倍。
- Command Code 被认为在速度、成本、性能、准确性上均属顶级。