核心信息

一项新的智能体基准测试在 29 个挑战性任务上运行了 GPT-6 Astra,对比了 6 种编码智能体工具。Command Code 在速度、成本、性能和准确性上进入第一梯队;其他工具失败时消耗的 token 最多高出 3–5 倍。

要点

  • 测试对象:Codex、Claude Code、OpenCode、Hermes Agent、Pi Agent 和 Command Code。
  • 多数工具成功率相近,但失败时的 token 消耗差异明显,某些工具多用 3–5 倍。
  • Command Code 被认为在速度、成本、性能、准确性上均属顶级。