核心信息

Command Code AI在Composio的知识工作基准测试中被誉为“GOAT”,在DeepSeek等开源模型上击败了其他所有框架:完成18/30个任务,平均用时仅375秒。

要点

  • 在开源模型测试中准确率最高,完成18/30个任务。
  • 平均任务完成时间最快,仅375秒,甚至超过DeepSeek自家的框架。
  • 同时被视为最节省token的顶级框架之一,在准确率、成本和速度上均领先于开源与闭源前沿模型。