核心信息

CommerceAgentBench是一个基于真实商业需求的开源基准测试,重点考察AI模型能否真正执行商业运营任务,而不仅仅是生成回答。早期结果显示,最佳整体完成率约为62%,阿里巴巴Qwen在开源权重模型中表现最强。

要点

  • 该基准覆盖复杂商业工作流,强调执行能力;在商业场景中,难点从来不是“回答”,而是“完成”。
  • 早期结果并不乐观:即使最强模型的工作流完成率也只有约62%,说明商业执行仍有很大提升空间。
  • 阿里巴巴Qwen在参与评估的开源权重模型中综合表现领先,官方鼓励在真实工作流中进一步测试。