核心信息

在一项覆盖 30 种任务类型、共 200 个合成样本的基准测试中,决策模型 Jev 在分类准确率上与主流 LLM 持平,同时成本排名第二低,仅次于 Qwen3.8 Flash。

要点

  • 五款测试模型的正确数只相差几个案例;除 GLM 5.3 Flash(必须开启推理并运行在低努力模式)外,其余 LLM 均关闭推理。
  • Jev 的成本低于另外三款 LLM,仅略高于 Qwen3.8 Flash。
  • 注意事项:200 个案例为合成数据,均匀分布到 30 种任务类型;DeepSeek 和 GLM 使用默认供应商路由,因此它们的尾部延迟反映的是多个供应商的混合表现。