核心信息

OpenRouter 使用 Ori Eval 在评判/分类任务上将 Typesafe 的 Jev 决策模型与热门 LLM 做了对比测试。结果显示,Jev 比第二快的模型快 5 倍以上,准确率与主流分类模型相当,并且在五个模型中成本第二低,仅次于 Qwen3.8 Flash。

要点

  • Jev 在该任务上比下一个最快的 LLM 快 5 倍以上。
  • 准确率与主流分类 LLM 持平,五个模型之间差距极小。
  • 成本排名第二低,仅次于 Qwen3.8 Flash,低于另外三个 LLM。
  • 验证了 Typesafe 的观点:决策模型可以同时做到快速、准确、便宜。