核心信息
OpenRouter 使用 Ori Eval 在评判/分类任务上将 Typesafe 的 Jev 决策模型与热门 LLM 做了对比测试。结果显示,Jev 比第二快的模型快 5 倍以上,准确率与主流分类模型相当,并且在五个模型中成本第二低,仅次于 Qwen3.8 Flash。
要点
- Jev 在该任务上比下一个最快的 LLM 快 5 倍以上。
- 准确率与主流分类 LLM 持平,五个模型之间差距极小。
- 成本排名第二低,仅次于 Qwen3.8 Flash,低于另外三个 LLM。
- 验证了 Typesafe 的观点:决策模型可以同时做到快速、准确、便宜。