核心信息
OpenRouter 用高度聚焦的分类任务对比了 TypesafeAI 的 Jev 决策模型与四款热门 LLM:把输入请求标记为 30 种任务类型之一,共 200 个相同案例。结果显示 Jev 比第二快的模型快 5 倍以上,价格第二低,同时准确率与其他模型持平。
要点
- 评测方式:五个模型均以无状态、顺序方式处理同样的 200 个案例,模拟延迟和成本都很重要的生产环境。
- 速度与成本:Jev 比第二快模型快 5 倍以上,价格仅次于 Qwen3.8 Flash,低于另外三款 LLM。
- 准确率未因速度受损:Jev 的分类准确率与主流 LLM 相当,五个模型之间差距很小。
- 这一结果印证了 Typesafe 的观点:对于聚焦、高频的生产任务,决策模型可以做到又快、又准、又便宜。