核心信息
OpenRouter 使用 Ori Eval 将 typesafeai 的决策模型 Jev 与主流 LLM 放在同一批评判/分类任务中测试。结果显示,Jev 比次快的 LLM 快 5 倍以上,同时准确率与完整大模型基本持平——五个模型的判断结果只相差个位数。
要点
- Jev 将问题拆成小的 yes/no 和多选决策,从而以更低成本实现快速回答。
- 在 OpenRouter 评测中,Jev 的速度比次快的 LLM 快 5 倍以上。
- 准确率没有因速度而下降:Jev 与常用分类 LLM 的正确数只差几个案例。
- 这类决策模型有望在每条消息或每次工具调用中运行,兼顾速度与正确性。