Jev Router 路由大模型测评报告!真的能打吗?
这一集测的是 OpenRouter 上刚上线的路由模型 Jev Router。TypeSafe 的 Jev 决策模型之前很火,拿来做大语言模型路由再合适不过,Jev Router 估计就是这么应运而生的——它会根据问题的难易程度,用不同的思考深度把请求路由到对应的模型。
不过开测前先看了眼余额:上次 23 号充的钱,测完 GPT6 和 Claude Opus 5.5 就只剩 2 美刀,不太够。所以这次也顺便指望它能多路由到免费模型。
第一题,强约束指令遵循句子生成。 完成得很快,而且没花钱,应该就是路由到了免费模型——OpenRouter 上之前测评过的 Space Bunny,不过那个模型上次表现就不太行。回看结果确实不行:第三、四、五、六、八、十句都不是从 1 到 10 结尾的,其他句子读起来还算通顺。
第二题,鹈鹕土星环骑自行车 SVG。 这次花了 0.02 刀,路由到的是便宜的 DeepSeek V4.1 Flash。从这个回答速度看,Jev Router 应该没给它太高的思考深度。效果上整体结构还可以,就是转弯没处理好,到了上方变成倒着骑行。
第三题,复合弓射箭 SVG。 这次是混着来的——过程中有些请求路由到 Gemini 3.8 Flash,有些路由到 DeepSeek V4.1 Flash。左边小人太水,弓箭位置也都是错的;复合弓倒还有点样子,射出去的抛物线也没问题。
第四题,实现一个精美的浏览器内操作系统。 还是 DeepSeek V4.1 Flash,看来 Jev Router 很喜欢我们的 DeepSeek。从回答速度看,思考深度肯定也不高。实测右上角弹窗功能没问题、UI 一般,dock 栏应用功能也正常,但太空射击游戏打不开——显然没用上高思考 level,不然不至于犯这么菜的错误。
第五题,实现 3D 赛车游戏。 又是 DeepSeek。没法玩,车都没见到一辆。
第六题,无第三方库实现一个高颜值 Trello 看板。 还是 DeepSeek,感觉这次是专门来测 DeepSeek V4.1 Flash 的低思考 level 了。UI 一般,但功能没有问题。
看完调用总览,如前面所见,大部分请求都路由到了 DeepSeek。整个测评下来,在 Jev Router 看来这套题基本都比较适合 DeepSeek 来做,但又没给很高的思考深度,导致整体 performance 真心不咋地。大家怎么看呢?












