Jev模型究竟是个什么鬼?凭什么海外爆火?
Jev 最近红透半边天——不止海外火了,国内也火得一塌糊涂。它到底是个什么鬼?简单说,它不是聊天模型。用法非常朴素:丢一段文本进去,再给一组带类型的问题,它一个字都不写,直接回概率。问题只有三种:choice 给几个选项让它挑一个,score 按你的量表打分,布尔判断则返回「是」的概率。
这恰恰是我们过去一直用 JSON 硬凑的东西。大模型吐出的那个 0.9 只是个字符,不是真概率;而 Jev 给的是校准过的真概率——它说 90%,就真有九成概率会答对。这让人想起几年前跟着吴恩达学深度学习时最早学的监督学习:训练一个分类器,分辨哪些邮件是垃圾邮件、哪些评论是负面评论。区别在于,传统分类器每换一个任务就得重新训练,标签也是焊死的;Jev 一个模型通吃,工单归哪类、评论正不正、消息急不急,同一套接口全扔给它,还不用人标数据训模型。
速度和成本是它爆火的直接原因。实测走 OpenRouter,输入每百万 token 4.2 美分,输出免费——因为根本没有逐字生成这回事。官方给出的端到端延迟是 70 到 500 毫秒。有开发者把 20 个任务串起来跑完,成本刚过一美分的十二分之一。举个具体的例子:问一段文字在不在提问,「是的概率 2%」,等于说否;一条被扣了两次钱的工单,它路由给账单团队;加个「立刻」,时效性概率就从 7% 跳到六七十。
为什么能这么快?卡尼曼把思考分成系统一和系统二:ChatGPT 这类推理模型是典型的系统二,慢、要深思;而 Jev 干的是系统一的活,凭直觉快速判断。它的创始人 Diogo Almeida 是 InstructGPT 论文的顶级作者之一——那篇论文正是 RLHF(人类反馈强化学习)的开山之作,ChatGPT 能听懂人话,就是从这套方法打的底。官方没发论文,只给了三个词:新架构、并行采样器、RLCD(校准决策强化学习)。外界推测它仍是 Transformer,但只跑一次预填充、一次前向就出结果,所以才能 70-500 毫秒返回。
所谓「不幻觉」也要拆开看。准确的说法是它不返回坏 JSON、不编工具名——你给什么选项,它就在里面挑;但挑错是可能的,靠 RLCD 兜着。从公开信息看,它的校准训练目标就是让报出的概率与真实正确率对齐,官方基准准确率约 67.8%,而且在文档抽取这类任务上只有 61.8%,官方也未公开论文、参数量与训练数据,上线前最好拿自己的数据验证一遍校准效果。
一句话总结:Jev 不是什么新聊天机器人,它就是个终极分类器。当年咱们吭哧吭哧手训神经网络分类器,现在 Jev 把这件老本行做到了极致,还便宜到离谱。还在用 Bert 做分类的,值得试一把。








