输出token永久免费,Jev爆火后,开源版也跟着火了
最近,一款名为Jev的新模型在开发者圈子里迅速走红,引发了广泛关注。
原帖浏览量突破了3700万,𝕏和Hacker News上到处都在讨论它。
走红的方式颇为奇特——它既不会聊天,也不会写代码,甚至连“是”或“否”都选择“或”。
简单来说,就是把传统大型语言模型(LLM)的生成功能给去掉了。
它只专注于一件事:做判断,然后把选项和对应的概率返回给你,而且不会胡乱编造。
性能表现相当出色:速度快了最多193.6倍,成本低了最多444.6倍。
更令人惊讶的是,由于新架构极其廉价,难以按量计费,输出token永久免费,输入每百万Token也仅需0.042美元。
相比之下,各家推出的Flash模型就显得有些尴尬了。
更有趣的是,开发这款模型的是OpenAI的前研究员Diogo Almeida,他曾参与RLHF、InstructGPT等核心研究。
他花了小半辈子教AI“好好说话”,最后却直接让AI“闭嘴”了。
这也是他创办的新公司TypeSafe AI的首次公开亮相。
System One Model
官方介绍称,Jev是它们的第一个System One Model。
这个概念源于丹尼尔·卡尼曼的快慢系统理论:系统1主打高速直觉式决策,系统2则偏向慢速的文本推理。
显然,当前的LLM大多沿着系统2发展,而Jev则回归本源,探索系统1。
Jev这个名字源自杰文斯悖论,意为单任务成本大幅下降,但整体AI使用量预计会爆发式增长。
Jev提供三种基本能力:Choice、Score和Noul。
- Choice:从候选项中做出选择;
- Score:根据标准进行评分;
- Noul:给出某个判断成立的概率。
更直白地说,你可以把Jev理解成一个带概率的**“语义逻辑门”**:
它接收非结构化的状态和一组限定回答类型的问题,然后输出决策结果和评分,再交给代码继续执行。
说到这里,可能有人会问:传统生成式模型不也能做分类吗?
当然可以,但区别在于答案的生成方式。
传统生成式模型通常还是逐token生成答案,哪怕最终只需要输出一个“A”,也会消耗大量token在解释答案上。
而Jev直接输出判断结果,同一份输入中的多个独立问题还能并行处理,省去了把答案逐字“写出来”的过程。
这样舍弃文本生成后,速度和成本就变得非常可观。
官方公布的端到端响应时间低至70~500毫秒,相比前沿模型能快20~200倍,价格便宜40~400倍。
当然,只有答案还不够,要真正融入工业流程,还有一个关键问题:模型到底有多大把握?
Jev提出了一种全新的训练方法——用于校准决策的强化学习(RLCD,Reinforcement Learning for Calibrated Decisions)。
相比之下,RLHF根据人类反馈奖励更偏好的回答,RLVR则根据可验证的结果给予奖励。
RLCD则将优化重点放在决策及其概率上,希望模型判断准确,同时也能准确表达不确定性。
所谓**“校准决策”**,可以理解为让模型输出的概率值,匹配真实发生的频率。
比如,模型标为0.2概率的结果,真实发生的比例大约就是20%;标为1则表示这件事几乎一定会发生。
如果没有这一步,模型输出的置信度数字就缺乏实际参考价值。
另一个值得关注的问题是幻觉。
官方描述Jev是**“零幻觉”**,其实有些夸大。
Jev保证的是模式匹配:比如你给它A、B、C三个选项,它确实不会自作主张编出一个D输出,但正确答案明明是A,它仍可能选成B。
所以,这里的“零幻觉”得打个折扣,类型正确但事实不一定正确。
Jev用法焚诀
在Jev有限的判断任务中,各路开发者找到了一些实用的打开方式。
一类是接管软件中的高频判断。
Vercel工程师Pranit在实际业务中,对fx自动模式的安全分类器进行了测试,Jev相比原本选择的GPT-5.6 Luna快了5~18倍,准确性也更高。
Bryo AI技术总监Nikhil Mudholkar则对Jev和Gemini同时进行商业邮件分类测试。
测试结果显示,Gemini的准确率略胜一筹,但价格是Jev的10~20倍。
从性价比来看,Jev更适合自动化工作流程。
另一类是给LLM当验收员,可以检查LLM的不当行为。例如,有用户部署Jev来追踪LLM Agent并防止模型越狱。
开发者Elvis Saravia将Jev接入自己的Agent框架,并构建了自定义验证器,可以在Agent宣称任务完成后再次检查。
这样验证成本足够低,且目标结果可信度高,也可以看作是系统1和系统2的巧妙结合。
同样的思路还可以用于模型路由:
先让Jev判断请求难度,简单任务交给快模型,难题再请昂贵的推理模型出马。
比如开发者Hassan的下棋测试(Jev VS GLM 5.3)就很有意思:
Jev每步约0.3秒、成本不到0.0001美元,GLM 5.3每步约5.8秒、成本约0.008美元,最终GLM 5.3在29步内将死对手。
下得快,未必想得深。
Hassan因此更看好多模型混搭:让Jev负责快速、明确的判断,让LLM处理需要深入推理的难题。
开源也跟上了
不仅如此,随着Jev带火了快速决策这条路线,开源版也来了——Nimble。
Jev目前还只能通过API访问,但Nimble已经可以部署到本地。
Nimble在思路上与Jev一脉相承,基于Qwen3.5-9B进行LoRA微调,模型适配器已以Apache 2.0许可发布,可配合基础模型使用。
除了模型,训练数据和方法也一并开源了。
训练思路有点像让AI**“找不同”**:构造两份几乎一模一样的材料,只改一个关键事实,答案的正确与否也随之翻转。
要答对,模型必须抓住真正影响判断的核心信息。
最终效果上,Nimble比Jev稍逊一筹,但比基座模型更强。
基础Qwen3.5-9B与参考标签的一致率为66.36%,Nimble提升到90.12%,Jev为93.21%。
换句话说,AI也不一定非得靠“说话”来工作。
只要判断做得可靠,哪怕全程不开口,活也能干得好。
参考链接:
[1]https://x.com/CompleteSkeptic/status/2099925682726002904 [2]https://github.com/bespokelabsai/nimble [3]https://docs.typesafe.ai/introduction [4]https://mp.weixin.qq.com/s/ND4whrG99frwJ58-fQ0TgQ [5]https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
本文来自微信公众号“量子位”,作者:鹭羽,36氪经授权发布。