跳到主内容
爱游戏在线入口

输出token永久免费,Jev爆火后,开源版也跟着火了

2026-09-20 · 董雅婷 · 更新于 2026-09-28

最近,一款名为Jev的新模型在开发者圈子里迅速走红,引发了广泛关注。

原帖浏览量突破了3700万,𝕏和Hacker News上到处都在讨论它。

走红的方式颇为奇特——它既不会聊天,也不会写代码,甚至连“是”或“否”都选择“或”。

简单来说,就是把传统大型语言模型(LLM)的生成功能给去掉了。

它只专注于一件事:做判断,然后把选项和对应的概率返回给你,而且不会胡乱编造。

性能表现相当出色:速度快了最多193.6倍,成本低了最多444.6倍。

更令人惊讶的是,由于新架构极其廉价,难以按量计费,输出token永久免费,输入每百万Token也仅需0.042美元。

相比之下,各家推出的Flash模型就显得有些尴尬了。

更有趣的是,开发这款模型的是OpenAI的前研究员Diogo Almeida,他曾参与RLHF、InstructGPT等核心研究。

他花了小半辈子教AI“好好说话”,最后却直接让AI“闭嘴”了。

这也是他创办的新公司TypeSafe AI的首次公开亮相。

System One Model

官方介绍称,Jev是它们的第一个System One Model。

这个概念源于丹尼尔·卡尼曼的快慢系统理论:系统1主打高速直觉式决策,系统2则偏向慢速的文本推理。

显然,当前的LLM大多沿着系统2发展,而Jev则回归本源,探索系统1。

Jev这个名字源自杰文斯悖论,意为单任务成本大幅下降,但整体AI使用量预计会爆发式增长。

Jev提供三种基本能力:Choice、Score和Noul。

  • Choice:从候选项中做出选择;
  • Score:根据标准进行评分;
  • Noul:给出某个判断成立的概率。

更直白地说,你可以把Jev理解成一个带概率的**“语义逻辑门”**:

它接收非结构化的状态和一组限定回答类型的问题,然后输出决策结果和评分,再交给代码继续执行。

说到这里,可能有人会问:传统生成式模型不也能做分类吗?

当然可以,但区别在于答案的生成方式。

传统生成式模型通常还是逐token生成答案,哪怕最终只需要输出一个“A”,也会消耗大量token在解释答案上。

而Jev直接输出判断结果,同一份输入中的多个独立问题还能并行处理,省去了把答案逐字“写出来”的过程。

这样舍弃文本生成后,速度和成本就变得非常可观。

官方公布的端到端响应时间低至70~500毫秒,相比前沿模型能快20~200倍,价格便宜40~400倍。

当然,只有答案还不够,要真正融入工业流程,还有一个关键问题:模型到底有多大把握?

Jev提出了一种全新的训练方法——用于校准决策的强化学习(RLCD,Reinforcement Learning for Calibrated Decisions)。

相比之下,RLHF根据人类反馈奖励更偏好的回答,RLVR则根据可验证的结果给予奖励。

RLCD则将优化重点放在决策及其概率上,希望模型判断准确,同时也能准确表达不确定性。

所谓**“校准决策”**,可以理解为让模型输出的概率值,匹配真实发生的频率。

比如,模型标为0.2概率的结果,真实发生的比例大约就是20%;标为1则表示这件事几乎一定会发生。

如果没有这一步,模型输出的置信度数字就缺乏实际参考价值。

另一个值得关注的问题是幻觉。

官方描述Jev是**“零幻觉”**,其实有些夸大。

Jev保证的是模式匹配:比如你给它A、B、C三个选项,它确实不会自作主张编出一个D输出,但正确答案明明是A,它仍可能选成B。

所以,这里的“零幻觉”得打个折扣,类型正确但事实不一定正确。

Jev用法焚诀

在Jev有限的判断任务中,各路开发者找到了一些实用的打开方式。

一类是接管软件中的高频判断。

Vercel工程师Pranit在实际业务中,对fx自动模式的安全分类器进行了测试,Jev相比原本选择的GPT-5.6 Luna快了5~18倍,准确性也更高。

Bryo AI技术总监Nikhil Mudholkar则对Jev和Gemini同时进行商业邮件分类测试。

测试结果显示,Gemini的准确率略胜一筹,但价格是Jev的10~20倍。

从性价比来看,Jev更适合自动化工作流程。

另一类是给LLM当验收员,可以检查LLM的不当行为。例如,有用户部署Jev来追踪LLM Agent并防止模型越狱。

开发者Elvis Saravia将Jev接入自己的Agent框架,并构建了自定义验证器,可以在Agent宣称任务完成后再次检查。

这样验证成本足够低,且目标结果可信度高,也可以看作是系统1和系统2的巧妙结合。

同样的思路还可以用于模型路由:

先让Jev判断请求难度,简单任务交给快模型,难题再请昂贵的推理模型出马。

比如开发者Hassan的下棋测试(Jev VS GLM 5.3)就很有意思:

Jev每步约0.3秒、成本不到0.0001美元,GLM 5.3每步约5.8秒、成本约0.008美元,最终GLM 5.3在29步内将死对手。

下得快,未必想得深。

Hassan因此更看好多模型混搭:让Jev负责快速、明确的判断,让LLM处理需要深入推理的难题。

开源也跟上了

不仅如此,随着Jev带火了快速决策这条路线,开源版也来了——Nimble。

Jev目前还只能通过API访问,但Nimble已经可以部署到本地。

Nimble在思路上与Jev一脉相承,基于Qwen3.5-9B进行LoRA微调,模型适配器已以Apache 2.0许可发布,可配合基础模型使用。

除了模型,训练数据和方法也一并开源了。

训练思路有点像让AI**“找不同”**:构造两份几乎一模一样的材料,只改一个关键事实,答案的正确与否也随之翻转。

要答对,模型必须抓住真正影响判断的核心信息。

最终效果上,Nimble比Jev稍逊一筹,但比基座模型更强。

基础Qwen3.5-9B与参考标签的一致率为66.36%,Nimble提升到90.12%,Jev为93.21%。

换句话说,AI也不一定非得靠“说话”来工作。

只要判断做得可靠,哪怕全程不开口,活也能干得好。

参考链接:

[1]https://x.com/CompleteSkeptic/status/2099925682726002904 [2]https://github.com/bespokelabsai/nimble [3]https://docs.typesafe.ai/introduction [4]https://mp.weixin.qq.com/s/ND4whrG99frwJ58-fQ0TgQ [5]https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/

本文来自微信公众号“量子位”,作者:鹭羽,36氪经授权发布。

更多文章