新模型 Jev 发布即爆火:官方称快 40–200 倍,实测便宜 444 倍(官方称属上限)【附 3 条白嫖方法】

文章介绍 Jev 模型,它不做生成,只做判断:快速、低成本地完成路由、分类、审核等选择题式任务。文中给出 3 种使用途径,并整理官方承认的局限与数据边界。

9 月 15 日,Jev 发布即爆火。但是它一个字都不会写,也不能聊天,也不能写代码。

它只会做一件事:判断。

本来 AI 判断一次需要等 8 秒,现在只需要 0.1 秒,成本只有原来的四百分之一。

装上它,你的 token 消耗骤减,速度骤增。

文末还有一份更狠的:17 个板块、90+ 篇 AI 资料包,提示词、AI 绘画、Agent、AI 赚钱全在里面。

不废话,直接给你用法,原理在后。

3 条白嫖方法,第一条不用排队

  1. ① OpenJev(社区免费托管,不排队,最快):还在 waitlist 上的人做的免费版,拿来先摸手感。提示和答案不留存,只记 token 数算额度。
  2. ② 官方 early access(免费,功能最全):typesafe.ai 申请 waitlist,有人反馈当天就过了。进 console.typesafe.ai 的 Playground,带引导教程和现成例子,不写代码也能点着玩。
  3. ③ OpenRouter / Vercel AI Gateway(按量付费,但约等于白嫖):openrouter.ai/typesafe/jev-1.13,不用等官方名额。输入每百万 token 0.042 美元,输出免费,一次判断的成本大概是 0.00008 美元。

新手的正确顺序:先在 Playground 或 OpenJev 点着玩通,再碰 API。写代码的从 console.typesafe.ai/settings/keys 拿 key,存进环境变量 TYPESAFE_API_KEY,别写进代码仓库。Codex 用户可以一行命令装官方 skill:

npx skills add typesafe-ai/skills

它本质是一个只做选择题的 AI

打个比方你就懂了。

现在的大模型,像个什么都能聊的实习生。你问什么它答什么,一个字一个字往外蹦,说得挺好,但有三个毛病:慢(前沿模型端到端要 3 到 329 秒)、贵、还可能一本正经地编。

Jev 像个只做选择题的判官。你给它一段情况,再给它几道题——这个用户着急吗?这活该派给谁?这段内容违规吗?——它不写一个字,直接返回答案,而且把所有题一次性并行答完,不是一道一道来。

更关键的是两件事:

第一,它给的答案带把握程度。不是“我觉得是”,而是“是,87% 的把握”。官方把这叫“校准过的概率”——说人话就是:它说自己有九成把握的时候,真的差不多就是九成准,而不是像大模型那样张口就来、问它信心它也瞎说。

第二,它答不出题目以外的东西。选项是你提前定好的,它只能在里面挑。所以官方敢说它“不会幻觉”——不是因为它更聪明,是因为它压根没有编造的余地。

这个模型叫 System One 模型,名字来自《思考,快与慢》里的“系统 1”——人脑那套快速直觉反应。大模型是系统 2(慢慢想),它是系统 1(瞬间判断)。

为什么瞬间爆火,有三点

第一,快得不像话。大模型要 3 到 329 秒,它 70 到 500 毫秒。官方说在同等智能水平下快 40 到 200 倍。

第二,便宜得不像话。输入每百万 token 0.042 美元,输出免费——官方原话是“便宜到不值得计量”。对比一下,主流大模型输入 0.2 到 10 美元,输出还要贵 5 倍左右。

一个实测对比:同一个任务,Jev 用了 0.114 秒、花了 0.000081 美元;GPT-5.6 Terra 用了 8.566 秒、花了 0.013880 美元。便宜 444 倍。

第三,它填的是个真窟窿。这才是它爆火的根本原因——

过去两年大家都在做 AI Agent,但一直有个尴尬:让大模型去做那种“该走哪条路”的小判断,又慢又贵还不稳。一个 Agent 跑一趟要做几十次这种判断,每次都调大模型,用户就得干等。

Jev 就是专门堵这个口子的。它不跟大模型抢活,它站在大模型旁边当裁判:路由、分类、打分、审核、给大模型的输出把关。

创始人 Diogo Almeida 是前 OpenAI 研究员,参与过 ChatGPT 背后那套训练方法,为这事潜行了两年。

它能给你带来什么

如果你在做 AI 产品或 Agent,这是直接的收益:

  • 路由:一个任务该交给哪个 Agent、哪个模型、哪个工具——以前调大模型判断,现在 0.1 秒搞定
  • 内容审核:实时判断违规、检测越狱提示词
  • 给大模型的输出把关:大模型写完,Jev 花几十毫秒打个分,不合格就重来
  • 处理海量数据:把一堆非结构化的东西批量打标签、分类、抽取

如果你不写代码,短期内不会直接用它,但你会很快感受到——你常用的那些 AI 工具会变快,以前卡住你的那几秒,很多就花在这类小判断上。

官方放的两个 demo 很能说明它的速度:让 Jev 实时玩毁灭战士(每秒 10 次判断,约 7 美元一小时),和玩维基竞速(每一步要在几百上千个链接里挑一个)。

泼点冷水,官方自己承认的

这一节可能比前面都重要,因为现在网上全是吹的。

那个 444 倍是上限,不是日常。官方原话:这些数字来自他们自己那套评测,“我们预计这是真实收益的上限”。

评测有倾向性,官方自己写明了。他们拿 GPT-6 Astra 和 Fable 5.1 的平均答案当“标准答案”,承认这会让结果偏向这两家;4 套测试流程是自己团队做的,“可能存在偏差”;速度是在他们自己笔记本上跑的。

“零幻觉”要看清楚是什么意思。图表里它的幻觉率写 0%,但官方注明这个数不是实测出来的——是因为输出格式有数学保证,所以直接填了 0。它不会输出格式外的东西,但在给定选项里选错,仍然是可能的。有第三方评测提到,在官方那套 4 流程测试上准确率约 68%。

能力边界很明确。选项要提前定义,最多 255 个。不能写东西、聊天、生成代码。

说白了:它不是来取代 ChatGPT 的,它是来给 ChatGPT 这类模型打下手的。把它当成“更聪明的 if 判断”,而不是“更强的大模型”,你的预期就对了。

今天就能帮到你的

  1. 先用 OpenJev 或 OpenRouter 试一次,五分钟,你会立刻明白“0.1 秒出判断”是什么体感;
  2. 同时去 typesafe.ai 挂上 waitlist,官方 Playground 的引导教程对新手更友好;
  3. 想清楚你手上哪个环节在“等 AI 做小决定”——有,那就是 Jev 的位置;没有,这轮热闹先看着就行。

最后说个有意思的

Jev 这名字取自经济学家杰文斯。当年蒸汽机越来越省煤,煤反而用得更多了——因为便宜到能用在从前用不起的地方。TypeSafe 赌的就是这个:智能每便宜一个数量级,就会冒出多几个数量级的新用法。

还有一份大礼包送给你👇

关注公众号领取 90+ 篇 AI 资料的二维码

从提示词、AI 绘画、AI 视频,到 Agent、AI 赚钱、AI 学习路线,一共 17 大板块、90+ 篇资料,关注我的公众号后即可领取。

公众号关注引导或资料包领取说明图
从提示词、AI 绘画、AI 视频,到 Agent、AI 赚钱、AI 学习路线,一共 17 大

内容核验说明

收录它,是因为“只做判断的小模型”这个卡位讲清楚了:路由、分类、审核这类选择题活儿,不该由大模型硬扛。三条免费试用路径和官方自曝的评测偏差都放在一起,做 Agent 的能直接对上号。但要有保留:444 倍是官方自称的上限,“零幻觉”来自输出格式保证而非实测,第三方准确率另有说法。文中的数据来自原作者公开披露,诀.com未独立验证,效果不保证复现。

文中速度、成本倍数、准确率、“零幻觉”等数据均来自原作者转述的官方披露或作者自述的对比,诀.com未独立验证;官方已承认评测存在倾向性且444倍为上限,第三方约68%准确率亦为转述,实际效果需自行核验,不保证复现。

原始来源

原作者:路飞 🏴‍☠️ AI 研究员🧐(@0xluffy_eth)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文