Jeff:把 Jev 类决策模型压到 0.8B,跑在本地

文章介绍 Jeff 系列小决策模型,它基于 Qwen3.5 和 Gemma 4 微调,以零样本分类方式返回选项的校准概率,可本地运行。内容涵盖基准成绩、零样本游戏测试、国际象棋微调示例、速度与体积、使用建议、作者列出的 caveats,以及对开源结果的判断和来源出处。

作者:Mathias Strasser(Scissero)

先说清楚它是什么、不是什么。

Jeff 是 Qwen3.5 和 Gemma 4 的微调版,做零样本分类——就是那种你塞进代码里的小决策模型,请求格式和 Jev 一样:你描述情况、用平实的词列出选项,它一次前向传播返回每个选项的校准概率。

没有生成的文本,不需要解析。

而且它跑在本地:RTX PRO 6000 上每次决策约 22 毫秒,Apple M4 Max(MLX)上 28 毫秒。

「零样本」的意思是选项可以是任何东西:客服队列、用户意图、审核标签、语音指令、游戏动作。你的类目不需要出现在训练数据里——你描述它们,Jeff 来选。

但它不是 Jev 的替代品。作者自己写得很直白:

这些是非常小的模型。它们在选项之间做极快、校准良好的判断,容易嵌进你的本地代码。在基准上它们接近、有时超过 Jev;但在这个尺寸上,它们的推理能力匹配不了 Jev——后者跑在一个大得多的模型上。

如果零样本准确率对你不合格,用你自己的样本做一个短微调能走远得多:我们的语音导航微调把留出准确率从 31.7% 提到 95.8%,在一块 GPU 上用了不到半小时。

一、基准:0.8B 追平了 Jev 的整体分

4,599 道题,来自五个公开基准,加上 JevBench 公开困难档(105 题,单独计分)。

基准                    Jeff-0.8B  Jeff-2B  Jeff-Gemma4  Jev(公布)  AutoJev-27B
整体(5 基准)             79.1      83.1      81.6        83.0        84.9
BBH                      64.0      68.0      66.4        94.3        82.8
Financial PhraseBank     96.4      96.3      96.1        77.0        84.2
JudgeBench               62.6      64.6      60.6        78.6        78.9
RAGTruth                 86.1      88.9      87.4        77.3        88.9
WinoGrande               68.6      79.0      77.4        90.7        83.3
JevBench 困难档(单列)     47.6      53.3      48.6        73.3        70.3

几个读法:

① 整体分上,Jeff-2B(83.1)几乎追平 Jev(83.0),而它只有 20 亿参数。但作者立刻提醒:公布数字是在同一批基准的不同样本上测的。

② 在分类和接地类任务上,小模型反超:Financial PhraseBank 96.4 vs 77.0、RAGTruth 86.1 vs 77.3。作者的解释是「Jeff 的整体分来自分类和接地,那里它追平或超过大模型」。

③ 在推理密集的基准上它明显落后:BBH 64.0 vs 94.3、JevBench 困难档 47.6 vs 73.3。作者说「正如你在这个尺寸上会预期的那样」——没有掩饰。

二、零样本测试:让 Jeff 打三个游戏

作者的测试方法值得学:游戏不是理想的零样本测试,因为游戏状态不是典型的非结构化数据;但它们是测试 System 1 模型的常见、且有趣的方式。

每一回合,代码用文字描述情况和合法动作,模型选一个。选项会说明每个动作导致什么(Frogger:「你会被车撞到,失去一条命」;Doom:「最近的怪物在你左边一点」),但从不说明哪个动作是对的。

每个结果是 20 局、种子 1234。

模型                Doom 击杀   Frogger 过河   Pac-Man 吃豆(共98)
随机动作              −0.05          0            11.2
手工规则 bot           6.55        10.25           94.1
Qwen3.5-0.8B 未训练     5.0          1.0           25.8
Jeff-Qwen3.5-0.8B      6.55        10.3           57.0
Qwen3.5-2B 未训练      0.55         0.05           72.1
Jeff-Qwen3.5-2B       −0.9          6.0           41.2
Gemma 4 E2B 未训练    −0.55           0            3.2
Jeff-Gemma4-E2B        0.55        0.15           53.2

最说明问题的一行对比:

Jev 公布的 Doom 成绩是 6.55——但它被告知了瞄准规则;不告诉它规则时是 −0.60。

而 Jeff-0.8B 拿到 6.55,没人告诉它任何规则。它等于手工规则 bot 的水平。

速度对比:Jeff-0.8B 在 M4 Max 上每次动作 29–49 毫秒;Jev 公布的 Doom 运行是每次调用 212 毫秒(含网络)。作者注明「这两个时间不是在同一硬件上测的」。

三、微调示例:国际象棋

零样本不够时,微调。他们拿 60 万个 Lichess 局面、由 Stockfish 标注,在一块 GPU 上训了约 3 个半小时。

1,000 道留出棋题:

Qwen3.5-0.8B 未训练              6.2%
Jeff-0.8B 零样本(没训过棋)       15.5%
Jeff-0.8B-Chess               55.8%

作者对这个模型的定性很诚实:

它不是强棋手:无搜索时大约 1000 Elo,而且输给 Stockfish 最弱的设置。重点在速度。每个动作是一次几十毫秒的前向传播,所以一块 GPU 能同时跟上约 600 场人类快棋。

他们放了一段 100 局同时进行的视频——其中唯一赢的那局是个九步将杀。

四、速度与体积

模型              参数              16位权重   RTX PRO 6000   M4 Max(MLX)   CPU(32线程)
Jeff-0.8B        0.8B               1.7 GB      22 ms          28 ms        463 ms
Jeff-2B          2B                 4.2 GB      24 ms          60 ms        708 ms
Jeff-Gemma4-E2B  2B有效(存4.6B)     9.3 GB      29 ms           —           1.0 s
AutoJev-27B      27B                ~54 GB     未公布           —             —
Jev              未披露            仅 API      公开发布的 Doom 运行中每次调用 114–212 ms(含网络)

注意 0.8B 的 1.7 GB 和 M4 Max 上 28 毫秒——这是可以直接塞进笔记本的规模。

五、五条使用建议(我认为最有价值的部分)

① 用代码推理,用 Jeff 决策。

它是一个分类器,不是规划器。把每个选项导致什么说出来(「这步会让你被车撞」);问它预测(「车两回合后会到」),它的表现不比随机好。

② 措辞影响巨大。

一致地描述选项:给 Frogger 的目标选项配上和其他所有前进选项相同的措辞,让一局从 15 次过河变成 23 次。

③ 用短选项键 + 描述性文本:{"1": "Engagement letter"},不要用长 ID——费时间还毫无帮助。

④ 把独立的问题放在一个请求里一起问。

⑤ 零样本不够就微调。一个约 1.1 万条应用特定样本的语音导航微调,一块 GPU 上约半小时,留出准确率 31.7% → 95.8%,M4 Max 上每次决策约 40 毫秒。

⑥ 按任务挑尺寸。

对于快速选项挑选,0.8B 是甜点:2B 更谨慎、游戏打得反而更差,尽管基准分更高。

六、六条 caveats(全部保留)

作者列的这几条,我认为比基准数字更有价值:

① 每题最多 26 个选项,暂时如此。

选项用 A–Z 编码,然后是 AA、AB。但训练里最大的问题是 19 个选项,所以发布的模型从未学会挑双字母代码:第 27 位及以后的选项实际上永远不会被选中,不管它说什么。

服务器因此拒绝超过 26 个选项的问题;更长的列表请先做短名单。

(这条来自一个 issue 报告——puhuk 提的 #1,我核实过,现在还开着。)

② 小模型不推理。期待的是在你描述的选项之间做快速、校准的选择,不是多步推理。这在 0.8B–2B 尺寸上对每个模型都成立,不只 Jeff。

③ Jeff-2B 的游戏表现比 Jeff-0.8B 差。

未训练的 2B 已经显得比未训练的 0.8B 更规避风险,而我们的训练似乎让这一点更严重了。这需要更多调查。

④ 基准分预测不了游戏表现。

未训练的 Gemma 4 E2B 在基准上打败未训练的 Qwen 模型,游戏却打得最差:大部分时候是对的,但不可靠。

⑤ 提示词很重要。Jev 自己的 Doom 提示词(一个原始方位数字加一条瞄准规则)对我们所有模型都不管用;说明后果的选项才管用。

⑥ 只支持英文和文本。

七、来源与出身

代码 MIT,模型权重 Apache 2.0。

Jeff 起于 AutoJev 的一个 fork——那是 Denis Yarats(Perplexity)的开放配方,把 Qwen3.8-27B 微调成返回 Jev 式决策。他们保留其核心设计(每次决策一次前向传播、训练出的答案读出、拟合温度做校准),然后在其上构建:小号学生模型(0.8B/2B Qwen、Gemma 4 E2B)、带泄漏过滤的本地合成数据管线、领域微调的提示布局、Apple 芯片上的 MLX 服务、游戏测试和训练看板。

训练环境值得一提:

完全建立在本地硬件上。在一块 RTX PRO 6000 工作站 GPU 上训练(0.8B 约 2 小时,2B 约 3.5 小时),所有合成训练数据由两台 DGX Spark 上的开放模型(Qwen3.8-Flash-Next)撰写,在一台 MacBook 上测试。没有云 GPU,训练数据里没有闭源模型的输出;闭源模型只被用来抽查一部分合成数据的质量。

以及那句必要的声明:

独立项目。Jeff 使用和 Jev 相同的请求格式,但它不隶属于 TypeSafe(Jev 的开发者),也未获其背书。

八、我的判断

这是 Jev 这条线上目前最实在的一个开源结果。

理由有三个:

① 尺寸的突破是真实的。0.8B / 1.7 GB / 28 毫秒(M4 Max)——这个规模意味着决策模型可以塞进任何东西:本地应用、边缘设备、笔记本上的批处理。而它的整体基准分(79.1)接近 Jev 公布的 83.0。

② 那个 Doom 对比很锋利。Jev 公布 6.55 是「被告知瞄准规则」的结果,不告诉它规则是 −0.60。而 Jeff-0.8B 拿到 6.55,没人告诉它任何规则。这说明在「用自然语言描述后果」这个提示形态下,小模型能追平大模型——而那个提示形态正是实用场景里该用的。

③ 作者列了六条 caveats,而且每一条都具体。尤其那条 26 选项上限——它是被用户报的 issue 才发现的,而且作者没有掩饰「我们的训练让 2B 的游戏表现变差了」。

诚实的边界:

  • 公布的 Jev 和 AutoJev 数字是在同一批基准的不同样本上测的,不是受控对比
  • 推理密集的基准(BBH、JudgeBench、JevBench)上 Jeff 明显落后,这是尺寸决定的,作者没有回避
  • 只支持英文和文本
  • 作者是独立开发者(Mathias Strasser,Scissero),仓库创建于 2026-09-28,918 星但只跑了一天
  • 训练数据没有发布(有权重和代码),部分来源是 CC BY-SA 的 share-alike

一句话:如果你要的是「几十毫秒、本地、能在你描述的选项之间做校准判断」的能力,Jeff 现在就能用;如果你要的是推理,它给不了,而且它不假装能给。

链接

仓库:https://github.com/firelex/jeff

Jeff-Qwen3.5-0.8B:https://huggingface.co/mstrasser/Jeff-Qwen3.5-0.8B

Jeff-Qwen3.5-2B:https://huggingface.co/mstrasser/Jeff-Qwen3.5-2B

国际象棋微调:https://huggingface.co/mstrasser/Jeff-Qwen3.5-0.8B-Chess

上游 AutoJev 配方:https://github.com/denis-pplx/autojev

#Jev #本地AI #开源

#Jev #本地AI #开源

内容核验说明

Jeff 把 Jev 式决策模型压到 0.8B、1.7GB,本地几十毫秒返回选项的校准概率,适合做意图分类、审核标签这类嵌入式判断的人。五条使用建议和六条 caveats 比基准分更能决定用不用:26 选项上限、2B 游戏反而更差都是硬约束。要推理、要非英文的不合适。基准与游戏数据来自原作者公开披露,诀.com 未独立验证,与 Jev 的对比也非同批样本。

文中基准、游戏、微调与速度数据均来自原作者公开披露,诀.com 未独立验证;Jev 与 AutoJev 的公布数字与 Jeff 不在同一批样本上,属非受控对比;作者自陈 2B 游戏表现变差一事仍待调查;零样本与微调结果依赖提示措辞与训练数据,不保证复现。

原始来源

原作者:yibie(@yibie)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文