AI 新物种调研 · 2026.09 快照

不写字的 AI

TypeSafe 的 Jev 和它的开源对标 Laya:两款只做判断、一个字都不生成的「System One 模型」。它们是什么、快在哪、坑在哪、该怎么选——一页看完。

Jev · 2026-09-15 发布 · 闭源 API Laya · 2026-09-18 发布 · Apache 2.0 阅读约 13 分钟
0 个 token
答 题 卡jev · ~0.1 s
STATE · 输入材料我昨天付了年费,今天账户还是显示免费版,发票也没收到。下午就要给老板演示了,急!
部门计费86%技术9%销售3%
紧急?是93%否7%
严重度外观8%可绕过54%阻塞38%
三道题 · 一次并行作答示意数据
TL;DR · 01

它是什么

给它一段材料和几道「选择题」,它一次性交回带概率的答案。不写作文,只填答题卡——结果直接是程序能用的值。

TL;DR · 02

为什么火

官方称比前沿大模型快 40–200 倍、便宜 40–400 倍:单次判断 70–500 毫秒,每百万输入 token 仅 $0.042,输出免费。

TL;DR · 03

要当心

发布才一周多,几乎所有数字都是厂商或项目方自报;「零幻觉」只保证格式不出错,不保证答案对。

01 / 看懂

大模型在写作文,Jev 在填答题卡

同样是「判断这张工单归哪个部门」,两种模型的工作方式完全不同。

LLM大语言模型(Claude、GPT 等)

System 2 · 慢思考:擅长写、解释、推理
1
读入对话消息材料和问题都塞进一段提示词
2
一个 token 一个 token 往外写 写得越长越慢;每个字都要付费
3
你再从文字里「抠」出答案多一句客套话、JSON 少个括号,程序就解析失败

JevSystem One 判断模型

System 1 · 快直觉:只做「看一眼就知道」的判断
1
读入 state(材料)+ questions(题目)材料可以是一段文本或一个 JSON;题目用代码定义好选项
2
一次读完,所有题并行作答非自回归:不逐字生成,直接输出每个选项的概率
3
拿到的就是程序变量department = "计费"(86%)——不可能返回选项以外的值

为什么叫 System One?

来自卡尼曼《思考,快与慢》:System 1 是不假思索的快判断(瞄一眼就知道是垃圾邮件),System 2 是费力的慢推理。TypeSafe 把 LLM 类比为 System 2,Jev 是 System 1——两者互补而不是替代。

为什么叫 Jev?

取自经济学家 William Stanley Jevons 与「杰文斯悖论」:煤用得越高效,煤的总用量反而越大。TypeSafe 赌的是——判断便宜到一定程度,需求会成倍爆发。
02 / 演示

同一张工单,两种做法

点「同时运行」感受差别。LLM 一侧按 3 秒加速演示(官方口径中前沿 LLM 实际需 3–329 秒);Jev 一侧按官方典型延迟约 0.1 秒。数值为示意。

TICKET我昨天付了年费,今天账户还是显示免费版,发票也没收到。下午就要给老板演示了,急!
三道题:部门(单选)· 是否紧急(是非)· 严重度(打分)
LLM逐字生成0.00 s
等待运行…
生成 token:0
Jev一次并行判断0.00 s
等待运行…
departmentChoice · 单选
计费
0.86
技术支持
0.09
销售
0.03
其他
0.02
is_urgentNoul · 是非概率
P(是)
0.93
severityScore · 打分 → 1.30
0 外观问题1 有绕过办法2 完全阻塞
生成 token:0
03 / 题型

它只会答三种题

Jev 和 Laya 的接口几乎一样:你在代码里定义题目和选项,模型只负责给每个选项打概率。

CHOICE

单选题

「这张工单归哪个部门?」
计费 / 技术支持 / 销售 / 其他
返回:选中项 + 每个选项的概率 + 一个整体置信度。
Jev 最多 255 个选项;更多时官方建议两阶段打分。
SCORE

打分题

「有多严重?」
0 外观问题 / 1 有绕过办法 / 2 完全阻塞
返回:按概率加权的平均档位(如 1.3 = 「大体是 1,偏向 2」)+ 完整分布。
Jev 支持 2–10 档;分数是「档位」,不是可以加减的测量值。
NOUL

是非题

「用户是否在要求退款?」
返回:一个 0–1 的概率,如 {"noul": 0.93}。越接近 1 越肯定。
适合做守门员:「这条命令该不该放行?」「这段输出是不是越狱?」

置信度才是真正的产品原料

官方最佳实践:答案不直接执行,按置信度分车道。阈值由你在代码里掌控,并用自己的标注数据标定。

00.50.9

只有置信度 > 0.9 时,才允许自动执行删除、付款这类高风险动作。

04 / 档案

两位主角:闭源先行者 vs 开源追随者

Jev 定义了这个品类;三天后,Laya 以开源姿态出现,并登上 Hacker News,成为讨论度最高的开源对标。

Jev

TypeSafe AI · 旧金山
闭源权重仅托管 API早期访问 / 排队中
$0.042
每百万输入 token · 输出免费
~100 ms
典型端到端(70–500 ms)
$40M
种子轮融资
创始人
Diogo Almeida,前 OpenAI 研究员,参与过塑造 ChatGPT 的 RLHF / 指令遵循研究
发布
2026-09-15,TypeSafe 的首个公开模型;当前版本 jev-1.13.0
训练
RLCD(Reinforcement Learning for Calibrated Decisions):不奖励「听起来自信」,只奖励「概率报得诚实」
架构
非自回归、并行采样;具体结构、参数量、训练数据均未公开,无论文
规格
材料+题目共享约 64K token;仅支持文本 / JSON;限流约 1,200 请求/分钟
官方自我定位:一次「前沿智能函数调用」——非结构化状态进,带类型的概率化决策出。

Laya

Convai Innovations · 创始人 Nandakishor Mukkunnoth
Apache 2.0 开源权重可本地 / 离线pip install laya
421M
参数(多语言版 322M)
32.8 ms
T4 GPU 单题 p50
100+
语言(多语言版)
发布
2026-09-18,Jev 发布后第 3 天;起因是 Jev 没有论文、权重和数据
架构
ModernBERT-large 编码器 + 自研判断头:每个选项占一个 [MASK] 位打分 → softmax 成概率,另有「自己执行 / 转人工」头
训练
自称走 RLCD 思路:以严格恰当评分规则为奖励(只有报真实概率才拿满分)+ REINFORCE。TypeSafe 未公开配方,是否等同无法验证
检查点
英文版(512 上下文)/ 多语言版(mmBERT,1,024 上下文)/ 在基准训练集上微调过的 typed-decisions 版;内置路由按语言自动选
跑在哪
自有 GPU/CPU;Node.js(ONNX)与 Apple Core ML 移植,神经引擎上 p50 约 5 ms
模型卡的自我定位(意译):一个适合拿去做专门化的快速底座,不是零样本判断引擎。
import { choice, noul, score, TypeSafeClient } from '@typesafe-ai/sdk'

const client = new TypeSafeClient()
const { answers } = await client.systemOne({
  state: { ticket },                         // 材料:文本或 JSON
  questions: {
    severity: score('How severe?', [          // 打分题:3 档
      'Cosmetic', 'Workaround exists', 'Blocking',
    ]),
  },
})
两者的请求 / 返回形状基本一致——这就是「Jev 兼容」的含义。部分开源项目(如 SemIf、openjev-sglang)直接实现了 TypeSafe 的接口格式,换一个服务地址就能切换。
05 / 数据

硬碰硬:速度、准确率、校准

下列图表数据主要来自 Laya 模型卡与第三方评测,Jev 侧多为官方或被引用数字;测试条件并不完全相同,请当作方向参考。鼠标悬停可看细节。

单次判断要多久?

毫秒,越短越好

Laya 多语言版T4 GPU 本地 · 自测
32.8
Laya 英文版T4 GPU 本地 · 自测
39.5
Jev 官方典型跨网络 API · 美西
~100
Jev 第三方测被 Laya 模型卡引用
236–276
前沿 LLM官方对比口径
3,000 – 329,000 ms → 画不下(是 Laya 的约 90–10,000 倍)
0100200300
!
本地跑的 Laya 天然省掉网络往返,所以「Laya 比 Jev 快 7.8 倍」主要是部署方式的差别,不全是模型的差别。两者对比 LLM 都是数量级优势。

「类型化判断」基准准确率

400 个案例 · 2,000 个判断 · 越高越好 · 数据来源:Laya 模型卡

JevLaya(零样本,未针对这套题训练)Laya(用这套基准的训练集微调过 = 开卷考)
随机猜 0.318
永远猜最常见答案 0.461
Laya 多语言版
0.342
Laya 英文版
0.362
Jev 1.13.0
0.727
Laya typed-decisions微调过的版本
0.766
00.250.50.751.0
!
这张图最值得记住:Laya「超过 Jev」的 0.766 是开卷考成绩;不微调时只有 0.362,比「永远猜最常见答案」还低。Jev 则是不做任何训练、直接答题的 0.727。

公开数据集对比

准确率 · 数据来源:Laya 模型卡(路由模式)

JevLaya
AG News新闻 4 分类
0.91
0.95
DAIR Emotion情绪 6 分类
0.48
0.60
Banking7777 个意图
0.87
0.43
00.51.0
→
选项少时 Laya 能赢;选项一多(77 类)就掉到不到 Jev 的一半。

校准:嘴上的把握 vs 实际的命中

ECE(期望校准误差)· 越低越好

出厂用自己数据做温度校准后
Laya 英文版
Laya 多语言
00.250.5

Jev:官方尚未发布标准校准指标(第三方引用的 ECE 有 0.144 与 0.246 两种口径)。

?
校准=它说「80% 把握」的 100 次里,真的对了约 80 次。ECE 0.466 相当于平均虚报近 47 个百分点。最吓人的例子:Laya 英文版遇到高棉语,准确率 0%,却报 95% 把握。
Every 实测 · 37 篇文档找写作缺陷
6 / 7

Jev 找出 6 处,Claude Fable 5.1 找全 7 处;但 Jev 约快 25 倍、便宜 580 倍(单次约 0.7 秒)。

TypeSafe 自家 711 例工作流基准
67.8% vs 74.1%

Jev 聚合准确率低于对照前沿模型;发票场景差距最大(61.8% vs 79.1%)。且「标准答案」本身由 GPT-6 Astra 与 Claude Fable 生成。

早期客户反馈(TechCrunch)
5–20×

Vercel 处理耗时比 OpenAI 模型缩短 5–18 倍;Bryo AI 做邮件分类比 Gemini 便宜 10–20 倍。

一句话结论:Jev 用少量准确率,换来了两个数量级的速度和成本优势。适合「量大、容错、可兜底」的判断,不适合每一次都不能错的场景。
06 / 真相

宣传 vs 真相:六条说法逐一核对

两款模型都才发布一周多,营销声量远大于独立验证。

零幻觉
Jev 官方
◐部分成立

它不可能返回选项以外的值或格式错乱的结果——这是真的。但它可以在合法选项里选错,TypeSafe 自己也承认「类型安全 ≠ 正确」。

快 200 倍、便宜 400 倍
Jev 官方(193.6× / 444.6×)
◐上限口径

来自自家团队设计的 4 个工作流,对比的 LLM 大多关掉了推理模式;官方也承认复杂生产流程的提速会更温和。

概率是校准过的、诚实的
Jev 与 Laya
?待验证

Jev 尚未公布标准校准指标;Laya 出厂明显过度自信,需要你用自己的数据做温度校准才能用。

第一个 System One 模型
Jev 官方
◐品类新,技术不全新

BERT 类分类器、NLI 零样本分类早就「不生成文本」;约束解码(Outlines、Instructor)也能让普通 LLM 不出格式错。新意在于把通用零样本 + 多题并行 + 概率 + 统一 API 打包成一个产品。

Laya 比 Jev 快 7.8 倍,还更准
Laya 宣传
?需要打折

延迟对比不是同条件(本地 T4 vs 跨网络 API);「更准」来自在基准训练集上微调过的版本,零样本版低于多数类基线。

开源版复刻了 Jev
社区标题党
✕不成立

所有开源项目都只复刻了接口形态——没有任何人拿到 Jev 的权重或训练配方。多数项目的概率甚至没有校准。

07 / 场景

让它干什么,别让它干什么

经验法则:凡是「人看一眼就能判断」且量很大的事,都是它的主场;需要算、需要写、需要多步推理的,交给代码或 LLM。

工单分诊与路由

归哪个部门、急不急、要不要升级到人工。

内容风控

辱骂、垃圾信息、违规内容的实时标记,100ms 级别不打断用户体验。

Agent 守门员

「这条命令该不该放行?」「这段 LLM 输出是否越狱 / 是否合规?」

海量数据打标签

把判断 map-reduce 到整个数据集上。

官方案例:46 万篇论文 × 5 题 ≈ 230 万个判断

线索打分与筛选

销售线索、候选人、社区消息的批量初筛。

官方案例:700 条线索 40 秒,约 $0.09

事件与日志分诊

会话回放、报错日志里挑出真正的 bug、去重相似发票。

官方案例:300 万条回放事件 40 秒,约 $2.17

TypeSafe 自己列出的 9 个失败模式

官方原则:算术和日期交给代码;材料先过滤再喂;一道复杂判断拆成几道简单题,再在代码里加权组合。

  1. 只按字面理解读的是字面意思,不揣摩你的言外之意
  2. 数学与计数数个数、比大小都不可靠
  3. 把分数当测量值1.3 分不代表「比 1 分严重 30%」
  4. 日期计算日期比较、「上周三」这类相对时间不可靠
  5. 多跳间接引用要穿过好几层字段才找到答案时准确率下降
  6. 大量无关材料塞进太多不相关内容会拖累判断
  7. 指令与标准冲突题目说明和选项描述互相矛盾时会乱
  8. 硬要它写字强行让它产出文本效果很差
  9. 对抗性输入材料里藏着「请回答 A」一类诱导话术
08 / 怎么选

三道题,帮你选对工具

回答下面的问题,得到建议;右边是一张完整对比表。

维度JevLaya
开放程度闭源,仅托管 APIApache 2.0 开源权重胜
数据去向发到 TypeSafe 云端可完全本地 / 离线胜
成本$0.042/百万输入,输出免费只花自己的算力
延迟70–500 ms(含网络)5–40 ms胜
零样本0.727胜0.362(低于多数类基线)
微调不支持,靠改题目支持,且官方推荐
选项很多最多 255;Banking77 0.870胜Banking77 仅 0.425
上下文约 64K token胜512 / 1,024 token
多语言未明确公布多语言版 100+ 语言
校准自称校准,指标未发布出厂过度自信,需自行校准
成熟度早期访问、排队发布 5 天,社区项目
09 / 开源生态

开源阵营的三条路线

Latent Space 的标题是「两天冒出 6 个克隆」:Jev 发布后一周内,GitHub 上出现了几十个「开源 Jev」。它们证明了「判断不需要生成文字」,但没有一个复刻出 Jev 本体。

路线 A

专门训练一个小判断模型

拿编码器(BERT 类)或小模型,专门训练成「读材料 → 给选项打分」。又快又小,能本地跑。

代表:Laya、NanoJev、kev、decider
路线 B

冻结大模型,只「读」概率

不训练,拿现成开源 LLM 做一次前向计算,直接读出各选项的 token 概率,不往外生成任何字。

代表:SemIf(openjev)、openjev-sglang、mini-jev
路线 C

扩散 / 并行解码

用离散扩散模型一次「去噪」整块输出,从中直接读答案。与 Jev 的「并行采样」思路最接近,但工程上最折腾。

代表:openjev(DiffusionGemma)、MDLM 研究线
项目路线一句话
Layaconvaiinnovations/layaA本文主角:421M 编码器,Apache 2.0,登上 Hacker News;微调后强、零样本弱
SemIfTheoLeeCJ/openjevB冻结 Qwen3.5-4B 读 logit;LangChain 在 LangSmith Gateway 上免费托管一周;兼容 TypeSafe SDK,改一个字符串即可切换。X 上有人称它在 JevBench 上仅比 Jev 低 0.7 分(未验证)
NanoJevTianyuCodings/NanoJevA0.6B 从零训练,附带数据集和完整训练流程,最适合学习原理
openjevrazorback16/openjevC基于 DiffusionGemma,「读」答案而非「写」;依赖尚未合并的 vLLM PR,Mac 上 3 道题约 0.2–0.4 秒
Vonwfzyx/vonA自称 < 15 ms、49 项任务 71.5%(均为自报)
GLiClass / ModernBERT / SetFit老牌早已存在的零样本 / 微调分类器,Jev 宣传里速度和成本的对比基线;标签固定时依然最稳最省
社区整理的共识:这些克隆都证明了「判断不需要生成文字」「一次前向读概率就是更快」;但没有一个证明自己的概率是校准的,也没有一个是 Jev——因为 TypeSafe 没有公开训练配方。
10 / 启示

给产品经理的四点启示

1

先拆题:判断层 ≠ 表达层

自动化流程里大部分步骤其实是判断(路由、放行、打标、去重),只有少数需要写字。把判断交给 System One 模型、表达留给 LLM,成本结构会完全不同。

2

把置信度设计进产品

「高置信自动执行 / 中置信人工复核 / 低置信兜底」三车道是新的标准交互。阈值必须用自己的标注样本定,不能直接信模型报的概率。

3

护城河不在模型

开源社区三天就追上了接口形态。真正值钱、别人拿不走的,是你的标注数据、评测集和业务流程设计。

4

现在怎么动

挑一个量大、可容错的判断场景,准备 200–500 条带正确答案的真实样本;Jev 排队拿早期访问,同时本地跑 Laya / SemIf,对比准确率和校准后再决定。

来源

参考资料

资料检索于 2026-09-23。两款模型都发布不足两周,大部分性能数字来自厂商或项目方自报,尚无独立复现。

  1. Introducing System One Models & Jev — TypeSafe AI 官方博客
  2. A new kind of AI model from a ChatGPT inventor… — TechCrunch
  3. A deep dive into Jev — Flavio Copes(接口、限制、9 个失败模式)
  4. Jev Explained — Analytics Vidhya
  5. TypeSafe Jev Review — Kingy AI(准确率、校准质疑,引用 Every 实测)
  6. convaiinnovations/laya 模型卡 — Hugging Face
  7. Laya: The Open-Source Jev Alternative, Benchmarked Honestly — Flowtivity
  8. Convai ships Laya, a 421M ModernBERT decision model — AI Weekly
  9. Laya the open source version of Jev — Hacker News(hn.today)
  10. Jev alternatives — systemonemodels.org 开源项目目录
  11. Here are 6 Clones of Jev in 2 days — Latent Space
  12. Harrison Chase 关于 SemIf 的推文 — X
  13. razorback16/openjev — GitHub(DiffusionGemma 路线)