---
title: "Jev 决策模型专题：原理、JevBench 榜单与类 Jev 开源 API|万维易源ShowAPI"
canonical_url: "https://www.showapi.com/ai/jev"
last_updated: 2026-09-29
meta:
  description: "Jev 是 TypeSafe AI 发布的 System One 决策模型：输入非结构化状态，输出带校准概率的类型化决策。本专题整理 Jev 原理、适用范围与边界、JevBench 独立榜单、开源替代对比与价格，并提供类 Jev 开源决策模型 API 与游戏体验入口。"
  keywords: "Jev 决策模型, System One 模型, 类 Jev 开源模型, JevBench 榜单, Jev 开源替代, 决策模型 API"
  "og:description": "Jev 是 TypeSafe AI 发布的 System One 决策模型：输入非结构化状态，输出带校准概率的类型化决策。本专题整理 Jev 原理、适用范围与边界、JevBench 独立榜单、开源替代对比与价格，并提供类 Jev 开源决策模型 API 与游戏体验入口。"
  "og:title": "Jev 决策模型专题：原理、JevBench 榜单与类 Jev 开源 API|万维易源ShowAPI"
---

*

*

*

System One 决策模型 · 专题  数据更新于 2026-09-29

# Jev 决策模型：原理、独立榜单与类 Jev 开源 API

Jev 输入非结构化状态，输出带校准概率的类型化决策，不生成文本。本专题整理它的工作方式、适用边界、JevBench 独立榜单、开源替代与价格，并提供类 Jev 开源决策模型 API 与游戏体验入口。

非官方第三方专题，与 TypeSafe AI 无隶属、合作或背书关系。

体验模型控制的游戏  看第三方榜单

ChoiceScoreNoul

示意数据，非真实输出

state: “Customer emailed twice this week about a failed refund…”

这封客户邮件应该转给哪个团队？

- 退款处理71%
- 账单争议19%
- 技术支持7%
- 其他3%

选中「退款处理」· 置信度 0.71

<dl>

<dt>JevBench 收录系统</dt>
<dd>95个</dd>

v1.4.2.2 版本，其中 91 个已排名

独立第三方

<dt>前十名中的开源模型</dt>
<dd>8/ 10</dd>

另有 1 个未标注开放状态

独立第三方

<dt>官方 Jev 综合名次</dt>
<dd>第 4名（63.29 分）</dd>

四轴等权调和平均，含成本与速度

独立第三方

<dt>官方输入价</dt>
<dd>$0.042/ 百万 token</dd>

输出免费；厂商公布价，可持续性未证实

官方口径

</dl>

## 30 秒速答

<dl>

<dt>它是什么</dt>
<dd>输入文本/JSON 状态，输出带校准概率的类型化决策，而非生成文本。</dd>

<dt>适合谁</dt>
<dd>有界选项上的语义判断：分类、路由、打分、核对；高频、低延迟、成本敏感。</dd>

<dt>局限</dt>
<dd>官方自陈 9 类失败模式（字面理解、数学与数字、日期时间比较）；不做文本生成。</dd>

<dt>榜单现状</dt>
<dd>JevBench v1.4.2.2（95 个系统）：前十名 8 个为开源（另 1 个未标注）；官方 Jev 排第 4。</dd></dl>

### 吃豆人Pac-Man

吃光豆子，躲开幽灵

<dl>

<dt>决策形态：</dt>
<dd>每个路口选一个方向</dd>

<dt>可选动作：</dt>
<dd><code>上 / 左 / 下 / 右</code></dd>

<dt>约束：</dt>
<dd>只列出此刻合法的方向，来路不算；模型无法回答「穿墙」</dd>

<dt>模型读到：</dt>
<dd>最近豆子、6 格内豆子、最近能量豆、最近危险幽灵等 8 项</dd></dl>

答题窗口500 ms

提前 3 格提问，即吃豆人走完这 3 格的时间；迟到的答案作废

- 答案在吃豆人进入路口时才生效，中途换主意不算
- 幽灵 AI 为近似实现，不复刻街机版的行为个性

[立即体验](https://www.showapi.com/ai/jev/game/pacman?from=jev-topic)

### 贪吃蛇Snake

吃食物、变长，别撞墙也别咬到自己

<dl>

<dt>决策形态：</dt>
<dd>每一步选一个方向</dd>

<dt>可选动作：</dt>
<dd><code>上 / 右 / 下 / 左</code></dd>

<dt>约束：</dt>
<dd>不提供 180° 掉头；撞墙、咬到自己这类致命方向照样是可选项</dd>

<dt>模型读到：</dt>
<dd>立刻致命、该方向可达空格数、距食物（格）、是否沿当前朝向等 6 项</dd></dl>

答题窗口500 ms

一步的时长，这一步内没答上就走回退规则；对响应速度要求最高

- 每一步都要一个新方向，模型的答题时间就是这一格的时长
- 致命方向也会给出，看模型是否真的避开

[立即体验](https://www.showapi.com/ai/jev/game/snake?from=jev-topic)

### 俄罗斯方块Tetris

接住下落的方块、消行，别堆到顶

<dl>

<dt>决策形态：</dt>
<dd>每个方块选一个落点</dd>

<dt>可选动作：</dt>
<dd><code>每块通常有 17–34 个落点（列 × 旋转）</code></dd>

<dt>约束：</dt>
<dd>答案是最终落点而不是逐步操作，转向与平移由系统执行</dd>

<dt>模型读到：</dt>
<dd>落点列位、落点行位、消行数、洞数变化等 13 项</dd></dl>

答题窗口整段下落

出生即提问，落地前答案都有效（空盘约 10 秒，随堆高与速度缩短）

- 一次决策就是一次布局，答案空间比方向键大得多
- 答案一到，方块自动转向、平移并加速下落

[立即体验](https://www.showapi.com/ai/jev/game/tetris?from=jev-topic)

### 2048

滑动并合并相同数字，合出 2048

<dl>

<dt>决策形态：</dt>
<dd>每一步选一个滑动方向</dd>

<dt>可选动作：</dt>
<dd><code>上 / 右 / 下 / 左</code></dd>

<dt>约束：</dt>
<dd>只提供会改变盘面的方向，滑不动的方向不是选项</dd>

<dt>模型读到：</dt>
<dd>合并得分、合并次数、滑后空格、滑后最大块等 5 项</dd></dl>

答题窗口500 ms

每回合的思考时限，超时走回退规则；盘面本身不会自己推进

- 回合制没有时钟，时间压力完全来自 500 ms 的思考时限
- 合出 2048 即算通关，本局结束

[立即体验](https://www.showapi.com/ai/jev/game/2048?from=jev-topic)

### Flappy Bird

点一下上升，穿过管道缝隙，别落地也别撞管

<dl>

<dt>决策形态：</dt>
<dd>每半秒选一次：拍，还是不拍</dd>

<dt>可选动作：</dt>
<dd><code>拍 / 不拍</code></dd>

<dt>约束：</dt>
<dd>只有一个按钮，两个选项任何时候都合法</dd>

<dt>模型读到：</dt>
<dd>下一拍致死、拍末高度、拍末速度、距缺口中心等 5 项</dd></dl>

答题窗口500 ms

一拍的时长；答案在拍末生效，读数描述的是那一刻的小鸟，而不是提问时刻的

- 物理已调成约原版重力的五分之一，让「半秒一次决策」成为可控的步长
- 撞管或落地才结束，每穿过一根管道得 1 分

[立即体验](https://www.showapi.com/ai/jev/game/flappy?from=jev-topic)

除俄罗斯方块外，各游戏在 1× 速度下的答题窗口都是 500 ms；速度档（0.5× / 1× / 2×）会等比放宽或压缩窗口，因此只有同为 1× 的对局才可横向比较。

### 游戏是怎么被模型控制的

1. 1游戏引擎

   固定 60Hz 步进，永不等待网络
2. 2类型化读数

   局面转成数字与枚举读数，不用截图，也不是自由文本
3. 3服务端模板

   读数在服务端填入提问模板，页面无法自行改写指令
4. 4决策模型

   在合法选项上给出概率分布
5. 5合法动作

   选中一个动作交还引擎；答案迟到则走回退规则

**设计原则：**算术交给代码，选择交给模型。代码从不给动作打分来推翻模型——否则就成了启发式在玩，模型的答案只是装饰。

控制模式：模型决策手动随机启发式（可对照人手、随机与启发式，直观看出模型决策的差别）

控制台实时显示：各选项的概率与模型置信度响应延迟（均值 / p50 / p95）每次决策依据的读数采纳 / 回退 / 迟到答案计数整局导出为 JSON

<details>

<summary>各游戏的回退规则展开查看</summary>



答案迟到、非法或缺失时，游戏不会停下等待，而是走下面这些刻意写得很简单的规则；每一次回退都会在控制台里标为 FALLBACK，并与采纳次数并排显示。

<dl>

<dt>吃豆人</dt>
<dd>保持当前朝向（若合法）→ 唯一其他出口 → 离最近危险幽灵最远的方向 → 固定顺序 上、左、下、右</dd>

<dt>贪吃蛇</dt>
<dd>保持朝向（若安全）→ 唯一安全方向 → 可达空格最多的安全方向 → 全部致命时保持朝向</dd>

<dt>俄罗斯方块</dt>
<dd>落定后堆高最低的落点 → 新增洞最少 → 按固定顺序取第一个</dd>

<dt>2048</dt>
<dd>角落优先：下 &gt; 左 &gt; 右 &gt; 上</dd>

<dt>Flappy Bird</dt>
<dd>向前推演一拍，选更靠近下一缺口中心的动作；并列时选「不拍」</dd>

</dl>

</details>

游戏控制台里的采纳率、延迟等数字是当前这一局的实时记录，受所选模型版本、速度档与网络影响，不代表模型的一般表现。

5 款游戏均基于开源项目：1 款以上游代码为起点并做了修改，4 款参考了上游的玩法规则，引擎与界面为重写。游戏画面在浏览器里绘制、音效由浏览器合成，不携带街机原版的图片与音频素材。

<details>

<summary>开源致谢查看上游项目</summary>



- #### 吃豆人代码源自MIT [~~tetsuya-dev-jp/jev-pacman~~（在新窗口打开 GitHub 仓库）](https://github.com/tetsuya-dev-jp/jev-pacman)

  迷宫、寻路、幽灵、移动与碰撞、画布渲染、合成音效，以及模型决策控制器的最初实现；此后经过修改与扩展。

  作者 tetsuya-dev-jp
- #### 贪吃蛇玩法参考MIT [~~patorjk/JavaScript-Snake~~（在新窗口打开 GitHub 仓库）](https://github.com/patorjk/JavaScript-Snake)

  玩法规则、方向编码与方向位移常量；引擎与渲染为重写，食物放置改用可复现的种子随机数。

  作者 Patrick Gillespie
- #### 俄罗斯方块玩法参考MIT [~~jakesgordon/javascript-tetris~~（在新窗口打开 GitHub 仓库）](https://github.com/jakesgordon/javascript-tetris)

  玩法规则、七种方块的 16 位位图表与下落速度曲线；引擎与渲染为重写，随机数改用可复现的种子实现。

  作者 Jake Gordon
- #### 2048玩法参考MIT [~~gabrielecirulli/2048~~（在新窗口打开 GitHub 仓库）](https://github.com/gabrielecirulli/2048)

  玩法规则（滑动、合并、计分、终局）与键位约定；引擎与渲染为重写，配色按深色界面重新设计。

  作者 Gabriele Cirulli
- #### Flappy Bird玩法参考未声明许可 [~~CodeExplainedRepo/Original-Flappy-bird-JavaScript~~（在新窗口打开 GitHub 仓库）](https://github.com/CodeExplainedRepo/Original-Flappy-bird-JavaScript)

  仅参考玩法规则。未使用其图片与音频：画面为矢量重绘，音效为合成，代码为重写。

  作者 CodeExplainedRepo

[~~版权行与许可全文：游戏站首页「开源致谢」~~（在新窗口打开）](https://www.showapi.com/ai/jev/game/#credits)

「Pac-Man」「Tetris」「Flappy Bird」等游戏名称归各自权利人所有；开源许可只覆盖代码，不覆盖名称与商标。

</details>

即将上线

### 类 Jev 开源决策模型 API 正在准备中

- 上线后，本页会自动展示模型卡片：许可、参数规模、榜单名次、价格与接入方式。
- 榜单名次一律引用独立第三方 JevBench，并标注口径，不做自说自话的对比。
- 仅提供 API 调用，模型在平台侧运行；不提供权重下载，也不支持自托管部署。
- 在此之前，可以先在游戏里感受模型实时决策的响应速度与稳定性。

先去体验游戏

把非结构化状态（文本/JSON）送进去，出来的是带校准概率的类型化决策——不是生成的字符串。

> Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.

**核心押注：**很多被包装成「聊天」的需求，本质是有界空间上的结构化决策（分类、路由、打分、校验）。把这类决策从生成式模型里剥离出来单独优化，可以用极小成本换到可用精度。

### 架构与训练主张 厂商主张，未经独立验证

- 新模型架构 + 并行采样器（parallel sampler）：所有输出在一次查询内并行产生，而非逐 token 自回归
- 训练方法 RLCD（Reinforcement Learning for Calibrated Decisions，校准决策强化学习）——直接对标 RLHF / RLVR
- 并行解码 ⇒ 端到端延迟 70–500ms；输入计费 $0.042/百万 token，输出免费
- 官方称输出结构由 schema 约束，故类型错误与结构错误在数学上不可能发生（0%）

### 版本别名会漂移

- `jev-latest` → `jev-1.13.0`：最新稳定正式版；官方 SDK 默认值
- `jev-preview` → `jev-1.13.0`：最新版本（含预览版）；当前与 jev-latest 同指

做可比测试请固定版本号（如 jev-1.13.0），不要使用会随新版本漂移的 jev-latest 别名。

### 三种原语：它能被问哪几种问题

#### Choice

<dl>

<dt>问：</dt>
<dd>从给定选项集中选一个</dd>

<dt>答：</dt>
<dd>全部选项上的概率分布 + 选中项的置信度</dd></dl>

选项集由调用方定义；支持基数最高 255（更高基数官方做两阶段打分再显式选择）

- 工单分类
- 意图路由
- 标签选择
- 枚举抽取

#### Score

<dl>

<dt>问：</dt>
<dd>在一组带描述的数值档位上打分</dd>

<dt>答：</dt>
<dd>沿评分档位的浮点分数</dd>

</dl>

官方明确警告：score 的数值校准较弱，不要用它在两档之间插值还原精确数值，只适合过阈值判断

- 紧急度分级
- 严重度评分
- 风险分层

#### Noul

<dl>

<dt>问：</dt>
<dd>对一个陈述给出是/否判断</dd>

<dt>答：</dt>
<dd>P(true) 的浮点概率（0–1）</dd></dl>

名称源自 Bernoulli 分布（伯努利）。官方在 HN 上确认了该词源；文档未解释自造词曾引发社区批评

- 相关性过滤
- 垃圾/钓鱼判定
- 护栏校验
- RAG 段落筛选

### 决策模型 vs 前沿 LLM：九个维度

官方对比表（厂商口径）

决策模型与前沿 LLM 九维对比

| 维度 | 前沿 LLM（GPT-5.6 / Opus 5 一类） | Jev（System One） |
| --- | --- | --- |
| 优化方法 | RLHF / RLVR（人类偏好 / 可验证奖励） | RLCD（校准决策强化学习） |
| 优化目标 | 人类评分者偏好的聊天与写作；可被程序验证的输出 | 在 System One 任务上给出「认知诚实」的概率 |
| 输入侧重 | 非结构化数据，强调顺序消息 | 非结构化数据，强调结构化程序状态 |
| 输出 | 字符串（需解析 + 校验；可能幻觉/拒绝/跑偏） | 类型安全的结构化值（输出空间预定义；全量概率 + 置信度） |
| 采样 | 顺序式，逐 token、以上一个 token 为条件 | 并行式，单次查询生成全部输出；硬件感知、极高效率 |
| 成本 | 输入 $0.20–$10 / Mtok；输出约为输入 5 倍 | 输入 $0.042 / Mtok；输出免费 |
| 速度 | 端到端 3–329 秒 | 端到端 70–500 毫秒（同等级 System One 任务下快 40×–200×） |
| 置信度 | 被要求也往往过度自信且不一致；无法说明自己何时处于 5% 失败区 | 每个输出都带置信度；校准：更高置信度对应更高准确率；对相近输入更一致 |
| 典型用途 | 人机协同（聊天、copilot、编码 agent）、可验证问题、原型、需要理由的多步推理 | AI 工作流 / 智能 if 语句、大数据 map-reduce、实时应用、LLM 输出校验与护栏 |

### 请求长什么样

一次请求可以同时问多个问题，每个问题声明自己的类型；返回值是类型安全的结构化结果。以下为官方示例（接口：`POST https://api.typesafe.ai/v1/systemone`）。

```
import requests

response = requests.post(
    "https://api.typesafe.ai/v1/systemone",
    headers={"Authorization": "Bearer YOUR_KEY"},
    json={
        "model": "jev-latest",
        "state": "Customer emailed twice this week about a failed refund...",
        "questions": {
            "category": {"type": "choice", "options": ["billing", "technical", "sales"]},
            "urgency": {"type": "score", "min": 0, "max": 100},
        },
    },
)
print(response.json())
```

### 官方定义的场景（4 类）

官方口径

#### AI 工作流 / 智能 if 语句

结构化输出像「模糊决策规则」插进普通软件：分类、路由、打分、抽取、分支，替代过于脆弱的硬编码逻辑。

#### 大数据的 map-reduce

把海量数据转成特征与洞察；官方发布文章举例，给 5000 万行评论打分约 $20。

#### 实时应用

低延迟让 AI 可以进入对响应时间敏感的用户路径。

#### 校验一切

对 LLM 的 prompt、推理链、输出做打分、评判、验证、护栏与越狱检测。

### 按应用领域浏览（14 类）

分类沿用社区 awesome-jev

分类与路由校验与护栏打分与排序自适应与实时界面Agent 决策数据标注与治理评估与基准校准与研究基础设施 / SDK / 集成游戏与仿真机器人与物理世界金融与交易合规与法务内容审核

#### 分类与路由

Classification & Routing

**适配说明：**最强场景。有界标签集上的语义判断

- [Notra（生产环境）](https://github.com/usenotra/notra)

  营销 GEO 平台用 NOTRA\_JEV\_CLASSIFIERS 开关把品牌可见度分类器从 LLM 换到 Jev 的 Boolean 决策，阈值 0.5，目标 p50 300ms
- [jev-router](https://github.com/gargpratyush/jev-router)

  让 Jev 在候选模型里挑最便宜可用的，把 Claude Code 任务路由过去
- [jev-cookbook](https://github.com/nexibeo/jev-cookbook)

  15 个可运行 Node 配方：工单路由、文档归档、银行流水归类、Gmail 打标，低置信度转人工
- [typesafe-jev CV screener](https://github.com/gtaras7/typesafe-jev)

  按可编辑策略对一文件夹简历做类型化判断，策略变更后免费重打分
- [jev-logtriage](https://github.com/jyatesdotdev/jev-logtriage)

  把折叠后的 Loki 日志合成一次调用（Noul+Score+Choice），代码把答案映射为抑制/观察/复核/通知/告警，低置信度走复核且不执行任何动作

### 9 类已知失败模式

官方自陈

- #### 1 字面理解

  只回答你写下的问题，不回答你想问的问题；限定词、否定、隐含条件按字面处理

  **规避：**把确切条件写进 instructions，边界情况写进 criteria；必要时拆成两个字面问题在代码里组合
- #### 2 数学与数字

  不是计算器；计数不可靠（字符数、出现次数、长列表项数），误差随规模增大；数值/二进制表示（hex、RGB、汇编）比语义表示差得多；不要用 score 插值还原精确数值

  **规避：**算术一律放代码；计数用代码迭代 + 每项一个 Noul 再自行求和；颜色等先转成语义名或分桶
- #### 3 日期时间比较

  把日期当文本读，不当作有序量；判断先后、间隔、是否落在窗口内都不可靠，混格式与季度/结算窗口等业务边界更糟

  **规避：**抽取交给模型（每个部分都是小闭集：12 月 / 31 日 / 有界年范围 ⇒ 用 Choice 枚举 + 显式「未给出」选项），排序、时长、偏移、星期一律代码算
- #### 4 多跳与间接性

  双重否定、复杂间接、需要多层推理的问题准确率下降（System Two 任务）

  **规避：**指令写直接；尽量按名字指明 state 中相关部分
- #### 5 无关细节堆砌的大 state

  state 越大且越含无关内容，准确率越低（context rot），且更难定位错误来源

  **规避：**先在代码里检索过滤，只送问题需要的字段；无法过滤时可用 Noul 先做相关性过滤
- #### 6 对抗内容

  state 被视为数据而非敌意输入；注入指令、误导性框定、自我辩护式文本都能推动答案

  **规避：**criteria 写明确；面向多用户前做充分边界测试
- #### 7 指令与判据冲突

  instructions 与 criteria 要求不一致时会混乱（例如 true 映射到「否」的 Noul 表现更差）

  **规避：**把 criteria 当作 instructions 的延伸，用清晰精确的语言对齐二者
- #### 8 常识性结构不变式不成立

  模型极其一致（语义相近输入给出量化相近输出），但不保证你想象的恒等式：同一问题问成 Noul 和 yes/no Choice 结果不可互推；P(x) 与 1-P(¬x) 之和可能不为 1（实测 0.72+0.47=1.19）

  **规避：**不要依赖期望的结构不变式；问题措辞直接表达意图；Noul 上调好的阈值不要搬到 Choice 上；不要对分开的问题施加算术恒等式
- #### 9 文本生成

  未训练生成文本；靠链式 choice 强行生成效果差且极慢

  **规避：**答案空间有界时，把抽取转成对候选的 Choice；确实需要生成就用别的模型

### 官方明确不建议的用法

- 问模型任何代码能精确算出的东西
- 把一个问题的多个判断藏在一起（应拆成原子问题）
- 让它做 System Two 任务（更多层间接推理）
- 给 state 塞超出问题所需的上下文（context rot 会吃掉准确率）

独立第三方

JevBench v1.4.2.2 · 生成于 2026-09-27 · 收录 95 个系统（91 个参与排名）

榜单方：Benchmark Heaven（独立第三方；与 TypeSafe AI 无隶属或背书关系）。与 TypeSafe AI 无隶属、无背书关系（榜单方声明）。 [~~查看在线榜单~~](https://benchmarkheaven.com/jev-models)

成本单位：美元 / 1,000 次决策（注意：不是每 1,000 token；一次决策 = 一道完整问题，含 state + rubric + options，约数百到数千输入 token）

<details>

<summary>榜单口径与局限（4）</summary>



- 242 / 534 条决策属试点规模，不是普查；仅英文，原始用例短且手写
- held-out 样本会发给被评测服务以获取预测；「未公开」≠「未见」，不构成污染证明
- 延迟来自德国单一出口的单一时刻；自托管与 demo 端点的延迟被乘 2 并 +0.15s（榜单方声明为「假设而非测量」）
- 「运行他人模型的服务」只列不排名（避免同一模型按两个价格出现两次）

</details>

### 成本-分数 Pareto 图

独立第三方

*图中共 89 个系统（需同时有成本与分数才能绘制）。官方 Jev 位于成本 $0.04、分数 63.29；越靠左上，成本越低且分数越高；气泡越大，延迟越低。成本有估算与实付两种口径，不可直接横比；延迟为榜单方按「自托管 ×2 + 0.15s」调整后的假设值，不是实测。*

<details>

<summary>查看图表数据（分数前 10；完整数据见下方榜单）</summary>



成本-分数图数据表（分数前十）

| 模型 | 分数 | 成本 / 千次 | p50 延迟 |
| --- | --- | --- | --- |
| Imajev-4B | 67.37 | $0.022 | 229 ms |
| Plumb-4B | 65.84 | $0.03 | 183 ms |
| decider-4b v2 | 64.13 | $0.02 | 185 ms |
| Jev 1.13.0 | 63.29 | $0.04 | 652 ms |
| JevK5 v0.2.0 | 62.04 | $0.022 | — |
| Cygnet | 61.76 | $0.037 | 220 ms |
| Hopper | 59.43 | $0.024 | 408 ms |
| Winnow-12B Q8 | 55.58 | $0.037 | 600 ms |
| reflex 4B | 53.99 | $0.022 | 3749 ms |
| djev | 52.23 | $0.026 | 237 ms |

</details>

### 四轴雷达：官方 Jev 与前三名开源模型

独立第三方

*四轴（智能、校准、速度、成本，越大越好）对比：Jev 1.13.0、Imajev-4B、Plumb-4B、decider-4b v2。综合分是四轴等权调和平均，智能低于 50 时额外惩罚；只看智能一项，排序会不同。*

<details>

<summary>查看图表数据</summary>



四轴雷达图数据表

| 模型 | 智能 | 校准 | 速度 | 成本 |
| --- | --- | --- | --- | --- |
| Jev 1.13.0 | 53.1 | 76.3 | 83.3 | 52 |
| Imajev-4B | 52.2 | 80.4 | 90.6 | 59.7 |
| Plumb-4B | 53 | 75.5 | 93.5 | 55.8 |
| decider-4b v2 | 49.4 | 75 | 92.9 | 60.9 |

</details>

### 完整榜单

仅看开源 显示 20 / 91

JevBench 榜单

| 名次  | 模型 | 类型 | 开放状态 | JevBench 分数  | 成本 $/千次  | p50 延迟（调整后） |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | Imajev-4B | jev-rebuild | 开源 | 67.37 | $0.022 估算 | 229 ms |
| 2 | Plumb-4B | jev-rebuild | 开源 | 65.84 | $0.03 估算 | 183 ms |
| 3 | decider-4b v2 | system-one-open | 开源 | 64.13 | $0.02 估算 | 185 ms |
| 4 | Jev 1.13.0 官方 | jev | 闭源 | 63.29 | $0.04 实付 | 652 ms |
| 5 | JevK5 v0.2.0 | jev-rebuild | 未标注 | 62.04 | $0.022 估算 | — |
| 6 | Cygnet | system-one-open | 开源 | 61.76 | $0.037 估算 | 220 ms |
| 7 | Hopper | jev-rebuild | 开源 | 59.43 | $0.024 估算 | 408 ms |
| 8 | Winnow-12B Q8 | jev-rebuild | 开源 | 55.58 | $0.037 估算 | 600 ms |
| 9 | reflex 4B | jev-rebuild | 开源 | 53.99 | $0.022 估算 | 3749 ms |
| 10 | djev | jev-rebuild | 开源 | 52.23 | $0.026 已公布 | 237 ms |
| 11 | Jev-Omni | jev-rebuild | 开源 | 51.34 | $0.037 估算 | 584 ms |
| 12 | metask-jev-4b | jev-rebuild | 开源 | 47.78 | $0.033 估算 | 281 ms |
| 13 | SemIf, formerly OpenJev | jev-rebuild | 开源 | 47.69 | $0.022 估算 | 546 ms |
| 14 | Jobe Qwen3.5-4B | native-logit | 开源 | 46.94 | $0.022 估算 | 419 ms |
| 15 | local-jev Qwen3.5-4B | jev-rebuild | 开源 | 46.8 | $0.03 估算 | 1565 ms |
| 16 | system-one-open | jev-rebuild | 开源 | 45.11 | $0.015 估算 | 1304 ms |
| 17 | spark-s1-4b-v6 | jev-rebuild | 开源 | 44.62 | $0.025 估算 | 779 ms |
| 18 | Malkuth-4B | jev-rebuild | 开源 | 44.45 | $0.019 估算 | 327 ms |
| 19 | jqv | jev-rebuild | 开源 | 44.35 | $0.056 估算 | 1645 ms |
| 20 | Qwen3-Reranker-4B | reranker | 开源 | 43.49 | $0.05 实付 | 411 ms |

「其他」类型含 LLM 基线、分类器等对照系统；LLM 在该榜单上分数偏低是评测设计使然，不能据此推断其通用能力。

展开全部 91 个系统

### 口径警示：Laya 是最典型的「口径决定结论」案例

Laya 官方报告称其在 2,000 条 typed decisions 上以 0.766 胜过 Jev 1.13.0 的 0.727，并在延迟（32.8ms vs 236–276ms）、成本（$0 自托管）、开放性上领先。但在 JevBench v1.4.2.2 的独立协议下，Laya 只排第 43（30.25 分），p50 延迟 1,724ms。

**为什么会这样：**① Laya 的 0.766 是「在 benchmark 训练集上微调过」的 checkpoint，零样本基座只有 0.362，低于多数类基线 0.461；② JevBench 把 Laya 跑在评测方自己的 CPU（4 线程）上并施加 ×2+0.15s 延迟调整，而 Laya 自测是在 T4 GPU 上；③ 双方都未在同一批次同硬件下互测。

任何决策模型的选型都应先在自己流量上按统一口径实测，再定阈值。

厂商自评

### 厂商自评：4-workflow 决策准确率

以下全部来自 TypeSafe AI 自家评估，截至 2026-09-29 无大规模独立复现。DataCamp 亦明确提醒「在有中立测试台复现前，应视为有前景但未定论」。

*厂商自评：Jev (TypeSafe) 准确率 67.8%、每案例 $0.0004；GPT-5.6 Terra 准确率 67.9%、每案例 $0.03；GPT-5.6 Sol 准确率 74.1%、每案例 $0.084；Claude Opus 5 准确率 73.1%、每案例 $0.18。成本使用对数轴。*

**评测方法：**4 个 workflow（安全事件响应、agent-trace 可观测性、发票处理、客户服务）；以最大最强外部模型（GPT-6 Astra 与 Anthropic Fable 5.1）的平均预测为参考答案，比较每个模型与参考答案的一致率

**厂商解读：**Jev 与 Terra 准确率基本持平（67.8% vs 67.9%），但每案例成本约为其 1/76、快约 25×；Sol 与 Opus 5 保持 5–6 个百分点的真实优势——需要峰值准确率时 LLM 仍胜出。

厂商自己承认的偏差

- workflow 由厂商自己的模型能力团队编写，可能存在偏差
- 参考答案取自 OpenAI 与 Anthropic 模型，偏向这两家，可能低估 Jev 与 DeepSeek 的相对表现
- 参与对比的 LLM 通过 TypeSafe 开源的 system-one adapter 运行，强制其输出结构化决策（更慢更贵）

厂商自评数据表

| 模型 | 准确率 | 每案例成本 | 延迟 |
| --- | --- | --- | --- |
| Jev (TypeSafe) | 67.8% | $0.0004 | 0.4s |
| GPT-5.6 Terra | 67.9% | $0.03 | 10.1s |
| GPT-5.6 Sol | 74.1% | $0.084 | 23.3s |
| Claude Opus 5 | 73.1% | $0.18 | 37.8s |

<details>

<summary>更多厂商自评细节：结构化输出错误率、宣传数字与前提展开查看</summary>



#### 结构化输出错误率 厂商自评

结构化输出与工具调用错误率

| 模型 | schema 错误率 | 工具调用错误率 |
| --- | --- | --- |
| Jev (TypeSafe) | 0.00% | 0.00% |
| OpenAI luna | 0.58% | — |
| OpenAI terra | 0.58% | — |
| Anthropic Opus 5 | 5.73% | — |
| Claude Haiku 4.5 | 45.50% | — |
| GPT-5.6 Sol | — | 17.00% |

LLM 侧数字取自 OpenRouter 统计，官方承认存在路由偏差（更复杂的 query 可能被路由到更好的模型）；Jev 的 0% 不是经验测量，而是由 schema 匹配保证，故在图中直接加 0。

#### 首页宣传数字与它们的前提

- 速度快 厂商自述

  同等级 System One 任务下快 40×–200×；首页宣称 193.6× 更快

  前提与保留：首页数字来自厂商 4-workflow 评测，厂商自称处于真实收益的高位区间
- 成本低 厂商自述 + 公开价目

  首页宣称 444.6× 更便宜；输入 $0.042/Mtok、输出免费

  前提与保留：厂商承认无法证明定价未获补贴，长期可持续性待验证
- 端到端延迟 厂商自述

  70–500ms

  前提与保留：厂商评测多在其美西笔记本上运行；第三方独立测得的 Jev 延迟为 236–276ms（Laya 报告口径）
- 大数据 map-reduce DataCamp 转述官方定价模型

  每案例约 $0.0004；5000 万行评论打分约 $20

  前提与保留：按厂商输入费率推算，未含工程与重试成本

</details>

榜单数据：JevBench 独立协议成本多为估算

同类决策模型横向对比

| Model | 厂商 / 作者 | 类型 | 开源 | 许可 | 参数量 / 基座 | JevBench 排名 | JevBench 分数 | p50 延迟(调整后) | 成本 $/千次决策 | 成本口径 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Jev 1.13.0 | TypeSafe AI | 官方闭源决策模型 | 否 | 专有 API | 未公开 | 4 | 63.29 | 652.4 ms | $0.04 | measured（实付） |
| Imajev-4B | mohit67890 | jev-rebuild | 是 | Apache-2.0 | 4B 级（Qwen3.5-4B 基座） | 1 | 67.37 | 229.2 ms | $0.022 | estimate |
| Plumb-4B | crh225 | jev-rebuild | 是 | Apache-2.0（权重+代码） | 4B（JevK5 v0.2 + LoRA） | 2 | 65.84 | 182.9 ms | $0.03 | estimate |
| decider-4b v2 | Mapika | system-one-open | 是 | Apache-2.0 | 4B | 3 | 64.13 | 185.0 ms | $0.02 | estimate |
| JevK5 v0.2.0 | crh225 | jev-rebuild | 部分 | 见来源 | 4B 级 | 5 | 62.04 | — | $0.022 | estimate |
| Cygnet | blockbrain | system-one-open | 是 | shim MIT / 权重 Apache-2.0(Google) | frozen Gemma-4-12B-it | 6 | 61.76 | 220.4 ms | $0.037 | estimate |
| Hopper | — | jev-rebuild | 是 | 组件级条款见来源 | — | 7 | 59.43 | 407.6 ms | $0.024 | estimate |
| Winnow-12B Q8 | — | jev-rebuild | 是 | 见来源 | 12B（Q8） | 8 | 55.58 | — | $0.037 | estimate |
| reflex 4B | kshetrajna12 | jev-rebuild | 是 | MIT 代码 / Apache-2.0 基座 | 4B | 9 | 53.99 | 3749.4 ms | $0.022 | estimate |
| djev | Maisa | jev-rebuild | 是 | Apache-2.0 代码 + Google DiffusionGemma 权重 | diffusion-gemma | 10 | 52.23 | 237.1 ms | $0.026 | announced（免费预览） |

当前展示 10 个系统，共 24 个。

展开其余 14 个系统

<details>

<summary>如何读这张表（口径说明）</summary>



- 表内 JevBench 排名/分数/延迟/成本均取自 v1.4.2.2（2026-09-27 生成），逐行明细见 jevbench.json。
- 「estimate」= 按相同权重或同规模模型的托管商公开价估算，不是 GPU 账单；「measured」= 公开费率 × 实测 token；「announced」= 提供方已公布但尚未实际收费。
- LLM 基线在 JevBench 上分数普遍很低，这是设计使然：该榜施加了与 Jev 相同的结构化决策约束，LLM 在此形态下并不擅长。不要据此推断 LLM 的通用能力。

</details>

### 口径警示：延迟列不可跨口径比

JevBench 对自托管与 demo 端点统一施加 ×2 + 0.15s 调整（榜单方明确标注为「假设而非测量」），官方 API 不加。因此 Jev 的 652ms 与开源模型的 183–230ms 不是同一量纲。

厂商公布的 70–500ms、第三方报告的 236–276ms、JevBench 的 652ms 三者口径都不同。

### 口径警示：厂商自评需与独立榜单分开看

TypeSafe 的 4-workflow 评测（Jev 67.8% 与 GPT-5.6 Terra 67.9% 持平）为厂商自建、自选 workflow，厂商亦承认存在偏差。截至 2026-09-29 尚无大规模独立复现。

另见榜单章的口径警示：Laya 是最典型的「口径决定结论」案例

### 主要开源替代：各自赢在哪、输在哪

#### Laya（Convai Innovations）

最知名的开源 Jev 替代，Apache-2.0，421M

2026-09-18 发布（Jev 发布后第 3 天）。三个 checkpoint：laya（ModernBERT-large，421M，512 token 上下文）、laya-multilingual（mmBERT-base，322M，1024 token，100+ 语言）、laya-typed-decisions（421M，1024 token，专家工作流）。内置路由按 Unicode 脚本在半个毫秒内选 checkpoint，避免「自信地读不懂高棉语」（英语 checkpoint 在高棉语上准确率 0.000 却报 0.952 置信度）。

优势

- 速度：T4 上 32.8ms/问；10 问批处理 72.3ms
- 成本：自托管 $0/token
- 开放性：完整 safetensors + Apache-2.0
- 多语言：51 语言评测中 45 个达 3× 随机水平

局限

- 零样本弱：基座约 0.35，低于 0.318 随机基线（需微调）
- 选项数：超过 20 个选项开始退化（Banking77 77 标签仅 0.425，Jev 0.870）
- 校准需要工作：原始 ECE 0.466，按问题类型拟合温度标量后才到 0.081
- 上下文短：英文 checkpoint 512 token 约等于一封邮件

#### kev（jaredpalmer）

基于 Qwen3.5 的 System One 复刻家族

提供 0.5B / 0.6B / 4B / 8B 研究预览。均在单张 RTX 3090 上以 BF16 跑完全部 534 条冻结决策，零失败请求。v1.2.5 轮次中 0.6B 曾以 66.7 分进入第 9；v1.4.2.2 现行榜单中该家族位于 #30/#51/#55/#61。

局限

- 更大的 checkpoint 提升 Intelligence，但在校准与托管成本上失分

#### 其他值得关注的开源复刻

### jev-1.13.0 官方规格

官方口径

官方规格与价格

| 项目 | 内容 |
| --- | --- |
| 模型版本 | jev-1.13.0 做可比测试请固定版本号（如 jev-1.13.0），不要使用会随新版本漂移的 jev-latest 别名。 |
| 输入价格 | $0.042 / 百万 token 约 $42.00 / 十亿 token |
| 输出价格 | 免费（too cheap to meter） |
| 单次请求上下文 | 64,000 token 其中 state 加最长问题 ≤ 32,000；state 只被摄入一次，所有 question 并行对其求值 |
| 限速 | 250,000 token/秒 · 1,200 请求/分钟 官方声明限速在动态调整中；超限返回 429，官方 SDK 默认带退避重试并遵守 retry-after |
| 输入类型 | text、JSON object、array of text values 不支持：image、audio、video、binaries（需先转成文本或结构化字段） |
| 语言支持 | 英文为主要训练语言、精度最高；其他语言（含 CJK）可用但精度不等。官方建议非英文负载先自测，并重点关注 confidence |
| 定制方式 | 不做客户数据微调 / LoRA；同一权重服务所有账号。领域适配靠请求里的 state / instructions / criteria，以及把大判断拆成原子问题后在代码里组合 |
| 数据处理 | 不用客户请求/响应训练；企业版提供零数据保留（ZDR） |

### 成本换算：一百万次决策约多少钱

估算

- 每次输入约 500 token

  短问题（如单条分类）

  $21.00
- 每次输入约 2,000 token

  常规 state 加一个问题

  $84.00
- 每次输入约 8,000 token

  长 state 加多个问题

  $336.00

按官方输入价估算，只计输入 token（输出免费），未含重试、网络与工程成本。官方承认无法证明当前定价没有补贴，长期价格以官方为准。厂商自评的每案例成本对比见 ~~第三方评测 ~~ 章节。

### 平台开源模型 API 定价

平台开源决策模型上线后，这里会列出各模型的 API 价格；平台仅提供 API 调用，不支持自托管。

### 官方演示3

官方口径

厂商自建演示，说明能力形态，不代表独立验证结果。

- #### Doom 实时决策演示

  场景：以约 10 次/秒的节奏反应式游玩 Doom

  方法：输入是结构化的游戏状态（文本形式的数据结构），不是图像；由代码把答案转成游戏动作<dl><dt>决策频率</dt><dd>约 10 次/秒</dd><dt>成本估算</dt><dd>约 $7/小时</dd><dt>说明</dt><dd>官方坦承非 AI 的 doom bot 能玩得更好；重点在「对不同的游戏状态表征都能反应」与「能遵循指令」</dd></dl>
  - 演示基于结构化状态而非像素（官方标注「（yet…）」表示未来可能做图像）

  来源：TypeSafe AI Blog
- #### Wikiracing 高基数选择演示

  场景：从某个维基页面出发，只用沿途链接抵达指定目标页面

  方法：每一步在数百到数千个链接中做选择<dl><dt>说明</dt><dd>用来展示「每秒智能」以及高基数选择下不幻觉带来的复利收益；Jev 支持基数上限 255，更高基数时官方采用两阶段（先独立打分再显式选择），偶有变慢</dd></dl>
  - 该演示对比的是各模型的非推理模式（Astra 除外设为最低推理档），因此加速幅度明显小于其他演示；Jev 反而用更少步数完成

  来源：TypeSafe AI Blog
- #### 并行采样 vs 自回归 对照演示

  场景：同一 state 与同一组 questions，对比 Jev 与 GPT-5.6 Terra

  方法：Jev 并行输出全部概率，LLM 自回归逐 token 生成<dl><dt>说明</dt><dd>公开记录中唯一分歧点是「Churn likelihood level」——官方认为该答案本身确实含糊</dd></dl>
  - query 高度简化，questions 特意选择了可读的 key 以便屏幕展示；state 是短而密的段落，相对更短的输入对 Jev 更有利

  来源：TypeSafe AI Blog

### 官方评测3

厂商自评

厂商自评，截至目前无大规模独立复现。

- #### 4-workflow 决策准确率<dl><dt>Jev 准确率</dt><dd>67.8%</dd><dt>Jev 每案例成本</dt><dd>$0.0004</dd><dt>Jev 延迟</dt><dd>0.4s</dd></dl>

  来源：本站数据整理
- #### 结构化输出与工具调用错误率<dl><dt>schema 错误率</dt><dd>0%</dd><dt>工具调用错误率</dt><dd>0%</dd></dl>

  来源：本站数据整理
- #### 大数据 map-reduce 成本模型<dl><dt>每案例成本</dt><dd>$0.0004</dd><dt>官方举例</dt><dd>5000 万行评论打分（情感 + 政策违规）约 $20 决策调用</dd></dl>

  来源：DataCamp

### 第三方实测4

独立第三方

第三方独立体验或整理，仍属小样本或二手转述。

- #### DataCamp：Jev 是否真的不幻觉

  场景：整理并交叉核对官方数字

  方法：文献整理 + 官方数字对比<dl><dt>结论</dt><dd>「准确率与 Terra 持平」有前景但未定论，直到中立测试台复现；Jev 作为快速决策与护栏层确实有用；真正值得围绕构建的是校准</dd></dl>
  - 独立基准是否确认准确率持平
  - 补贴结束后定价是否维持

  来源：DataCamp
- #### Simon Willison：检索重排与黑盒批评

  场景：把 Jev 当检索重排器，并体验 API

  方法：用 BM25 取 100 个候选 → 让 Jev 按相关性打分排序<dl><dt>结论</dt><dd>决策模型这一框架确实帮助理解使用边界（分类类任务最强）；但 Jev 让系统更黑盒——只给浮点数不给理由，若用于排名存在隐藏偏见风险；因此 evals 与结构化实验比普通 LLM 项目更重要</dd><dt>有趣发现</dt><dd>他让 Jev 对湾区城市回答「是否是好城市？」，Cupertino 最高、East Palo Alto 最低</dd></dl>

  来源：simonwillison.net
- #### Flowtivity：在无 GPU 的 CPU VPS 上自测 Laya

  场景：4 vCPU / 7GB RAM、无 GPU 的 VPS，跑 Laya 官方支持工单 quickstart（1 个 state、3 个问题）

  方法：pip install laya 0.3.4，下载约 808MB 英文 checkpoint，端到端计时<dl><dt>导入耗时</dt><dd>26 秒</dd><dt>加载权重</dt><dd>675 秒</dd><dt>首次冷启动预测</dt><dd>85.4 秒</dd><dt>热启动预测（中位数）</dt><dd>49.4 秒</dd><dt>官方文档称 CPU 延迟（ms）</dt><dd>193–464</dd><dt>决策质量示例</dt><dd>一条生产故障 + 退款诉求的工单：queue=billing 置信度 0.532、urgency 2.73/3、churn 风险 19.3%</dd></dl>

  来源：Flowtivity
- #### Hacker News：约 480 条评论的对抗性讨论

  场景：发布帖下的技术与定位争论（1,800+ 分）

  方法：社区评审 + 厂商创始人（CompleteSkeptic / zenlikethat）高频回复<dl><dt>支持方观点</dt><dd>速度、成本、校准置信度；定位为 LLM 的「潜意识层」；已在 Vercel gateway 上线，实测「真的很棒」</dd><dt>质疑方观点</dt><dd>类型安全 ≠ 事实正确（WhitneyLand）；标题夸大：曾用「New frontier model 40-400x cheaper and 20-200x faster」并在 1 小时内修改；Doom demo 用结构化状态而非像素；闭源黑盒、架构保密、无技术论文；与已有约束解码（BNF / JSON schema）的区别不清；Noul 等自造词未在文档解释引发集中批评</dd></dl>

  来源：Hacker News

### 社区实验12

社区

社区项目与实验，收录不代表背书。

- #### 用 Jev 玩扑克<dl><dt>说明</dt><dd>借牌桌探边界：快速决策模型在哪里有用、在哪里没用</dd></dl>

  来源：GitHub
- #### Jev 玩 Minecraft（WIP）<dl><dt>说明</dt><dd>包括夜间逃离僵尸，用于测试快速结构化决策</dd></dl>

  来源：GitHub
- #### jev-2048<dl><dt>说明</dt><dd>用 Jev 玩 2048 滑盘；本页「游戏体验」章节也提供 2048 的模型控制版本</dd></dl>

  来源：simonwillison.net
- #### tsai-sc：驱动原版星际争霸<dl><dt>说明</dt><dd>通过键鼠驱动共享版，逐次记录动作概率</dd></dl>

  来源：GitHub
- #### jev-plays-pokemon<dl><dt>说明</dt><dd>游戏状态读成文本 → 每回合类型化问题 → 确定性代码转成操作</dd></dl>

  来源：GitHub
- #### typesafe-mario<dl><dt>说明</dt><dd>从模拟器结构化状态出发逐个动作决策</dd></dl>

  来源：GitHub

展开其余 6 条

### 发布与生态时间线

最新在上；日期精度以来源为准。

1. 2026-09-28生态 #### 自托管部署路径公开

   Red Hat Developers 发布《Run decision models on vLLM and Red Hat AI》，说明决策模型类模型的自托管部署方式。
2. 2026-09-27榜单 #### JevBench v1.4.2.2 生成：开源模型登顶

   最新榜单生成（2026-09-27T18:49:51Z）：95 个系统、91 个排名。Imajev-4B 以 67.37 登顶，Plumb-4B 65.84 第二，decider-4b v2 64.13 第三，Jev 1.13.0 以 63.29 位列第 4。榜单口径为「20% 来自 308 条全新封存决策的校正 Intelligence + 80% 来自 v1.3.0 Intelligence 轴」的混合。
3. 2026-09-26榜单 #### 榜单显示层修正（无测量与排名变化）

   JevBench 应运营方请求做显示层修正（Autoloops 托管的 Gemma 系统改名；无任何测量、分数、轴、排名变化）。
4. 2026-09-23媒体 #### 开源替代清单成型

   DataCamp 发布《Top 7 Open-Source TypeSafe Jev Alternatives》，把 Laya、Von、NanoJev 列为最有意思的小型专用决策模型。
5. 2026-09-22生态 #### 工程集成加速

   Simon Willison 发布 llm-typesafe（给 LLM CLI 加 Jev 支持）；kev 项目（Qwen 3.5 基座的 0.8B/4B/9B 复刻）在 HN 引发新一轮讨论（id=49783999）。JevBench v1.2.15/1.2.16 纳入 Zefan Cai 的 Open-Jev 2B/9B 与一批 reranker。
6. 2026-09-21独立评测 #### 独立评测与开源对比集中出现

   Simon Willison 发布《Jev introduces a new shape of LLM—System One, aka Decision Models》：解释三种原语（确认 Noul=Bernoulli）、指出黑盒与偏见风险、分享检索重排实验。Flowtivity 发布《Laya: The Open-Source Jev Alternative, Benchmarked Honestly》，逐项对照 Jev 并在无 GPU 的 CPU VPS 上自测 Laya。

展开其余 8 条

### 基本概念

<details>

<summary>

#### 什么是 System One 模型？

</summary>

TypeSafe 提出的一类模型：做快速、结构化、可被软件直接消费的决策，而不是生成文本。名字借自 Daniel Kahneman《思考，快与慢》里「快速直觉的 System 1」与「缓慢深思的 System 2」之分。

来源：TypeSafe AI Blog

</details>

<details>

<summary>

#### 「Jev」这个名字从哪来？

</summary>

取自 William Stanley Jevons。官方类比：蒸汽机效率提升最终让煤炭需求上升——智能成本每降一个数量级，会解锁数量级更多的用例（杰文斯悖论）。

来源：TypeSafe AI Blog

</details>

<details>

<summary>

#### Jev 是 LLM 吗？

</summary>

不是。它接受文本输入，但输出是浮点数与概率分布（对应分类、是/否、评分），不做字符串生成。官方把它描述为「frontier-intelligence function call：非结构化状态进，类型化概率决策出」。

来源：TypeSafe AI Blog、simonwillison.net

</details>

<details>

<summary>

#### 它可以问哪几种问题？

</summary>

三种原语。Choice：从给定选项里选一个，返回全部选项上的概率分布 + 选中项置信度。Score：沿一组带描述的数值档位打分。Noul：对一个陈述给出 P(true) 的浮点概率——「Noul」源自 Bernoulli（伯努利）分布。

来源：simonwillison.net、TypeSafe AI Blog

</details>

<details>

<summary>

#### 它需要图像输入吗？

</summary>

不需要也不支持。官方明确：输入仅文本（字符串、JSON 对象或文本数组），无图像、音频、视频。非文本输入需先转成文本或结构化字段再作为 state 发送。社区惯用做法是把程序状态（坐标、距离、枚举）作为结构化读数传入。

来源：TypeSafe AI Docs、TypeSafe AI Blog

</details>

<details>

<summary>

#### Jev 会被客户数据微调吗？

</summary>

不会。不做微调、不做 LoRA，同一份权重服务所有账号。领域适配靠请求里的 state / instructions / criteria，以及把大判断拆成原子问题后在代码里组合。官方也声明不用客户请求与响应训练。

来源：TypeSafe AI Docs

</details>

### 能力与边界

<details>

<summary>

#### Jev 最强的地方在哪？

</summary>

有界选项空间上的语义判断：分类、路由、打分、是/否核对，尤其是高频、大批量、单次成本敏感的场景；以及作为 LLM 的校验与护栏层。

来源：TypeSafe AI Blog、DataCamp

</details>

<details>

<summary>

#### 它不能做什么？

</summary>

官方「不要做」清单：问它任何代码能精确算出的东西；把多个判断藏进一个问题；让它做 System Two 任务（更多层间接推理）；给 state 塞超出问题所需的上下文。另外它是字面理解、不擅长数学与计数、把日期当文本读、不适合生成文本。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 它能做算术吗？

</summary>

不能可靠地做。官方原话：Jev 不是计算器，强烈建议任何数学逻辑都在代码里实现。计数尤其不可靠（字符数、词频、长列表项数），且误差随规模增长——它会识别答案的「形状」而不是真的在数。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 处理日期时间靠谱吗？

</summary>

不可靠。它把日期当文本而不是有序量，判断先后、间隔、是否落在窗口内都会出错，混格式与季度/结算窗口等业务边界更糟。官方建议：抽取交给模型（每个部分都是小闭集，可用 Choice 枚举 + 显式「未给出」选项），排序、时长、偏移、星期一律由代码负责。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 为什么 state 越大准确率越低？

</summary>

官方称之为 context rot：与决策无关的内容充当干扰项，且大 state 让你更难定位是哪部分输入导致了错误答案。建议先在代码里检索过滤，只送问题需要的字段；无法过滤时可用一个 Noul 先做相关性过滤。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 同一个问题问成 Noul 和 Choice，结果一致吗？

</summary>

不保证。官方给了实测数据：对同一张工单问「客户是否在要求退款」，Noul 给 0.22，yes/no Choice 给 yes 0.01 / no 0.99 / 置信度 0.97。同一问题与其否定的两个 Noul 之和也可能不为 1（实测 0.72 + 0.47 = 1.19）。所以：不要把 Noul 上标定的阈值搬到 Choice，也不要对分开的问题施加算术恒等式。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 支持中文吗？

</summary>

支持但不保证精度。官方：英文是主要训练语言、当前准确率最高；其他语言（含 CJK）可用但精度不等，建议非英文负载先用自己的内容测试，并重点关注置信度。

来源：TypeSafe AI Docs

</details>

### 与其他模型对比

<details>

<summary>

#### Jev 和 GPT-5.6 / Opus 5 比谁更强？

</summary>

取决于任务是否「有界」。厂商自评的 4-workflow 决策准确率：Jev 67.8%、GPT-5.6 Terra 67.9%、GPT-5.6 Sol 74.1%、Claude Opus 5 73.1%。也就是说 Jev 与 Terra 基本持平，而 Sol / Opus 5 保持 5–6 个百分点的真实优势；但 Jev 每案例成本约为 Terra 的 1/76、快约 25×。需要峰值准确率或需要理由时，LLM 仍胜出。

来源：DataCamp（厂商自评数据）

</details>

<details>

<summary>

#### 有开源替代吗？

</summary>

有，而且很多。Laya（Convai Innovations，Apache-2.0，421M）是最知名的一个；此外还有 kev 家族（Qwen3.5 基座，0.5B–8B）、djev（DiffusionGemma）、SemIf / 原 OpenJev、Imajev-4B、Plumb-4B、decider-4B、Von、NanoJev、reflex、GLiNER2 等。截至 2026-09-29，JevBench 已收录 95 个系统、91 个参与排名。

来源：本站数据整理、Flowtivity

</details>

<details>

<summary>

#### 开源替代已经能超过 Jev 了吗？

</summary>

在 JevBench 的独立协议下：第一名 Imajev-4B（67.37）超过 Jev 1.13.0（63.29，第 4）；前十名里 9 个是开源模型。但注意该榜对自托管端点施加了 ×2+0.15s 的延迟假设，且成本列多为估算。反方向看，Laya 官方报告称自己在 2,000 条 typed decisions 上以 0.766 胜过 Jev 的 0.727——而 JevBench 独立测得 Laya 仅排第 43。结论：换模型时要连口径一起看。

来源：本站数据整理

</details>

<details>

<summary>

#### 这和已有的 JSON schema 约束解码有什么区别？

</summary>

这是 HN 上最常见的质疑：OpenAI 与 Anthropic 的 JSON schema 背后本来就是语法约束解码，类似机制几年前就有（BNF / constrained decoding）。支持方回应：可用 schema 约束 LLM 输出，但 Jev 能「可靠地每次选对类别」；且官方强调 Jev 输出的是「模型自己的概率分布」而非「被要求写出来的概率」。JevBench 也把这两者分开标注为 native 与 verbalized。

来源：Hacker News、GitHub

</details>

### 定价与可用性

<details>

<summary>

#### Jev 怎么收费？

</summary>

按输入 token 计费：$0.042 / 百万 token（约 $42 / 十亿），输出 token 免费。官方称输出「便宜到无需计量」。工作流层面约 $0.0004 / 案例。

来源：TypeSafe AI Docs、DataCamp

</details>

<details>

<summary>

#### 怎么获得访问权限？

</summary>

托管 API，早期访问需等候名单（waitlist）。端点 POST https://api.typesafe.ai/v1/systemone，模型路由 jev-latest，提供官方 Python 与 JavaScript SDK。也已有 OpenRouter（beta）、Cloudflare AI Gateway、Vercel AI Gateway 等第三方接入。

来源：DataCamp、GitHub

</details>

<details>

<summary>

#### 有速率限制吗？

</summary>

有，且官方声明在动态调整中。当前：250,000 token/秒、1,200 请求/分钟；超限返回 429，官方 SDK 默认带退避重试并遵守 retry-after。更高限额需联系销售。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### 上下文窗口多大？

</summary>

每请求 64k token；其中 state 加最长单个问题合计 32k token。state 只被摄入一次，所有问题并行对其求值——所以塞很多问题进去总耗时与只问一个相近。

来源：TypeSafe AI Docs

</details>

<details>

<summary>

#### $0.042 这个价格可持续吗？

</summary>

官方坦承无法证明定价未获补贴，需要长期来验证可持续性，但预期价格会下降而非上升。这也是第三方（DataCamp）列出的两个待解问题之一。

来源：TypeSafe AI Blog、DataCamp

</details>

### 接入与工程

<details>

<summary>

#### 怎么把 Jev 接进已有系统？

</summary>

官方推荐三种方式：把专有内容、记录与参考资料放进 state；把领域规则与边界情况写进每个问题的 instructions 和 criteria；把宽泛判断拆成原子问题后在代码里组合结果。社区生态里已有网关插件（new-api 的 /v1/systemone）、CLI 插件（llm-typesafe）、数据库扩展（PostgreSQL / DuckDB）等形态。

来源：TypeSafe AI Docs、GitHub

</details>

<details>

<summary>

#### 怎么决定哪些决策交给 Jev、哪些留给 LLM？

</summary>

按「有界 vs 开放」拆。有界决策（分类、路由、打分、护栏）交给 Jev；开放式输出、需要书面解释、需要多步推理的交给前沿 LLM。Jev 的校准让交接干净——可基于置信度阈值把案例升级上去。

来源：DataCamp

</details>

### 质疑与争议 存在争议

以下问题存在不同观点，答案整理自公开资料，请结合来源自行判断。

<details>

<summary>

#### 「不会幻觉」的说法成立吗？

</summary>

这是 HN 上最激烈的争论点。社区主流反驳：「类型安全不等于事实正确」（type safety is not factual correctness）——对未授权操作的 approve 仍然满足 schema 保证。官方的 0% 也不是经验测量，而是由 schema 匹配保证，因此可以直接写进图里。官方在承认这些局限的同时为更广泛的可靠性宣传做了辩护。

来源：Hacker News

</details>

<details>

<summary>

#### 为什么有人批评 Doom 演示「作弊」？

</summary>

因为输入不是像素，而是结构化游戏状态（坐标、弹道角度等直接喂入），且地图路径被加工。官方也在博客里标注了「demo 基于结构化状态而非图像（yet…）」。支持方的回应是：演示的重点是展示「从状态到动作快到能实时游玩」，这是其他模型做不到的。

来源：Hacker News、TypeSafe AI Blog

</details>

<details>

<summary>

#### Jev 会给理由吗？能审计吗？

</summary>

不能。它只给数字，不给自然语言解释。Simon Willison 认为这让 ML 更「黑盒」——如果一个内容被判为垃圾，无法知道是哪些信号导致的；偏见问题因此需要前置关注。DataCamp 也指出这对调试与受监管领域审计是真实约束，实用做法是把 Jev 留在高吞吐路由层，把低置信或标记案例升级到能写解释的模型。

来源：simonwillison.net、DataCamp

</details>

### 免责声明

本页为万维易源整理的第三方技术专题，与 TypeSafe AI 无隶属、合作或背书关系；Jev 为 TypeSafe AI 的产品名称。JevBench 由 Benchmark Heaven 独立运营。页面数据来自公开资料，截至 2026-09-29，请以各来源最新信息为准。平台提供的类 Jev 开源决策模型 API 为万维易源自有服务，并非 Jev 官方服务。

下次计划复核：2026-10-13

<details>

<summary>来源登记（23）展开查看完整登记表</summary>



数据来源登记

| 来源 | 发布方 | 类型 | 可信度 | 发布日期 |
| --- | --- | --- | --- | --- |
| [Introducing System One Models &amp; Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) | TypeSafe AI Blog | 官方 | 高 | 2026-09-15 |
| [Models](https://docs.typesafe.ai/models) | TypeSafe AI Docs | 官方文档 | 高 | — |
| [Jev 1.13 jaggedness](https://docs.typesafe.ai/model-jaggedness/jev-1.13) | TypeSafe AI Docs | 官方文档 | 高 | — |
| [Introduction](https://docs.typesafe.ai/introduction) | TypeSafe AI Docs | 官方文档 | 高 | — |
| [JevBench v1 (fstandhartinger/jevbench)](https://github.com/fstandhartinger/jevbench) | GitHub | 独立评测 | 高 | — |
| [jevbench-v1.4.2.2-results.json](https://raw.githubusercontent.com/fstandhartinger/jevbench/main/results/v1.4.2.2/jevbench-v1.4.2.2-results.json) | GitHub raw | 数据集 | 高 | — |
| [JevBench live board](https://benchmarkheaven.com/jev-models) | Benchmark Heaven | 独立评测 | 高 | — |
| [Jev: TypeSafe's System One Model That Never Hallucinates](https://www.datacamp.com/blog/system-one-models-jev) | DataCamp | 媒体分析 | 中高 | 2026-09-16 |
| [Top 7 Open-Source TypeSafe Jev Alternatives](https://www.datacamp.com/blog/top-open-source-jev-alternatives) | DataCamp | 媒体分析 | 中高 | 2026-09-23 |
| [Jev introduces a new shape of LLM—System One, aka Decision Models](https://simonwillison.net/2026/Sep/21/jev/) | simonwillison.net | 专家博客 | 高 | 2026-09-21 |
| [Laya: The Open-Source Jev Alternative, Benchmarked Honestly](https://flowtivity.ai/blog/laya-open-source-jev-alternative/) | Flowtivity | 媒体分析 | 中高 | 2026-09-21 |
| [Jev Decision Index](https://huggingface.co/spaces/multimodalart/jev-decision-index) | Hugging Face Space (multimodalart) | 社区工具 | 中 | — |
| [awesome-jev (yibie)](https://github.com/yibie/awesome-jev) | GitHub | 精选列表 | 中高 | — |
| [awesome-jev-by-typesafe (Anil-matcha)](https://github.com/Anil-matcha/awesome-jev-by-typesafe) | GitHub | 精选列表 | 中 | — |
| [Introducing System One Models and Jev (Hacker News)](https://news.ycombinator.com/item?id=49717558) | Hacker News | 社区讨论 | 中 | 2026-09-15 |
| [Jev tutorials and demos — YouTube videos about Jev](https://madewithjev.com/videos) | madewithjev.com | 视频聚合 | 中 | — |
| [YouTube videos about Jev](https://devwithjev.com/tutorials) | devwithjev.com | 视频聚合 | 中 | — |
| [What Is Jev? A Guide to TypeSafe AI's System One Model](https://www.langchain.com/blog/building-a-harness-with-jev) | LangChain Blog | 厂商博客 | 中 | 2026-09-17 |
| [Run decision models on vLLM and Red Hat AI](https://developers.redhat.com/articles/2026/09/28/run-decision-model-vllm-and-red-hat-ai) | Red Hat Developers | 厂商博客 | 中 | 2026-09-28 |
| [Typesafe AI's Non-Autoregressive System-1 Model](https://www.mindstudio.ai/blog/jev-system-one-model-launch) | MindStudio | 媒体分析 | 中 | 2026-09-18 |
| [How to Use Jev: A practical guide](https://dev.to/valyuai/how-to-use-jev-a-practical-guide-to-typesafes-system-one-model-g5e) | dev.to | 教程 | 中 | 2026-09-17 |
| [What Is Jev AI? A Beginner's Getting-Started Guide](https://app.therundown.ai/guides/what-is-jev-ai-getting-started) | The Rundown AI | 教程 | 中 | 2026-09-22 |
| [LLM Leaderboard &amp; AI Model Benchmarks](https://benchlm.ai/) | benchlm.ai | 榜单 | 中 | — |

</details>

### 延伸阅读（精选 22）

- [Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

  Diogo Almeida (TypeSafe) · 2026-09-15 · 英文

  一手定义来源：RLCD、对比表、Doom/Wikiracing 演示、FAQ
- [TypeSafe AI](https://typesafe.ai/)

  英文

  首页宣称 193.6× 更快 / 444.6× 更便宜
- [Documentation — Introduction](https://docs.typesafe.ai/introduction)

  英文
- [Models（规格 / 定价 / 限速 / 别名）](https://docs.typesafe.ai/models)

  英文
- [Jev 1.13 jaggedness（9 类失败模式）](https://docs.typesafe.ai/model-jaggedness/jev-1.13)

  英文

  「适用范围」章节的核心依据
- [API reference](https://docs.typesafe.ai/api)

  英文
- [SDKs（Python / JavaScript）](https://docs.typesafe.ai/sdk)

  英文
- [Concepts — System One](https://docs.typesafe.ai/concepts/system-one)

  英文
- [TypeSafe Console（Playground / API Keys）](https://console.typesafe.ai/)

  英文

  申请 key 与试用
- [JevBench live board（可自定义权重）](https://benchmarkheaven.com/jev-models)

  Benchmark Heaven · continually updated · 英文

  专题页对比图的权威数据源之一
- [fstandhartinger/jevbench](https://github.com/fstandhartinger/jevbench)

  英文

  方法学、修订日志、逐轮结果 JSON；MIT
- [Jev Decision Index（HF Space）](https://huggingface.co/spaces/multimodalart/jev-decision-index)

  multimodalart · 英文

  开源复现版在 5 个能力维度的对比（表格 + 雷达图）
- [Jev: TypeSafe's System One Model That Never Hallucinates](https://www.datacamp.com/blog/system-one-models-jev)

  DataCamp · 2026-09-16 · 英文
- [Top 7 Open-Source TypeSafe Jev Alternatives](https://www.datacamp.com/blog/top-open-source-jev-alternatives)

  DataCamp · 2026-09-23 · 英文
- [Jev introduces a new shape of LLM—System One, aka Decision Models](https://simonwillison.net/2026/Sep/21/jev/)

  Simon Willison · 2026-09-21 · 英文

  最被信赖的独立技术视角，含黑盒批评
- [Laya: The Open-Source Jev Alternative, Benchmarked Honestly](https://flowtivity.ai/blog/laya-open-source-jev-alternative/)

  Flowtivity · 2026-09-21 · 英文

  Jev vs Laya 逐项对比 + CPU VPS 自测，口径差异的最佳素材
- [Hacker News launch thread](https://news.ycombinator.com/item?id=49717558)

  2026-09-15 · 英文

  1,800+ 分、约 480 评论；FAQ 中「争议」一节的依据
- [What Is Jev? A Guide to TypeSafe AI's System One Model](https://www.langchain.com/blog/building-a-harness-with-jev)

  LangChain · 2026-09-17 · 英文

  如何在 agent loop 中使用 Jev
- [awesome-jev（yibie，1.9k stars / 292 forks）](https://github.com/yibie/awesome-jev)

  英文

  按应用域归类；含明确的「收录≠背书」声明与同日批量提交警示
- [深入解读 Jev 模型：毫秒级判定与工程边界（中文）](https://github.com/kuhung/understanding-jev)

  中文

  中文深度解读，可直接参考其工程边界表述
- [Laya（Convai Innovations，Apache-2.0，421M）](https://huggingface.co/convaiinnovations/laya)

  英文
- [kev（jaredpalmer）](https://github.com/jaredpalmer/kev)

  英文