














typesafe/jev)、OpenRouter(typesafe/jev-1.13,输入 $0.042/百万 token,输出免费)、LangChain(langchain-typesafe 包),上下文窗口 32K token。Jev 是 TypeSafe AI 公司于 2026 年 9 月发布的结构化评估模型(structured evaluation model),也是该公司所称的「系统一模型」品类的第一个产品。用一句话概括:你给它一个状态(state)和几个关于这个状态的问题,它返回的不是一段文字,而是一个带概率的类型化答案。
这一点和我们对「AI 模型」的直觉完全不同。传统 LLM(如 Claude、GPT 系列)是自回归文本生成器——逐 token 生成自然语言,应用层再用解析、重试、校验把文本「翻译」成软件可用的结构。而 Jev 跳过了文本生成这一步:
TypeSafe 官方甚至直接打出了「零幻觉」(Zero Hallucinations)的口号。这里的准确含义是:输出永远是预期的数据结构,且每个决策都带置信度,所以软件知道什么时候可以自动执行、什么时候应该升级给人工复核(当然,这是厂商口径,实际选型请参考下文的局限部分)。
「系统一 / 系统二」的类比来自心理学的双系统理论:系统一是快速、直觉、自动化的反应;系统二是缓慢、深思熟虑的推理。TypeSafe 借用了这个框架来划分 AI 模型的分工:
| 维度 | 系统一模型(Jev) | 系统二模型(传统 LLM) |
|---|---|---|
| 输出 | 类型化决策(数据) | 自由文本(字符串) |
| 延迟 | 约 0.1 秒级 | 数秒到数十秒 |
| 成本 | 每次 $0.000081 量级 | 每次 $0.0138 量级 |
| 确定性 | 结构固定、带置信度 | 每次措辞可能不同 |
| 擅长 | 分类、路由、评分、守门 | 开放推理、写作、规划 |
| 类比 | 直觉反应 | 深度思考 |
TypeSafe 的核心论点是:RLHF(人类反馈强化学习)把 LLM 优化成了「讨好人类偏好的聊天机器」,带来了模式坍缩、过度自信和可靠性问题,导致每个生产系统都需要人类在环。而机器之间的通信本来就不需要自然语言——Jev 就是为「机器原生」的决策场景设计的,官方称之为「更像代码」:可靠、快速、自洽、类型安全。
专业提示 不要把 Jev 理解成「更便宜的 GPT」。它是流程中的判断节点:LLM 负责理解复杂的开放问题并生成方案,Jev 负责在流程的关键分叉点上做快速、可量化、可审计的判断。两者是互补关系。
Jev 的 API 只有两个核心概念:state(要评估的数据)和 questions(关于这个数据的问题)。问题分三种类型:
| 问题类型 | 用途 | 返回内容 |
|---|---|---|
| Noul | 是/否二元判断(可附判断标准) | 陈述为真的概率(如 0.95) |
| Choice | 多选一分类,每个选项可写描述性标准 | 选中的选项 + 每个选项的概率 + 置信度(如 billing,0.8) |
| Score | 按有序量表打分(如 0–2) | 连续分数 + 分布 + 置信度(如 1.04,置信度 0.94) |
一个真实感的例子(来自 Cloudflare 官方文档):一张客服工单写着「payouts 已经失败 3 天」,同时问三个问题——
多个问题可以针对同一个 state 一次发出,Jev 会并行评估它们。额外的问题几乎不影响响应时间,只增加对应的 token 消耗。这意味着你可以同时问「紧急吗?归谁管?客户生气吗?要退款吗?」而延迟基本不变。
graph TD
A[业务事件: 工单/订单/日志/Agent状态] --> B[构造 state: 文本或 JSON]
B --> C[定义 questions: Noul/Choice/Score]
C --> D[Jev 并行评估]
D --> E[返回类型化答案 + 置信度]
E --> F{置信度 >= 阈值?}
F -->|是| G[软件自动执行: 路由/升级/拦截]
F -->|否| H[转人工复核]
G --> I[记录决策与概率, 可审计]
H --> I
Jev 基于全新架构和采样器,采用一种名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)的训练算法。与 RLHF 优化「人类偏好」不同,RLCD 优化的是「校准的决策」——即模型给出的概率要真实反映正确率,这正是置信度阈值策略能够成立的前提。
TypeSafe 官网给出的基准(系统一任务工作流):
| 指标 | TypeSafe (Jev) | 传统 LLM | 差距 |
|---|---|---|---|
| 单次决策成本 | $0.000081 | $0.013880 | 444.6 倍 |
| 单次决策延迟 | 0.114 秒 | 8.566 秒 | 193.6 倍 |
| 输入 token 单价 | $42 / 10 亿 | — | 号称比 Claude Fable 5.1 低 238 倍 |
LangChain 博客在集成场景下的引用口径是「最高 200 倍速、400 倍便宜」,与官网数字基本一致(一个是官网峰值口径,一个是实战口径)。
实际交易数据可以佐证这个量级:jev-1.13 于 2026 年 9 月 18 日上线 OpenRouter,定价 输入 $0.042/百万 token、输出 $0/百万 token(输出是极小的类型化 JSON,直接免计费),上线几天内已处理超过 1610 亿 token(来源:OpenRouter 模型页)。
专业提示 价格换算一下:$42/十亿输入 token ≈ 一美分可以做约 240 次单问题决策。对于「每封邮件、每个工单、每次工具调用都要判断一次」的高频场景,这个成本结构才让「全量判断」在经济学上成立——这也是此前只能靠关键词规则或抽样处理的原因。
typesafe/jev)Jev 已作为第三方模型上架 Cloudflare Workers AI,上下文窗口 32K token,通过 Worker 绑定或 REST API 调用。state 可以是普通字符串,也可以是嵌套 JSON(问题中用反引号引用字段,如 `ticket.message`):
// Cloudflare Worker 中调用
const result = await env.AI.run("@cf/typesafe/jev", {
state: {
ticket: { message: "Stripe 支付回调整整 3 天没有成功", channel: "email" },
order: { total: 499.0, status: "paid" },
policy: "重复扣款且服务不可用超过 24 小时,支持全额退款"
},
questions: {
is_urgent: {
type: "noul",
question: "这张工单需要立即升级处理吗?"
},
department: {
type: "choice",
question: "应该路由给哪个部门?",
choices: { billing: "计费与支付问题", technical: "技术故障", account: "账号问题" }
},
refund_warranted: {
type: "noul",
question: "根据退款政策,这笔订单支持退款吗?"
}
}
});
// 每个答案都带概率与置信度
console.log(result.is_urgent); // { value: true, probability: 0.95, ... }
console.log(result.department); // { value: "billing", confidence: 0.8, ... }
官方文档提供了完整的输入/输出 JSON Schema 下载,响应中同时包含各问题的答案和 token 用量。
typesafe/jev-1.13)如果你已经在用 OpenRouter 做多模型路由,直接把模型 ID 换成 typesafe/jev-1.13 即可。另有 typesafe/jev-latest 作为别名,始终指向 Jev 家族的最新版本(当前为 jev-1.13.0)。
langchain-typesafe 包)LangChain 官方博客《Building a Harness with Jev》展示了三种典型集成:
1. 基础分类器——TypeSafeClassifier 接收 state(文本、结构化数据或 LangChain 消息)+ 问题:
from langchain_typesafe import TypeSafeClassifier, Noul
classifier = TypeSafeClassifier()
response = classifier.invoke(
state="用户报告 Stripe 集成完全失败,影响线上支付",
questions={"urgent": Noul(question="这需要立即升级吗?")}
)
print(response.nouls["urgent"].noul) # 0.999 —— 直接可用于自动优先级
2. 模型路由——ModelRouterMiddleware 让 Jev 在「快模型」和「强模型」之间做选择,按任务难度把每个请求分给「能胜任的最便宜模型」。
3. 工具调用守门(Auto Mode)——AutoModeMiddleware 在高风险工具(如 bash)真正执行前,用 Jev 评估这次调用是否危险,危险则拦截。这个模式借鉴了 claude、codex、cursor 等编码 harness 中的护栏设计——这也是「用 Jev 构建 harness」的核心玩法:用系统一模型给系统二模型上保险。
✅ 最佳实践 三个问题类型都支持(也应该)写判断标准(criteria)。比如 Noul 问题不要只问「紧急吗?」,而是把「紧急」定义清楚:「影响生产环境、持续超过 24 小时、或涉及资金」。标准写得越具体,概率越可信。
| 对比维度 | Jev(系统一) | 传统 LLM(系统二) |
|---|---|---|
| 输出形式 | 类型化决策 + 概率 | 自然语言文本 |
| 幻觉风险 | 无自由文本可跑偏(厂商口径「零幻觉」) | 存在,需要解析与校验 |
| 延迟 | ~0.1 秒 | 秒级到分钟级 |
| 成本/次 | ~$0.00008 | ~$0.014 |
| 开放推理 / 生成 | 不支持 | 核心能力 |
| 可解释性 | 概率与分布,易于审计 | 需要额外评估框架 |
| 典型角色 | 路由、分级、评分、守门 | 对话、规划、内容生成 |
一句话决策规则:如果这个判断的结果可以从有限选项里枚举出来,用 Jev;如果答案本身需要「想出来」,用 LLM。
来自官方文档与社区实践(LangChain 博客、Cloudflare 文档):
bash 等高危工具执行前拦截评估,风险高就阻断或转人工。⚠️ 注意 以下几点在选型时务必考虑:
A: 不会。Jev 不生成文本,无法做对话、写作或开放式推理。它的定位是承接 LLM 技术栈中「判断」类的环节——路由、分类、评分、审批——让 LLM 专心做「思考」类的环节。LangChain 在博客中明确将其称为 LLM 的补充(complement)而非替代。
A: Noul 是 TypeSafe 自定义的问题类型,用于是/否二元判断:你给出一句话陈述和判断标准,Jev 返回该陈述为真的概率(如 0.95)。与 Choice(多选分类)、Score(量表评分)并列为 Jev 的三种问题类型。
A: OpenRouter 上 typesafe/jev-1.13 定价为输入 $0.042/百万 token(即 $42/十亿 token),输出 $0。TypeSafe 官网称这一输入价格比 Claude Fable 5.1 低约 238 倍。注意实际「每次决策」的成本取决于 state 的长度,官网基准约为单次 $0.000081。
A: 目前有四个入口:Cloudflare Workers AI(typesafe/jev)、OpenRouter(typesafe/jev-1.13 或 typesafe/jev-latest)、TypeSafe 官方控制台 console.typesafe.ai(early access)、以及 LangChain 生态的 langchain-typesafe 包(底层可对接以上任一渠道)。
A: 更准确的说法是「没有文本幻觉」——因为 Jev 根本不生成自由文本,输出永远是预设类型的结构化答案,所以不存在编造段落的风险。但它的概率判断本身仍可能出错,生产环境中应配合置信度阈值使用:高置信自动执行,低置信转人工。
A: 三个信号:① 有高频、重复的分类/分级判断(工单、邮件、审核、日志);② 这类判断目前在用 LLM 做,成本或延迟撑不住;③ Agent 流程需要低成本的守门机制(工具调用审批、模型路由)。命中任意一条都值得试。
Jev 代表了一个值得认真对待的新方向:把「判断」从文本生成中剥离出来,做成软件可以直接消费的类型化、带置信度的原语。193 倍的速度差和 444 倍的成本差不是「快一点的 LLM」,而是让「全量、实时、每次都判断」的架构第一次在经济上可行。
建议的下一步:
bash、发邮件、动数据库,用 Auto Mode 模式给它加一层系统一守门。此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。