Jev 使用教程:TypeSafe 判断型 AI 怎么用,和 ChatGPT 有什么区别
TL;DR: Jev 不写话,只给判断——你定义选项,它返回选项、概率和置信度,置信度决定这条判断该自动执行还是转人工。本文用三条真实客服消息实测它的判断质量。
本文目录
- 1. Jev 是什么?和 ChatGPT 有什么区别
- 2. 三种判断基元怎么选
- 3. 上手:在 Playground 里跑通第一个判断
- 4. 实测:三条客服消息的判定结果
- 优缺点
- 适合人群
- 5. 常见问题(FAQ)
- 6. 下一步
1. Jev 是什么?和 ChatGPT 有什么区别
Jev 是 TypeSafe 推出的判断型 AI,也是这家公司的旗舰模型和第一个 System One 模型,目前处于 early access 阶段。名字来自卡尼曼《思考,快与慢》:System 1 快而直觉,System 2 慢而审慎——Jev 只做前一半。

ChatGPT 负责写内容(怎么说),Jev 负责做判断(下一步往哪派)。
输入:「我付完款了但没收到套餐,怎么回事?」
ChatGPT 给用户写一段话:
「很抱歉给您带来不便,请提供您的账号和订单截图……」
Jev 给代码返回一个判断:
choice: "option_d" ← 该走哪条流程
confidence: 0.93 ← 这个判断有多确定
probabilities: { ... } ← 每个选项各自的概率| 维度 | 通用大模型(ChatGPT / Claude) | 判断型 AI(Jev) |
|---|---|---|
| 核心职责 | 生成文本:写作、总结、对话 | 做判断:分类、打分、真假判定 |
| 输出 | 自然语言,格式会漂移,拿到后还要再解析 | 受约束的选项值 + 概率分布 + 置信度,形状固定 |
| 谁来消费 | 人 | 代码 |
| 做不到什么 | 同一段输入,判定结果不稳定 | 不写句子、不生成代码、不解释推理过程 |
所以两者不是替代关系:Jev 是门口的分流安检员,ChatGPT 是里面的业务顾问。
2. 三种判断基元怎么选
所有问题都必须归到三种类型之一。三种基元回答的问题不同,返回的字段也不同。

| 基元 | 回答什么问题 | 典型场景 | 返回什么 |
|---|---|---|---|
| Noul | 是不是(真假) | 是否含诈骗风险、是否表达紧迫感 | noul:0~1 的「是」的概率,没有置信度 |
| Score | 有多强 / 有多严重 | 销售意向打分、客服情绪强度 | score(可落在两级之间)+ legend + probabilities + confidence,等级 2~10 级 |
| Choice | 属于哪一类 | 工单归类、客服分流、意图识别(最常用) | choice(概率最高的选项)+ probabilities + confidence,选项上限 255 个 |
Noul 只返回一个 0~1 的「是」的概率,这个概率就是你唯一的信号。名字是 Noul,不是 Null,写错会直接报错。
判断准不准,取决于你把每个选项的边界写得多清楚。 边界写得越明确,判断越不会被无关线索带偏;但边界再清楚,两个选项都说得通的输入也永远会有,那是输入本身的模糊。官方文档里的示例值只是示意配置,不是训练好的固定分类。
3. 上手:在 Playground 里跑通第一个判断
打开 TypeSafe Console 的 Playground(docs.typesafe.ai 是文档站,别搞混)。界面只要看懂两块:

State(输入) 填待判断的内容。用 JSON 对象比纯文本更好——可以一次交给它多个相关字段,规则里按字段名引用:
{ "customer_message": "Pro 5x 一个月多少钱?可以开发票吗?" }Questions(规则) 选基元类型,写清每个选项的边界:
{
"new_choice_1": {
"type": "choice",
"instructions": "判断 customer_message 属于哪类客户消息",
"criteria": {
"option_a": "serious_buyer: 明确准备购买或升级",
"option_b": "potential_buyer: 有需求,在比较价格方案",
"option_c": "freebie_seeker: 仅索取免费试用或白嫖",
"option_d": "high_risk: 付款异常、账号风险或退款纠纷"
}
}
}点 Run,结果面板会返回命中的选项、完整概率分布和置信度。
验证点:跑通的标准是返回的选项和你想的一致。老选错就先改边界描述,别急着调阈值。
4. 实测:三条客服消息的判定结果
三条消息都走同一套 Choice 规则。
案例 1:普通咨询(边界模糊)
"Pro 5x 一个月多少钱?可以开发票吗?"

问价属于潜在意向,但「能开发票吗」带着报销和采购的味道,两个选项都说得通。
案例 2:明确购买(高置信命中)
"我想开 Pro 20x,两个账号,今天能开吗?"

套餐、数量、时效三个要素齐全,概率几乎全压在一个选项上。
案例 3:资金风险(类目优先)
"我之前一直是 Pro 20x,今天突然变成 Free 了,昨天扣的钱也没有到账,现在还能帮我恢复吗?"

命中异常降级和扣款未到账两条红线。注意别把置信度当成第二个证据——置信度是从概率分布算出来的,概率压满,它必然是 1.0。
三条消息的数据汇总
| 输入特征 | 命中 | 概率 | 置信度 | 耗时 | 该走哪条路 |
|---|---|---|---|---|---|
| 问价 + 开发票,意向模糊 | option_b(潜在客户) | 75% | 67% | 1.15s | 转人工 / 辅助决策 |
| 套餐 + 数量 + 时效齐全 | option_a(明确购买) | 98% | 98% | 1.67s | 自动执行 |
| 掉档 + 扣款未到账 | option_d(资金风险) | 100% | 100% | 0.7s | 风险类目,直接截停人工处理 |
优缺点
Jev 值得用的地方
- 输出形状固定:不会像自然语言那样格式漂移,代码不用写一堆容错解析
- 判断标准由你定义:同一套标准反复打分,结果稳定可比较;判错了也知道改哪一行,去改边界描述就行
需要注意的地方
- 只认文本:图片、音频、视频目前都不支持
适合人群
适合:每天要处理大量客服消息、工单、商机,想先让 AI 自动分流的运营和客服负责人;想让 AI 输出纯结构化字段、直接喂给代码的开发者。
不太适合:需要 AI 写回复、写文章的人;需要图片或音频输入的场景;不打算把判断标准写清楚、只想让 AI「大概看看」的人。
5. 常见问题(FAQ)
Jev 和 ChatGPT 最根本的区别是什么?
Jev 的三种基元(Primitives)怎么选?
置信度(Confidence)和概率(Probability)有什么区别?
置信度在业务里怎么用?
Jev 能处理图片或音频吗?
Jev 能替代 ChatGPT 吗?
6. 下一步
- 官方文档:https://docs.typesafe.ai/
- 置信度到底怎么算、怎么用:https://docs.typesafe.ai/confidence
如果你已经在用 Claude Code,官方还提供了一个 Skill,装完可以让 Agent 自己读懂这套 API:
claude plugin marketplace update typesafe-ai
claude plugin update typesafe@typesafe-ai
装完重启,之后在项目里说「用 TypeSafe skill」即可。想先摸清 Claude Code 本身,看 Claude Code 使用指南。
