上一篇写的是评测:Jev 是什么、值不值得关注。这一篇只讲一件事:怎么把它接进你自己的流程里。
先说清楚它和聊天模型的用法差别,这是很多人第一次用会卡住的地方。用 ChatGPT 那类模型,你写的是提示词,然后从它吐出来的一段话里想办法把数据抠出来。用 Jev,你写的是问题的结构:给它一段材料,再告诉它你要问哪几个问题、每个问题的备选答案或判定标准是什么。它返回的是程序可以直接用的值,不需要解析。(站内 Prompt 模板 那篇讲的是前一件事怎么写好;这篇讲的是后一件事。)
第一步:注册、拿 key、先玩五分钟
打开 console.typesafe.ai。登录方式两种:Google 账号,或者用邮箱收验证码。GK 实测两种都能进,注册不需要信用卡,也不需要等邀请。
登录之后别急着写代码。控制台里有个 Playground,这是最快的上手方式:把一段文字粘进去当“状态”,再写一个问题,马上就能看到它怎么回答。

Playground 里的一次真实操作:贴进一条客服消息,问它该转给哪个团队。账务 67%、技术 33%,而置信度只有 50%——它明确告诉你这个判断不稳
要写代码的时候,去控制台的 keys 页面生成一个 API key。这个 key 只在生成时完整显示一次,记得当时就存好。

拿 key 的位置:控制台 API Keys 标签页 → Create key → 填个名字(图里已把 key 抹掉)
目前它还是早期阶段,官方文档里专门有一页列着自己知道的缺陷,后面会单独讲。另外它的接口地址是 api.typesafe.ai/v1/systemone,和 OpenAI 那套接口不通用,模型名写 jev-latest 就行。
第二步:看懂三种提问原语
整个接口只有三种问题类型。理解这三个,就理解它的全部用法了。
| 类型 | 问什么 | 返回什么 |
|---|---|---|
| Choice | 从你给的选项里挑一个。选项由你自己定义,每个选项配一句说明 | 选中的那个,每个选项各自的概率,以及置信度 |
| Score | 沿着一个有序的等级量表打分。等级由你自己描述 | 一个连续分数(可以是 1.35 这种小数)、各等级的概率、置信度 |
| Noul | 一个是非判断 | 答案成立的概率,0 到 1 之间 |
三个名字里,前两个好懂。Noul 是 TypeSafe 自己造的词,你可以直接理解成“是或否的判断题”。它返回的是概率而不是布尔值,这点很重要:0.95 和 0.55 在代码里该走不同的分支。
有个用法值得单独说:同一个请求里可以混着问多个问题,而且它们并行算完。加问题几乎不增加响应时间,只增加那点问题的 token,而 token 很便宜。所以别一个个问,把能想到的都塞进同一个请求。
另外一个容易被忽略的点:置信度只有 Choice 和 Score 才有,Noul 不返回这个字段。因为 Noul 本身就是个概率,它的“确定程度”已经包含在那个值里了。
第三步:跑通第一次调用
接口只有一个,POST 到 api.typesafe.ai/v1/systemone,请求头带上 key。请求体三段:state 放材料,model 指定模型,questions 放你的问题。
下面这个请求同时问了三个问题:这段客服消息该转给谁、客户情绪有多强、是否紧急。

返回里值得注意两处。第一,每个答案都带概率分布,不只是给一个结论。第二,department 那一项虽然选了 billing,但置信度只有 0.57,因为“收款账号连不上”确实同时像账务问题和集成问题。它在两个选项之间摇摆,并且把这件事说出来了。
如果你用 Python,官方有 SDK,装好之后不用自己拼 JSON:

五个能直接抄的实战案例
下面五个都是 GK 真实跑过的,输入和返回都在。前四个是内容运营场景,第五个是客服场景,都能直接改成你自己的。
案例一:给内容自动分类
场景:一篇文章写完,不知道该归到站内哪个栏目。用 Choice,把栏目列成选项,每个选项配一句说明。
GK 拿它把站内 43 篇文章全部跑了一遍:与站内现有归类的一致率 93%,平均置信度 0.959,总耗时 30.6 秒,总成本 0.0013 美元。三篇判断不一致的全部集中在兜底栏目上,说明问题不在模型,在那个栏目本身定义就模糊。
案例二:两个标题选一个
场景:标题定不下来,两个都还行。用 Choice 问它哪个更值得发,选项就是两个标题,说明写清各自的风格。
实测:它选了 A,置信度 0.99。有意思的是同一批问题里 GK 还问了一句“这个判断是否足够明确、不需要人工再纠结一遍”,它给了 0.48。意思是“标题选 A 我有把握,但要我保证不用人再过一眼,我没那么确定”。这两件事是分开的,也是这个模型最好用的地方。
案例三:文案质检
场景:写完一句推广文案,拿不准有没有夸大。一个 Noul 问“这段话里有未经核实的绝对化表述吗”,一个 Choice 问“最需要改的是哪里”。
实测输入是一句话:“这个模型的速度是同类产品的 12 倍,成本只有它们的 1/50,是目前最强的决策模型。”返回:绝对化表述的概率 0.93,最需要改的地方选了“两者都有”,置信度 0.83。数字缺少来源、以及“最强”这种用词,它都点出来了。
案例四:给标题打分
场景:一次写了十个标题,想知道哪个最值得用。用 Score,把等级描述写清楚,从“太平淡”到“有具体信息”。
实测把它用在站内一篇旧文的标题上:《香港VPS大盘点 2026:大厂到性价比,四档实测与避坑》,返回 1.98 分(满分 2),置信度 0.97。
案例五:客服工单分流
场景:客户消息进来,先判断该转给哪个团队、有多急、客户情绪怎么样,再决定要不要人工介入。
这是官方文档里的经典例子,也是最能体现“一次问多个问题”的场景。三个问题一次发出去,0.6 秒拿回三个答案:该转账务、客户情绪是“不满但克制”、紧急概率 0.95。而“该转给哪个团队”这一项的置信度只有 0.57,代码就该在这里停下来交给人工,其余两项可以直接自动处理。
置信度:怎么拿它做决定
这是整套东西里最需要想清楚的部分。官方给的建议是分三档处理:
高置信度:自动执行。模型看得很清楚,直接走,不需要人介入。上面那条客服消息里的情绪和紧急程度就是这类。
中等:带着警惕继续。它有答案,但不确定。这种情况可以请求用户确认,或者标记出来等人过一眼。
低:不要行动。转人工,或者要求补充信息。它在告诉你信息不够,或者这个问题不适合它回答。
阈值定在哪里,取决于做错了的代价有多大。同一个系统里,只读操作的阈值可以低一些,会改数据的操作要高一些。官方文档里给的参考值是以 0.5 为下限,高风险动作要到 0.9 以上才自动执行。
这里有一个 GK 实测出来的细节值得记住:置信度高不代表判断对。43 篇文章里有三篇判断和站内归类不一致,其中两篇的置信度分别是 0.94 和 0.97。所以置信度是用来决定“要不要人看一眼”的信号,不是正确率的保证。真要拿它做关键决策,还得自己标一批数据测一下。
接入方式怎么选
除了直接调接口,现在能选的路径不少。按上手难度排:
Playground:不写代码,浏览器里试。适合先判断它能不能干你的活。
REST 接口:一个 POST 请求,任何语言都能调。适合脚本、定时任务、小工具。
官方 SDK:Python 和 JavaScript 两套,用 Choice、Score、Noul 三个类写问题,不用自己拼 JSON。适合正经写进项目。
现成集成:LangChain 有 langchain-typesafe 包,Pydantic AI 和 LiteLLM 也都支持。如果你已经在用这些框架,可以直接接进去,不用另写一层。
自托管替代品:不想依赖闭源服务的话,现在也有开源选择。Laya 是 Apache 2.0 的决策模型家族,自托管零成本,官方标称比 Jev 快近 8 倍。但要看清它的前提:基础模型在部分基准上接近随机水平,必须用自己的领域数据微调才能用;分类选项超过 20 个时性能下降明显。它适合有数据、有人手做微调的团队,不适合拿来即用。
值得一提的是 LangChain 那两个中间件:一个按你的标准给请求挑模型,简单任务用便宜模型,复杂的才用贵模型;另一个在工具执行前先判断这个动作危不危险,危险就拦下来。这两个用法很能说明这类模型该放在什么位置:不是替代大模型,而是在大模型的流程里补上那些需要快速做、又必须可靠的判断。
这两个位置是配套的。站内 DeepSeek Harness 完整教程 那篇讲的是让模型动手做事;Jev 负责在动手之前,把那些不适合交给大模型的小判断做掉。
九个已知的坑,和 GK 又踩到的三个
官方文档里有一页专门列了自己知道的缺陷,GK 把它整理成一张表。这页很值得看,因为它直接告诉你哪些事不该交给它做。
| 坑 | 会发生什么 | 应该怎么做 |
|---|---|---|
| 照字面理解 | 它回答你写下来的问题,不是你心里那个问题。隐含条件、范围词会被当字面意思读 | 把确切条件写进 instructions,边界情况写进选项说明 |
| 算术不可靠 | 数数、加减乘除都容易错,而且要数的东西越多错得越离谱 | 算术放在代码里。要统计符合条件的数量,就逐条问再自己加起来 |
| 日期当文本处理 | 日期先后比较、时间段计算它做不好 | 把日期拆成成分取出来,在代码里比较 |
| 间接提问 | 需要绕几步才能推出答案的问题,表现明显下降 | 减少跳数,直接把相关信息写进状态 |
| 状态里塞太多无关内容 | 无关细节会干扰判断 | 先筛一遍,只发当前问题需要的部分 |
| 对抗性内容 | 状态内容不防提示注入,别人可以往材料里塞指令 | 指令写精确,上线前专门测边界情况 |
| 指令和选项说明互相矛盾 | 它只能按你写的东西判断,写矛盾了结果就飘 | 对齐两者,别让说明和问题打架 |
| 常识性等式 | 它不保证“各部分加起来等于总体”这类不变量 | 一个决定只问一次,等式关系在代码里校验 |
| 生成任务 | 写文案、写代码、写回复,它一样都做不了 | 这些交给生成模型 |
除了官方列的这些,GK 自己用下来还补三条:
中文能力弱于英文。官方在模型页上写明它在英语上表现最强,含中日韩文字的语言“可用但明显较弱”。GK 的 43 篇中文测试跑下来是可用的,但如果你的任务对准确率要求高,中文场景必须先用自己的一批数据测过再上生产。
阈值附近的结果会抖。模型返回的是精确到小数点后的分数,但这不等于业务规则就可靠了。有公开实测里出现过这种情况:标注下限 2.00 的一条消息,模型给 1.99;标注 0.75 的给 0.71 到 0.72。重复跑 15 次,有 3 道题在通过和不通过之间反复。所以阈值别卡在临界点上,要么留余量,要么把边界情况路由给人工复核。
从网站服务器调用要注意请求头。如果你在服务器上写脚本调它,记得带一个正常的 User-Agent。GK 第一次跑批处理时就被 Cloudflare 挡了,因为脚本默认发的 User-Agent 被当成自动化流量。这个坑和 Jev 本身无关,但很耽误时间。
成本
官方定价是每百万输入 token 收 0.042 美元,输出不收费。这个价格是什么概念:GK 把站内 43 篇文章全部跑一遍,输入了几万 token,总共花了 0.0013 美元,不到一分钱。
响应速度官方给的是 70 到 500 毫秒。GK 实测单篇平均 0.71 秒,比官方上限高一些,因为包含了网络往返;服务端本身的耗时在官方区间内。
便宜到这个程度会改变用法:不再是“省着用”,而是“随手就用”。站内 AI 订阅省钱方案 那篇算过同一笔账,逻辑是一样的。判断一个评论要不要人工过一遍、一篇文章该进哪个栏目、用户这句话是投诉还是咨询,这些以前觉得不值得调模型的判断,现在都可以做。
诚实声明
按 GK 的规矩,把这篇里信息的来源摊开讲:
- 一手实测:43 篇文章分类测试、40/43 一致率、置信度分布、单篇 0.71 秒、0.0013 美元成本、标题二选一、文案质检、标题打分、客服工单分流四个案例的输入与返回,全部是 GK 用自己账号调用 API 跑出来的
- 资料整理:注册流程、三种原语的写法和返回格式、置信度三档建议、九个已知坑、定价与官方延迟区间,来自官方文档;LangChain、Pydantic AI、LiteLLM 的集成方式来自各自的官方文档
- 没有说的:GK 没有测试大规模并发下的表现,也没有做过多语言准确率的系统对比。中文可用是 GK 在一批站内文章上的结论,样本是内容分类这一个场景,不代表其它任务
想看它是什么、值不值得关注,可以读上一篇。Jev 实测:43 篇文章自动分类,一致率 93%




