首页 > > Jev 完整教程:注册取 key、三种提问原语,5 个能直接抄的实战案例

Jev 完整教程:注册取 key、三种提问原语,5 个能直接抄的实战案例

GK 更新于 2026年9月21日
一句话结论:这是 Jev 的接入教程。从注册取 key 到跑通第一个判断,三种提问原语的写法和返回格式,五个能直接抄的实战案例,官方自己列出的九个已知坑,以及 GK 实测的成本数据。前置条件只有一个:一个 TypeSafe 账号,不需要信用卡。

上一篇写的是评测:Jev 是什么、值不值得关注。这一篇只讲一件事:怎么把它接进你自己的流程里

先说清楚它和聊天模型的用法差别,这是很多人第一次用会卡住的地方。用 ChatGPT 那类模型,你写的是提示词,然后从它吐出来的一段话里想办法把数据抠出来。用 Jev,你写的是问题的结构:给它一段材料,再告诉它你要问哪几个问题、每个问题的备选答案或判定标准是什么。它返回的是程序可以直接用的值,不需要解析。(站内 Prompt 模板 那篇讲的是前一件事怎么写好;这篇讲的是后一件事。)

第一步:注册、拿 key、先玩五分钟

打开 console.typesafe.ai。登录方式两种:Google 账号,或者用邮箱收验证码。GK 实测两种都能进,注册不需要信用卡,也不需要等邀请。

登录之后别急着写代码。控制台里有个 Playground,这是最快的上手方式:把一段文字粘进去当“状态”,再写一个问题,马上就能看到它怎么回答。

TypeSafe Playground 实操:贴进一条客服消息,问该转给哪个团队,返回各选项概率与置信度

Playground 里的一次真实操作:贴进一条客服消息,问它该转给哪个团队。账务 67%、技术 33%,而置信度只有 50%——它明确告诉你这个判断不稳

要写代码的时候,去控制台的 keys 页面生成一个 API key。这个 key 只在生成时完整显示一次,记得当时就存好。

TypeSafe 控制台创建 API key 的操作路径:进入 API Keys 标签页,点 Create key,填写名称

拿 key 的位置:控制台 API Keys 标签页 → Create key → 填个名字(图里已把 key 抹掉)

目前它还是早期阶段,官方文档里专门有一页列着自己知道的缺陷,后面会单独讲。另外它的接口地址是 api.typesafe.ai/v1/systemone,和 OpenAI 那套接口不通用,模型名写 jev-latest 就行。

第二步:看懂三种提问原语

整个接口只有三种问题类型。理解这三个,就理解它的全部用法了。

类型 问什么 返回什么
Choice 从你给的选项里挑一个。选项由你自己定义,每个选项配一句说明 选中的那个,每个选项各自的概率,以及置信度
Score 沿着一个有序的等级量表打分。等级由你自己描述 一个连续分数(可以是 1.35 这种小数)、各等级的概率、置信度
Noul 一个是非判断 答案成立的概率,0 到 1 之间

三个名字里,前两个好懂。Noul 是 TypeSafe 自己造的词,你可以直接理解成“是或否的判断题”。它返回的是概率而不是布尔值,这点很重要:0.95 和 0.55 在代码里该走不同的分支。

有个用法值得单独说:同一个请求里可以混着问多个问题,而且它们并行算完。加问题几乎不增加响应时间,只增加那点问题的 token,而 token 很便宜。所以别一个个问,把能想到的都塞进同一个请求。

另外一个容易被忽略的点:置信度只有 Choice 和 Score 才有,Noul 不返回这个字段。因为 Noul 本身就是个概率,它的“确定程度”已经包含在那个值里了。

第三步:跑通第一次调用

接口只有一个,POST 到 api.typesafe.ai/v1/systemone,请求头带上 key。请求体三段:state 放材料,model 指定模型,questions 放你的问题。

下面这个请求同时问了三个问题:这段客服消息该转给谁、客户情绪有多强、是否紧急。

Jev API 请求与返回:一次调用同时问三个问题,返回结构化结果

返回里值得注意两处。第一,每个答案都带概率分布,不只是给一个结论。第二,department 那一项虽然选了 billing,但置信度只有 0.57,因为“收款账号连不上”确实同时像账务问题和集成问题。它在两个选项之间摇摆,并且把这件事说出来了。

如果你用 Python,官方有 SDK,装好之后不用自己拼 JSON:

TypeSafe Python SDK 用法:用 Choice、Score、Noul 三个类定义问题

五个能直接抄的实战案例

下面五个都是 GK 真实跑过的,输入和返回都在。前四个是内容运营场景,第五个是客服场景,都能直接改成你自己的。

案例一:给内容自动分类

场景:一篇文章写完,不知道该归到站内哪个栏目。用 Choice,把栏目列成选项,每个选项配一句说明。

GK 拿它把站内 43 篇文章全部跑了一遍:与站内现有归类的一致率 93%,平均置信度 0.959,总耗时 30.6 秒,总成本 0.0013 美元。三篇判断不一致的全部集中在兜底栏目上,说明问题不在模型,在那个栏目本身定义就模糊。

案例二:两个标题选一个

场景:标题定不下来,两个都还行。用 Choice 问它哪个更值得发,选项就是两个标题,说明写清各自的风格。

实测:它选了 A,置信度 0.99。有意思的是同一批问题里 GK 还问了一句“这个判断是否足够明确、不需要人工再纠结一遍”,它给了 0.48。意思是“标题选 A 我有把握,但要我保证不用人再过一眼,我没那么确定”。这两件事是分开的,也是这个模型最好用的地方。

案例三:文案质检

场景:写完一句推广文案,拿不准有没有夸大。一个 Noul 问“这段话里有未经核实的绝对化表述吗”,一个 Choice 问“最需要改的是哪里”。

实测输入是一句话:“这个模型的速度是同类产品的 12 倍,成本只有它们的 1/50,是目前最强的决策模型。”返回:绝对化表述的概率 0.93,最需要改的地方选了“两者都有”,置信度 0.83。数字缺少来源、以及“最强”这种用词,它都点出来了。

案例四:给标题打分

场景:一次写了十个标题,想知道哪个最值得用。用 Score,把等级描述写清楚,从“太平淡”到“有具体信息”。

实测把它用在站内一篇旧文的标题上:《香港VPS大盘点 2026:大厂到性价比,四档实测与避坑》,返回 1.98 分(满分 2),置信度 0.97。

案例五:客服工单分流

场景:客户消息进来,先判断该转给哪个团队、有多急、客户情绪怎么样,再决定要不要人工介入。

这是官方文档里的经典例子,也是最能体现“一次问多个问题”的场景。三个问题一次发出去,0.6 秒拿回三个答案:该转账务、客户情绪是“不满但克制”、紧急概率 0.95。而“该转给哪个团队”这一项的置信度只有 0.57,代码就该在这里停下来交给人工,其余两项可以直接自动处理。

置信度:怎么拿它做决定

这是整套东西里最需要想清楚的部分。官方给的建议是分三档处理:

高置信度:自动执行。模型看得很清楚,直接走,不需要人介入。上面那条客服消息里的情绪和紧急程度就是这类。

中等:带着警惕继续。它有答案,但不确定。这种情况可以请求用户确认,或者标记出来等人过一眼。

低:不要行动。转人工,或者要求补充信息。它在告诉你信息不够,或者这个问题不适合它回答。

阈值定在哪里,取决于做错了的代价有多大。同一个系统里,只读操作的阈值可以低一些,会改数据的操作要高一些。官方文档里给的参考值是以 0.5 为下限,高风险动作要到 0.9 以上才自动执行。

这里有一个 GK 实测出来的细节值得记住:置信度高不代表判断对。43 篇文章里有三篇判断和站内归类不一致,其中两篇的置信度分别是 0.94 和 0.97。所以置信度是用来决定“要不要人看一眼”的信号,不是正确率的保证。真要拿它做关键决策,还得自己标一批数据测一下。

接入方式怎么选

除了直接调接口,现在能选的路径不少。按上手难度排:

Playground:不写代码,浏览器里试。适合先判断它能不能干你的活。

REST 接口:一个 POST 请求,任何语言都能调。适合脚本、定时任务、小工具。

官方 SDK:Python 和 JavaScript 两套,用 Choice、Score、Noul 三个类写问题,不用自己拼 JSON。适合正经写进项目。

现成集成LangChain 有 langchain-typesafe 包,Pydantic AILiteLLM 也都支持。如果你已经在用这些框架,可以直接接进去,不用另写一层。

自托管替代品:不想依赖闭源服务的话,现在也有开源选择。Laya 是 Apache 2.0 的决策模型家族,自托管零成本,官方标称比 Jev 快近 8 倍。但要看清它的前提:基础模型在部分基准上接近随机水平,必须用自己的领域数据微调才能用;分类选项超过 20 个时性能下降明显。它适合有数据、有人手做微调的团队,不适合拿来即用。

值得一提的是 LangChain 那两个中间件:一个按你的标准给请求挑模型,简单任务用便宜模型,复杂的才用贵模型;另一个在工具执行前先判断这个动作危不危险,危险就拦下来。这两个用法很能说明这类模型该放在什么位置:不是替代大模型,而是在大模型的流程里补上那些需要快速做、又必须可靠的判断。

这两个位置是配套的。站内 DeepSeek Harness 完整教程 那篇讲的是让模型动手做事;Jev 负责在动手之前,把那些不适合交给大模型的小判断做掉。

九个已知的坑,和 GK 又踩到的三个

官方文档里有一页专门列了自己知道的缺陷,GK 把它整理成一张表。这页很值得看,因为它直接告诉你哪些事不该交给它做。

会发生什么 应该怎么做
照字面理解 它回答你写下来的问题,不是你心里那个问题。隐含条件、范围词会被当字面意思读 把确切条件写进 instructions,边界情况写进选项说明
算术不可靠 数数、加减乘除都容易错,而且要数的东西越多错得越离谱 算术放在代码里。要统计符合条件的数量,就逐条问再自己加起来
日期当文本处理 日期先后比较、时间段计算它做不好 把日期拆成成分取出来,在代码里比较
间接提问 需要绕几步才能推出答案的问题,表现明显下降 减少跳数,直接把相关信息写进状态
状态里塞太多无关内容 无关细节会干扰判断 先筛一遍,只发当前问题需要的部分
对抗性内容 状态内容不防提示注入,别人可以往材料里塞指令 指令写精确,上线前专门测边界情况
指令和选项说明互相矛盾 它只能按你写的东西判断,写矛盾了结果就飘 对齐两者,别让说明和问题打架
常识性等式 它不保证“各部分加起来等于总体”这类不变量 一个决定只问一次,等式关系在代码里校验
生成任务 写文案、写代码、写回复,它一样都做不了 这些交给生成模型

除了官方列的这些,GK 自己用下来还补三条:

中文能力弱于英文。官方在模型页上写明它在英语上表现最强,含中日韩文字的语言“可用但明显较弱”。GK 的 43 篇中文测试跑下来是可用的,但如果你的任务对准确率要求高,中文场景必须先用自己的一批数据测过再上生产。

阈值附近的结果会抖。模型返回的是精确到小数点后的分数,但这不等于业务规则就可靠了。有公开实测里出现过这种情况:标注下限 2.00 的一条消息,模型给 1.99;标注 0.75 的给 0.71 到 0.72。重复跑 15 次,有 3 道题在通过和不通过之间反复。所以阈值别卡在临界点上,要么留余量,要么把边界情况路由给人工复核。

从网站服务器调用要注意请求头。如果你在服务器上写脚本调它,记得带一个正常的 User-Agent。GK 第一次跑批处理时就被 Cloudflare 挡了,因为脚本默认发的 User-Agent 被当成自动化流量。这个坑和 Jev 本身无关,但很耽误时间。

成本

官方定价是每百万输入 token 收 0.042 美元,输出不收费。这个价格是什么概念:GK 把站内 43 篇文章全部跑一遍,输入了几万 token,总共花了 0.0013 美元,不到一分钱。

响应速度官方给的是 70 到 500 毫秒。GK 实测单篇平均 0.71 秒,比官方上限高一些,因为包含了网络往返;服务端本身的耗时在官方区间内。

便宜到这个程度会改变用法:不再是“省着用”,而是“随手就用”。站内 AI 订阅省钱方案 那篇算过同一笔账,逻辑是一样的。判断一个评论要不要人工过一遍、一篇文章该进哪个栏目、用户这句话是投诉还是咨询,这些以前觉得不值得调模型的判断,现在都可以做。

诚实声明

按 GK 的规矩,把这篇里信息的来源摊开讲:

  • 一手实测:43 篇文章分类测试、40/43 一致率、置信度分布、单篇 0.71 秒、0.0013 美元成本、标题二选一、文案质检、标题打分、客服工单分流四个案例的输入与返回,全部是 GK 用自己账号调用 API 跑出来的
  • 资料整理:注册流程、三种原语的写法和返回格式、置信度三档建议、九个已知坑、定价与官方延迟区间,来自官方文档;LangChain、Pydantic AI、LiteLLM 的集成方式来自各自的官方文档
  • 没有说的:GK 没有测试大规模并发下的表现,也没有做过多语言准确率的系统对比。中文可用是 GK 在一批站内文章上的结论,样本是内容分类这一个场景,不代表其它任务

想看它是什么、值不值得关注,可以读上一篇。Jev 实测:43 篇文章自动分类,一致率 93%

© 2026 Jev 完整教程:注册取 key、三种提问原语,5 个能直接抄的实战案例 · 本文由 GK 原创撰写,发布于 gkmix.com。 未经授权禁止转载、洗稿、机器抓取。AI 训练数据使用需获得书面授权。