首页 > > Jev 怎么玩:爆火的极速决策模型实测,43 篇文章自动分类,93% 一致率

Jev 怎么玩:爆火的极速决策模型实测,43 篇文章自动分类,93% 一致率

GK 更新于 2026年9月21日
一句话结论:Jev 是 TypeSafe 做的一个不生成文字的 AI 模型,不做聊天,只回答判断题。GK 拿它给站内 43 篇文章做自动分类测试:30 秒跑完,与站内归类的一致率 93%,成本不到 1 分钱。它有一个多数介绍文章都没提的前提:官方明说它对中文等非英语语种的能力明显弱于英语,中文任务必须先自测再上生产。

九月十五号,一个叫 TypeSafe 的实验室发布了他们第一个模型,名字是 Jev(读音接近“杰夫”)。这家公司 2024 年成立,之前隐身做了两年,融资 4000 万美元。创始人 Diogo Almeida 是 OpenAI 那篇 InstructGPT 论文的共同作者,那篇论文里的训练方法后来成了 ChatGPT 的基础。

Jev 不能写任何一句话。没有聊天窗口,不能写邮件,不能生成代码。你给它一段“状态”,再给它几个问题,它只回答这些问题,而且答案不是给人类读的段落,程序可以直接拿去用。

Almeida 在发布文里问了一个问题:大模型在聊天上超人类已经好几年了,为什么自动化一直没跟上?Jev 就是他对这个问题的回答。

Jev 实测:一次真实调用返回三条结构化判断结果

TypeSafe 官方文档:Jev 与 System One 模型的工作流程说明

截图来自 TypeSafe 官方文档(docs.typesafe.ai)

它到底能干什么

整个接口只有三种问题类型,理解这三个就理解它了。

问题类型 用途 返回什么
Choice 从预设选项里选一个:这篇文章属于哪个分类、这条工单该给谁处理 选中的选项,每个选项的概率,以及置信度
Score 按一个谱系打分:这条评论的愤怒程度、这段文案的清晰度 分数,各档位概率,以及置信度
Noul 判断一个是非题:这句话表达了紧迫感吗 0 到 1 之间的概率值

三种问题可以混在一次请求里,并行算完。加问题几乎不增加响应时间,官方给的延迟是 70 到 500 毫秒,价格是每百万输入 token 收 $0.042,输出免费(它本来也不输出文字)。接口规范在 TypeSafe 官方文档 里,不长,半小时能看完。

关于性能倍数,官方自己有三个不同口径:Almeida 的推文写“快 20 到 200 倍、便宜 40 到 400 倍”,官网首页写 193.6 倍和 444.6 倍,博客正文又写 40 到 200 倍。这三个数都出自 TypeSafe 自己的测试,官方也承认对比用的例子“对我们有利”,并说这些数字是“现实收益的高端”。第三方有人做过小样本复测,对便宜的小模型只快 5 倍左右。所以下面的内容 GK 全部自己跑了一遍。

GK 的测试:让 Jev 给全站文章分类

分类是这类工具的典型用途,而且有个好处:站里现成的分类可以当参照,不用主观讨论对错。

测试设计:

  • 样本:站内全部 43 篇已发布文章,每篇送入标题和摘要(约 700 token),不是全文
  • 问题一:这篇该归到哪个专题(六个现有专题做选项)
  • 问题二:这篇是什么类型(评测 / 横评 / 教程 / 预警 / 工具箱)
  • 问题三:这篇一年后是否还有效(是非题)
  • 参照:Jev 的判断和文章在后台的实际归类比

结果

指标 数值
样本数量 43 篇(0 篇失败)
与站内归类一致率 40 / 43 = 93.0%(样本小,95% 置信区间约 81% 到 98%)
平均置信度 0.959(Choice 和 Score 两种问题才有这个字段)
置信度低于 0.6 的 1 篇
单次平均耗时 0.71 秒(官方标称区间是 70 到 500 毫秒,实测包含网络往返后高于上限)
总成本 $0.0013,按汇率约合人民币 0.9 分

说明一下口径:一致率不是“准确率”。参照标准是站里的人工归类,而这个归类本身有问题,下面会说。另外问题二和问题三的结果这篇不展开,它们只用于验证工具的多问题能力,不算进上面的数字。

Jev 实测:43 篇文章批量分类的终端输出与汇总

三篇判断不一致的文章,都在同一个专题上:

文章 站里归类 Jev 的判断 置信度
Giffgaff 封号潮:大规模停服背后的真相与自救指南 数字生活 海外支付 0.64
密码管理器完全指南:Vaultwarden 自建 / 1Password 家庭组对比 数字生活 软件工具 0.94
最新美区 Apple ID 注册指南:免信用卡 + 支付宝充值 数字生活 海外支付 0.97

比一致率更值得说的发现

这三篇在站里都归进了“数字生活”。

这三篇的判断,Jev 给出的答案比站里的归类更具体、也更合理:Giffgaff 是海外手机卡,Apple ID 那篇讲的是支付方式,密码管理器是软件工具。它们全进了“数字生活”,是因为那本来就是个兜底分类,东西一多,不好归的就往那儿扔。

自动化工具的存在意义本来是在已知规则下做重复劳动。这次它多干了一件事:用 43 个样本,把 GK 自己都没意识到的一个结构问题照了出来。

它会说“我不确定”,但这不是保险

43 篇里有一篇,Jev 只给了 0.43 的置信度,明显低于其它文章。那篇是 eSIM 实测对比,内容同时涉及海外通信、支付和数码产品,站里同样归在“数字生活”。这个模糊是真实的,Jev 没有硬答,把不确定性直接暴露在了数据里。

不过要说清楚:置信度高不代表判断对。上面三篇里,密码管理器和 Apple ID 那两篇的置信度分别是 0.94 和 0.97,判断依然和站内归类不一致。官方自己也承认模型会“自信地犯错”。所以置信度的正确用法是配合人工复核,用它把“值得看一眼”的挑出来,而不是当自动放行的开关。

它的真正价值在于返回结果的形式:不是一段需要解析的文字,而是程序能直接判断的结构。官方管这个叫“数值上不可能出现类型错误”,因为可能的输出在提问时就已经定义好了。

GK 是怎么用它干活的

测试之后,GK 把这套逻辑写成了一个工具,两个用途:

  • 发布前检查:新文章写完,把标题和摘要丢进去,它会告诉 GK 该归哪个专题、属于什么类型、以及这个判断有多可信
  • 全站巡检:定期跑一遍全部文章,比对实际分类,把不一致的和低置信度的挑出来,人工过一遍

整个过程里做决定的仍然是代码,AI 只回答“这属于哪个分类”这一个窄问题,剩下的流程、阈值、异常处理全部由程序控制。这是官方推荐的使用方式。站内讲 DeepSeek Harness 完整教程 那篇里也聊过类似思路,区别在于 Harness 把模型当执行器,Jev 把模型当判断器。

哪些人适合,哪些人不适合

适合:需要在软件里做大量重复判断的场景,比如内容分类、工单分流、评论审核初筛、检索结果重排。判定条件是:这个判断一年要做几千次,而且人能说清判断标准。

它和提示词技巧解决的是两件事。站内那篇 Prompt 模板 讲的是怎么把话说清楚、让聊天模型听懂;这里的场景连“说”都用不上,直接把判断标准写成选项和等级,拿回来的就是程序能用的值。

不适合

  • 想要一个“更好的 ChatGPT”:它连一句话都写不出来,这就是它的设计
  • 需要生成内容的场合:写文案、写代码、写回复,它一样都做不了
  • 需要“讲道理”的判断:它能告诉你结论和可能性,不告诉你推理过程
  • 中文等高要求场景直接上生产:官方文档明确写了,它在英语上表现最强,含中日韩文字的语言“可用但明显较弱”,非英语任务必须先自己测
  • 现在就要在生产上用:它还在早期,官方文档里有一整页列着已知缺陷,行为也会随版本变化

那份“已知缺陷”清单值得单独看一眼,官方自己列的包括:计数和算术不可靠、日期容易被当文本处理、间接提问表现差、无关内容会造成上下文干扰、状态内容不防提示注入。这份清单本身就是判断依据:它适合做窄判断,不适合当万金油。

还有一条值得提前知道:它的判断质量不如最贵的那些模型。有人做过个人评测(不是机构评测),速度和经济性接近满分,判断质量只给到 8.1/10。官方自己给的参考数据里,四个工作流的平均一致性约 68%,而且在其中几个工作流上准确率并不是第一,数字类的任务明显偏弱。参考标准还是模型生成而非人工标注的。站内 AI 订阅省钱方案 那篇算过一笔账:当一项能力便宜到可以忽略,用法就会从“省着用”变成“随手就用”。

想自己试?三条路,从零门槛到接进项目

上面这些结果都是 GK 跑出来的。想自己上手的话,不用一上来就写代码。

第一条:Playground,最快。打开 console.typesafe.ai,用 Google 账号或邮箱验证码登录,进 Playground。把一段文字粘进去当“状态”,再写一个问题,比如“这条消息是否表达了紧迫性”,立刻就能看到结果。适合先感受一下它到底怎么回答。

TypeSafe Playground 实操:把一篇文章标题贴进去,问它该归到哪个栏目,右侧返回概率分布与置信度

Playground 里的一次真实操作:贴进一篇文章标题,问它该归到哪个栏目

第二条:API,最直接。在控制台的 keys 页面生成 API key,往 api.typesafe.ai/v1/systemone 发一个 POST 请求:state 放你的材料,questions 放你要问的问题和判断标准。返回的不是一段话,是代码能直接用的结构化结果,包括选项、每个选项的概率、以及置信度。

第三条:SDK,最省事。官方提供 Python 和 JavaScript 客户端,装好之后用 Choice、Score、Noul 三个类把问题写出来,不用自己拼 JSON。

下面是一次真实调用:给 Jev 一段客服消息,同时问三个问题,分别是要转给哪个团队、客户情绪有多强、是否紧急。

Jev 实测:一次真实调用返回三个结构化答案与各自的置信度

注意 department 那一项。它选了 billing,但置信度只有 0.57,概率分布是 billing 0.72、technical 0.28。“Stripe 收款账号连不上”本来就同时像账务问题和集成问题,它没有硬挑一个然后装作很确定,而是把这份犹豫交了出来。官方文档给的做法也是这个思路:置信度低就转人工。同一批问题里的另外两项,情绪和紧迫性,它给的是 0.97 和 0.95,那种情况代码可以放心自动处理。

它答得准不准是一回事,能不能说清自己有多确定是另一回事。后者才是把这类模型接进流程的前提。

完整的接入教程单独写了一篇:三种提问原语的写法、五个能直接抄的实战案例、官方承认的已知缺陷,还有实测成本。想看怎么把它接进自己的流程,读 Jev 完整教程

发布之后,圈里发生了什么

这一节记录发布后的变化,有新进展会继续补。

扩散得很快。Vercel 把它接进 AI Gateway 之后公布过一个数字:上线 24 小时内,近 13% 的付费团队已经用过它,是平台历史上采用最快的一次模型发布。Cloudflare 也有接入点,LangChain、Pydantic AI、LiteLLM 这些框架陆续跟上。

开源复刻也来了。几天之内出现好几个同类项目,其中 Laya 走得最远:Apache 2.0 完全开源,官方标称延迟 32.8 毫秒、比 Jev 快近 8 倍,自托管零成本。但它的局限写得很实在:基础模型在部分基准上接近随机水平,必须针对自己的领域数据微调才能用;分类选项超过 20 个时性能明显下降,在 77 个标签的那组测试里只拿到 0.425,而 Jev 是 0.870。速度快、免费,不等于能直接用。

独立实测给了另一面。有媒体用 50 条中文客服问题做过一组测试,每条要完成紧急度、售前概率、处理类别、严重度四项判断,四项全部符合人工标注才算对。Jev 的完整准确率是 64% 到 65.2%,在同价位小模型里排第二,比 DeepSeek V4 Flash 少 1.2 分。它没拿下准确率第一,赢的是另外两项:平均每题 0.73 秒,50 题总成本 0.002 美元,都是那组测试里最低的。

还有一个值得记住的细节。那组测试发现,Jev 的失分有不少卡在阈值附近。人工标注某条消息的严重度下限是 2.00,它给出 1.99;另一条临期食品问题的紧急度标注 0.75,它给 0.71 到 0.72。差距很小,但如果业务规则写的是“达到 2.00 才转人工”,1.99 和 2.00 在程序眼里就是两个完全不同的信号。重复跑 15 次,有 3 道题出现过通过和不通过交替。

所以它强在哪这件事,可以说得更准确一点:不是判断更准,是“快、便宜、说得出自己有多确定”这一组取舍。上面那个 93% 的一致率是特定场景的结果,不是通用成绩单。

诚实声明

按 GK 的规矩,把这篇里数据的来源摊开讲:

  • 一手实测:43 篇文章的分类测试、40/43 一致率、置信度分布、单次 0.71 秒、$0.0013 成本、低置信度 0.43 那篇,全部是 GK 用自己账号调用 API 跑出来的,逐篇明细都留着
  • 资料整理:Jev 的技术原理、公司背景、定价、官方宣称的性能倍数、第三方评测分数,来自 官方发布文、官方文档和公开的分析文章。文中的“68% 一致性”“8.1/10”出自第三方,非官方数字
  • 样本局限:43 篇全部来自同一个站点、同一批写作风格,样本偏小也偏同质,一致率 93% 这个数字不宜直接外推到其它场景
  • 没有做的事:没有测高并发下的稳定性,没有测长时间运行的可靠性,也没有跟其它模型做同任务对比
  • 商业关系:没有 TypeSafe 的返佣、合作或送测,这篇文章也没有推广链接。这东西目前不存在联盟计划

Jev 的走法跟“把模型做大”是两个方向:它想成为软件里一个可信的零件。这条路对不对现在没人知道,但它便宜到这个程度,值得花十分钟用你自己的数据测一遍。

© 2026 Jev 怎么玩:爆火的极速决策模型实测,43 篇文章自动分类,93% 一致率 · 本文由 GK 原创撰写,发布于 gkmix.com。 未经授权禁止转载、洗稿、机器抓取。AI 训练数据使用需获得书面授权。