ChatGPT 研究员 Diogo Almeida 前几天放出新模型 Jev。它不聊天,不写代码,只干一件事:给判断。据他介绍,同样一个判断任务,它比传统大模型快 20 到 200 倍。成本只剩对方的四十分之一到四百分之一。
一个不会说话的模型,凭什么更快也更便宜。
下面按顺序说清楚。这篇 AI软件教程 从排号讲到上手,也顺带划出它的边界。
想试的话先排号。打开官网,点 Join Waitlist,填上邮箱。

我这边等了几个小时就放行了。等的工夫可以先看原理。

它跟聊天模型差在哪
差别在输出形式。和 AI对话 模型不同,它不生成大段文字。
传统大模型给你的是一段话。你问它选哪个工具,它会先复述需求,再挨个比较候选,最后才报结论。

这个判断模型只报结论。

它把任务压缩成一个结果,答完就停。不解释原因,也不列优缺点。
三种判断方式
它把判断拆成三类。
Choice 用来选。从一堆候选里挑最合适的那个。比如下一步该调哪个工具,或者这条工单该给谁。
用法是先把清单给它。清单里有几个选项,它就回几个分数。候选写得越具体,判断越贴近你要的结果。
Score 用来打分。判断的是程度,不只有对错。
一条内容要不要人工复核,看分数落在哪一档。用户有多生气,风险有多高,都能落到分数上。
分数档位也要先定义。零分和三分各代表什么,提前说清。
Noul 用来验真假。判断某件事是否成立,同时给一个概率。
比如这条评论是不是广告,这个单子要不要退款,这次操作有没有安全风险。
它也很适合做闸门。放行还是拦下,一个概率就够。
三类可以一次问完。一条用户反馈同时判断类别、情绪和退款意图,省掉三轮往返。
概率低的时候,别急着让它继续。人工看一眼更稳。
它们都不产出新内容。想要一段通顺的解释,还得回去找会聊天的模型。
这三类覆盖了大部分日常决策。它们的共同点是,你得先把选项或者标准交出去,这一步省不掉。
为什么又快又便宜
因为它少算了一大半。
传统模型生成答案,是一个字接一个字往后写。回答越长,生成得越多,等待和费用跟着涨。
真正省下来的不是字数,是步骤。
会聊天的模型每多写一个字,都要再算一遍。判断模型只算一次。
它不写长文。算完直接出结果,任务结束。
定价说明了这一点。输入端每百万 token 收 0.042 美元,折合人民币两毛八。输出端免费。
它不只告诉你选哪个,还告诉你有多确定。输出里带概率和置信度。
这一点很实用。某次判断给出某个工具 72%,另一个 19%,剩下的加起来不到一成。
你可以据此定规则。概率超过九成就自动执行。六到九成再确认一次。低于六成转人工。
阈值怎么定,看你的场景。宁可多拦一道的,把线压到五成。
图省事就先用默认值跑一周,看看误判落在哪。
确定的事让机器做,不确定的事交给人。它的定位就在这里。
短板也明显。你给不出候选范围,它就没法判断。
候选里没有正确答案时,它照样会挑一个最像的,概率还给得不低。这一点得留神。
指望它凭空想出一堆方案,不现实。
有人担心它会取代对话模型。目前看是分工,不是取代。
从注册到上手
申请通过后,邮箱会收到邀请链接。

走这个链接才能注册。

注册完就能用了。它由 TypeSafe 发布,注册送五美元额度。
登录后分两步。先看首页的快速开始,再创建 API 密钥。

快速开始的正文可以整段复制。里面有现成的安装指令,你把它发给自己常用的编程助手就行。

密钥的创建是常规流程。进页面,点 Create key,起个名字,复制出来。它只显示一次。

第一次用直接跟助手说需求就行。前提是先给它可判断的范围。
比如让它从四个标题里挑一个最适合普通读者的。也可以让它读一条用户反馈,一次输出三个判断。这属于哪类问题,用户有多不满,有没有退款意图。
还能拿它定工具调用。用户说想看明天去上海的机票,顺手查一下上午有没有会。候选工具摆在它面前,由它拍板先调哪个。
给一堆 AI工具 做路由也是常见玩法。简单查询走便宜模型,复杂的多步推理交给强模型,让它来出这个决定。
已经有人在这么用
有人拿它当 Agent 的安全闸门。在退款和转账这类动作前,先过一道判断。
有人用它做客服分流。一次判断给出两个答案,该进哪个部门,急不急。
还有人干脆让它玩游戏。每走一步都问它选哪个动作,从迷宫一路玩到老游戏。
搜索重排和钓鱼邮件检测,这些场景都有人试过。
原文作者测了一下午,账单是 0.0008 美元。

