参与造出 ChatGPT 的人,发了新模型,它不会说话。
Diogo Almeida,OpenAI 时期参与 InstructGPT 和 RLHF 的核心研发,ChatGPT 与 GPT-4 论文的共同作者。两年前他离开聚光灯创办 TypeSafe AI,本周二公司走出潜行期,第一个产品叫 Jev。
他的官宣推文第一句就说。
共同发明 ChatGPT 之后,我一直在问自己,为什么超人的聊天模型没有带来 AGI。
—— Diogo Almeida,TypeSafe AI 创始人
他的答案很极端。聊天这件事,可能从头就是 AI 走向大规模自动化的错误形态。Jev 第一刀砍掉的就是文本生成,没有对话框,不写文章,不陪你聊,它只干一件事,判断。
会聊天,在软件里是包袱
大模型很强,但把它塞进软件里打工,一直有三个老大难。
一是慢。主流模型吐字像打字机,一个字一个字往外蹦,软件里一秒要做上百个决定的地方,根本等不起。二是贵。按 token 计费,输入输出都收钱,海量任务跑起来账单吓人。三是不可靠。你让它返回一个是非加一个分数,它十有八九先写一段客套开场白,格式偶尔还崩,程序一解析就报错。
工程师的老办法是打补丁,写约束、套检查、失败了重试,把大模型的输出硬掰回能用的形状。Diogo 的判断更狠,这些毛病不是补丁没打好,是生成文本这个动作自带的。只要模型还要逐字往外吐,慢和贵就省不掉。
只卖判断的模型
新类别叫 System One 模型,名字借自卡尼曼《思考,快与慢》里的系统一,人不假思索的那部分脑子,扫一眼就知道该往哪走。放到软件里,官方给它的定位是智能 if 语句,代码跑到岔路口,它负责抬手一指。
打个比方。大模型像按字收费的顾问,你问这单退货该走哪条流程,他先写一篇小作文论证,再谨慎地给个结论。Jev 像车间老师傅,你把现场往桌上一摊,他眼皮都不抬就给你指了条道,还告诉你这个判断有几分把握。
具体拆开,Jev 只做三种动作,官方叫三个原语。Choice,从选项里挑一个。Score,按你给的标准打分。Noul,判断一句话是真是假,返回一个 0 到 1 的真值。三种动作可以在一次调用里并行打包,复杂判断拆成原子小问题,用你自己的代码拼装,加权逻辑留在代码里,改权重改系数,不用碰 prompt。
输出的格式在架构层就被锁死,行话叫类型安全,说人话就是它想说错格式都难,官方称类型错误率在数学上等于零。每个答案自带校准过的概率和置信度,模型知道自己哪块地界有把握,哪块没底。
训练方法有自己的名字,RLCD,校准决策强化学习。过去几年行业标配的 RLHF 对齐人类偏好,模型学会说讨人喜欢的话。RLCD 对齐决策的校准性,模型学会把概率算准。这是 TypeSafe 的核心创新,也是判断能单独拿出来卖的技术前提。
X 上的科技博主宝玉看完发布会,总结得比官方还直白。
Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是,我需要 AI 的判断力,但不需要它的表达力。
—— 宝玉,X 科技博主
官方口径的数字
价格先摆出来。输入 0.042 美元每百万 token,折合十亿 token 42 美元,主流模型的输入价在 0.2 到 10 美元一档。输出 token 免费,官方的说法是便宜到没法计费。官方口径,同任务比同智能水平的大模型
快 20 到 200 倍,便宜 40 到 400 倍。
这些数字要打折听。评测是 TypeSafe 自建的四个工作流基准,参照对象是 GPT-6 Astra 和 Anthropic Fable 5.1,官方自己也承认出题阅卷都是一家,结果可能有偏向。193.6 倍的最大加速、444.6 倍的最大省钱,属于最优情况,别当日常水位。
延迟这一项最硬。70 到 500 毫秒,大模型回一句话的工夫,Jev 已经把一整批判断交卷了。这个量级,才塞得进有真人在线等的环节,实时推荐、动态定价、游戏里的 AI 对手,这些过去不敢想让 AI 介入的地方。
一场演示,一组第三方数据
演示最能说明定位。TypeSafe 让 Jev 实时玩老游戏 DOOM,每秒约 10 次决策,跑一小时成本约 7 美元。换成按字收费的大模型,光延迟就够游戏卡成幻灯片。
第三方数据更扎实。科技博主 Dewaldt Huysamen 拿到早期试用,转录了两组数字。内容公司 Every 把 37 份文档跑过 21 项检查,777 个判断 0.7 秒出结果,成本约 0.25 美分。另一位早期用户跑了 5000 个请求,总花费 2 美元,一半请求 150 毫秒内返回,95 分位也就 350 毫秒。
一次判断 0.0004 美元。判断力便宜到这个地步,工程师可以挥霍着用,过去舍不得让 AI 看一眼的数据,现在能全量过一遍机器。
同一批测试里也有反面结果。写作质检场景,7 个植入错误 Jev 抓出 6 个,Fable 5.1 抓出全部 7 个。Jev 快 25 倍、便宜 580 倍,准确率差一口气。Dewaldt 的结论很清醒,Jev 适合当第一道快速闸门,终审留给大模型,两道工序各司其职。
新类别能不能立住
该泼冷水了。TypeSafe 刚出潜行期,融资规模据传 4000 万美元种子轮,出处是 X 上 Grok 的自动回复,官方没确认。定价能不能长期守住、输出免费是不是拿补贴换市场,都要时间给答案。
更基本的问题只有一个,市场需不需要一个新类别。大模型厂商也在进化,结构化输出、函数调用这些能力一直在补课。Jev 赌的是判断值得从生成里彻底拆出来,单独造一种模型,这张牌桌上目前只有它一家。
跟你的钱包有什么关系
你用的 AI 产品,背后是开发者在付推理账单。账单结构变了,产品形态就会跟着变。过去一个功能要在贵而聪明和便宜而笨之间二选一,现在多出一个选项,让大模型想,让 Jev 断。实时审核、客服分流、逐条打标,这些因为成本和延迟一直不敢重度上 AI 的环节,账突然算得过来了。
对行业,这条新腿值得单独说一句。我五月份写过,Claude Code 的源码里 AI 决策逻辑只占 1.6%,剩下 98.4% 是工程约束,当时的结论是模型的脑子要靠工程系统拎着走。Jev 把这个问题又往前推了一步,判断这件小事,干脆从大模型身上拆下来,做成一颗便宜的标准零件。
最后说名字。Jev 取自 19 世纪经济学家杰文斯,他留下一个悖论,效率越高,消耗越多。名字里藏着创始人的野心,等判断便宜到白菜价,软件对判断的胃口只会越撑越大。大模型负责把话说好,Jev 们负责把事断对,两种能力分开计价,这笔账第一次算得这么清楚。
Macaron 🧁 | 快想慢说,分开卖