社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

ChatGPT 的共同发明人,造了个不会聊天的模型 Jev,判断和表达头一回拆开卖

O神经网络 • 2 小时前 • 6 次点击  


参与造出 ChatGPT 的人,发了新模型,它不会说话

Diogo Almeida,OpenAI 时期参与 InstructGPT 和 RLHF 的核心研发,ChatGPT 与 GPT-4 论文的共同作者。两年前他离开聚光灯创办 TypeSafe AI,本周二公司走出潜行期,第一个产品叫 Jev。

他的官宣推文第一句就说。

共同发明 ChatGPT 之后,我一直在问自己,为什么超人的聊天模型没有带来 AGI。

—— Diogo Almeida,TypeSafe AI 创始人

他的答案很极端。聊天这件事,可能从头就是 AI 走向大规模自动化的错误形态。Jev 第一刀砍掉的就是文本生成,没有对话框,不写文章,不陪你聊,它只干一件事,判断。

会聊天,在软件里是包袱


大模型很强,但把它塞进软件里打工,一直有三个老大难。

一是慢。主流模型吐字像打字机,一个字一个字往外蹦,软件里一秒要做上百个决定的地方,根本等不起。二是贵。按 token 计费,输入输出都收钱,海量任务跑起来账单吓人。三是不可靠。你让它返回一个是非加一个分数,它十有八九先写一段客套开场白,格式偶尔还崩,程序一解析就报错。

工程师的老办法是打补丁,写约束、套检查、失败了重试,把大模型的输出硬掰回能用的形状。Diogo 的判断更狠,这些毛病不是补丁没打好,是生成文本这个动作自带的。只要模型还要逐字往外吐,慢和贵就省不掉。

只卖判断的模型


新类别叫 System One 模型,名字借自卡尼曼《思考,快与慢》里的系统一,人不假思索的那部分脑子,扫一眼就知道该往哪走。放到软件里,官方给它的定位是智能 if 语句,代码跑到岔路口,它负责抬手一指。

打个比方。大模型像按字收费的顾问,你问这单退货该走哪条流程,他先写一篇小作文论证,再谨慎地给个结论。Jev 像车间老师傅,你把现场往桌上一摊,他眼皮都不抬就给你指了条道,还告诉你这个判断有几分把握。

具体拆开,Jev 只做三种动作,官方叫三个原语。Choice,从选项里挑一个。Score,按你给的标准打分。Noul,判断一句话是真是假,返回一个 0 到 1 的真值。三种动作可以在一次调用里并行打包,复杂判断拆成原子小问题,用你自己的代码拼装,加权逻辑留在代码里,改权重改系数,不用碰 prompt。

输出的格式在架构层就被锁死,行话叫类型安全,说人话就是它想说错格式都难,官方称类型错误率在数学上等于零。每个答案自带校准过的概率和置信度,模型知道自己哪块地界有把握,哪块没底。

训练方法有自己的名字,RLCD,校准决策强化学习。过去几年行业标配的 RLHF 对齐人类偏好,模型学会说讨人喜欢的话。RLCD 对齐决策的校准性,模型学会把概率算准。这是 TypeSafe 的核心创新,也是判断能单独拿出来卖的技术前提。

X 上的科技博主宝玉看完发布会,总结得比官方还直白。

Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是,我需要 AI 的判断力,但不需要它的表达力。

—— 宝玉,X 科技博主

官方口径的数字


价格先摆出来。输入 0.042 美元每百万 token,折合十亿 token 42 美元,主流模型的输入价在 0.2 到 10 美元一档。输出 token 免费,官方的说法是便宜到没法计费。官方口径,同任务比同智能水平的大模型 快 20 到 200 倍,便宜 40 到 400 倍

这些数字要打折听。评测是 TypeSafe 自建的四个工作流基准,参照对象是 GPT-6 Astra 和 Anthropic Fable 5.1,官方自己也承认出题阅卷都是一家,结果可能有偏向。193.6 倍的最大加速、444.6 倍的最大省钱,属于最优情况,别当日常水位。

延迟这一项最硬。70 到 500 毫秒,大模型回一句话的工夫,Jev 已经把一整批判断交卷了。这个量级,才塞得进有真人在线等的环节,实时推荐、动态定价、游戏里的 AI 对手,这些过去不敢想让 AI 介入的地方。

一场演示,一组第三方数据


演示最能说明定位。TypeSafe 让 Jev 实时玩老游戏 DOOM,每秒约 10 次决策,跑一小时成本约 7 美元。换成按字收费的大模型,光延迟就够游戏卡成幻灯片。

第三方数据更扎实。科技博主 Dewaldt Huysamen 拿到早期试用,转录了两组数字。内容公司 Every 把 37 份文档跑过 21 项检查,777 个判断 0.7 秒出结果,成本约 0.25 美分。另一位早期用户跑了 5000 个请求,总花费 2 美元,一半请求 150 毫秒内返回,95 分位也就 350 毫秒。

一次判断 0.0004 美元。判断力便宜到这个地步,工程师可以挥霍着用,过去舍不得让 AI 看一眼的数据,现在能全量过一遍机器。

同一批测试里也有反面结果。写作质检场景,7 个植入错误 Jev 抓出 6 个,Fable 5.1 抓出全部 7 个。Jev 快 25 倍、便宜 580 倍,准确率差一口气。Dewaldt 的结论很清醒,Jev 适合当第一道快速闸门,终审留给大模型,两道工序各司其职。

新类别能不能立住


该泼冷水了。TypeSafe 刚出潜行期,融资规模据传 4000 万美元种子轮,出处是 X 上 Grok 的自动回复,官方没确认。定价能不能长期守住、输出免费是不是拿补贴换市场,都要时间给答案。

更基本的问题只有一个,市场需不需要一个新类别。大模型厂商也在进化,结构化输出、函数调用这些能力一直在补课。Jev 赌的是判断值得从生成里彻底拆出来,单独造一种模型,这张牌桌上目前只有它一家。

跟你的钱包有什么关系


你用的 AI 产品,背后是开发者在付推理账单。账单结构变了,产品形态就会跟着变。过去一个功能要在贵而聪明和便宜而笨之间二选一,现在多出一个选项,让大模型想,让 Jev 断。实时审核、客服分流、逐条打标,这些因为成本和延迟一直不敢重度上 AI 的环节,账突然算得过来了。

对行业,这条新腿值得单独说一句。我五月份写过,Claude Code 的源码里 AI 决策逻辑只占 1.6%,剩下 98.4% 是工程约束,当时的结论是模型的脑子要靠工程系统拎着走。Jev 把这个问题又往前推了一步,判断这件小事,干脆从大模型身上拆下来,做成一颗便宜的标准零件

最后说名字。Jev 取自 19 世纪经济学家杰文斯,他留下一个悖论,效率越高,消耗越多。名字里藏着创始人的野心,等判断便宜到白菜价,软件对判断的胃口只会越撑越大。大模型负责把话说好,Jev 们负责把事断对,两种能力分开计价,这笔账第一次算得这么清楚。


Macaron 🧁 | 快想慢说,分开卖


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201173