社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

新模型Jev爆火:曾帮ChatGPT学会聊天的人,为啥做个不聊天AI?

罗辑思维 • 6 天前 • 52 次点击  

过去两年,大模型都在往“更全能”卷:会写、会画、会推理、会调用工具。但最近硅谷突然火了一个反着走的模型Jev。

它不会写文章,不会写代码,甚至不会聊天,只做三件事:选择、打分、判断是非。偏偏就是这样一个“不会说话”的AI,拿到了4000万美元种子轮融资,也迅速刷屏开发者社区。

今天,得到AI学习圈主理人快刀青衣老师就来聊聊,Jev为什么会在这个时间点突然走红。它真正值得看的,不只是一次技术路线上的“反着来”,更是它提醒了我们一个常被忽略的问题:能力越强,不等于越适合所有任务。真正重要的,是把能力放到最需要它的地方。
作者:快刀青衣
来源:得到App《AI学习圈》

不少朋友可能发现,虽然最近这两三个月新的大模型层出不穷,但我却很少聊这些。

原因很简单,我觉得现阶段,这几个顶尖大模型的能力虽然有差别,但整体都已经非常强了。

比起纠结到底选什么大模型,我们更应该关注,到底用AI解决什么问题。

还有一个原因,过去一年,大模型赛道上来来回回都是那几张熟面孔:GPT、Claude、Gemini、DeepSeek……

大家卷的方向也差不多,谁写得更好,谁推理更强,谁上下文更长,真是你方唱罢我登场。

不过,今天我要跟你聊一个这两天新冒出来的东西,叫Jev。

它简直就像我们在管理学故事里常见的「鲶鱼」一样,掀起了讨论热潮,刷屏了整个硅谷开发者社区。

它火得很猛。创始人的发布帖两天拿了超过3000万次浏览、6万多个赞,DCVC领投了4000万美元的种子轮,有媒体说估值大约2亿美元。

我更感兴趣的是它做的一个选择,同时也能解答大家的一个问题:这模型凭啥突然火了?

要知道,Jev这个模型主动砍掉了大模型最核心的一项能力:生成文本。它不会写文章,不会写代码,甚至不会聊天。

它重点只做一件事:判断。

造它的人叫迪奥戈·阿尔梅达,前OpenAI研究员,也是2022年InstructGPT论文的共同作者之一。

InstructGPT这篇论文地位非常高,因为它是ChatGPT的直系前身,也就是让AI学会听人话、像人一样说话的那套训练方法。

阿尔梅达是参与者之一,所以,也有唯恐天下不乱的短视频把他称为「ChatGPT之父」。怎么说呢,反正我觉得ChatGPT挺不容易的,我差不多见过七八个人被称为它的爸爸了。

不过我的好奇心就来自这里:他当初可是帮AI学会聊天的人,离开OpenAI之后花了两年时间,造了一个不会聊天的AI。为什么?他图什么?

他在发布帖的视频里解释了动机,大意是:现在的AI Agent系统,有一个巨大的浪费。

我们来想一个场景。你是一家公司的客服主管,每天收到几千封客户邮件,需要分拣到不同的处理队列里,退款的归退款,投诉的归投诉,咨询的归咨询。

你让一个大模型来干这事,它会怎么做呢?

它会认认真真读完每封邮件,然后写一大段分析:这封邮件的客户情绪偏负面,涉及产品质量问题,建议归类为投诉类,优先级为高。

写得很好。但软件系统根本不需要这段话。软件需要的只是一个词,「投诉」;或者一个数字,「3」;或者一个判断,「是或否」。

中间那一大段文字,没人会读,也没有软件会用。它就是凭空生成出来,又凭空消失掉了。

这就像一个人被要求做选择题,但他每次都非要先写一篇议论文,然后再从里面提取出ABCD。

阿尔梅达说,在今天的Agent系统里,这种浪费无处不在。一个复杂的AI工作流可能要做上百次判断,每次都让大模型跑一整套生成流程,等于用大炮打蚊子。

而Jev的做法是,把这些「小判断」单独拎出来,用一个专门训练过的模型来处理。它只输出三种东西:选择、打分、是否。

不写句子,不做解释,不输出任何人类语言。

快多少呢?官方给的数据是,同样一个分类判断,GPT-4o可能要花几秒甚至更久,Jev可以压到几十毫秒,快了近200倍。

再说成本。因为它不需要生成任何文本,每次调用消耗的算力极小,官方说成本只有原来的四百分之一。

当然,这些倍数大家看看就好,因为比的是特定任务上的峰值表现,不是所有场景都这样。但核心逻辑是成立的:在不需要语言输出的任务上,压根不需要一个会说话的模型。

那它到底好使在哪?我翻了一圈发布这两天媒体和社区里的讨论,还有官方放出来的案例,挑几个具体说说。

第一个是浏览器Agent。Browser Use的创始人格雷戈尔·祖尼奇做了一个演示,让AI帮他搜一张从苏黎世飞伦敦的机票。

用传统大模型驱动的浏览器Agent,光是在页面上判断该点哪个按钮、该往哪个输入框填内容,就磨磨蹭蹭花了好几分钟。

换成Jev处理这些中间判断,整个流程7秒钟跑完。因为每一步的判断延迟从秒级压到了毫秒级,累计下来,差距就是几十倍。

第二个是上下文压缩。现在的Agent动不动就要处理超长文本,一个复杂任务的上下文可能撑到上百万token。

Jev可以做一件事:逐段扫描这些上下文,判断每一段跟当前任务有没有关系,没关系的直接扔掉。

有人测试过,128万token的上下文,经过Jev筛完只剩8.6万,缩了93%,而且关键信息没丢。

这就相当于,你让一个实习生先帮你把一百页的报告划出重点段落,你只需要看那七八页就行了。

第三个是大批量文档处理。有个开发者测试了一下,用Jev跑777次分类判断,总共花了大约0.25美分,不到两分钱人民币。

对那些每天要处理海量文档的企业来说,这个成本意味着,以前用不起的场景,现在可能可以随便跑了。

但值得关注的是,类似这样只用来判断的东西早就有人做过,为什么偏偏是Jev在这个时间点爆了?

我觉得,让它这次火起来的,是时机。

过去一年,AI Agent从概念走向实际部署,越来越多的开发者真的开始在生产环境里跑Agent了。

举个例子,Anthropic最近披露了一组内部数据,他们自己的研发流程里,半年前能被Agent主导的任务占比还不到1%,现在已经飙到了26%,有3万个Agent在同时运行。

这还只是一家公司。

Agent跑得越多,那些中间环节的小判断就越多。每次都调大模型跑完整的生成流程,账单高得离谱,延迟慢得想骂人。

特别是现在越顶级的大模型,思考时间越长。甚至一个小问题,顶级模型都会觉得:人肯定不会问这么简单的问题,一定有深意。

Jev不是第一个看到这个问题的,但它的出现,恰好是所有人都受够了的时候。

你看,推出时机,可能比技术本身更重要,这件事本身就是一个挺好的案例。当然,Jev这个故事里最让我有感触的,是我们之前忽略的一个问题。

过去两年,大模型变得越来越强,能写文章,能写代码,能推理,能多模态,所有人都在卷「全能」。我们也习惯了,遇到什么任务都往大模型上扔。

但拆开来看,Agent系统里真正需要语言能力的环节,可能连一半都不到。大量的中间步骤,要的只是一个选择、一个评分、一个是或否。

我们一直在用会说话的模型,去干不需要说话的活。

这个错配,不是谁故意为之,而是因为之前没有别的选择。你手上只有锤子,什么都得当钉子。现在Jev出来了,它未必是最终答案,但它至少让大家意识到了这个错配的存在。

做产品也一样。现在AI把很多工具层面的能力拉平了,人人都能做网站,人人都能写APP。做出来不难,难的是做出来有人用。

Jev给我的启发是,先别急着想「我能做什么」,先问一个更基本的问题:我的用户到底需要什么?

需求匹配得准,比一味追求能力全面更重要。

说了这么多,除了技术本身,我还挺佩服这个团队做的事情,因为他们做的是一件反共识的事,并不是别人怎么做,自己就怎么做。

也许正因为这样,阿尔梅达才能在之前参与做出擅长说话的AI,现在又做出了不会说话的Jev。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201440