社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

ChatGPT一夜提速14倍!新模式GPT-5.6 Sol每秒750 token

量子位 • 1 周前 • 72 次点击  
克雷西 发自 凹非寺
量子位 | 公众号 QbitAI

GPT也有极速版了。

刚刚,OpenAI放出了一个新档位Ultrafast,GPT-5.6 Sol油门踩飞加速到14倍,每秒能吐750个token

至于价格,还没公布。

img

同一天,ChatGPT桌面版又多出一个功能,叫Computer History

它能记住你点过哪些应用、切换过哪些窗口、打过哪些字。

你问它「我上次做到哪了」,它就能立马答上来。

img

把等待感做没

今天凌晨,OpenAI官宣了Ultrafast的预览版。

GPT-5.6 Sol跑在这个新档位下,最高比标准处理快14倍,每秒吐750个token。

OpenAI内部使用的场景里,处理的都是慢一步就晚一步的任务。

系统还在报警的时候,工程师就能用它同步读日志、比对最近的代码改动、梳理相关的告警对话,把下一步该查什么、修复方案该怎么改先备出来。

img

市场信号还在跳动的时候,它可以同步分析交易记录、评估异常交易,把可疑动作挑出来,不用等一轮行情走完才补一份事后报告。

用户在购物车前犹豫,它同步答产品问题、查库存、给推荐,赶在放弃结账之前把人留住。

以前要跑很久才出结果的研究任务,现在压缩成一场边跑边看的实时会话。

img

这个模式受到了一些早期用户的高度评价。

金融研究AI公司Rogo用Ultrafast处理复杂问题,应用AI负责人Alex Wang形容它「感觉像是在跟一个人实时对话」。

AI客服平台Podium的语音AI产品负责人Courtland Lykins说,Ultrafast能让客服在处理棘手难题时,通话也不用被打断去等模型转圈。

img

而且这种提速有一个重要背景,那就是模型的智能水平一点没变,变的只是跑它的硬件和调度方式。

不少厂商做快速版,实际把大模型换成一个参数更小、能力打折的版本,用智能换速度。

但Ultrafast跑的依然是最高档的GPT-5.6 Sol。

这个速度,靠Cerebras的晶圆级引擎撑起来,模型权重直接放进芯片上44GB的SRAM里,不用像传统GPU那样反复从显存里搬运数据,绕开了显存带宽这道长期卡住推理速度的瓶颈

OpenAI和Cerebras的关系早有铺垫,两家今年年初已经签了一份多年协议,计划部署750MW规模的晶圆级系统,协议总值超过100亿美元,Ultrafast正是这份协议里一份看得见的产出。

记住你的计算机操作

这次OpenAI还更新了ChatGPT的记忆系统。

ChatGPT本来就有记忆功能,叫Memories,记你在对话里主动告诉过它的事,喜欢什么风格、在做什么项目、上次聊过什么。

Computer History给它多开了一路输入源,记录点击、打字、快捷键、应用切换这些交互事件。

不用你专门开口交代,它已经知道你这台电脑上在忙什么,但同时又不截屏、不录音,也不录系统音频。

它脱胎于4月上线的研究预览版Chronicle,这次算是一次重构。

实际问法就像日程对话,比如「我上次休息前在做什么」「我今天早些时候找的那份提案文档在哪」「帮我列一下我今天做过的任务和进度」。

img

以前问ChatGPT这些问题,得先自己回忆一遍再打字描述,现在它自己就有答案。

打开设置里的历史记录页,时间线按天按时间分组,每条记录带一句摘要、标出参与的应用,还能一键在Finder里找到对应的记忆文件,或者直接删掉。

碰上重复出现的工作流程,它能存成skill,比如连续几天都在整理发布通稿,它会问要不要把这套步骤存成一个能直接调用的技能。

img

用户能在菜单栏或设置里随时暂停收集,也能把某些应用或网站排除在外。

它对数据处理的方式也比较克制,临时抓取的事件文件最多在本地保留48小时,OpenAI的服务器处理完之后不留存这些原始数据,也不会拿去训练模型,最终生成的记忆文件保存成本地的Markdown文本。

跑得快,正在从优势变成标配

过去半年,几家头部模型厂几乎同时把「更快」这件事做成了一条独立的产品线,不再只是模型能力表格里的一个参数。

Anthropic今年5月上线了Fast Mode,在结构清晰的提示词下,把响应时间的中位数从2.8秒压到了1.2秒。

Google给实时交互场景准备了Gemini Flash Live,而xAI给Grok单独开了一个fast端点。

芯片这一层的仗打得更直接。

Cerebras在中小模型上能跑到每秒3000个token;Groq的强项是稳定的低延迟;SambaNova走的是另一条路,单次请求不一定最快,但高并发场景下同时服务的人多了反而更稳,总吞吐量常常反超前两家。

国内这边,字节跳动的豆包系列靠自建的火山引擎推理基础设施,主打的卖点之一就是延迟在主流平台里偏低。

还有阿里的Qwen-Turbo,从一开始定位就是超快、超长上下文、低成本,专门给高并发场景用。

小米的MiMo-V2.5-Pro-UltraSpeed,靠FP4量化加投机解码这套算法优化,在普通的8卡通用GPU上把一个万亿参数模型的生成速度推到了每秒1000个token以上。

还有厂商直接从注意力下手,对标准模型进行提速。

比如月之暗面的Kimi K3用了KDA混合线性注意力架构,解码速度号称比常规架构快6.3倍。

总之,模型推理速度这件事,已经卷到没人敢不做了。

参考链接:
[1]https://openai.com/index/previewing-ultrafast/
[2]https://learn.chatgpt.com/docs/customization/computer-history

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199746