社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

GPT-5.6深夜上线,ChatGPT和Codex正式合并,一个时代结束了

起点财经 • 1 月前 • 75 次点击  
图片
作者:卡兹克
来源:数字生命卡兹克
文章已获授权

今天,GPT-5.6终于在OpenAI的直播中正式上线了。
除了GPT-5.6之外,ChatGPT也迎来了2022年诞生之后,我觉得最大的升级。
从OpenAI的直播预告动画就能看出来有趣的端倪了,ChatGPT和Codex,在今天、在此刻合体。
于是,全新的ChatGPT来了。
图片
Codex直接消失,与ChatGPT应用正式合并,以后,也没有Codex这个应用了,只有ChatGPT了。
但是当你打开新版的ChatGPT界面以后,你又会发现,原版的ChatGPT界面也没有了,满屏的UI,都属于原本的Codex,只剩下那个小小的聊天Tab,证明着曾经的ChatGPT,还存在过。
图片
突然有点感慨。
至此,由ChatGPT 2022年11月30日开启的Chat时代,也在今天完成了属于大众启蒙的使命,而今天,ChatGPT和Codex的合并,一切也都标志着新时代的来临,此名:
Agent时代。
让我们一个一个来聊。

一. GPT-5.6
先聊最核心的GPT-5.6。
这次一共是三个模型,分别是新旗舰模型Sol,以及适用于日常工作的均衡模型Terra,还有OpenAI所谓的最具成本效益的模型Luna。
我们主要的核心,还是来聊GPT-5.6 Sol,因为这个也基本代表着OpenAI能对外放出来的目前智能的巅峰。
这个模型强不强,你就看Anthropic的动作就行了,在GPT-5.6 Sol发布后,他们直接决定,重置额度。。。
图片
可能我这几年,从来没有像现在这样,如此期待一个新模型,期待GPT-5.6的上线。
原因特别简单,因为我那个AI新闻网站AIHOT,虽然大的我能做的都做了,比如IP地址已经换了,且藏在了边缘代理后面,做了部分DDoS防护,封禁策略和JS挑战啥的也都做了。
但是每天都在被各种手段攻击,最初的普通攻击,到现在几乎全是DDoS,还有用分布式CC来恶心的,各种乱七八糟的。
昨天一天就被打了4轮,昨天早上的没防住,导致昨天早上又被干崩了,但是下午的3轮都防住了
图片
在这个阶段,Claude Fable 5已经完全没办法用了,因为这些词几乎都是敏感词,一聊DDoS啥的直接给我切换到Opus 4.8,而且Fable 5虽然智商和规划能力超群,但是在真正的执行上,还是有点问题,经常顾此失彼,然后漏很多的东西,并且跟Claude系列一样,有一定的幻觉。
然后最大的缺点,就是贵,没蹬一会额度就没了。。。
图片
GPT-5.5是我最近反而用的最多的了。
但是问题也非常大,规划和做方案的能力非常一般,完全不思考全面,起手就知道干,幻觉率确实极低,代码执行确实很强,改BUG啥的很不错,但是吧,也经常不够全面,再加上方案和规划能力是一坨,短板还是有点太明显了。
经常给我用的非常的暴躁。
图片
在做安全策略上,更是漏洞百出,它做的方案,被人打成筛子,最后还是得我那仅剩的10%额度的Claude Fable 5来进行规则的重置和兜底。
这7天高强度的攻防和平均每天16个小时的Coding的经验,让我对Fable 5和GPT-5.5的评价一下的话。
那就是Fable 5确实是一个总监级别的大神,但是你知道的,管理层嘛,一般执行的细节程度上总归有一点的不精确,工具使用、主动性太强了,经常不管不顾的自己就全部给你搞完了,但是最后在一些细节上,是偏离了你想要的东西的。
而GPT-5.5呢,就是一个高级工程师,在执行上确实是一把好手,但是用一个网友的话来做一个很形象的描述就是:“GPT-5.5最像那种会议室里突然站起来画白板的人,你还在描述混乱,它已经开始拆方案。”
现在就卡在这了,Claude Fable 5额度用完了,GPT-5.5只能做中型的项目执行。
所以在这个背景下,大家应该就懂了,为啥我如此的期待GPT-5.6了。
因为真的希望他们能把整个Coding的能力,再往前推一步,而且我极度支持OpenAI干死呆逼Anthropic。
在OpenAI 6月26号发布了前瞻之后,今天凌晨,GPT-5.6终于来了。
图片
我第一时间直接把GPT-5.6 Sol拉到最高档Ultra开干了。
在我高强度并行开发了5个小时之后,我觉得我对GPT-5.6有了一些自己的体感,如果用一段话描述的话,那就是:
当今世界最水桶级别的模型,价格低廉,性价比极高,方案和规划能力在一些非巨型任务上媲美Fable 5(巨型任务我也接触不到,已经远超我的能力上限了),Agent能力和Coding执行上幻觉率极低极为精准,配合Codex交互体验和远程Coding更是极佳,浏览器控制更加稳定等等。
不过前端审美和内容创作依然是老大难问题,这块确实比不上Claude,但除此之外,其他的任何方面我想不出来我自己再用Claude的理由了。
而且,GPT-5.6 Sol,包含在订阅计划中,未来,订阅用户可用!
OpenAI赛高!Codex赛高!GPT赛高!
还是惯例,简单过一下GPT-5.6的官方跑分。
在覆盖55个领域长期专业工作流的Agents' Last Exam中,GPT‑5.6 Sol以53.6分刷新纪录,比Claude Fable 5(自适应推理)高出 13.1 分。
即便采用中等推理模式,它仍以约四分之一预估成本领先Fable 5达11.4分。
图片
这个我觉得是里程碑式的,Fable 5确实很强,但是那个经济效应,几乎也代表着我们几乎不可能日常大规模的使用。
而GPT-5.6以极低的成本,完成了执行效果上的超越。
而在AA家的智能指数上,GPT-5.6比Fable 5只低了一分,但是任务完成时间缩短61%,成本预估降低约一半。
图片
而在Coding领域,这个优势更加离谱了。
Artificial Analysis 编程智能体指数中,启用最大推理能力的 GPT‑5.6 Sol 以 80 分创下最新技术标杆,比Fable 5高出2.8 分,同时输出 token 减少一半以上,耗时缩短一半以上,成本降低约三分之一。
图片
从这张图其实也能看出来,对于日常来说,改BUG啥的其实推理强度开到高就差不多了。
图片
如果是大型的任务,就开到极高。
图片
究极大型的重构或者要命相关(比如我的AIHOT防护)的任务,或者你的token实在烧不完的时候,偶尔再把推理等级开到Ultra,是Token利用率最高的解法。
而且你知道,当我看到GPT-5.6 Sol在衡量从接触漏洞代码到任意代码执行进展的ExploitBench, 上,它在可比输出token预算下得分为73.5%。
这意味着什么呢,意味着,只要极低的成本,就可以达到几乎跟Fable 5相同的网络安全效果!!!
图片
说实话,我看到这个的时候,我的眼睛都在冒光,我激动的都睡不着觉。
而且在我的实测中,虽然偶尔也会出现网络安全的禁止提示。
图片
但是在我表明是为了做我的边缘代理的防护策略,我希望他帮我优化之后,他顺利的给我进行执行了,没有做任何的阻拦。
我给的任务,就是这个,我因为是语音输入的,还输入错了,把EO识别成了EU,不过这种都是小问题了:
图片
我直接开了Ultra,而且是快速模式,几乎全部都是浏览器操控,在将近21分钟之后,给了我一个非常详细的审查报告。
我是200刀的Pro套餐,Token的消耗量大概5小时额度花了20%,周额度大概花了2~3%,我想说,这比Fable 5舒服太多了。
图片
要知道,这可是21分钟的全程Chrome操控且开了快速模式,有1.5倍的消耗,再加上Ultra啊!
如果是Fable 5的话,你相信我,就这么玩,Fable 5 + Ultracode,都没有快速模式一说,一波能给你周额度干没8~10个点。
太离谱了。
而且这个质量,非常的高。
因为我的边缘代理的规则底子是Fable 5打的,后面GPT-5.5在上面打了一些补丁,也做了N次优化,但是感觉也优化不出来啥,找不出来啥问题了。
但是GPT-5.6 Sol,直接找出了一堆以前他两没有想到的问题。
图片
我就不放全文了,因为漏洞太多了。。。
直接扒拉出来了11个任务。
反正我是叹为观止,然后让GPT-5.6 Sol一波直接自己去修了。
非常的稳,一波处理的明明白白,没有任何的BUG,就看明天被攻击时候的实际防护效果了。
然后还有一个方案,大概能看出来GPT-5.6 Sol和Claude Fable 5的一些性格和个性的区别。
比如我有一个长久以来的痛点,就是为了AIHOT大家无需开魔法的阅读体验,所以我做了每个新闻的详情页,就像这样。
图片
但是这个详情页想法是好的,在实现上,有巨大的问题,因为我要把所有源站的信息,原封不动的抓过来,然后尽可能的给大家还原成跟源站一样的阅读体验。
但是你要知道,我现在监控信源的背后,有几百个形色各异的网站,我已经尽可能的去想尽一切办法去处理了,还是经常会抓来一些奇奇怪怪的东西。
就像这样。
图片
还有这样。
图片
想适配所有的网页,全部清洗成好看的,几乎跟源站一样的,甚至还要保留格式、超链接、代码库、图表等等,太难了,因为背后的网页形式实在是太多太多了,之前用Opus 4.8和GPT-5.5分别开发过,效果基本就是一坨狗屎。
但是我一直还是想解决这个需求,让AIHOT的用户在浏览信息上,能得到最好的体验。
所以我就把这个需求,同时扔给了GPT-5.6 Sol和Claude Fable 5。
让他俩同时想方案。
图片
甚至他两用的都是同一份CLAUDE.md,因为我的AGENTS.md直接软链的CLAUDE.md,所以几乎变量都是一样的,唯一不同的就是模型本身。
而最终输出后,GPT-5.6的方案,坦诚的讲,在细致程度上,我甚至觉得比Fable 5考虑的更加周全,这确实是一个很有趣的点。
比如一开始,从源头上,其实是有分类的,比如有很多不是直接抓取的,是走API和RSS的。
图片
这些是有明确的正文的。
而在GPT-5.6的考虑中,也想到这部分,但是,他并没有跟Fable 5一样,直接把那个规则当做了必须遵守的。
而是提出了质疑。
图片
所以,我们不能信他们,所有的源头都只是源头而已,我们必须自己要去做结构化的正文抽离,即使它是RSS和API输出来的,也需要如此考虑。
Fable 5其实把这个细节漏了。
包括有一个同域名网站里最近反复出现的内容,大概率就是导航啊固定CTA啥的,所以其实可以做标准化的统计,重复的就可以被识别出来了直接删掉。
GPT-5.6和Fable 5都考虑到了这一点,但是还是那个问题,在首次的输出上,依然是GPT-5.6考虑的更加细致一点。
而且还有个更离谱的是,我觉得,这一次GPT-5.6输出内容的可读性,我觉得比Fable 5是要强的,他的方案我能读的下去,但是Fable 5,可能是我太菜逼了,他的信息密度太高了,我读不下去。
最后这两个方案,我还是选择了让GPT-5.6 Sol去开了目标模式进行最终执行。
图片
因为坦率的讲,这个任务有点复杂,我对Claude Fable 5能长时的稳定的精准的处理完这么多细节,我没有信心,后期其实还是容易出现幻觉,改了这里忘了那里,然后最后再对抗性审查的时候又不断的推翻自己,很麻烦。
但是GPT-5.6的幻觉率在我的测试过程中,我体感是一如既往的,几乎就是洲际导弹的级别,指哪打哪,再配合上目标模式,最后总是能极其精准的完成任务,真的很香。
虽然过程中也会偶发跟GPT-5.5一样,有一些奇怪的低级错误导致了部分环节中的循环,但是次数会少一些,同时也能更快的解决,且不影响最终的输出。
然后之前的那个任务,截止到我发文的时候,已经开发了快2个小时了,但是还没有开发完,主要是逐篇审查对比优化,确实比较浪费时间。
图片
但是在它测试过程,我看到了一些页面,还是很棒的,我现在有点期待完他写完以后,部署到AIHOT上的效果了。
然后是前端审美这块,确实比GPT-5.5有巨幅加强,但是还是离Claude有一定距离。
比如最近马上台风不是要来了吗,我随手写了一个Prompt:
调用一个接口获取巴威台风数据, 生成一个单HTML文件的可视化大屏。
GPT-5.5的效果是这样的,就Emmmmmm。
图片
但是GPT-5.6 Sol是这样的。
图片
前端效果上还是进化了很多的,至少是不会出AI Slop了。
目前Plus、Pro用户可以使用GPT‑5.6 Sol,而免费和Go用户,只能使用GPT‑5.6 Terra。
而最高档的Ultra推理等级,只对100刀和200刀的Pro用户开放,Plus用户也用不了。
目前GPT‑5.6按每百万Token计费。
Sol 为 5 美元输入 / 30 美元输出;Terra 为 2.5 美元输入 / 15 美元输出;Luna 为 1 美元输入 / 6 美元输出。
GPT‑5.6 还引入了更可预测的提示缓存功能,包括支持显式缓存断点⁠以及30分钟的最低缓存生命周期。
对于GPT‑5.6及后续模型,缓存写入按模型非缓存输入价格的1.25倍计费,而缓存读取则继续享受90%的缓存输入折扣。

二. ChatGPT Work
这是一个我没有想到的更新。
也就是我们开头所说的,合并了ChatGPT和Codex。
现在,你可以在左上角,直接切换工作和Codex了。
图片
其实就是Cowork和Claude Code的区别。
Codex虽然是个通用Agent,可能一些专业者都知道,他既能写代码,也能办公,完全没有问题的。
但是依然有个市场的老大难问题,就是心智问题,你一说你能开发,你能写代码,很多的用户依然会觉得,那上手门槛是不是很高。
所以从心智上来说,Work和Code,反而拆开应该是最好的,虽然底层都是一个东西,但是用户认账啊。
你看国内WorkBuddy就知道了,现在都千万日活了,你这找谁说理去。
而OpenAI的产品确实有点东西,他们妙就妙在这里,没有选择推出Codex Work,而是直接把ChatGPT这个10亿周活的巨无霸给改造了,变成了ChatGPT Work,你看,这是不是就好理解多了。
而且过去的ChatGPT用户迁移过来,那简直顺理成章。
不过你要说这个Work模式跟Codex的区别,我觉得可以小到忽略不计了。
最大的心智特征,可能就是在这个菜单栏上,把分支啥的偏Code的元素,换成了Doc、PPT、Excel三件套,让你体感上,更像是帮你工作的。
图片
我随手用GPT-5.6 Sol给它自己的上线,用它自己的插件,做了个PPT。
图片
就咋说呢,GPT系列的审美啊,是不是得GPT-6的全新一代的预训练模型才能补上了。。
只是纯能看了。
不过处理表格啥的数据分析任务,那是真的强,强到上天。
有条件的,我推荐大家所有人都可以去下一个ChatGPT的应用,用它来帮大家去处理工作,这可能是你当今,能用上的性价比最高、质量最好的Work类Agent产品了。
而之前的ChatGPT Chat模式,也就是聊天,被藏在了一个小小的tab中,就好像,它的历史使命已经完成了。
图片
点击以后,右下角会出现一个弹窗,这个小小的界面,就是ChatGPT Chat了。
图片
而且这次还有个好玩的新东西,也是给Work场景用的。
就是新增了一个叫站点的功能。
图片
我们过去都知道,很多非开发者,其实做了一个产品,想要部署到线上,给别人用还是很麻烦的一件事。
所以OpenAI这次就为了解决这个需求,搞了这么个功能。
底层本质是包了一个他们自己的叫Sites的Skill。
图片
你做完一个东西以后,直接用Prompt说一句话,比如用Sites部署一下。
图片
他就会自己帮你部署到线上,然后给你一个域名,这个域名就可以分享给你的朋友和同事了。
图片
对大众来说,极其友好。

写在最后
我觉得这一次,OpenAI用他们的产品、用他们的模型,再一次证明了。
这家公司,还是有生命力的,他们还是当年的那个OpenAI。
曾经的OpenAI,是面对Google的屠龙少年,随着时代的发展,他们逐渐从勇士,变成了金银财宝之上的恶龙。
他们开始骂声一片,没人再喜欢他们,大家都在说,OpenAI就该完蛋。
可随着Anthropic的异军突起,OpenAI有那么一段时间,被打的全线开花。
他灰溜溜的走下了王座,看着曾经它的王座上,盘踞一条新的恶龙。
随后,他重新拾起盾牌,捡起那个已经开始发绣的剑。
斩向了自己的身后,把那个亲手将自己送上傲慢王座的Sora,一刀斩断。
它决定回到群众中,做群众想要的模型,做群众喜欢的产品。
直到几个月后的今天,他又回到了那个曾经属于他们的王座之前,站在了那个叫Anthropic的恶龙之前。
他说,这次。
轮到你了。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:卡兹克

>/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com


图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198686