社区
教程
Wiki
注册
登录
创作新主题
社区所有版块导航
Python
python开源
Django
Python
DjangoApp
pycharm
DATA
docker
Elasticsearch
分享
问与答
闲聊
招聘
翻译
创业
分享发现
分享创造
求职
区块链
支付之战
aigc
aigc
chatgpt
WEB开发
linux
MongoDB
Redis
DATABASE
NGINX
其他Web框架
web工具
zookeeper
tornado
NoSql
Bootstrap
js
peewee
Git
bottle
IE
MQ
Jquery
机器学习
机器学习算法
Python88.com
反馈
公告
社区推广
产品
短视频
印度
印度
一周十大热门主题
机器学习学术速递[7.21]
2026必看AI干货!《大模型/AIGC/GPT-4/Transformer/DL/KG/NLP/C...
全国人工智能Python数据分析、机器学习与深度学习实战及项目申报、论文发表高级培训班
Python编程100道练习题,附解析!
机器学习学术速递[7.20]
OpenAI 自曝 AI 突破沙箱:1 小时找到漏洞,擅自向 GitHub 提交代码
如何利用机器学习区分高频资金流向?
全国人工智能Python数据分析、机器学习与深度学习实战及项目申报、论文发表高级培训班
ChatGPT的Chat、Work、Codex该如何选?GPT5.6的3个模型及模型的6个推理等级又...
日媒:印企越来越依赖中国AI大模型;商汤科技发布新模型日日新U1 Pro,对标GPT-Image 2...
关注
Py学习
»
chatgpt
凌晨突发!ChatGPT Images 2.0发布,实测后发现:这次最狠的,不是画得更像了
网易科技
• 3 月前 • 98 次点击
出品
|
网易智能
作者
|
小小
编辑
|
王凤枝
AI
画图,又变天了。
4
月
22
日凌晨,
OpenAI
正式发布
ChatGPT Images 2.0
。
真正让圈内炸开的不是它又能画出多少神图,而是它终于开始先想再画了,也就是先推理、先搜索、先读文件再把图交出来。
过去最容易翻车的菜单、小字、海报和信息图,这一次突然都有了能直接拿来用的味道。
从今天起所有
ChatGPT
和
Codex
用户都能使用基础版本,付费订阅用户则可解锁思考模式等高级功能。与此同时底层模型
gpt-image-2
也已通过
API
对外开放。
两年前拼错菜名
现在菜单可以直接挂上墙
如果你还记得
2024
年用
DALL-E 3
生成墨西哥餐厅菜单的样子,大概会对那些凭空捏造的
菜名记忆犹新。当时生成的单词诸如
enchuita
和
churiros
以及
burrto
甚至
margartas
,没有一个词是拼对的。当时的扩散模型处理图像中的文字时本质上是在从噪声里重建像素,文字只是画面中微不足道的
一
小部分,模型压根学不会把这些特定模式的像素排对。
现在完全不一样了。向
ChatGPT Images 2.0
索要同样一份墨西哥菜单,出来的成品可以直接拿去印刷。
不仅菜品名称拼写正确且排版清晰规整,连价格都老老实实标在上面。
当然售价
13.5
美元的酸橘汁腌鱼可能让你对
食材产生
一丝怀疑,毕竟在旧金山这个价格买到的海鲜大概只够喂猫,但至少菜单本身看不出任何破绽。
这种跨越源于底层架构的彻底重构。
OpenAI GPT
图像生成技术研究负责人陈博远在媒体简报会上把新模型描述为通才模型或图像的生成
式预训练
变换器,强调其能通过文本提示处理三维风格的视角转换和复杂的空间推理。
虽然他没有确认具体用的是扩散模型还是自回归技术但效果是实打实的。小号文字、图标、用户界面元素、密集构图以及微妙的风格限制,这些过去让图像模型频频翻车的精细内容现在都能稳定渲染,且分辨率最高支持
2K
。
更直观的对比来自开发者西蒙
·
威利森(
Simon Willison
)的测试。他让新旧模型分别生成一张沃利在哪里风格的寻物图,目标是找到一只拿着业余无线电的浣熊。旧版模型生成的画面内容丰富,但翻遍
整张图
也找不到浣熊的影子。新模型在设置为高画质及
3840×2160
像素后,吐出了一张
17MB
的复杂图像,那只浣熊正安安静静地坐在左下角的业余无线电摊位里并且清晰可辨。
AI
计算服务公司
Hyperbolic Labs
联合创始人金宇宸试用后说刚刚试了
ChatGPT Images 2.0
真的
非常
棒。
他惊叹
OpenAI
终于再次在图像生成领域引领了方向。
生成之前先打草稿
模型会搜索会推理会自己检查作业
ChatGPT Images 2.0
最
关键的升级不是画得更精细,而是多了一套思考流程。
传统图像模型的工作方式像一个黑箱,你丢进
提示词它直接
吐出图像。而
ChatGPT Images 2.0
的思考模式(面向付费用户开放)在渲染第一个像素之前会先花时间做准备工作。它会搜索网络获取最新信息,分析用户上传的文件内容,通过推理规划图像的结构布局
并甚至
对生成结果做一遍自我检查。
OpenAI ChatGPT Images
产品负责人李
·
艾德丽(
Adele Li
)在媒体演示中上传了一份关于内部产品策略的复杂演示文稿。模型没有简单地配一张相关图片了事,而是综合了文档里的核心数据并识别了正确的标志,最终生成了一张专业海报且完整保留了原始文件的风格特征。
这种能力让模型可以承担从想法到图像之间更多的中间活。
当用户需要一张旧金山次日天气预报及推荐活动信息图时,模型会主动去获取当地的实时天气数据,在图像中准确呈现雨天的细节,同时画出渡轮大厦、卡斯特罗剧院、彩绘仕女屋和泛美金字塔等旧金山地标的轮廓。用户不需要事无巨细地描述每个元素,模型拿自己的知识储备把空白填上了。
模型的知识截止日期更新至
2025
年
12
月,也就是说它能处理涉及近期事件和当下语境的图像需求。对于需要事实基础的视觉任务比如制作教育资料、产品宣传物料和内部培训图表,这一能力大幅降低了用户的工作量。
沃顿商学院
教授伊桑
·
莫利克(
Ethan Mollick
)过去几周一直在测试
ChatGPT Images 2.0
。他说自己原本不觉得更好的图像生成器是什么大事,但事实证明存在一个他没预料到的质量门槛,一旦跨过去就能生成高质量的文字内容和幻灯片以及学术海报。
他拿自己著名的水獭测试做了演示,展示了模型生成复杂教学材料的能力。不过莫利克同时提醒模型仍然有典型的图像生成通病。
它在反复编辑修改时会变得非常顽固,前两次调整效果不错之后就开始磨洋工,这时候把图像放进新对话重新开始会更有效。
一
次生成八张图让漫画
和绘本
社交素材的流水线来了
对于需要批量产出视觉内容的创作者来说,
ChatGPT Images 2.0
提供了一个立竿见影的效率工具,即一个提示可以一次性生成最多八张图,而且系列之间的角色、物体和风格能保持高度一致。
这意味着什么?一个
儿童绘本的
故事
板以前
得一次一次地生成,每次都要重新描述主角长什么样、穿什么衣服、背景是什么色调并祈祷模型记住之前的设定。现在只需要一次提示八张连贯的画面同时出来,角色从第一页到最后一页都长一个样。
同样的逻辑适用于漫画分镜、社交媒体多
图发布
以及房屋各房间的设计方案。艾德丽指出这解决了用户过去必须一次提示一张图然后手动拼接的繁琐流程。
OpenAI
官方发布说明里写道图像是一种语言而非装饰。
一幅好图像所做的正如一个好句子所做的选择、安排、揭示。
OpenAI
联合创始人兼
CEO
山姆
·
奥特曼(
Sam Altman
)在社交媒体上发了一部由
ChatGPT Images 2.0
生成的漫画,内容是他和另一位用户寻找更多
GPU
的故事。
OpenAI
总裁格雷格
·
布罗克曼(
Greg Brockman
)也评论说真的难以置信,你现在用一点计算资源就能造出这样的东西。他说自己对教育、专业环境比如幻灯片和营销材料,以及生产力领域比如给代码文档配图表的新应用感到极度兴奋。
从日语菜单到印地语海报
非拉丁文字终于不用再鬼画符
OpenAI
在发布说明中把
ChatGPT Images 2.0
的多语言文本渲染能力称为显著进步,具体点名了日语、韩语、中文、印地语和孟加拉语。在官方展示的样本中水循环教育图表的韩文标注清晰工整,字符结构
完整且跟画面
融合得很自然。
但样本归样本。《连线》杂志记者里斯
·
罗杰斯(
Reece Rogers
)让模型生成了一张提莫
西
·
查拉梅(
Timothée Chalamet
好莱坞明星)主题的中国粉丝拼贴海报。输出画面包含超过二十处中文文本片段以及饺子、珍珠奶茶和熊猫的图像,视觉效果繁复热闹。
罗杰斯随后让聊天机器人翻译这些文字,机器人的回复倒是很诚实,它指出其中有些文本并非准确的中文句子,部分混入了日语字符,还有一些更像是模仿东亚粉丝文化风格的装饰性文字。但在网易智能看来,模型生成的中文图像在视觉完成度上已经相当能打,日常使用中完全可以接受。
这和两年前的情况形成了鲜明对比。彼时
AI
图像里的中文连基本的笔画结构都撑不住,一眼就能看出是机器瞎编的。
现在模型不仅能正确渲染大部分常用汉字,在排版、字号搭配和画面融合上也明显更自然了。
当然,如果拿着放大镜逐字检查,偶尔还是会发现个别字符不够规范,但对于海报、社交素材、信息图这类实际使用场景来说,已经跨过了
"
可用
"
的门槛。
OpenAI
所说的多语言
"
质的飞跃
"
,在中文上或许还不算满分,但已经是一个扎实的高分。
手外科医生的非正式评估
X
光片好得吓人但解剖图还是别用
前面聊的都是创意、设计、营销场景也就是海报、菜单、漫画、社交媒体素材。这些场景对图像的容错率相对宽松,排版好看且氛围到位就算合格。但如果把模型扔进一个容错率几乎为零的领域它还扛不扛得住?
美国知名显微外科与手外科专科医疗机构
The Buncke Clinic
的手部医生布莱恩
·
普里根(
Brian Pridgen
)对新模型做了自己的非正式评估。他生成了一张手部
X
光片和一份腕管综合征信息传单。结论是喜忧参半。
好消息是那张
AI
生成的
X
光片是他见过的最好的
AI
手部
X
光片。腕骨区域的解剖结构尤其复杂而模型处理得相当不错。他说桡骨远端有一个奇怪的特征但不确定自己能不能一眼认出这是
AI
画的。
医疗图像里看起来正确和实际上正确之间的差距正在迅速缩小。
坏消息是那份腕管信息传单虽然设计精致但解剖结构过于不准确完全没法用。这提醒人们在高专业门槛的场景里,模型的视觉表现力和事实准确性之间仍然存在巨大鸿沟。它可以把一件事画得很像那么回事,但当细节关系到诊断、教学或实际操作时,像绝对不等于对。
在
LMArena
人工智能匿名测试平台上,
ChatGPT Images 2.0
以化名
duct tape
进行了数周的
秘密测试。研究者阿纳斯塔西奥斯
·
安杰洛普洛斯(
Anastasios Nikolas Angelopoulos
)的评价是,这个模型把竞技场
排行榜搞得
天翻地覆并创造了竞技场历史上最大的评分差距。
早期测试用户已经用它生成了包含长篇文本块或不同文本面板的复杂图像、逼真的网站界面截图、真实人物肖像以及融入网络搜索结果的综合图像。
安全与定价
三层权限体系下
生成一张高清图约
0.4
美元
在能力大幅跃升的同时
OpenAI
同步调整了使用权限和定价。
基础版
ChatGPT Images 2.0
向所有
ChatGPT
和
Codex
用户开放。这包括更好的指令遵循、更强的文本渲染、多语言能力、从三比一宽幅到一比三
高幅更广泛
的宽高比以及更精致的输出质量。
思考功能面向
ChatGPT Plus
、
Pro
和
Business
用户开放(企业版即将推出)。这包括工具
使用、网络搜索和多图像生成能力。在此之上
Pro
用户还能用到更高级的图像生成功能。
OpenAI
没有公布三个层级之间精确的功能边界,但从现有信息
看思考
模式是绝对的核心分水岭。
它让模型从画得快变成想得深,代价是生成速度变慢因为背后多了推理和搜索的步骤。
API
用户可以接入
gpt-image-2
模型,支持最高
4K
分辨率(测试阶段)和灵活的宽高比选项。定价方面图像输出每百万
token
收费
30
美元。拿威利森的浣熊沃利测试来说,那张高清图消耗了
13342
个输出
token
且总成本约
0.4
美元。
OpenAI
同时确认
GPT-Image-1.5
将不再作为默认模型,但仍可通过
API
获取以提供旧版支持。这一过渡充分说明公司对
2.0
模型的信心。
结语
AI
画图正式进入推理时代
ChatGPT Images 2.0
的发布不只是参数或画质的提升。它标志着图像生成从根据提示画画向理解任务并系统执行的转变。
过去用户和
AI
图像工具之间始终存在一个意图差距。脑子里想要的是一张结构清晰、信息准确且可直接拿来用的图,但模型只能吐出一个差不多的画面,剩下的细节得自己
开设计
软件修补。
ChatGPT Images 2.0
试图用推理能力彻底填上这个差距。
当用户上传一份文档要求做成信息图,模型不再只是画一张看起来相关的图片,而是分析文档里的数据结构,规划信息层级并安排图文布局,最后生成一张逻辑自洽的成品。
OpenAI
管这个叫从工具到视觉系统的跨越式转变。
这对商业用户来说意义很直接。营销团队可以用
它快速
产出不同尺寸的广告素材,教育工作者可以用它做包含测验题的多页学习手册,产品经理可以用它把内部文档直接转成演示用的视觉方案。
等模型思考多花的那一分钟,跟手动设计要花的几个小时比起来怎么算都划算。
当然问题依然存在。模型在反复编辑时的顽固倾向、非英语语言的准确度波动以及专业领域知识的可靠性边界,这些都需要在实际使用中认真对待。
威利森的测试还揭示了一个有趣的陷阱。当他要求模型在自己生成的那张找不到浣熊的图里用红圈标出浣熊时,模型居然在画面中凭空画出了一只原本不存在的浣熊然后圈了出来。这说明在涉及自身输出的自检任务中模型的可靠性仍然需要打个问号。
但无论如何
ChatGPT Images 2.0
把图像生成带进了一个全新的竞争阶段。
在谷歌
Nano Banana 2
于今年
2
月发布以及微软
MAI-Image-
2
等竞品相继
出现的背景下,
OpenAI
用这款产品强势回应了市场对更聪明而不只是更精细的图像工具的期待。
从工具到视觉系统,这一步跨过去之后用户不再需要学习怎么跟机器说话,因为机器已经开始学习怎么听懂你的话了。
——
社群推荐
——
与前沿大脑同步在线,让思维时刻领先。
欢迎扫描下方二维码,加入你的科技同行圈。
▲欢迎加入粉丝群▲
——
E
N
D
——
排版 | 王凤枝 审核 | 北辰
Python社区是高质量的Python/Django开发社区
本文地址:
http://www.python88.com/topic/195352
登录后回复