社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

刚刚,ChatGPT-6 震撼发布

学术AI大模型 • 16 小时前 • 19 次点击  

这次,科研人的工具箱又要大更新了。

9月3日(美国时间),OpenAI 发布 GPT-6 Astra,同步升级Codex运行框架。

Greg Brockman喊出的口号是 “欢迎来到AGI时代”。落到科研人桌面上,这次升级最吸引我的,是GPT-6开始更有能力接下一整份工作:读材料、跑分析、处理报错,再交回图表和文档。

| 01 GPT-6强在哪

最明显的跃升,是复杂科研任务的执行能力。

Terminal-Bench Science 0.1中,GPT-6得分64.6%,上一代GPT-5.6 Sol为22.4%,提高42.2个百分点。这套测试涵盖数据分析、模拟、模型拟合,检查实际交付物,很贴近科研人的日常。

高难数学也上了一个台阶:FrontierMath Tier 4(v2)从83.0%升至97.6%。研究生级科学问答GPQA Diamond则从94.6%升至96.0%。

放在一起看,进步的重心很清楚:在原本已擅长的知识问答上继续提高,在需要多步推导和执行的任务上拉开更大差距。对于科研用户,我会更看重后面这一类能力,它关系到一个方案能否继续做下去。

电脑操作同样更熟练。OSWorld 2.0离线集的部分计分成绩从65.7%升至72.6%;官方延迟模拟中,单任务耗时从约75分钟缩到40分钟。

软件操作能力把推理结果接到了实际工具上。比如一份分析需要导入数据、调整选项、导出结果,再把结果放进汇报材料,GPT-6的操作效率提升,就有机会省掉人在窗口之间来回切换、反复解释下一步的时间。

而在 ARC-AGI-3 上,GPT-6的表现更是惊人。这项指标,主要用于反映智能体在解决陌生的交互任务时的学习能力。GPT-6 Astra 在评估中表现优异,得分为99.9%。作为参考,平均人类测试者得分约为48%。

在使用代码和终端工具完成科学研究工作流,包括数据分析、运行模拟和模型拟合的过程中。GPT-6 Astra 在所比较的模型中也达到了新高,准确率为64.6%,而此前长期处于榜首的 Claude Fable 5.1,准确率仅为52.6%,其估计的API成本也低约31%。

综上所述,GPT-6这次的大进步集中在 “难题推理+连续执行”。对于分析跑到一半报错、需要在软件里反复操作的任务,这比多答对几道知识题更有吸引力。

| 02 GPT-6 的科研能力

1 数学:把长期难题向前推了一步

孪生素数猜想研究的是:差值为2的素数对,是否有无穷多?这个问题长期困扰数学界。2013年,张益唐首次证明存在一个有限的素数间距界,随后研究者不断缩小它。

像11和13、17和19,就是两组孪生素数。找出这样的例子很容易,难的是证明它们永远找不完。沿着数轴往远处走,素数整体越来越稀疏;研究者仍要证明,有无穷多个局部区域会出现相距很近的素数。

OpenAI公布的《Improved Short Gaps Between Primes》把这一方向长期熟悉的246推进到186,并将证明归功于GPT-6。同期Julia Stadlmann也有将界降至240的独立工作。

直观地说,论文给出的结果是:数轴无论延伸多远,总能继续找到间距不超过186的相邻素数对。

这里缩小的,是理论所能保证的距离范围。把246推进到186,意味着关于“素数可以靠得多近”的结论更强了。对于一个经过长期研究的数论方向,这种推进本身就是实质性的科研进展。

2 文件核对:一次检查41份材料

在官方演示中,Legora用GPT-6交叉核对财务文件,几分钟内找出全部4个预埋错误,包括收入附注里50万英镑的差额。公司报告,该项工作流的内部评测表现提升近40%,整套测试平均提升约3%。

这个场景和论文写作异曲同工:检查正文样本量与表格是否一致,回归结果与附录是否对应,同一变量有没有换单位。

试想一下,在审稿时,我们科研让GPT-6按“文件、位置、差异”列出清单,先对样本量、变量名称和单位,再找同一结果在正文、表格、附录中的不同写法。

接下来作者就能直接定位修改,少在几十个附件之间来回翻找。

3 PPT与科研图:会操作,也更懂排版

除了更会“干活”以外,GPT-6 在审美方面的能力,也有巨大提升。

让它基于一份只有三页的模板,制作虚构模型GPT-Gaia的介绍PPT。生成页面延续了模板布局,重新组织图文层级,重点也更集中。

想要内容更丰富的图表?也没问题!

这次审美的,对组会汇报很实用:把课题组模板与研究结果一起交过去,让GPT-6统一字体、配色和信息层级,能更有针对性地解决“内容齐了,页面还是乱”的问题。

如果上述场景还不足以展示GPT-6的潜力,那就请看看GPT-6绘制的电路图吧:

除此之外,官方还展示了测序质量检查、遗传变异可视化等场景。GPT-6的用武之地已经延伸到专业软件里的图形编辑。

未来,我们可以把科研图的要求进一步拆开:数据图先处理坐标、分组和图例,机制图先梳理对象与关系,最后再统一视觉风格。PPT里则要考虑投影后的可读性,减少小字,把最需要观众看到的结果放在显眼位置。

3 更擅长记忆的Codex

除了模型本身,配套的 Codex 也喜提重大更新。

如今的 Codex,能跨上下文窗口记笔记、检索旧消息和工具输出。做长时间分析或反复改图时,Codex 可以找回早先的要求与报错记录,接着推进任务。

早期的模型有时会将导航指令视为一个新目标,从而丢失了原始请求或之前的约束条件。

而 GPT-6 Astra 加持下的 Codex 能够融入新要求,在被要求时调整路线,并回答相关问题而不偏离整体任务。

试想一下,我们要把一张结果图改到第五轮,第一轮确定的分组顺序、第二轮排除的方案、后面新增的配色要求,都属于继续工作要用到的信息。

能检索这些记录,长任务就更容易沿着已经确定的方向前进,少把旧问题重新讨论一遍。

| 03 费用

是的,GPT-6确实更贵了

GPT-6的API标准价为每百万token输入10美元、输出50美元,均为Sol当前单价的2.5倍。

按10万未缓存输入、1万计费输出token计算,标准请求费用约为GPT-6的1.50美元、Sol的0.60美元。长输入和Fast模式另有加价。

把GPT-6预算优先留给推理、排错和跨软件长任务;小修小改继续用便宜模型。

| 04 谁能先用上

如今,GPT-6正在分批开放

Chat中,100美元Pro档每周50条,与Sol Pro共享;200美元档GPT-6 Pro每周200条,另有与Sol Pro合计每日200条的限制。

| 05 科研人怎么选

1 复杂科研任务,用GPT-6

我会优先拿它审计复现工程、排查连续报错的分析流程,以及核对正文与补充材料。它的优势集中在任务链较长、文件相互关联、需要反复推理的地方。

组会PPT、需要操作专业工具的科研图,也可以放进这份清单。

第一次用,我建议挑一个手头正在卡住的小项目:附上现有代码和报错,要求它定位原因、完成修改并重新运行;或者给一组结果和课题组模板,让它交付几页可编辑的汇报。这样试用,最容易看出它能替自己省掉哪一段工作。

交任务时,可以直接约定文件形式:分析交脚本和结果表,画图交图片和源文件,汇报交可编辑幻灯片。把这些要求一起说明,后面接着修改或换一种呈现方式都会方便得多。

2 日常任务,按需选模型

常规分析、日常代码修改、文献整理,先用Sol;字段提取、格式统一、短段落润色,交给低成本模型。修改三个小标题,就别请旗舰模型开一场专家会诊了。

同一个项目也可以分工:先用低成本模型整理材料,遇到难解的推导或报错,再交给GPT-6集中处理。选模型时,我会把“还要自己返工多久”也算进成本;如果一个复杂问题能少来回折腾几轮,较高单价就可能花得值得。

尾声 科研之外

GPT-6把模型竞争进一步推向完整工作的交付:读文件、操作软件、处理中途的问题,最后生成能继续编辑的成果。

这会改变我们分配时间的方式。原本要亲自盯着的执行环节,可以逐步交给GPT-6;尝试一条分析路线、重做一版图表的成本也有望降低。

对小团队而言,这尤其值得期待。一项研究往往同时需要写代码、处理数据和制作汇报,切换工作本身就消耗精力。如果GPT-6能接住其中连续的执行步骤,团队就更有条件并行尝试几个方案,把原本排在待办清单后面的想法也做出来。

从这个角度看,Brockman那句“欢迎来到AGI时代”,正在成为现实。

不过也别急着畅想未来,比起模型是否更加聪明,作为人类的我们,似乎还有更多”现实问题”需要面对,例如掉线:

(:3 」∠)

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200632