这次,科研人的工具箱又要大更新了。
9月3日(美国时间),OpenAI 发布 GPT-6 Astra,同步升级Codex运行框架。
Greg Brockman喊出的口号是 “欢迎来到AGI时代”。落到科研人桌面上,这次升级最吸引我的,是GPT-6开始更有能力接下一整份工作:读材料、跑分析、处理报错,再交回图表和文档。
| 01 GPT-6强在哪
最明显的跃升,是复杂科研任务的执行能力。
Terminal-Bench Science 0.1中,GPT-6得分64.6%,上一代GPT-5.6 Sol为22.4%,提高42.2个百分点。这套测试涵盖数据分析、模拟、模型拟合,检查实际交付物,很贴近科研人的日常。
高难数学也上了一个台阶:FrontierMath Tier 4(v2)从83.0%升至97.6%。研究生级科学问答GPQA Diamond则从94.6%升至96.0%。
放在一起看,进步的重心很清楚:在原本已擅长的知识问答上继续提高,在需要多步推导和执行的任务上拉开更大差距。对于科研用户,我会更看重后面这一类能力,它关系到一个方案能否继续做下去。
电脑操作同样更熟练。OSWorld 2.0离线集的部分计分成绩从65.7%升至72.6%;官方延迟模拟中,单任务耗时从约75分钟缩到40分钟。
软件操作能力把推理结果接到了实际工具上。比如一份分析需要导入数据、调整选项、导出结果,再把结果放进汇报材料,GPT-6的操作效率提升,就有机会省掉人在窗口之间来回切换、反复解释下一步的时间。
而在 ARC-AGI-3 上,GPT-6的表现更是惊人。这项指标,主要用于反映智能体在解决陌生的交互任务时的学习能力。GPT-6 Astra 在评估中表现优异,得分为99.9%。作为参考,平均人类测试者得分约为48%。
在使用代码和终端工具完成科学研究工作流,包括数据分析、运行模拟和模型拟合的过程中。GPT-6 Astra 在所比较的模型中也达到了新高,准确率为64.6%,而此前长期处于榜首的 Claude Fable 5.1,准确率仅为52.6%,其估计的API成本也低约31%。
综上所述,GPT-6这次的大进步集中在 “难题推理+连续执行”。对于分析跑到一半报错、需要在软件里反复操作的任务,这比多答对几道知识题更有吸引力。
| 02 GPT-6 的科研能力
1 数学:把长期难题向前推了一步
孪生素数猜想研究的是:差值为2的素数对,是否有无穷多?这个问题长期困扰数学界。2013年,张益唐首次证明存在一个有限的素数间距界,随后研究者不断缩小它。
像11和13、17和19,就是两组孪生素数。找出这样的例子很容易,难的是证明它们永远找不完。沿着数轴往远处走,素数整体越来越稀疏;研究者仍要证明,有无穷多个局部区域会出现相距很近的素数。
OpenAI公布的《Improved Short Gaps Between Primes》把这一方向长期熟悉的246推进到186,并将证明归功于GPT-6。同期Julia Stadlmann也有将界降至240的独立工作。
直观地说,论文给出的结果是:数轴无论延伸多远,总能继续找到间距不超过186的相邻素数对。
这里缩小的,是理论所能保证的距离范围。把246推进到186,意味着关于“素数可以靠得多近”的结论更强了。对于一个经过长期研究的数论方向,这种推进本身就是实质性的科研进展。
2 文件核对:一次检查41份材料
在官方演示中,Legora用GPT-6交叉核对财务文件,几分钟内找出全部4个预埋错误,包括收入附注里50万英镑的差额。公司报告,该项工作流的内部评测表现提升近40%,整套测试平均提升约3%。
这个场景和论文写作异曲同工:检查正文样本量与表格是否一致,回归结果与附录是否对应,同一变量有没有换单位。
试想一下,在审稿时,我们科研让GPT-6按“文件、位置、差异”列出清单,先对样本量、变量名称和单位,再找同一结果在正文、表格、附录中的不同写法。
接下来作者就能直接定位修改,少在几十个附件之间来回翻找。
3 PPT与科研图:会操作,也更懂排版
除了更会“干活”以外,GPT-6 在审美方面的能力,也有巨大提升。
让它基于一份只有三页的模板,制作虚构模型GPT-Gaia的介绍PPT。生成页面延续了模板布局,重新组织图文层级,重点也更集中。
想要内容更丰富的图表?也没问题!
这次审美的,对组会汇报很实用:把课题组模板与研究结果一起交过去,让GPT-6统一字体、配色和信息层级,能更有针对性地解决“内容齐了,页面还是乱”的问题。
如果上述场景还不足以展示GPT-6的潜力,那就请看看GPT-6绘制的电路图吧:

除此之外,官方还展示了测序质量检查、遗传变异可视化等场景。GPT-6的用武之地已经延伸到专业软件里的图形编辑。
未来,我们可以把科研图的要求进一步拆开:数据图先处理坐标、分组和图例,机制图先梳理对象与关系,最后再统一视觉风格。PPT里则要考虑投影后的可读性,减少小字,把最需要观众看到的结果放在显眼位置。除了模型本身,配套的 Codex 也喜提重大更新。
如今的 Codex,能跨上下文窗口记笔记、检索旧消息和工具输出。做长时间分析或反复改图时,Codex 可以找回早先的要求与报错记录,接着推进任务。
早期的模型有时会将导航指令视为一个新目标,从而丢失了原始请求或之前的约束条件。
而 GPT-6 Astra 加持下的 Codex 能够融入新要求,在被要求时调整路线,并回答相关问题而不偏离整体任务。
试想一下,我们要把一张结果图改到第五轮,第一轮确定的分组顺序、第二轮排除的方案、后面新增的配色要求,都属于继续工作要用到的信息。
能检索这些记录,长任务就更容易沿着已经确定的方向前进,少把旧问题重新讨论一遍。
| 03 费用
是的,GPT-6确实更贵了
GPT-6的API标准价为每百万token输入10美元、输出50美元,均为Sol当前单价的2.5倍。
按10万未缓存输入、1万计费输出token计算,标准请求费用约为GPT-6的1.50美元、Sol的0.60美元。长输入和Fast模式另有加价。
把GPT-6预算优先留给推理、排错和跨软件长任务;小修小改继续用便宜模型。
| 04 谁能先用上
如今,GPT-6正在分批开放
Chat中,100美元Pro档每周50条,与Sol Pro共享;200美元档GPT-6 Pro每周200条,另有与Sol Pro合计每日200条的限制。
| 05 科研人怎么选
1 复杂科研任务,用GPT-6
我会优先拿它审计复现工程、排查连续报错的分析流程,以及核对正文与补充材料。它的优势集中在任务链较长、文件相互关联、需要反复推理的地方。
组会PPT、需要操作专业工具的科研图,也可以放进这份清单。
第一次用,我建议挑一个手头正在卡住的小项目:附上现有代码和报错,要求它定位原因、完成修改并重新运行;或者给一组结果和课题组模板,让它交付几页可编辑的汇报。这样试用,最容易看出它能替自己省掉哪一段工作。
交任务时,可以直接约定文件形式:分析交脚本和结果表,画图交图片和源文件,汇报交可编辑幻灯片。把这些要求一起说明,后面接着修改或换一种呈现方式都会方便得多。
2 日常任务,按需选模型
常规分析、日常代码修改、文献整理,先用Sol;字段提取、格式统一、短段落润色,交给低成本模型。修改三个小标题,就别请旗舰模型开一场专家会诊了。
同一个项目也可以分工:先用低成本模型整理材料,遇到难解的推导或报错,再交给GPT-6集中处理。选模型时,我会把“还要自己返工多久”也算进成本;如果一个复杂问题能少来回折腾几轮,较高单价就可能花得值得。
| 尾声 科研之外
GPT-6把模型竞争进一步推向完整工作的交付:读文件、操作软件、处理中途的问题,最后生成能继续编辑的成果。
这会改变我们分配时间的方式。原本要亲自盯着的执行环节,可以逐步交给GPT-6;尝试一条分析路线、重做一版图表的成本也有望降低。

对小团队而言,这尤其值得期待。一项研究往往同时需要写代码、处理数据和制作汇报,切换工作本身就消耗精力。如果GPT-6能接住其中连续的执行步骤,团队就更有条件并行尝试几个方案,把原本排在待办清单后面的想法也做出来。
从这个角度看,Brockman那句“欢迎来到AGI时代”,正在成为现实。
不过也别急着畅想未来,比起模型是否更加聪明,作为人类的我们,似乎还有更多”现实问题”需要面对,例如掉线: