参赛的并不是我们日常用的ChatGPT或Gemini网页版,而是它们内部特别微调、专门为了数学题训练的“考前突击型”。//@百无一用饺书生:IMO能拿金牌,常识问题可能答不对。估计是用很专业的数据训练的,应用场景很窄
#模型时代# Caleb Writes Code做的一只讲解视频,对OpenAI和Gemini的模型拿了奥数金牌做了一个来龙去脉的解释(目前都是一个独立的模型参赛,不是市面版本):
最近OpenAI和Google的Gemini在2025年国际数学奥林匹克竞赛中都拿到了金牌。这个成就看起来离我们很远,毕竟大多数开发者平时写的是网页应用,不怎么接触高深数学。
但先看看这个比赛是什么样的:6道极难的数学题,需要在9小时内完成,每道题都需要深度推理能力。OpenAI和Gemini都答对了前5题,但第6题都失败了。
有意思的是,如果把第6题翻译成实际业务场景,就是这样一个问题:
你在为公司开发仓库管理软件。仓库是2025×2025的空间,仓库经理想尽可能多地存放大型矩形产品。但安全规定要求每行每列都必须预留一个位置安装火警设备。问题是:怎样布置这些火警设备,才能让剩余空间最大化,存放最多的大型产品?
这道题,OpenAI和Gemini都没能解决。事实上,95%的人类参赛者也没解出来,只有5%拿到了满分。在这个特定的推理任务上,人类仍然保持着优势。
更值得关注的是,我们日常使用的那些公开AI模型在这次比赛中的表现如何?答案是:没有一个得分超过13分,连及格线都没到,更别提获奖了。
OpenAI和Gemini能拿金牌,是因为他们使用了专门针对数学内容进行微调或训练的特殊版本模型。这引发了一些争议:这样的准备到底算不算公平?应该允许多少程度的专门训练?
如果把竞赛题目按难度排序,目前我们使用的商业模型大概只能解决中低难度的题目,而OpenAI和Gemini这次展示的能力已经接近顶尖水平,只是还没能攻克最难的那道题。
当然,现实中的模型还有互联网访问、工具调用、MCP等各种增强功能,这些在比赛中都不允许使用。如果加上这些能力,模型的实际表现可能会更好。
这次比赛展示了AI在复杂推理能力上的进步,虽然还没达到人类顶尖水平,但差距正在缩小。随着GPT-5、Gemini 3等下一代通用模型的到来,我们可能很快就能看到AI解决这类高难度问题的能力。
这对我们意味着什么?未来的AI将能帮助我们解决越来越复杂的实际问题,不仅仅是写代码或回答问题,而是真正的深度推理和问题求解。 高飞的微博视频
最近OpenAI和Google的Gemini在2025年国际数学奥林匹克竞赛中都拿到了金牌。这个成就看起来离我们很远,毕竟大多数开发者平时写的是网页应用,不怎么接触高深数学。
但先看看这个比赛是什么样的:6道极难的数学题,需要在9小时内完成,每道题都需要深度推理能力。OpenAI和Gemini都答对了前5题,但第6题都失败了。
有意思的是,如果把第6题翻译成实际业务场景,就是这样一个问题:
你在为公司开发仓库管理软件。仓库是2025×2025的空间,仓库经理想尽可能多地存放大型矩形产品。但安全规定要求每行每列都必须预留一个位置安装火警设备。问题是:怎样布置这些火警设备,才能让剩余空间最大化,存放最多的大型产品?
这道题,OpenAI和Gemini都没能解决。事实上,95%的人类参赛者也没解出来,只有5%拿到了满分。在这个特定的推理任务上,人类仍然保持着优势。
更值得关注的是,我们日常使用的那些公开AI模型在这次比赛中的表现如何?答案是:没有一个得分超过13分,连及格线都没到,更别提获奖了。
OpenAI和Gemini能拿金牌,是因为他们使用了专门针对数学内容进行微调或训练的特殊版本模型。这引发了一些争议:这样的准备到底算不算公平?应该允许多少程度的专门训练?
如果把竞赛题目按难度排序,目前我们使用的商业模型大概只能解决中低难度的题目,而OpenAI和Gemini这次展示的能力已经接近顶尖水平,只是还没能攻克最难的那道题。
当然,现实中的模型还有互联网访问、工具调用、MCP等各种增强功能,这些在比赛中都不允许使用。如果加上这些能力,模型的实际表现可能会更好。
这次比赛展示了AI在复杂推理能力上的进步,虽然还没达到人类顶尖水平,但差距正在缩小。随着GPT-5、Gemini 3等下一代通用模型的到来,我们可能很快就能看到AI解决这类高难度问题的能力。
这对我们意味着什么?未来的AI将能帮助我们解决越来越复杂的实际问题,不仅仅是写代码或回答问题,而是真正的深度推理和问题求解。 高飞的微博视频
![[doge]](https://face.t.sinajs.cn/t4/appstyle/expression/ext/normal/a1/2018new_doge02_org.png)
