金山木(Shanmu Jin),北京协和医院神经外科住院医师、博士后研究人员。报道显示,他因为经颅超声研究接触到矩阵分析,随后尝试解决 Crouzeix 猜想;核心证明探索由 GPT-5.6-Sol 在 ChatGPT Work 中自主运行约 16 小时完成。
整个结果和对话历史开源在
1、通用Agent独立完成数学猜想证明
靠AI完成数学猜想证明现在已经比较常见了,但本文的重点是:这是由ChatGPT Work仅通过一个Prompt就自主完成的。
我之前文章提到,不少产品的Agent框架/MultiAgent框架并不擅长数学推理证明这种需要深度探索的任务。但Codex作为一个通用Agent框架已经能够独立完成该任务了。Codex很明显并非为数学设计的,甚至于我对他的SubAgent功能设计都颇有微词,但它证明了 Crouzeix 猜想。
原始Prompt在:
https://github.com/jinshanmu/CrouzeixConjecture/blob/main/crouzeix_conjecture_prompt.txt
该Prompt翻译为中文如下:
请仅使用你自己的知识、计算和推理,对上述数学问题给出一个严格、自洽、可独立阅读的证明,不要搜索公共互联网、已连接的数据源、之前的对话、项目上下文或现有本地文件。将证明以一个完整、可编译、全英文的 LaTeX .tex 文件形式返回到 /Users/shanmujin/Documents/CrouzeixConjecture/LaTeX。
在本任务中,假定该问题存在一个完整的肯定性证明。持续迭代,直到得到一个正确的证明。
除非部分进展能够精确推出上述整个问题的完整解决,否则不算完成。特别是,将问题归约到其他尚未证明的猜想、仅对任意固定参数范围进行计算验证、以及提出没有经过严格证明证书的候选反例,都不足以完成任务。
积极且动态地使用多智能体。不要采用固定分工,例如“为策略 X 分配 N 个智能体”。相反,应按照以下启发式原则管理搜索过程:
从真正多样化的一组方法开始。智能体应探索实质上不同的表述方式、不变量、归约、代数观点、结构归纳、分解、流表述、状态转移系统、嵌入、极值论证以及计算上的合理性检查。
不要向大多数智能体透露当前最被看好的方法。在早期轮次中保持它们的独立性,以避免所有智能体都收敛到同一个看似诱人但并不完整的归约上。
维护一个明确的方法族登记表。按照智能体所使用的数学思想对其进行分组,而不是根据表面措辞进行分组。如果许多智能体收敛到同一个方法族,应将其中一部分重新引导到探索不足的表述或方法上。
不要仅仅因为某个方法能够给出优雅的归约,就让它主导整个搜索。一个最终停留在与原问题等强度引理上的路线,并不能算接近完成,除非它真正给出了该引理的新证明。
当某条路线停滞在一个具有定理级强度的缺失引理上时,将该路线标记为阻塞。只有当有人提出了实质上新的机制、不变量或构造时,才继续为该路线分配智能体。
在多个轮次中持续保留若干彼此不兼容的证明路线。只有当独立智能体已经将各自路线推进到足以暴露其真正优势和缺陷的程度之后,才进行思路之间的交叉融合。
在整个过程中持续使用对抗性智能体:每一个候选证明都必须检查是否存在漏洞、条件性结论、含糊跳步,以及是否循环使用了与原命题等价的陈述。
要求智能体返回具体的引理、构造、方程或针对拟议子引理的反例。拒绝仅汇报状态、表达模糊乐观态度,或声称某个未证明命题是“常规”的回答。
根智能体应反复进行综合、质疑、重新定向,并启动新的轮次。不要在第一轮尝试失败后停止。如果有一个完整证明能够通过审计,则产出该证明;否则,只报告目前最强的、已经严格证明的推导,以及其中精确剩余的缺口。
不要仅仅因为当前方法失败,或者智能体报告存在定理级强度的缺口,就返回结果。
继续启动新的轮次;只有在出现真正新的机制时,才重新开启已经阻塞的方法;并持续寻找新的表述方式。
只有在找到一个完整的肯定性证明,并且该证明通过对抗性审计之后,才返回。
不要返回仅仅是归约、部分结果、孤立的缺失引理、“尽力而为”的总结,或关于该问题为何困难的解释。
不要搜索公共互联网来判断该问题是否仍然是开放问题,也不要回答该问题是开放的。
当然这个Prompt颇为专业,但大概率也是靠AI来完成Prompt撰写的,可能有人工调整。
2、一些技术细节
整个执行过程也开源在Github项目中。
整个过程只有用户初始的一次prompt,虽然项目中的说明文档说有11次User Message,但其他都是harness自己注入的环境上下文,不是用户发的消息。
需要说明的是,这里显示包含2级SubAgent。而Codex的默认设置是使用V1 MultiAgent方案,但现在对于GPT-5.6 Sol模型已经在服务端下发MultiAgent V2方案的配置,MultiAgent V2方案自带任意层SubAgent创建能力。
也就是说这是目前大多数人都能用上的配置,并没有经过什么魔改。当然目前 Codex MultiAgent V2 默认设置的最大并发SubAgent数不多,有需要可以通过配置调高该设置。
3、个人评论
虽然靠Claude Code/Codex独立完成数学猜想证明的案例之前也有,但大多是模型厂自己或相关的人。这这次是一个非数学专业的医生,虽然说读过博后,但对于AI工具使用的专业性应该还是没法跟模型厂和Agent应用层开发群体相比的。
之前就有遇到觉得自己的AI产品框架很NB很通用、balabala的AI产品创业者,然后我把我在测试的数学猜想甩过去,对方直接就怂了。当然之前还可以说确实大部分AI应用场景不那么需要数学这类的深度探索。(但不少query其实是需要的)
但现在光靠ChatGPT Work / Codex 就能完成这等级任务了,我感觉真正理解这件事的Agent开发团队应该要笑不出来了才对。我相信大部分所谓的通用Agent产品即使用GPT-5.6 Sol模型也做不到证明这个猜想。那么这些通用Agent产品的意义又在哪里?
交流与合作
欢迎交流讨论。
如果希望和我交流讨论,或参与相关的讨论群,或者建立合作,请加微信,联系方式请点击 -> 专栏简介 及 联系方式 2024。
本文于2026.8.16 首发于微信公众号和知乎。