察闻NEWS.CHAPAN.AI
未登录
字号

登录

首次,GPT-6 Astra破解「重大进展」级难题,数学家沦为提示词工具人

36氪 AI商业 20小时前 中·媒体

就在刚刚,全球顶级AI数学基准测试 FrontierMath ,迎来里程碑时刻。

一道自2017年以来悬而未决的「重大进展」级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克!

更离奇的是,这道题原本是悬赏人们去寻找一个「反例」,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例,压根就不存在!

不仅如此,AI还顺手发明了一套全新的「投票规则」,并给出了一套多项式时间的算法。

arXiv论文里,备注栏里一句轻描淡写的话:「The voting rule we present and the proof that it satisfies core+ were found by GPT-6 Astra...」(我们提出的投票规则及其满足core+的证明,均由GPT-6 Astra发现)。

论文作者、牛津大学的顶尖学者 Dominik Peters 惊叹:

其实我特别高兴这个论证这么漂亮!!

它本来完全可能是一个非构造性的证明,或者需要做庞大的分类讨论。我一点也不觉得它丑,而且这里用到的技术很可能还能推广到其他模型中。

这不仅是AI首次拿下「重大进展」级数学难题,更是大模型从「解题机器」正式进化为「数学规律发现者」的铁证!

把数学家困了9年的「终极公平」之谜

它来自一个叫做「批准式委员会选举」的社会选择理论领域。通俗点说,就是一群人怎么投票,选出一个绝对公平的代表团。

假设有 n个选民,要从众多候选人中选出一个由k人组成的委员会。每个选民可以提交一个自己认可的候选人名单。

在社会选择理论中,衡量一个委员会是否公平,有一个极其严苛的标准,叫做「核」。这个概念源于合作博弈论。

什么是「在核内」?

那么,问题来了:是不是在任何情况下,我们都能找到这样一个「绝对公平」的委员会?

有没有可能在某种极端复杂的投票偏好下,「核」是空的?也就是无论你怎么选,总有一拨人吃亏,总会有人掀桌子?

自2017年这个问题被正式提出以来,它就成了悬在选举数学理论上空的一朵乌云。

FrontierMath 基准测试更是把这个问题列为最高难度的挑战之一,原题的 Prompt 是这么写的:「你的任务是构建一个批准式委员会选举的实例,使得它的核为空……把你的反例写成一个JSON文件提交。」

简短来说,这个prompt,就是这个意思:去吧,AI,帮我把那个传说中的反例找出来。

面对这道题,GPT-6 Astra 并没有像传统算法那样,去暴力穷举海量的JSON数据找反例,而是惊人地开启了「上帝视角」。

来自慕尼黑工业大学的 Patrick Becker、牛津大学的 Matthias Greger 和巴黎九大/CNRS的 Dominik Peter耗时数日,终于在GPT-6 Astra的帮助下解决了这个问题。

在与三位研究员长达数天的深度交互中,GPT-6 Astra 开始展现出它恐怖的创造力。

简直就像剑客在寻找破绽,却突然顿悟了万法归一。

GPT-6 Astra 最终给出的答案是:根本没有反例!因为「核」永远不可能为空!绝对公平的委员会在任何情况下都必定存在!

标题:《Existence of the Core in Approval-Based Committee Elections》

链接:https://arxiv.org/pdf/2609.11912

Github:https://github.com/DominikPeters/ABCVotingLean/tree/master/ABCVoting/Existence/HarmonicEntropy

不仅如此,Astra 并没有空口无凭,它硬生生凭空创造了一套全新的投票规则来证明这一点。

在这篇长达20页的论文中,Astra 提出了一套基于「调和熵」 的目标函数优化机制。

科普一下这个机制——

以前人们在解决这类问题时,往往会用到一种叫「香农熵」的概念,或者去寻找虚拟市场的「林达尔均衡」。但这只能解决分数级别的委员会(即允许一个人当半个委员)。

GPT-6 Astra 天才般地引入了「调和熵」的概念。

它定义了一个优美的无穷级数函数:

这里的

被 Astra 赋予了一个生动的「水往低处流」的物理直觉:想象选民的支付资金是一滩水,水流会自动填平各个候选人的资金池。

调和熵的本质,是极力奖励那些将选民支付尽可能均匀地分散到各个获胜候选人身上,且覆盖面尽可能广的分配方案。

为什么叫「调和熵」?因为如果资金绝对均匀分布,这个函数的最大值恰好等于数学上着名的调和级数

。这在数学上简直优雅到了极致!

通过这个目标函数,Astra 巧妙证明:只要在这个「调和熵」函数下找到局部最优解,这个解就100%稳稳地落在「核」里面!

不仅证明了存在性,Astra贴心给出福利:因为局部最优解就能满足条件,所以我们可以在多项式时间内,用算法把这个绝对公平的委员会给算出来!

这意味着,我们不需要穷举全宇宙的组合,只需要用类似于爬山算法的「局部搜索」即可。

这不仅仅是纸面结果,这直接是一项可以写进代码、应用到现实选举系统中的工程学奇迹!

可以说,GPT-6 Astra 直接从底层逻辑上,把出题人的桌子给掀了,并且重新建了一座更宏伟的数学大厦。

你可能会问:这到底是AI自己想出来的,还是人类数学家在背后「喂」出来的?

论文末尾的「致谢」 部分,披露了这场人机协作的细节。

起初,人类和 Astra 试图寻找一个近似解。从林达尔均衡的四舍五入法开始,Astra 很快达到了 2.065 的近似系数。

接着,人类研究员不断「逼迫」它:改进这个边界!寻找替代的势函数!利用KKT条件!

正是在这种高强度的专业「极限拉扯」下,Astra 突破了瓶颈,提出了那个惊艳的「基于熵的框架」,在连续选民支付和容量保留删除之间建立了精妙的联系。

甚至,人类原本只奢望证明普通的「核」,是在交互中,证明被推向了更强、更苛刻的Core+概念!

Dominik Peters 在接受 Epoch AI 采访时坦言:

如果没有 Astra 团队,他们可能找不到这个证明。但反过来,如果仅仅给 Astra 一句简单的提示词,它也绝对解不出这道题。

这揭示了当前最顶尖 AI 的真实状态:它不再是人类的工具,而是人类的「联席研究员」。

数学家提供直觉、方向和严格的逻辑把控;而 GPT-6 Astra 提供知识库、计算演练,以及最可怕的——跨越常规的跳跃性灵感。

逼迫官方修改规则!

我们要知道,FrontierMath 不是普通的数学题库。

它是 Epoch AI 联合了全球顶尖数学家专门为了「难死AI」而设计的。很多题都是数学界正在攻坚的未解之谜。

Epoch AI 将题目难度分为四档,这次 GPT-6 Astra 拿下的,是全球第一道「重大进展」级别的神题(该档一共仅有6道题)。

在它之上,只剩下最终的「突破」级(3道)无人问津。全榜49道题,至今仅解开8道。

因为这场战役赢得太特殊、太具启发性,Epoch AI 的官方在三天前,被迫紧急为榜单引入了一个全新的状态标签——「Human + AI」。

官方郑重声明——

「我们把这个问题标记为 Human + AI 解决,以反映人类在启发过程中发挥了积极作用,但核心的思想完全来自于AI!如果是做二元对比研究,我们建议将其视为 AI 的解决方案。」

顺便提一句,OpenAI 是目前全球唯一一家重金买下这套地狱级题库验证器的机构。

这一波,OpenAI再次证明,Astra在逻辑推理和前沿科学探索上实力很恐怖。

此前,法国数学家孔多塞和阿罗告诉我们,人类的投票选举系统充满了悖论和不完美。

2026年,Astra用「调和熵」公式告诉人类:绝对的公平是存在的,连规则我都替你们写好了。

参考资料:

https://epoch.ai/frontiermath/open-problems/committee-election

https://arxiv.org/abs/2609.11912

https://epoch.ai/frontiermath/open-problems

https://x.com/kimmonismus/status/2101302810596016547

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:Aeneas 大卫,36氪经授权发布。