GPT - 5.6一页纸超越44页顶刊,AI解数学题引发“难”的定义之争

发布时间:2026/7/22 21:43:17
GPT - 5.6一页纸超越44页顶刊,AI解数学题引发“难”的定义之争 GPT - 5.6一页超越44页论文攻克埃尔德什难题1991年《数学年刊》登出József Beck的44页论文《单位圆上零点多项式的模埃尔德什的一个问题》攻克埃尔德什问题库中编号119的难题。Beck是组合数学圈知名人物提出Beck - Fiala定理获1985年Fulkerson奖是1986年国际数学家大会受邀报告人、差异理论奠基者之一。此问题是在单位圆上取复数为零点构成多项式其在单位圆上的最大模Mn能否在无穷多个n处超过n的c次方Beck证明可以。该问题当年有三问第三问悬赏100美元如今状态为SOLVED。AI再突破引发数学界关注35年后这篇论文被一页纸超越。说这话的是数学家、曼彻斯特大学研究员、erdosproblems.com网站创建者和维护者Thomas Bloom。埃尔德什留下的1000多道开放问题都挂在该网站AI宣称解决问题都要过他这关。他在X上称GPT - 5.6 Sol是数学上有趣的新模型提交到网站的证明经他查看均正确且有有趣想法。OpenAI总裁Greg Brockman转发推文称这是推进数学的分水岭时刻科学与医学突破近在咫尺。问题溯源与AI新解这道题1957年由埃尔德什在论文中提出此后在1961、1964、1982、1990、1997年反复提及。第一问1980年被Wagner解决第二问1991年由Beck解决这就是那篇44页论文发表于《数学年刊》1991年第134卷第3期。第三问埃尔德什悬赏100美元如今由GPT - 5.6和数学家Korsky用一页纸解决。Bloom评价GPT在Korsky提示下用1页调和分析技巧证出比Beck论文更强结果。关键一步是把非负函数卷积再时间平移1表达式变光滑这是分析常用方法旧工具用在新地方。Bloom表示Beck论文有重要想法但此题用不上那个常数估计很小Beck若觉得重要会计算。这不是AI推翻顶刊而是发现人类可避的弯路对数学家刺激更大这次是工具纠正用工具的人。AI持续发力解决更多猜想7月9日GPT - 5.6 Sol Ultra全量放开7月10日OpenAI宣布其产出Cycle Double Cover猜想完整证明。该猜想由Szekeres在1973年、Seymour在1979年各自独立提出悬了约五十年。模型分配8小时实际用不到1小时64个子智能体并行开工提示词和证明PDF公开。Bloom评价证明短、初等、1980年代本可发现推测关键一步有反直觉拐弯。人类数学家可能尝试自然做法不行就放弃AI不会气馁会做小变体直到成立强在不做情绪性止损。回顾AI解题历程与人类反思今年4月GPT - 5.4 Pro在80分钟里解掉Erdős 1196用的是von Mangoldt函数。牛津的Jared Lichtman在该问题上耗了七年他称自1935年以来做原始集问题的人习惯同一开局动作遮蔽了90年的技术可能。陶哲轩认为过去几十年人类第一步就走偏。人类直觉是效率工具偶尔会省掉不该省的尝试。AI数学成果争议不断去年10月Bloom曾公开打脸OpenAI。当时OpenAI副总裁Kevin Weil转发Mark Sellke帖子称GPT - 5找到10道未解埃尔德什问题的解11道有进展。Bloom称这是戏剧性的误导GPT - 5只是找出他不知道的文献找到文献不等于造出证明。随后LeCun暗讽Hassabis直言尴尬Weil删帖OpenAI研究员Sébastien Bubeck承认只是找到文献已有解。今年5月OpenAI宣布推翻1946年埃尔德什几何猜想时同步附上Noga Alon、Melanie Wood和Thomas Bloom的评价。论战AI在数学上是否撞墙Bloom帖子下论战精彩。唱衰派以用户qrdl为代表认为5.6思维链输出少677题无进展物理侧CritPT评测相比5.4几乎没动AI在数学上已撞墙。他认为大模型是静态权重的token生成器做数学时不会像人一样实时长出新神经连接真正的创造性跳跃需要弹性大脑每次开新会话攻677模型都用老招式。回怼很快Nat Sothanaphan指出CritPT是物理测试不是数学基准5.6在包括FrontierMath在内的评测上比5.5有提升。实战派代表old - bielefelder报告GPT - 5.6 Sol思考14分钟、复核9分多钟把Pintz 2018年0.72的指数改进到0.7195前一晚GPT - 5.5在同一问题上磨一小时0.72没动他将结果通知了Pintz本人。Nat Sothanaphan借用Bloom说法认为现代数学是巨大教堂大模型能高效走到前沿突破源于此再往前需流动智力ARC系列评测上涨证明大模型有流动智力GPT - 5.6 Sol在ARC - AGI - 3上表现随推理档位陡升。争论焦点“难”的定义这场争论两周后真正吵出来的不是“AI能不能做数学”而是“难”的定义。数学史上“悬而未决”的条目部分记录问题难度部分记录人类耐心边界现在开始能区分。一道题几十年没人解决可能是没人肯多尝试还有多少题目是被人类耐心卡住