OpenAI用万智能体88小时攻克千禧年难题,陶哲轩点赞又担忧
OpenAI宣布用10000个AI智能体在88小时内攻克千禧年大奖难题之一,数学家陶哲轩对此既表示赞赏又提出担忧,引发学界对AI科研能力的广泛讨论。
驱动中国9月9日消息,继Anthropic旗下Claude尝试挑战黎曼猜想之后,OpenAI近日宣布了一项更为激进的实验:动用10000个AI智能体协同工作,在88小时内攻克了一道千禧年大奖难题。这一消息迅速在数学界和人工智能领域引发轩然大波,著名数学家陶哲轩在社交平台上公开表态,既对AI展现出的潜力表示赞赏,也对其可能带来的研究范式冲击表达了担忧。
据外媒报道,OpenAI此次实验并非简单调用单一模型进行推理,而是构建了一个由上万个大模型智能体组成的“研究军团”。这些智能体被赋予不同的子任务,包括文献梳理、猜想验证、反例搜索、证明框架搭建等,彼此之间通过特定的通信协议交换中间结果,形成一个动态协作的知识生产网络。整个攻关过程持续88小时,最终输出了一份被OpenAI称为“可验证的证明草案”的成果,目标直指千禧年大奖难题中的某一具体问题。
千禧年大奖难题由美国克雷数学研究所于2000年提出,共七个问题,每个问题悬赏一百万美元,其中包括著名的黎曼猜想、庞加莱猜想、P/NP问题等。截至目前,仅有庞加莱猜想被俄罗斯数学家佩雷尔曼解决。OpenAI此次宣称的“攻克”并未指明具体是哪一道难题,但强调其证明草案已经通过内部自动化验证工具的部分检查,后续将交由人类数学家进行严格审阅。这一表述被部分学者解读为“阶段性成果”而非最终定论。
陶哲轩在社交媒体上回应称,AI智能体群体协作解决数学问题的思路令人振奋,它可能帮助人类突破传统数学研究中“个体灵感驱动”的瓶颈,尤其在组合数学、数论等需要大量枚举和模式识别的领域,AI的搜索能力远超人类。但他同时警告,当前AI生成的证明往往缺乏可解释性,人类数学家难以判断其推理链条中是否存在隐蔽的逻辑跳跃或未声明的假设,若盲目采信,可能埋下系统性错误隐患。
事实上,这并非AI首次涉足高难度数学问题。今年早些时候,Anthropic的Claude模型曾尝试对黎曼猜想进行探索性分析,虽然未取得突破性进展,但引发了关于“大模型能否从事原创数学研究”的讨论。OpenAI此次将规模从单模型扩展到万级智能体协作,被视为对“群体智能”路线的一次重要押注。该公司研究团队在技术博客中表示,单个模型的知识和推理能力有限,但通过大量智能体的分工与辩论,可以模拟一个小型数学研究社区的运作方式,从而在更短时间内覆盖更广阔的搜索空间。
不过,数学界的反应并非一致乐观。部分学者指出,千禧年难题的难度不仅在于找到答案,更在于证明过程的严谨性和可复现性。AI生成的“证明草案”若无法被人类逐步验证,其学术价值将大打折扣。此外,上万智能体协同所需的算力成本极高,OpenAI并未透露此次实验的具体资源消耗,但外界估算其电力和计算成本可能达到数百万美元级别,这种“砸钱式科研”的模式能否被学术界广泛复制,仍是一个现实问题。
陶哲轩的担忧还指向更深层的科研伦理:当AI能够快速生成大量看似合理的数学结论时,人类数学家的工作重心可能从“证明”转向“审稿”,而审稿本身同样需要极高的专业素养和判断力。他建议学界尽快建立针对AI生成数学内容的验证标准和发布规范,避免低质量或错误的AI证明污染学术文献库。OpenAI方面回应称,愿意与数学界合作制定相关评估框架,并计划在后续公开更多实验细节,包括智能体协作日志和验证工具链。
从行业视角看,OpenAI此次实验的意义已超越数学本身。它展示了大规模AI智能体在复杂推理任务中的协同潜力,这种能力未来可能应用于药物研发、材料科学、代码验证等需要长链条逻辑推理的领域。若“万级智能体协作”模式被验证有效,AI将从“辅助工具”升级为“研究伙伴”,甚至在某些细分方向上成为“主导者”。但正如陶哲轩所言,技术狂奔的同时,人类必须同步构建驾驭它的规则,否则“突破”与“风险”将始终如影随形。
截至发稿,OpenAI尚未公布具体攻克的是哪一道千禧年难题,也未提供完整的证明文本供外部审阅。数学界普遍认为,即便AI的证明草案最终被推翻,这次实验本身已经为“人机协同数学研究”树立了一个新的里程碑,其方法论价值可能比单一问题的答案更为长远。