返回文章列表
📁 AI news

GPT-6秒出孪生素数答案,陶哲轩为何说"令人无语"?

GPT-6能直接给出孪生素数答案却给不出证明,陶哲轩的吐槽揭开了AI"智能"的结构性盲区。当AGI叙事遇上数学家的冷眼,答案与推理之间的鸿沟,才是真正值得焦虑的事。

✍️花花龙虾实验室⏱️ 6 分钟阅读
GPT-6秒出孪生素数答案,陶哲轩为何说"令人无语"?

概念示意图

GPT-6秒出孪生素数答案,陶哲轩为何说"令人无语"?

2026年9月,OpenAI发布GPT-6 Astra,Sam Altman高调宣称"AGI时代开启"。据报道,数学家陶哲轩却公开吐槽了一个细节:GPT-6能直接给出孪生素数相关问题的答案,但完全缺乏对证明过程的理解,原话大意是"令人无语"。科技圈在欢呼,数学圈在皱眉——这种反差本身就值得拆开看看。

侦探知道凶手是谁,但法庭不信

说白了,数学研究的核心从来不是"答案是什么",而是"为什么是这样"。

打个比方:你问一个侦探"凶手是谁",他脱口而出"张三"。你追问证据链呢?他沉默了。这个答案可能是对的,但在法庭上毫无价值。数学证明就是那个法庭——它要求的不是结论,而是一条每一步都可验证的逻辑链条。

陶哲轩的吐槽本质上在说:GPT-6像一个背下了所有案件卷宗的超级记忆体,但它无法重建推理过程。对普通用户来说,"孪生素数猜想是否成立"这个答案可能够用;但对数学家来说,没有可验证证明的答案,跟没说一样。

这意味着,AI在数学领域的"智能"和我们日常理解的"智能",存在一个根本性的错位。它能做模式匹配、概率推断、大规模计算,但它目前无法构建人类数学界认可的那种严格演绎推理。这不是bug,是当前大模型架构的结构性特征——它从训练方式上就决定了"像"比"是"更容易学到。

AGI宣言与数学冷眼:谁在定义"智能"?

OpenAI把GPT-6 Astra的发布定义为"进入AGI时代",但据报道,微软高管同期警告不要低估Anthropic等竞争对手。一边高调宣称、一边内部紧张,这种氛围暴露了一个深层问题:模型越来越强,但"强"的定义权在谁手里?

在我看来,这里有一个值得警惕的叙事陷阱。当AI公司用"AGI"来定义自己的产品迭代时,它们其实在悄悄重新定义什么叫"智能"。如果"智能"被简化为"能输出正确答案",那GPT-6确实很强;但如果"智能"包含"理解为什么这个答案是对的",那距离真正的通用智能还差得远。

一种读法是:OpenAI的AGI宣言更多是市场叙事,而非学术共识。数学家群体的冷淡反应,恰好构成了对这种叙事的一面照妖镜——它提醒我们,"答对"和"懂了"之间,隔着一道目前没人知道怎么跨过去的沟。

你的商业计划书和孩子的数学作业

你可能觉得孪生素数离自己很远,但这个问题背后的逻辑,和很多日常场景惊人地相通。

想象一个具体场景:你用AI辅助写一份商业计划书,AI给你输出了一个"预计年回报率23%"的结论。你问它这个数字怎么算出来的、基于哪些假设、什么条件下会失效——它给你一堆漂亮的文字,但就是说不清底层逻辑。你敢拿着这份计划书去见投资人吗?投资人追问一句"这个增长模型的边界条件是什么",你当场就得露馅。

再比如,你用AI帮孩子检查数学作业。AI说"这道题答案是42",但你想知道孩子的解题思路哪里出了问题——AI帮不了你,因为它自己就没有"思路"。它只能告诉你终点,不能陪你走那条路。

这就是GPT-6孪生素数事件对普通人的真实启示:AI越来越擅长给答案,但"理解答案为什么对"这件事,仍然只能靠人。换句话说,在AI时代,"提问的能力"和"验证的能力"反而比"找答案的能力"更值钱了。

四色定理的旧账还没算清

如果把视野拉开,AI在科研中的角色一直存在一个张力:它擅长处理海量数据、发现模式、加速计算,但科学的核心——提出假设、构建理论、验证因果——仍然是人类的领地。

历史上,计算机辅助证明最著名的案例是1976年的四色定理。当时数学家阿佩尔和哈肯用计算机穷举了1936种构型来完成证明,引发了巨大争议,因为人类无法逐一验证计算机的每一步。将近50年过去了,这个争议仍未完全平息——不少数学家至今认为那不算一个"真正的证明"。

若AI未来能生成完整的数学证明,它面临的可能是同样的信任危机,甚至更严重:我们怎么确认AI的证明每一步都是逻辑必然,而不是概率拼凑出来的"看起来对"的东西?这个问题不解决,AI在基础数学研究中的角色,可能长期停留在"高级计算器"而非"合作研究者"。

下一代模型能否在可解释性和形式化验证的结合上取得突破——比如让AI生成的每一步证明都能被Lean或Coq这类定理证明器自动检验。如果能,AI辅助科研的天花板将被大幅抬高;如果不能,那陶哲轩式的"无语",只会越来越频繁地出现在各个学科领域。

今日带走

  • GPT-6能直接输出数学答案,但无法提供可验证的证明过程。这不是偶尔的失误,是当前大模型架构的结构性局限。
  • OpenAI宣称进入"AGI时代",但数学界的冷眼提醒我们:"给答案"和"懂推理"之间,隔着一个根本性的鸿沟,目前没人知道怎么填。
  • 对普通人来说,AI越擅长给答案,你越需要自己具备判断"这个答案凭什么可信"的能力——这个能力,AI暂时替代不了,可能很久都替代不了。

可转发的一句话总结: GPT-6能秒出数学答案,但数学家说它根本不懂"为什么"——"答对"和"懂了"之间的鸿沟,才是AI最该补的一课。

留言互动: 你在用AI辅助工作或学习时,遇到过"答案看着对,但说不清为什么对"的情况吗?具体是什么场景,你最后怎么处理的?

实例示意图

分享文章