DeepMind Research Talks · Special

AlphaProof: AI for Mathematical Reasoning

AlphaProof:AI 与数学推理
November 2025 ·

Demis Hassabis breaks down AlphaProof's IMO silver-medal breakthrough and the future of AI for mathematics.

Demis Hassabis 详解 AlphaProof 在 IMO 银牌水平的突破,及 AI for Mathematics 的未来。

00:00
00:00
So there was a recent breakthrough by one of the Frontier Lab's Google DeepMind,
最近,前沿实验室之一的谷歌DeepMind取得了一项重大突破,而我认为大多数人尚未意识到这一进展的严重性。DeepMind成功成为首个在国际数学奥林匹克竞赛中达到银牌得主水平的前沿实验室。这结合了AlphaProof——一种用于推理的全新突破性模型,以及AlphaGeometry 2——他们此前系统的改进版本。我认为,人们对此有些轻描淡写,因为他们没有意识到这项工作的影响,但我认为这绝对是今年最重要的五大突破之一。接下来,我将解释为什么如此,以及为什么你应该对此保持关注。
00:05
and I think most people haven't realized the gravity of the situation here. DeepMind managed to
我觉得大多数人还没意识到这件事的严重性。DeepMind 成为了第一个在国际数学奥林匹克竞赛中达到银牌水平的 Frontier Lab。这结合了 AlphaProof,一个用于推理的全新突破性模型,以及 AlphaGeometry 2,他们之前系统的改进版本。我认为这件事确实被大家有点忽略了,因为人们没意识到这项工作的影响,但我认为这绝对是今年最重要的五大突破之一。接下来我会解释为什么,以及为什么你应该关注相关的信息。所以本质上,他们留在了这里,这些突破性模型,
00:11
be the first Frontier Lab to solve international mathematical Olympiad problems at a silver
成为首个在国际数学奥林匹克竞赛中达到银牌级别解题水平的Frontier Lab。这结合了Alpha Proof——一个用于推理的全新突破性模型,以及Alpha Geometry 2——他们之前系统的改进版本。我认为很多人确实有点忽略了这一点,因为他们没有意识到这项工作的影响力,但我认为这绝对很可能是今年最重要的五大突破之一。接下来我会解释为什么这么说,以及为什么你应该关注相关的信息。本质上他们坚持在这里,这些突破性模型、通用智能,以及具备高级数学推理能力,有潜力开启新的前沿领域。
00:18
medallist level. And this combines alpha proof, a new breakthrough model for reasoning,
奖牌级别的水平。这结合了alpha proof,一个用于推理的新突破模型,以及alpha geometry 2,他们之前系统的改进版本。我觉得很多人确实有点忽略了这一点,因为他们没意识到这项工作的影响力,但我认为这绝对很可能是今年最重要的五大突破之一。接下来我会解释为什么这么说,以及为什么你应该关注相关的信息。基本上他们在这里指出,这些突破模型具备通用智能,加上高级数学推理能力,有可能解锁新的前沿领域,发现新的见解、新颖的算法,以及解决开放问题的答案,但当前的AI系统……
00:23
an alpha geometry 2, an improved version of their previous system. Now this was something that I think
Alpha Geometry 2,是他们之前系统的改进版本。我觉得吧,很多人其实没太重视这个,因为他们没意识到这项工作的影响力。但我认为这绝对是今年最重要的五大突破之一。接下来我会解释为什么,以及为什么你应该关注相关的信息。简单来说,他们在这里提出了突破性模型——通用智能,具备高级数学推理能力,有潜力解锁新领域、发现新见解、新算法,以及解决开放性问题。但当前的AI系统和训练数据——这就是疯狂之处了。今天我们推出Alpha Proof。
00:29
people did gloss over a little bit because they didn't realize the impact of this work,
人们确实有点轻描淡写了,因为他们没意识到这项工作的影响,但我认为这绝对很可能是今年最重要的五大突破之一。接下来我会解释为什么,以及为什么你应该关注相关的信息。简单来说,他们在这里提出了突破性模型,具备高级数学推理能力的通用智能,有潜力开启新领域、发现新见解、新算法,并解答未解难题,但当前的AI系统和训练数据——这就是疯狂之处。今天我们展示AlphaProof,来自今年国际数学奥林匹克竞赛的题目。如果你不知道这是什么——
00:33
but I think that this is most certainly probably one of the top five most important breakthroughs
但我认为这绝对是今年最重要的五大突破之一。接下来我会解释为什么,以及为什么你应该关注相关的信息。简单来说,他们在这里提出了突破性模型——具备高级数学推理能力的通用智能,有潜力开启新领域、发现新见解、提出新算法并解决开放性问题。但当前的AI系统和训练数据——这就是疯狂之处开始的地方。今天我们展示AlphaProof,它解答了今年国际数学奥林匹克竞赛的题目。如果你不了解这个竞赛,它涉及很多不同的内容,其中之一当然是图论,以及各种不同的方法。
00:39
this year. And I'm going to get into why that is and why you should be paying attention to
今年。我来解释一下为什么,以及为什么你应该关注相关的信息。所以基本上,他们留在这里,那些突破性的模型,通用智能,具备高级数学推理能力,有潜力解锁新的前沿领域,发现新的见解、新颖的算法,以及解决开放问题的答案,但当前的AI系统和训练数据。而这就是疯狂开始的地方。今天我们展示AlphaProof,来自今年国际数学奥林匹克竞赛的问题。如果你不知道那是什么,有很多不同的东西。其中之一当然是图的使用,当然还有不同的方法。这是一个里程碑,因为解决ARC基准测试将是一个重要的里程碑,因为无论什么。
00:43
this research and what it means. Because not only was it incredible, there was also some other
这项研究及其意义。因为不仅它本身令人难以置信,还有一些其他相关信息。简单来说,这些突破性模型——AlphaProof 和 AlphaGeometry 2——能够解决数学中的高级推理问题,并具备高级数学推理能力,有望在人工智能通用领域解锁科学和技术的新前沿。我们在构建帮助数学家发现新见解、新算法以及解决开放问题的AI系统方面取得了巨大进展,但当前的AI系统由于推理能力和训练数据的限制,仍然难以解决一般的数学问题。而疯狂之处就在这里开始。今天,我们推出了AlphaProof。
00:47
pieces of information surrounding. So essentially they stayed here, the breakthrough models,
周围的信息碎片。所以本质上他们停留在这里,突破性模型,通用智能,具备高级数学推理能力,有潜力解锁新前沿,发现新见解、新算法以及开放问题的答案,但当前的AI系统和训练数据。而疯狂就从这里开始。今天我们展示AlphaProof,来自今年国际数学奥林匹克竞赛的题目。如果你不知道这代表什么,有很多不同的方面。其中之一当然是使用方式,以及不同的路径。这是一个里程碑,因为解决ARC基准测试将是一个重大里程碑,无论从哪个角度看。而OpenAI在这些基准测试上取得超过90%的分数,才是真正推动进展的关键。
00:51
alpha proof, and alpha geometry 2, solve advanced reasoning problems in mathematics, artificial
Alpha Proof和Alpha Geometry 2,能解决数学中的高级推理问题,以及通用人工智能——因为高级数学推理有潜力开启科学和技术的新前沿。我们在构建AI系统方面取得了很大进展,这些系统能帮助数学家发现新见解、新算法以及开放问题的答案,但当前的AI系统在解决通用数学问题时仍然很吃力,原因在于推理能力和训练数据的局限性。而疯狂就从这里开始。今天,我们推出Alpha Proof,这是我们几何求解系统的改进版本。两者合力,成功解决了今年国际数学奥林匹克竞赛六道题中的四道。如果你不了解这个比赛——
00:57
general intelligence, with advanced mathematical reasoning as the potential to unlock new frontiers
通用智能,加上高级数学推理能力,有可能解锁新的前沿领域,发现新的洞见、新颖的算法以及开放问题的答案,但当前的AI系统和训练数据还做不到。而这就是疯狂开始的地方。今天我们展示Alpha Proof,来自今年国际数学奥林匹克竞赛的题目。如果你不知道这是什么,它其实包含很多不同的东西,其中之一当然是工具的使用,以及不同的方法。这是一个里程碑,因为解决arch基准测试将是一个重大里程碑,无论从哪个角度看,OpenAI在这些基准测试上取得超过90%的分数,才是真正推动进展的关键。
01:02
in science and technology. We've made great progress in building AI systems that help mathematicians
在科技领域,我们在构建能帮助数学家发现新见解、新算法以及解决开放问题的AI系统方面取得了巨大进步,但当前的AI系统在解决通用数学问题时仍面临困难,原因在于推理能力和训练数据的局限性。而疯狂之处就从这里开始。今天我们要介绍AlphaProof,这是我们几何解题系统的改进版本。两者合力成功解出了今年国际数学奥林匹克竞赛六道题中的四道。如果你不了解情况——相比人类参赛者,我们在2024年IMO中获得了42分总分中的28分。Gemini系统从零开始训练,使用的合成数据量比其前身多出一个数量级。
01:08
discover new insights, novel algorithms and answers to open problems, but current AI systems
发现新的洞见、新颖的算法以及开放问题的答案,但当前的AI系统
01:14
still struggle with solving general math problems because of limitations in reasoning skills
在解决通用数学问题时仍然存在困难,主要是因为推理能力和训练数据的限制。而疯狂之处就从这里开始。今天我们要介绍Alpha Proof,这是我们几何解题系统的改进版本。它们联手解决了今年国际数学奥林匹克竞赛六道题中的四道。如果你不了解与2024年IMO人类选手相比的情况——我们总共获得了42分中的28分。Gemini是从头开始训练的,使用的合成数据量比其前身多了一个数量级。如果你想看看之前那种神经符号系统——如果你还记得AlphaGo Zero的话,当时有一个AlphaGo Zero,它是AlphaGo的一种形式,表现要好得多。
01:18
and training data. And this is where the craziness starts. Today we present alpha proof,
和训练数据。而疯狂就从这里开始。今天我们要介绍AlphaProof,
01:23
and reinforcement learning based system, formal math reasoning, and alpha geometry 2,
基于强化学习的系统、形式化数学推理、AlphaGeometry 2,以及我们几何求解系统的改进版本。它们共同成功解答了今年国际数学奥林匹克竞赛六道题目中的四道。如果你不了解国际数学奥林匹克竞赛,可能无法理解这有多么惊人。这是面向年轻数学家的历史最悠久、规模最大、最具声望的赛事,自1959年起每年举办。每年,顶尖的大学预科数学天才们需要投入数千小时的训练,去攻克代数、组合数学、几何和数论领域六道极其困难的题目。而本质上,这正是人工智能面临的挑战之一。
01:28
and improved version of our geometry solving system. Together they managed to solve four out of six
我们几何求解系统的改进版本。它们共同解决了今年国际数学奥林匹克六道题中的四道。如果你不了解的话,相比IMO 2024的人类参赛者,我们获得了总分42分中的28分。Gemini从头训练,使用的合成数据量比其前身多了一个数量级。如果你想看看之前那种神经符号系统的样子,还记得AlphaGo Zero吗?当时有个AlphaGo Zero,它是AlphaGo的一个变体,表现好得多,你知道,后来超越了AlphaGo Master。所以AlphaGo Zero是一个基本上能自我训练的系统,并且在短短21天内就掌握了围棋。这是一个全新的突破。
01:33
problems from this year's International Mathematical Olympiad. Now if you don't know what the
来自今年国际数学奥林匹克竞赛的题目。如果你不知道什么是
01:38
International Mathematical Olympiad is, you probably won't realize why this is so crazy.
国际数学奥林匹克竞赛——你可能不太明白这到底有多疯狂。
01:42
This is the oldest and largest most prestigious competition for young mathematicians
这是历史最悠久、规模最大、最具声望的青少年数学竞赛,自1959年起每年举办。
01:47
held annually since 1959. In each year elite pre-college mathematicians train sometimes for thousands
每年,顶尖的大学预科数学选手会投入数千小时的训练,去解决六道极其困难的代数、组合、几何和数论问题。
01:54
of hours to solve six exceptionally difficult problems in algebra, combinatorics, geometry,
基本上,这正是人工智能面临的挑战之一——真正有能力的系统已经出现了。
02:00
and number theory. And basically this is one of the challenges for artificial intelligence
现在你可以看到这个原因,这里展示的是我们在2024年IMO题目上的得分。
02:04
and many people do predict that once we have a system that's able to get gold we'll know
许多人预测,一旦我们拥有一个能够获得金牌的系统,就意味着真正有能力的系统已经到来。现在你可以看到这个原因——请看这里,这是我们在2024年国际数学奥林匹克竞赛(IMO)中的得分情况。图表展示了我们的AI系统与人类参赛者在IMO 2024中的表现对比。我们在总分42分中获得了28分,达到了与银牌得主相同的水平。可以看到,它实际上只差一分就能拿到金牌。不过我认为,如果是28分的话,那其实意味着差两分。但无论如何,距离金牌仅一步之遥。然而这绝对令人震惊,因为我意识到谷歌所做的其中一件事是——他们回溯了历史。
02:09
the truly capable systems are here. Now you can see here that this reason, so you can see here the
这张图显示了我们的AI系统与人类选手在2024年IMO中的表现对比。
02:15
score on the IMO 2024 problems. You can see the graph showing performance of our AI system
我们总共获得了42分中的28分。
02:20
relative to human competitors at the IMO 2024. We earned 28 out of 42 total points,
相对于IMO 2024的人类参赛者,我们拿到了总分42分中的28分。
02:26
achieving the same level as the silver medalist in the competition. So you can see that it literally
达到了比赛中银牌得主的水平。所以你可以看到它实际上
02:31
was one point away from getting the gold medal. I think actually, if it's 28, then that means
只差一分就能拿到金牌。我觉得其实,如果是28分的话,那意味着
02:37
it's two points away. But nonetheless, it is a fine margin to getting the gold. But this is
差了两分。但不管怎样,离金牌只有一步之遥。但这
02:43
absolutely insane because one of the things I realized the Google have done is they've gone back
简直太疯狂了,因为我发现Google做的一件事是,他们回顾了
02:48
to some of their old architectures that they previously used to use. Now if you aren't familiar
针对他们过去曾使用的一些旧架构。如果你不熟悉谷歌之前做过什么,他们实际上已经开展了大量不同的人工智能项目,这些项目非常成功,甚至成功创建了超人类的人工智能系统。现在,本质上,我之所以说这非常疯狂,以及这让我如此兴奋的原因在于,如果我们仔细看看谷歌在这里的成果,你会发现他们实际上描述了一个神经符号混合系统,其中语言模型基于Gemini,并且从头开始训练,使用的合成数据量比其前身多出一个数量级。这帮助该模型解决了更具挑战性的几何问题,包括关于……的问题。
02:53
with what Google have previously done in the past, they've actually done a huge amount of different
Google过去做过的事情,他们实际上做了大量不同的
02:57
AI projects that have been really successful and they've even managed to create superhuman AI systems.
AI项目,这些项目都非常成功,甚至成功打造出了超人类的AI系统。
03:03
Now essentially, the reason why I say that this is so crazy and the reason why this excited me was
现在,我之所以说这太疯狂了,以及这让我如此兴奋的原因,是
03:09
because if we actually take a look at what Google have done here, you can see that they actually
因为如果我们仔细看看Google在这里的成果,你会发现他们实际上
03:13
described that this is a neurosymbolic hybrid system in which the language model was based on
描述说这是一个神经符号混合系统,其中的语言模型基于Gemini,并且从头开始训练,使用的合成数据量比前一代多了一个数量级。这帮助模型解决了更具挑战性的几何问题,包括关于能力的问题。如果你想看看之前那种神经符号系统,还记得AlphaGo0吗?AlphaGo0是AlphaGo的一个变体,性能好得多,但本质上这个模型基本超越了之前的AlphaGo,实际上它后来还超越了AlphaGo Master。所以AlphaGo0是一个系统,它基本上能够自我训练,并在仅仅21天内掌握了围棋。这是一个全新的突破。
03:18
Gemini and trained from scratch on an order of magnitude more synthetic data than its predecessor.
Gemini从头训练,使用的合成数据量比上一代多了一个数量级。
03:24
This helped the model tackle much more challenging geometry problems, including problems about
这帮助模型解决更复杂的几何问题,包括关于能力的问题。如果你想看看之前那种神经符号系统,如果你还记得AlphaGo0的话,当时有个AlphaGo0,它是AlphaGo的一个变体,表现好得多,但本质上这个模型基本超越了之前的AlphaGo,而且实际上它后来还超越了AlphaGo Master。所以AlphaGo0是一个系统,它基本上能自我训练,并在短短21天内掌握了围棋。这是一个全新的突破,成为了世界上最好的围棋选手,而且完全是通过自我对弈实现的。当然,如果你还记得,并且一直关注那些流传的报告的话——
03:28
movements of objects and equations of angles ratio or distances. And Alpha Geometry 2
物体的运动轨迹、角度比例或距离的方程。而Alpha Geometry 2
03:34
employs a symbolic engine that is two orders of magnitude faster than its predecessor when
采用了一个符号引擎,其速度比前代产品快两个数量级。
03:38
presented with a new problem, a novel knowledge sharing mechanism is used to enable advanced
当面对新问题时,系统会使用一种新颖的知识共享机制,
03:43
combination of different search trees to tackle more convex problems. And the reason that this is
实现不同搜索树的高级组合,以解决更复杂的凸问题。
03:48
crazy is because neurosymbolic AI from what we've seen in early experiments, even on some of the
之所以说这令人震惊,是因为根据我们在早期实验中的观察,
03:54
hardest benchmarks, have proven to consistently generate results that surprise even the most
神经符号AI即便在最难的基准测试中,
04:00
well researched researchers. So that's why this is so crazy because if Google managed to continue
也持续产生出连最资深的研究人员都感到意外的结果。
04:05
pushing the bounds on neurosymbolic AI, I do believe that they're likely to make an increasing
这就是为何此事如此惊人——如果谷歌能够继续
04:10
number of breakthroughs and increasingly more powerful systems in terms of their reasoning
在推理能力方面,突破性进展的数量不断增加,系统也变得越来越强大。如果你想了解一种早期的神经符号系统,可以回想一下AlphaGo Zero。AlphaGo Zero是AlphaGo的一种改进版本,性能大幅提升,本质上它超越了之前的AlphaGo,随后又进一步超越了AlphaGo Master。AlphaGo Zero是一个能够自我训练的系统,仅用21天就掌握了围棋。这是一种全新的方法,可以看到它在40天内超越了所有其他版本的围棋程序,成为世界上最好的围棋选手,而这一切完全是通过自我对弈实现的。当然,
04:14
capability. If you want to take a look at a kind of neurosymbolic system that was there before,
如果你想看看之前那种神经符号系统的例子,
04:19
if you remember AlphaGo0, there was AlphaGo0 which was a form of AlphaGo which was a lot better,
如果你还记得AlphaGo Zero,它比AlphaGo Master强很多,
04:25
but essentially this model basically surpassed the previous AlphaGo and actually it's previously,
但这个模型基本上超越了之前的AlphaGo,实际上它后来又超越了AlphaGo Master。所以AlphaGo Zero是一个系统,它基本上能够自我训练,并在短短21天内掌握了围棋。这是一个全新的突破,它完全通过自我对弈成为了世界上最好的围棋选手。当然,如果你还记得并且关注过一些流传的报告,比如“我们该怎么办?”之类的讨论,但人们一直在慢慢探索的一件事是,神经符号AI通过使用许多不同的东西来提升AI的推理能力。其中之一当然是工具使用,以及不同的方法。
04:31
you know, then went to surpass the AlphaGo master. So AlphaGo0 was a system that basically managed
然后超越了AlphaGo Master。AlphaGo Zero基本上是一个能自我训练的系统,
04:38
to train itself and essentially managed to master Go in just 21 days. This was a new apart,
在短短21天内就掌握了围棋。这是一个全新的突破,
04:45
this was a new approach and you can see that in 40 days that it surpasses all other versions of Go
这是一种全新的方法,可以看到在40天内它就超越了所有其他版本的围棋程序,成为世界上最好的围棋选手,而且完全是通过自我对弈实现的。当然,如果你还记得并且一直关注那些流传的报道,他们一直在说,看,AI的训练数据快用完了,数据不够了,我们该怎么办?等等等等。但人们一直在慢慢探索的一个方向是,neurosymbolic AI通过使用多种不同的技术来提升AI的推理能力。其中一项当然是工具使用,以及不同的搜索和解决推理问题的方法。我认为这种方法是我们已经……
04:50
and becomes the best Go player in the world and it does this entirely from self play. Now of course
并成为世界上最好的围棋选手,而这一切完全是通过自我对弈实现的。当然,如果你还记得,并且一直关注那些流传的报告,我们该怎么办?等等等等。但人们一直在慢慢探索的一件事是,neurosymbolic AI 通过使用许多不同的东西来提升 AI 的推理能力。其中之一当然是工具使用,以及不同的方法。这应该是通往 AGI 道路上的一个重要里程碑,这就是为什么我说这是一个重大里程碑,因为解决 arch benchmark 将是一个重大里程碑,因为无论你采用什么方法,只要能解决那个 benchmark,就意味着你的推理引擎已经足够强大。
04:54
I'm not saying that you can apply this entire concept to LLMs but the point here is that one of
翻译:我并不是说你可以将整个概念直接套用到大型语言模型上,但关键在于,如果你还记得并留意过一些流传的报告,就会发现它们一直在说:看,人工智能的训练数据快用完了,数据快枯竭了,我们该怎么办?等等等等。然而,人们正在慢慢探索的一个方向是,神经符号人工智能通过利用多种不同手段来提升AI的推理能力。其中一种手段当然是图的使用,以及各种搜索和解决不同推理问题的方法。我认为,在我查阅过的所有研究论文中,这种方法已经屡见不鲜。这确实是一个值得关注的方向。
04:59
the things if you remember and if you've been paying attention to some of the reports floating
如果你还记得并且关注过一些流传的报告,
05:02
around is that they've been saying that look AI is running out of training data, running out of
他们一直在说,AI的训练数据快用完了,数据不够了,怎么办?云云云。但人们慢慢在探索的一件事是,神经符号AI通过利用多种不同的手段来提升AI的推理能力。其中一种手段当然是tour use,还有不同的搜索和解决推理问题的方法。我认为这种方法是我们一直在做的,而且这应该是通往AGI道路上的一个重要里程碑,所以我才会说这是一个重大里程碑,因为解决arch基准测试将是一个重大里程碑——无论你采用什么方法,只要能通过这个基准测试,就意味着你的推理引擎已经达到了某种水平。
05:07
data, what are we going to do? Yada, yada, yada. But one of the things that people have been
数据方面,我们该怎么办?等等等等。但人们一直关注的一个问题是——
05:12
slowly exploring is the fact that neurosymbolic AI improves AI's reasoning capabilities by using
慢慢探索下来,会发现神经符号AI通过多种方式提升了AI的推理能力。其中一种方式当然是使用tour,还有各种不同的方法。这应该是通往AGI道路上的一个重要里程碑,所以我才会说这是个重大突破——因为解决arch benchmark本身就是个重大里程碑,无论你采用什么方法,只要能攻克这个基准测试,就意味着你的推理引擎足够强大。说到这个,Paul Cristiano,也就是发明RLHF的那个人,他最近基本表态说……今年早些时候有两次消息源描述了他们看到的场景,OpenAI的员工告诉他们……而且我们确实有那个能力去做一些非常有趣的事情,但与此同时……
05:18
many different things. One of the things is of course tour use and of course different ways to
许多不同的事情。其中之一当然是使用方式,当然还有不同的方法去
05:23
search and solve different reasoning problems. And I think that this method is something that we've
搜索并解决不同的推理问题。我认为这种方法是我们一直在做的,而且这应该是通往AGI道路上的一个重要里程碑,所以我才会说这是一个重大里程碑,因为解决arch基准测试将是一个重大里程碑——无论你采用什么方法,只要能通过这个基准测试,就意味着你的推理引擎基本上搞清楚了该怎么做。现在这简直太疯狂了,因为就像我之前说的,那个meme用GPT-4o达到了72%的准确率,他实际上用了神经符号方法,所以这个meme其实有点不准确。但本质上这确实很疯狂,因为这是很多人之前认为不可能的事。只要能得出结果,过程其实不重要,结果本身才重要。
05:28
seen time and time again in all the research papers that I've looked at. This is something that
在我看过的所有研究论文中,这种情况反复出现。这是
05:32
increases the reasoning ability of these models. So basically you have this researcher called
以下是中文翻译:
05:36
Francis Raleigh. He's a French software engineer and computer scientist working at Google. Now
Francis Raleigh,一位在Google工作的法国软件工程师兼计算机科学家。现在
05:42
essentially he created a benchmark that is rather hard for current AI systems and it's kind of
提升了这些模型的推理能力。简单来说,有一位名叫弗朗西斯·雷利(Francis Raleigh)的研究人员。他是一位在谷歌工作的法国软件工程师兼计算机科学家。他创建了一个对当前人工智能系统来说相当困难的基准测试,而且这个基准测试不会受到数据污染的影响。也就是说,它不会像某些训练数据那样被泄露,让AI能够提前准备,也无法通过记忆来应对。因此,这是一个非常困难的基准测试。更令人惊讶的是,他明确表示:“我从未声称解决ARC(抽象推理语料库)就等于实现通用人工智能(AGI)。第一个解决ARC的模型不会是一个AGI。”但他也提到,他创建的这项ARC挑战——我之前确实提到过——
05:48
benchmark that is not subject to contamination. So it's not something that is leaked in the
有一个不受数据污染影响的基准测试。也就是说,它既没有泄露到
05:53
training data where AI's can plan for it. And it's not something they can memorize either. So
训练数据中让AI可以提前准备,也不是它们能靠记忆解决的问题。所以
05:59
this is a really hard benchmark. Now what's crazy about this is that he basically said to be clear
这是一个非常难的基准测试。而疯狂的是,他基本上说得很清楚:
06:03
I've never claimed that solving arc was equivalent to solving AGI. The first arc solver is not going
我从未声称解决ARC就等于解决AGI。第一个ARC求解器
06:08
to be an AGI but he basically said that you know this arc challenge that he created and I did talk
不会是一个AGI。但他基本上表示,他创建的这个ARC挑战——我之前确实聊过
06:12
about this before but I just wanted to quickly gloss over this. But he says here that until we solve
关于这一点我之前提过,但只是想快速带过一下。不过,他在这里指出,除非我们解决了ARC问题,否则我们不会拥有通用人工智能(AGI),因为目前的人工智能系统只是适应了它们之前未见过的简单任务。而解决ARC问题需要弄清楚如何让人工智能系统在遇到新任务时即时适应。这应该是通往AGI道路上的一个重要里程碑——正因如此,我才说这是一个重大里程碑。因为一旦攻克了ARC基准测试,无论你采用什么方法,只要能通过该基准测试,就意味着你所使用的推理引擎——无论是最近邻方法,还是某种研究型方法,或是其他任何方法——都将是某种真正具有突破性的东西。
06:17
arc we don't have AGI since the AIs we have kind of adapted to simple tasks that they haven't seen
ARC——我们还没有实现AGI,因为现有的AI只是适应了它们从未见过的简单任务。
06:21
before and solving arc require figuring out how to make AI systems adapt on the fly to novel tasks
在解决ARC之前,关键在于搞清楚如何让AI系统能够即时适应全新的任务。这将是通往AGI道路上的一个重要里程碑,所以我才会说这是个重大突破。因为一旦攻克了ARC基准测试,无论你采用什么方法——不管是nearest bullet、research还是其他任何思路——都意味着你的推理引擎真正奏效了。ARC的初衷就是让研究者把注意力从死记硬背重新转向智能本身,真正实现那种能举一反三、在多种任务上都表现出色的智能。
06:27
and this should be a major milestone on the way to AGI which is why I said that this is a major
这应该是通往AGI道路上的一个重要里程碑,所以我才会说这是个重大突破。因为解决ARC基准测试本身就会成为关键节点——无论你采用什么方法,只要能攻克这个基准测试,就意味着你的推理引擎达到了某种水平。保罗·克里斯蒂亚诺,就是发明RLHF的那个人,他最近基本表态说……据两个消息源描述,今年早些时候他们看到OpenAI员工透露,我们确实有能力搞点真正有趣的东西,但同时也很震撼。因为不仅OpenAI做到了,如果你还记得的话,谷歌其实也发布过……而OpenAI在这些基准测试上拿到超过90%的分数,这才是真正推动进展的关键。
06:31
milestone because solving the arch benchmark is going to be a major milestone because whatever
里程碑,因为解决ARC基准测试将是一个重要的里程碑,因为无论什么
06:36
approach that you do you should solve that benchmark it means that you know whatever reasoning engine
你采取的方法就是,你应该解决那个基准测试,这意味着,你知道,不管是什么推理引擎。
06:41
that you're using whether it be nearest bullet whether it be you know research or whatever kind of
你用的方法,不管是nearest bullet,还是research,或者别的什么方式,反正你用的那个方法,它就会是某种东西。
06:46
approach it is that you do use whatever approach that is going to be it's going to be something
ARC的目的,就是让研究者重新聚焦在智能本身,远离死记硬背。
06:50
that's remarkably effective if it can actually focus and solve this benchmark and he says here
翻译如下:
06:55
the purpose of arc is to get researchers to refocus on intelligence and pure way from memorization
真正的智能,是指他们能自己搞明白事情,在很多任务上都表现得好。
07:01
because I believe this is how we will get to AGI and basically you didn't know LLMs they don't
如果它真的能集中注意力并解决这个基准测试,那效果就非常显著了。他在这里说,ARC(抽象推理语料库)的目的是让研究人员重新聚焦于智能本身,远离死记硬背,以纯粹的方式探索智能。因为我相信,这才是我们实现通用人工智能的途径。基本上,你之前不知道的是,大型语言模型并不具备真正的智能——那种能自己弄明白事情的能力。它们在许多任务上表现良好,只是因为接受了各种数据的训练。而人类与它们之间存在本质区别:比如,人类看到一张两只猫的图片,就能立刻在现实世界中认出什么是猫。这就是那种能让你在新旧场景中随机应变、理解当下情况的能力。不过,对于那个基准测试来说,实际上……
07:05
really have intelligence in the sense that they figure things out they do well on many tasks
人类看到一张两只猫的图片,马上就能认出外面世界里的猫是什么样子。
07:10
because they've been trained on various pieces of data and there's a pure difference between you
因为它们训练时用了各种数据,而人类看到一张两只猫的图片就能立刻认出猫是什么,这种推理能力让你能在新旧场景中快速判断发生了什么。但那个基准测试的结果显示,实际上有人已经搞定了这个——这太疯狂了,因为就像我之前说的,那个梗在调侃神经符号AI,但Ryan用来让GPT-4o达到72%准确率的方法,其实正是神经符号方法。所以那个梗其实不太对,但这件事本身确实很惊人,因为很多人原本以为这根本做不到。
07:15
know humans that can see an image like of two cats and then immediately they can you know recognize
这就是那种推理能力,能让你在新旧场景中当场搞清楚状况。
07:20
what a cat is outside in the world so this is the kind of reasoning where you're able to figure out
不过,有了那个benchmark之后,实际上基本上已经有人搞明白怎么做到这一点了。
07:26
what's going on on the fly in new and old scenarios now with that benchmark though the reason actually
现在这简直疯了,因为就像我之前说的那个meme一样。
07:31
brought this up was because someone basically decided to use LLMs and a neurosymbolic approach
之所以提起这个,是因为有人基本上决定使用大语言模型和神经符号方法,并且成功找到了实现这一目标的方式。这很疯狂,因为就像我之前说的,那个梗——有点调侃神经符号AI——但实际上,这个人(瑞安)所用的方法,成功让GPT-4达到了72%的准确率,他确实采用了神经符号方法。所以那个梗其实不太准确。但本质上,这相当惊人,因为很多人原本以为这需要相当长的时间才能实现。你可以在这里看到分支情况,他们表示,这是目前最有前景的研究方向之一:利用大语言模型辅助离散程序搜索,通过将大语言模型作为采样程序或分支决策的工具。而这正是神经符号AI的核心所在。
07:37
and basically managed to figure out how to do this now it's crazy because like I said before the meme
基本上他们成功搞明白了怎么做这件事,现在这简直太疯狂了,因为就像我之前说的那个梗。
07:41
kind of memes neurosymbolic AI but essentially the method that the person used which was Ryan to
有种神经符号AI的梗,但本质上那个人(Ryan)用的方法,就是靠神经符号方法才让GPT-4o达到了72%的准确率,所以这个梗其实不太对。但这事确实挺疯狂的,因为很多人觉得只要能出结果,怎么做到的并不重要,结果本身才重要。我们早在2016年AlphaGo时期就率先使用了这类神经符号系统,很快也会应用到主流的Gemini模型上,敬请期待。这意味着Gemini模型可能马上就要变得极其聪明了。整件事对某些人来说有点吓人,我说的吓人是指,这确实是有些人之前预测会发生的。
07:47
manage to get you know 72% with GPT 40 he actually used a neurosymbolic approach so the meme here is
他用GPT-4o居然达到了72%的准确率,实际上他采用了一种神经符号方法,所以那个梗其实有点不对。
07:52
kind of wrong but essentially this was pretty crazy because it was something that many people thought
但本质上这还是挺惊人的,因为这是很多人之前认为不可能的事。
07:58
would take quite a while and you can see here branches so they said this has been the most promising
会花不少时间,你可以看到这里的分支,所以他们说这是目前最有前景的
08:03
branch of approaches so far leveraging an LLMs to help with discrete program search by using the
分支方法,利用LLM来辅助离散程序搜索,通过把LLM当作采样程序或分支决策的工具,这正是神经符号AI的核心理念
08:08
LLM as a way to sample programs or branching decisions this is exactly what neurosymbolic AI is
结果就是系统竞争力大幅提升。现在我在想这到底能有多有效,因为
08:14
for the record and that's why when you have AIs that can search over multiple things it's something
需要说明的是,正因如此,当人工智能能够对多种可能性进行搜索时,它就会形成一个更具竞争力的系统。现在我想知道这究竟能有多大的效果——因为当像AlphaGo这样的人工智能系统能够对数以百万计的不同局面进行搜索时,我们就能有效过滤掉糟糕的决策,从而获得真正有价值的结果。尽管有人会争辩说"这算不上真正的智能",但我的看法是:只要它能达成目标,过程并不重要,结果才是关键。而最令人惊叹的是,正如德米斯·哈萨比斯在推文中提到的:"我们早在2016年AlphaGo项目时就开创性地运用了这类神经符号系统。"
08:20
that results in a much more competitive system now I wonder how effective this is going to be because
当你有一个像AlphaGo这样的AI系统,它可以搜索数百万甚至数亿个
08:26
when you have an AI system like AlphaGo that can search over millions and millions of different
不同的局面,我们就能过滤掉那些糟糕的决策,然后自然就能得到真正的
08:31
positions we can manage to filter out the bad decisions and then of course we can get to the real
结果。虽然有些人可能会争论说“哦,但那不是真正的智能”,我的意思是,如果
08:36
results and although some people would argue that oh but that's not real intelligence I mean if
它真的能达成结果,那它怎么做到的其实并不重要,重要的是它做到了。
08:40
it manages to get the result then it doesn't really matter how it gets there it just matters that it
只要能拿到结果,过程其实不重要,重要的是结果本身。
08:44
is there and what's crazy about all of this is that you know Demis Osabis tweeted about this he says
有没有这回事?疯狂的是,Demis Osabis 发了条推文说,我们从2016年AlphaGo开始就长期引领这类神经符号系统的应用,很快会融入我们的主流Gemini模型,敬请期待。这意味着Gemini模型可能即将变得极其聪明。这件事对某些人来说有点吓人——我说的吓人是指,确实有人预测过这会大幅缩短时间线。如果你不清楚我在说什么,可以看看这里:发明RLHF的Paul Cristiano基本上说了,如果AI在2025年底前任何国际数学奥赛拿到金牌,他就会更新自己的时间线。
08:50
we've long pioneered the use of these types of neurosymbolic systems starting with AlphaGo in 2016
我们早在2016年就用AlphaGo开创了这类神经符号系统的使用,很快也会应用到主流的Gemini模型上,敬请期待。这意味着Gemini模型可能会变得非常非常聪明。这件事对某些人来说有点吓人,我说的吓人是指,这确实是有些人之前预测会发生的。Paul Cristiano,也就是发明RLHF的那个人,他基本上表示,如果到2025年底AI能在任何国际数学奥林匹克竞赛中获得金牌,他就会更新自己的时间线。现在的情况是,随着时间推移,时间线正在缩短,而考虑到这些问题的难度,很多人甚至没想到这会发生。
08:55
through to Alpha Zero we'll be bringing all the goodness of Alpha Proof than Alpha Geometry 2
通过Alpha Zero,我们将把Alpha Proof和Alpha Geometry 2的所有优势,很快带入我们的主流Gemini模型中。敬请期待。这意味着Gemini模型可能会变得极其智能。这件事对某些人来说有点令人担忧——我指的是“担忧”在于,这恰恰是一些人曾预测会缩短时间线的事情。如果你不熟悉我在说什么,可以看看这里:发明RLHF的保罗·克里斯蒂亚诺基本上表示,如果到2025年底,任何AI能在国际数学奥林匹克竞赛中获得金牌,他将更新自己的时间线。而今天,Alpha Proof距离获得那枚金牌仅差一分。你可以在这里看到——
09:01
to our mainstream Gemini models very soon watch this space so it means that Gemini models are
很快会应用到我们的主流Gemini模型上,敬请期待。这意味着Gemini模型可能会变得非常非常聪明。
09:07
potentially about to get really really smart now this whole thing was a little bit scary for some
整件事对某些人来说有点吓人,我说的吓人是指,这确实是有些人之前预测会发生的。
09:13
individuals and I mean scary in the sense that this is something that some people did predict would
这里保罗·克里斯蒂亚诺,也就是发明RLHF的那个人,他基本上说他要……
09:19
initially shrink the timeline so if you're not familiar with what I'm talking about you can see
首先把时间线缩短,如果你不熟悉我在说什么,你可以看到这里,Paul Cristiano,也就是发明RLHF的那个人,现在基本上他说了,如果到2025年底,AI在任何国际数学奥林匹克竞赛中拿到金牌,他就会更新他的时间线。这里的情况是,随着这一年过去,时间线在缩短,而这是很多人原本认为不可能发生的,因为解决这个问题有多难。但事情是这样的:如果你有一个世界上最强的国际象棋棋手,你和他对弈,100%的情况下他都会输,但我们不知道他会怎么输。我无法告诉你他会把棋子放在棋盘上的哪个位置,但我们知道的是——
09:23
here that Paul Cristiano the person who invented RLHF now he basically said here that he's going to
这里,Paul Cristiano,那个发明了RLHF的人,现在他基本上说,他打算……
09:29
update his timeline if an AI got gold in any international math Olympiad by the end of 2025
如果到2025年底,有AI在任何国际数学奥林匹克竞赛中拿到金牌,就更新他的时间线
09:36
and today Alpha Proof came within one point of achieving that gold medal you can see here the
今天Alpha Proof差一分就拿到了那枚金牌,你可以看到这里。
09:42
his statements he says that I think the IMO challenge would be significant direct evidence
他所说的言论是:他认为国际数学奥林匹克竞赛(IMO)的挑战将成为强有力的直接证据,证明强人工智能会更早实现,或者至少从技术层面会更早成为可能。他认为这将是相当重要的证据,或许会将他预测的2040年实现概率从25%提升至40%左右。他还认为,这将是重要证据,表明技术突破将受限于社会学因素和工程投入,而非机器学习平滑扩展的缓慢进程。他可能会将“硬起飞”的概率从30%调整至50%。因此,基本的情况是:随着时间推移,时间线正在缩短——考虑到这些挑战的难度,许多人此前甚至认为这种情况根本不会发生。
09:46
that powerful AI would be sooner or at least would be technologically possible sooner I think this
那个强大的AI迟早会出现,或者至少在技术上迟早会成为可能——我认为这会是相当重要的证据,可能会把我对2040年的概率从25%推到40%左右。
09:52
would be fairly significant evidence perhaps pushing my 2040 probability up from 25% you 40% or
而且我认为这会是重要证据,表明起飞速度将受限于社会学因素和工程努力,而不是平滑的机器学习scaling缓慢推进。
09:59
something like that and I think that this would be significant evidence that the takeoff will be
我可能会把硬起飞的概率从30%调整到50%。
10:04
limited by sociological facts and engineering effort rather than a slow march of smooth machine
所以基本上我们现在面临的情况是,随着今年时间的推移,时间线在缩短。
10:10
learning scaling maybe I'd move from 30% to a 50% chance of a hard takeoff so basically what we
考虑到这些任务有多难,很多人甚至没想到会发生这种事。
10:16
have here is a situation where timelines are shrinking as we move throughout the year and this
这里的情况是,随着时间推移,时间线在不断缩短
10:21
is something that many people didn't even think would happen considering how difficult these
而这是很多人原本根本没想到会发生的事,毕竟这些题目有多难
10:25
problems are now Eliza Yukowski actually made a statement here that said Paul Cristiano and I
以下是中文翻译:
10:30
previously worked hard to pin down concrete disagreements and one of our headers was that Paul put up
之前我们花了很多功夫去明确具体的分歧点,其中一个要点是Paul提出的
10:35
an 8% probability on AI built before 2025 IMO reaches gold level on it and I put it at least 16%
问题在于,伊莉莎·尤科夫斯基实际上曾发表过这样一番言论,称保罗·克里斯蒂亚诺和我之前努力想找出具体的分歧点,而我们的一个分歧标题是:保罗认为在2025年之前,AI在IMO(国际数学奥林匹克竞赛)上达到金牌水平的概率为8%,而我给出的概率至少是16%。
10:44
now the reason that this is so crazy is because Eliza Yukowski has been someone who's basically stating
现在这件事之所以这么疯狂,是因为Eliza Yukowski基本上一直在说
10:50
creating super intelligent AI is just a stupid thing to do simply put it's just stupid it's just
现在,这件事之所以如此疯狂,是因为伊莉莎·尤科夫斯基一直以来基本上都在宣称:创造超级智能AI本身就是一件愚蠢的事情——简单来说,就是愚蠢,彻头彻尾的愚蠢。因为接下来会发生的事情是,它会做出一些导致不可逆损害、甚至可能让人类灭绝的行为。而这一切最疯狂的地方在于,如果你看过、了解过伊莉莎·尤科夫斯基的一些对话和论点……
10:55
downright stupid because what's going to happen is it's going to do something that is going to cause
这完全是愚蠢的,因为接下来会发生的事情,将会造成不可逆的损害,甚至可能导致人类灭绝
11:00
irreversible damage or potentially human extinction and what's crazy about all of this is that if you've
而整件事最疯狂的地方在于,如果你看过Eliza Yukowski的一些对话,他提出的某些论点
11:05
seen and you know looked at some of the conversations that Eliza Yukowski has some of the arguments he
你几乎不可能反驳,举个例子,比如有些人
11:10
does make are quite fascinating because he basically describes how a super intelligent AI is one
确实如此,这相当引人入胜,因为他基本描述了超级智能AI的本质——如果你仔细想想,比如有些人常说:“好,告诉我超级智能AI会怎么赢,然后我们就能解决这个问题。”但实际情况是这样的:如果你有像马格努斯·卡尔森或加里·卡斯帕罗夫这样的世界顶尖棋手,你可以说,如果让一个普通人跟他们对抗,100%的情况下普通人会输,但我们不知道他们会怎么输。我无法告诉你他们会把棋子放在棋盘上的哪个位置,但我们知道最终结果。同样的情况也适用于AI——我们不知道这个AI会做什么。
11:16
that you simply cannot win against if you think about it like this for example some people
经常说:好,那你告诉我超级智能AI会怎么赢,然后我们再去解决那个问题
11:21
frequently say that okay tell me how the super intelligent AI is going to win and then we're going to
但实际情况是,如果你有一个世界顶尖的象棋选手
11:25
solve that issue but it's like this okay if you have someone who is the best chess player in the
解决这个问题,但事情是这样的——如果你有一个世界上最强的国际象棋选手,
11:31
world like Magnus Carlton or Gary Casparov you can say that look if you put an average person
像Magnus Carlsen或Gary Kasparov这种级别的棋手,你可以说,如果让一个普通人去跟他们下,100%会输,但我们不知道他们会怎么输。我没办法告诉你他们会把棋子放在棋盘上的哪个位置,但我们知道最终结果。同样的情况也适用于AI——我们不知道这个AI会做什么。人类这个物种可能不会存在太久,或者基本上被当作娱乐工具,或者只是摆设。也许比这更重要的是,想象一下把一台空调的设计图纸送回11世纪。就算图纸足够详细,让他们能造出来,当冷风吹出来的时候他们还是会震惊,因为空调利用了温度和压力的关系。
11:36
against them you know 100% of the time they are going to fail but what we don't know is how they're
你100%知道他们会输给对手,但我们不知道的是他们会怎么输。
11:41
going to fail I can't tell you where they're going to place the pieces on the board but what we do know
我无法告诉你他们会把棋子放在棋盘上的哪个位置,但我们从Lazio Kalski那里知道的是,
11:46
is the end result and the same situation is where the AI we don't know what this AI is going to do
最终结果是一样的,我们不知道这个AI会做什么。
11:51
if it is a super intelligent system what we do know is that the end result is that humans lose
如果它是一个超级智能系统,我们所知道的是,最终结果是人类会失败。
11:56
because we look at evolution anytime a new species comes on that is far more intelligent but other
因为从进化角度看,每当一个更智能的新物种出现时,其他物种往往无法长久存在,要么被当作娱乐,要么被圈养以获取资源——这只是其中一两种可能性。
12:00
species aren't around for much longer or are essentially kept as entertainment or just pretty
人类物种要么撑不了多久,要么就沦为娱乐或摆设。
12:05
much farmed for whatever resources they have but just paint one or two possibilities okay so
那么,为什么这很难理解?首先,因为你无法准确预测一个更聪明的棋类程序会如何移动。
12:12
why is this hard first because you can predict exactly where a smarter chess program will move
更重要的是,想象一下,把空调的设计图送回11世纪——即使细节足够让他们制造出来,当冷气吹出时,他们也会感到震惊,因为空调利用了温度与压力的关系。
12:17
maybe even more importantly than that imagine spending the design for an air conditioner back to
甚至比这更重要的是,想象一下把空调的设计图纸送回11世纪——就算细节足够让他们造出来,当冷风吹出时他们也会吓一跳,因为空调利用了拉齐奥·卡尔斯基的温度压力关系。
12:23
the 11th century even if they if it's enough detail for them to build it they will be surprised
但关键在于,我和Paul争论的那个元观点是:
12:28
when cold air comes out because the air conditioner will use the temperature pressure relation
我们赌局的市场走势表明,这一进展并非基于公开信息就能平稳预测的,也就是说,前沿实验室目前正在进行的那种研究,其走向是无法轻易预判的。
12:34
and they don't know about that law of nature so if you want me to sketch what a super intelligent
以下是中文翻译:
12:40
smart do I can go deeper and deeper into places where we think there are predictable technological
聪明,我可以深入再深入那些我们认为存在可预测技术路径的地方。
12:46
advancements that we haven't figured out yet and as I go deeper and deeper get harder hard to follow
他们并不了解那条自然法则,所以如果你要我描绘一个超级智能的智慧体,我可以深入到那些我们认为存在可预测的技术进步、但尚未完全弄清楚的领域。随着我越挖越深,内容会变得越来越难以理解。它可能极具说服力,相对容易理解——我们并不完全了解大脑的运作方式,因此这是一个绝佳的切入点,可以利用那些我们尚未知晓的自然法则、环境规则,并在此基础上发明新技术。然后,你可以制造一种合成病毒,让人类患上感冒,并引发神经系统的变化,使他们更容易被说服。你能自己构建合成生物学、合成半机械人吗?你能直接跳过这些,实现共价键结合吗?
12:50
it could be super persuasive that's relatively easy to understand we do not understand exactly how
它可能非常有说服力,这一点相对容易理解——我们并不完全了解大脑是如何运作的,所以这是一个绝佳的机会,可以利用我们尚未认知的自然法则、环境规则,并在此基础上发明新技术。
12:56
the brain works so it's a great place to exploit laws of nature that we do not know about rules of
然后你制造出一种合成病毒,让人类得感冒,同时引发神经变化,让他们更容易被说服。
13:01
the environment invent new technologies beyond that and you build a synthetic virus that gives humans
你能制造自己的合成生物学、合成半机械人吗?
13:09
a cold and then did a neurological change and they're easier to persuade can you build your own
你能直接跳过这些,去实现共价键结合吗?
13:15
synthetic biology synthetic cyborgs can you blow straight past that to covalently bonded the
你会有那些沿着更陡峭的势能梯度下降、并且由Lazio Kalski键合的东西。
13:23
equivalence of biology where instead of proteins that fold up and are held together by static
以下是中文翻译:
13:28
cling you've got things that go down much sharper potential energy gradients and are bonded
但关键在于,你知道我和Paul争论的那个元观点。
13:33
together people have done advanced design work so the point here and I might even include a clip
生物学的等价物,其中不是由蛋白质折叠并通过静电吸附保持在一起,而是由沿着更陡峭的势能梯度下降并通过化学键结合的物质构成。人们已经完成了先进的设计工作。所以这里的要点——我甚至可能加入一段拉斯洛·卡尔斯基的片段——但关键在于,我和保罗争论的元点是:AI的进步是否平滑,因此可预测且可限定?而我们赌约中预测市场的剧烈波动表明,这一发展并非基于公开信息就能平滑预测的。这意味着,前沿实验室目前正在进行的研究表明,正在开发的这类系统可能远远超越……
13:37
from Lazio Kalski but the point here is that you know the meta point that Paul and I was arguing
关键在于,我和Paul争论的那个元观点是:
13:41
was is the progress of AI smooth and therefore predictable and boundable and the sharp prediction
AI的进展是否平滑、可预测、可界定?而预测市场对我们赌注的剧烈反应表明,这种发展并非基于公开信息就能平滑预测的。这意味着前沿实验室正在进行的研究告诉我们,目前正在开发的系统可能远超现有水平——那些看似强大的系统并不遥远,考虑到预测市场这些惊人的跳跃,它们可能比我们想象的更近。而整件事更疯狂的是,有人发推说“OpenAI有机会做一件最搞笑的事”,然后Sam Altman回复了“lol”(就是大笑)。这之所以疯狂,是因为……
13:46
market movement on our bet suggests that this development was not smoothly predictable based on
我们赌注的市场走势表明,这种发展并非基于公开信息就能平稳预测的,
13:51
public information meaning that the kinds of research that's going on right now in Frontier labs
这意味着目前Frontier labs正在进行的研究表明,
13:56
shows us that the kinds of system that are currently being developed could far surpass the
向我们展示了,目前正在开发的这类系统,其能力可能远超我们想象。那些看起来能力强大的系统已经不远了,考虑到预测能力上这些惊人的飞跃,它们可能比我们想的更近。而整件事更疯狂的是,有人发推说“OpenAI有机会做一件最好笑的事”,然后Sam Altman回复了“lol”,就是单纯地笑出声。这件事之所以疯狂,是因为这涉及到OpenAI秘密模型的信息——如果你还记得,那个秘密模型其实专注于数学——而Sam Altman对此回复“lol”,基本上意味着那些不可思议的系统可能已经存在了。而且我不认为Sam Altman是在开玩笑。
14:01
current estimate of what is even capable on the upper bounds of current intelligent which means
当前对智能上限所能达到的估计表明,具备类似能力的系统并不遥远,而且考虑到预测能力方面这些惊人的飞跃,它们可能比我们想象的更近。现在,整件事中更疯狂的是,有人发推文说“OpenAI有机会做最有趣的事”,然后山姆·奥特曼回复了“lol”(只是笑出声)。这之所以疯狂,不仅是因为山姆·奥特曼回复了这条推文说“lol”,还因为最近有一些关于OpenAI秘密模型的信息——如果你还记得,这个秘密模型实际上专注于数学——而山姆·奥特曼对此回复“lol”。
14:06
that look capable systems are not far away and they're probably closer than we think considering
看起来有能力的系统并不遥远,而且考虑到预测能力上的这些惊人飞跃,它们可能比我们想象的更近。
14:12
these incredible jumps in terms of prediction mark now what was even crazier about this entire
现在,整件事中更疯狂的是——
14:16
thing was that someone tweeted open AI has the opportunity to do the funniest thing and then
事情是这样的,有人发推说Open AI有机会做一件最搞笑的事,然后Sam Altman回复了“lol”,就是笑出声那种。这事儿之所以离谱,是因为这条推文提到了Open AI的秘密模型——如果你还记得的话,那个秘密模型其实是在专注数学。而Sam Altman对这个回复“lol”,基本上意味着那些不可思议的系统可能已经存在了。不过我觉得Sam Altman这反应也不算过度解读,他只是打了个“lol”而已。但你要知道,最近那个Q*项目或者草莓项目,路透社(非常可靠的来源)有报道说,两位消息人士描述今年早些时候看到的情况,Open AI的员工告诉他们这些项目确实存在。
14:21
Sam Altman responded stating lol just stating laughing out loud now the reason this is crazy is because
Sam Altman 回应说“lol”,就是直接打“lol”笑出声
14:29
not only did Sam Altman respond to this tweet saying lol there has actually been some recent
Sam Altman 不仅回复了这条推文说“lol”,而且最近确实有一些关于 OpenAI 秘密模型的消息。如果你还记得,这个秘密模型的重点其实是数学,而 Sam Altman 回复“lol”基本上意味着——那些不可思议的系统可能已经存在了。我觉得如果情况不是这样,Sam Altman 根本不会去回复那条推文。对于那些觉得“这有点牵强,他只是打了个‘lol’而已”的人,你得记住,最近那个 Q* 项目或者草莓项目,你可以从 Reuters 看到,那是一个非常可靠的来源,报道说有两个消息源描述了今年早些时候看到的情况,当时 OpenAI 的员工告诉他们这些信息。
14:35
information regarding open AI's secret model and if you remember what the secret model was actually
这件事之所以疯狂,是因为
14:40
you know focusing on it was actually focusing on math and Sam Altman saying lol at this basically
关于OpenAI秘密模型的信息——如果你还记得那个秘密模型
14:46
is an indication that they perhaps might even be far ahead of where other systems currently are
这表明他们可能甚至远远领先于其他系统目前的水平,这可能意味着不可思议的系统已经存在。而我认为,如果不是这样,山姆·奥特曼不会对那条推文做出回应。对于那些觉得“这只是在过度解读,他不过是发了个‘哈哈’”的人,你们要记住,最近你知道的Q*项目或草莓项目——你可以在这里看到路透社的报道,这是一个非常可靠的来源——称有两名消息人士描述了今年早些时候的观察,当时OpenAI的员工告诉他们,Q*的演示能够回答那些当今商用模型无法企及的棘手科学和数学问题。另一名了解此事的消息人士则表示……
14:53
which could mean that incredible systems are already here and I don't think that Sam Altman
其实它重点是在数学上
14:58
would have responded to that tweet if that wasn't the case now for those of you that think okay
如果情况不是这样,我早就回复那条推文了。对于觉得“这只是在硬扯”的人来说,他只是回了个“lol”,但你要知道,最近那个所谓的Q*项目,或者叫草莓项目,路透社——一个非常可靠的来源——报道说,有两名消息人士描述称,今年早些时候OpenAI的员工告诉他们,这些模型是今天市面上可用的商业模型。而另一名了解情况的消息人士则表示,这些数学问题——路透社无法确认这是否就是草莓项目——所以这件事之所以这么疯狂,是因为一方面OpenAI基本上在说“lol”,而且我们确实有本事搞点真正好笑的事,但与此同时……
15:03
this is just reaching all he did was just put lol you have to remember that the recent you know
而Sam Altman对此直接回了个“lol”
15:08
q star project or the strawberry project you can see here from Reuters which is a very reliable source
q star project 或者叫 strawberry project,你可以从路透社这里看到,路透社是一个非常可靠的来源,说有两个消息源描述了今年早些时候看到的情况,OpenAI 的员工告诉他们,嗯,我们确实有那个能力做一些非常有趣的事情,但同时也很谨慎、高度保密。但如果这个 AI 真的在某个数学数据集上得分超过 90%,那确实很厉害,因为不仅 OpenAI 做到了,而且如果你还记得的话,Google 其实也发布过类似的东西。OpenAI 在这些基准测试上得分超过 90%,这实际上会推动其余的技术进步,因为这种研究确实能带来实质性的进展。而 OpenAI 暗示他们的系统甚至更强大,这一点也很关键。
15:14
said that two sources described viewing earlier this year where open AI staffers told them were
他说,有两个消息源描述了今年早些时候的一次会面,OpenAI的员工告诉他们,情况是这样的。
15:19
q star demos capable of answering remember tricky science and math questions out of reach of
q star 演示了能够回答那些目前市面上商用模型无法企及的棘手科学和数学问题,而另一位了解情况的消息人士表示,这些数学问题——路透社无法确认这是否就是 strawberry 项目——所以这件事之所以这么疯狂,是因为一方面 OpenAI 基本上在说“哈哈,我们确实有能力搞点真正有趣的事”,但与此同时我们完全不知道 strawberry 那边到底在搞什么,因为这个模型被高度保密、高度机密。但如果这个 AI 真的在某个数学数据集上拿到了超过 90% 的分数,那确实相当厉害,因为不仅 OpenAI 做到了,而且如果你还记得的话,Google 其实也发布过类似的东西。
15:26
today's commercially available models and a different source briefed on the matter said the
目前市面上的商用模型,以及另一位了解此事的消息人士表示,
15:31
open AI has tested AI internally the scored over 90% on a math data set a benchmark of championship
OpenAI 内部测试了一款AI模型,该模型在数学数据集(一项包含国际数学竞赛题目的基准测试)上得分超过90%。路透社无法确认这是否就是“草莓项目”,而这件事之所以如此引人关注,是因为一方面OpenAI基本宣称“哈哈,我们确实有能力搞点真正有趣的事”,但另一方面,我们对“草莓”项目的情况一无所知——毕竟这是一个高度保密、高度机密的模型。然而,如果该AI确实在数学数据集上得分超过90%,那确实相当令人印象深刻,因为不仅OpenAI做到了这一点,而且如果你还记得的话,谷歌实际上也发布过——不是公开发布,而是发表了一篇论文,其中提到了他们的专用模型。
15:39
math problems and Reuters could not determine if this was the strawberry project so that's the
数学题方面,路透社无法确认这是否就是“草莓项目”,所以这就是为什么这件事如此疯狂——因为一方面,OpenAI 基本上在宣称“哈哈”,我们确实有能力做点非常搞笑的事,但同时又保持戒备且高度保密;但如果这个AI确实在某个数学数据集上得分超过90%,那确实相当令人印象深刻,因为不仅OpenAI做到了,而且如果你还记得,Google其实也发布过相关成果。
15:44
reason that this is so crazy is because you know on one hand you've got open AI basically stating
而OpenAI在这些基准测试上取得超过90%的得分,将会真正推动其余的技术进步,因为这才是那种能够实际推动研究进展的工作。
15:50
that lol and we do have the you know ability to do something really funny but at the same time
而且,我们确实有,你知道,能力去做一些非常搞笑的事情,但同时也很令人印象深刻,因为不仅OpenAI做到了,如果你还记得的话,Google实际上也发布了。
15:55
we don't know what's going on with strawberry because this was a model that is you know highly
我们不清楚Strawberry到底是怎么回事,因为这是个高度保密、严防死守的模型。但如果这个AI真的在某个数学数据集上拿到了超过90%的分数,那确实相当厉害——因为不仅OpenAI做到了,而且如果你还记得的话,Google其实也发布过类似成果。而OpenAI能在这些基准测试上拿到90%以上的成绩,恰恰会成为推动后续技术进步的关键,因为这类研究才有可能真正带来新知识,当然也包括AGI。所以这正是我想聊的话题。而且OpenAI还在暗示他们的系统能力更强,这一点真的非常引人入胜。那么,如果你喜欢这期视频,记得告诉我。
15:59
guarded and highly secret but if the a i did score over 90% on a math data set then that is pretty
Open AI 那边保密工作做得非常严,但如果他们的 AI 真的在某个数学数据集上拿到了超过 90% 的分数,那确实相当厉害。因为这不只是 Open AI 做到了,如果你还记得的话,Google 其实也发布过类似的结果。而 Open AI 能在这些基准测试上拿到 90% 以上的成绩,这本身就会推动后续的技术进步,因为这种研究是真正能带来实际突破的。而且 Open AI 还在暗示他们的系统能力更强,这离 AGI 就更近了一步。现在有很多不同的方向在讨论,当然神经符号 AI 目前看起来非常有前景。那么,如果你喜欢这个视频,希望你能——
16:05
impressive because not only did open a i do it but you if you do remember google actually did release
而OpenAI在这些基准测试上拿到超过90%的分数,这将会是真正推动进展的因素。
16:12
not release but you know release a paper which actually spoke about their specialized model
不是发布,而是你知道,发了一篇论文,里面讲到了他们的专用模型。
16:16
called Gemini math specialized 1.5 pro and we can see that it scores 91.1% and of course there
名为“双子座数学专业版1.5 Pro”的模型,我们可以看到它的得分达到了91.1%。当然,其中还涉及一些“RM”在256层面的应用——我其实没读过相关论文,所以不清楚具体含义,但这很可能是某种能让AI系统获得更优结果的方法。因此,我认为我们正处在一个关键的转折点上:真正具备能力的系统在数学和科学领域已近在咫尺。谷歌和OpenAI这类突破——在基准测试中取得超过90%的分数——将切实推动其余技术领域的进步,因为这类研究能够真正催生新知识,当然也包括通用人工智能(AGI)。这正是我想探讨的话题。
16:23
is some rm at 256 actually haven't read the papers so i don't know what that means but it's probably
有个叫“rm at 256”的东西,我其实没读过那篇论文,所以不知道具体什么意思,但大概是一种能让AI系统得到更好结果的方法。
16:28
some kind of method that allows the AI system to get better results so i think what's going on here
所以我觉得现在的情况是,我们确实处在一个转折点上,真正有能力的系统在数学和科学领域已经近在眼前了。
16:33
is that we do have this inflection point on our hands where truly capable systems are just around
我认为谷歌和OpenAI在这些基准测试上取得超过90%分数的突破,将会真正推动其余的技术进步。
16:39
the corner in terms of math and science and i think that these kind of breakthroughs from google
因为这种研究,你知道,是那种能真正带来新知识,当然还有AGI的研究。所以这正是我想聊的话题。
16:44
and from open AI managing to score over 90% on these benchmarks is going to be what actually drives
以及来自OpenAI在这些基准测试上取得超过90%的分数,这将是真正推动进展的关键。
16:50
the rest of technological progress because this is the kind of you know research that can actually
其余的技术进步,因为这是一种你知道的、真正能带来成果的研究
16:55
lead to new knowledge and of course AGI so this was something that i wanted to talk about
带来新的知识,当然还有AGI,所以这正是我想聊的话题。而且OpenAI在暗示他们的系统能力会更强,这真的非常吸引人。那么,如果你喜欢这个视频,请告诉我。在数学竞赛方面,以及你对各路专家关于我们如何实现AGI的不同看法有什么想法——现在有很多不同的观点在流传,但当然,神经符号AI(neuro symbolic AI)目前看起来非常有前景。那么,如果你喜欢这个视频,希望你能喜欢。
17:01
less about the you know the information just regarding the fact that you know it was able to get
这不仅仅是关于你知道它获得了银牌这一信息,更多的是关于这样一个事实:如果我们看看时间线已经如何缩短,以及OpenAI正在暗示他们的系统将变得更加强大,这确实是一件非常引人入胜的事情。那么,如果你喜欢这个视频,请告诉我你对AI创造新知识的看法,你对国际数学奥林匹克竞赛的看法,以及你对各位专家关于我们如何实现通用人工智能(AGI)的不同观点有何想法。目前有很多不同的观点在流传,但当然,神经符号AI到目前为止看起来非常有前景。那么,如果你喜欢这个视频,希望……
17:05
silver but more around the fact that you know if we look at how timeline to have now shrunk
但更关键的是,你看现在时间线已经大幅缩短了,而且OpenAI也在暗示他们的系统能力会更强,这确实非常引人深思。那么话说回来,如果你喜欢这个视频,欢迎告诉我你对AI创造新知识的看法,你对国际数学奥林匹克竞赛怎么看,还有那些各路专家关于我们如何实现AGI的不同观点——现在确实有很多说法在流传。不过当然,neuro symbolic AI目前看起来还是很有前景的。那么就这样,希望你喜欢这个视频。
17:10
and the fact that open AI are hinting towards their systems being even more capable this is
而OpenAI正在暗示他们的系统能力更强,这将会通向AGI
17:15
something that is a truly fascinating so that being said if you did enjoy this video let me know
这确实是个非常有意思的话题。如果你喜欢这个视频,记得告诉我。
17:19
what your thoughts are on AI creating new knowledge and what you think about the international
你对AI创造新知识有什么看法?关于国际数学奥林匹克竞赛你怎么看?还有那些各路专家对如何实现AGI的不同观点——现在确实有很多说法在流传,当然神经符号AI目前看起来很有前景。话说回来,如果你喜欢这个视频,希望你能……
17:23
math at limpiad and what you think about you know the varied experts on opinions on how we're
数学竞赛,还有你对各路专家关于我们如何实现AGI的不同看法有什么想法——现在有很多不同的观点在流传,但当然,神经符号AI目前看起来确实很有前景。那么,如果你喜欢这个视频,希望你能——
17:28
going to get to AGI there are many different things floating around but of course neuro symbolic AI
目前有很多不同的概念在流传,但神经符号AI(neuro symbolic AI)
17:32
so far does look to be very promising with that being said if you enjoyed the video hopefully
到目前为止看起来确实很有前景。话虽如此,如果你喜欢这个视频,希望
17:36
guys have a wonderful day and i'll see you in the next AI update
祝大家度过美好的一天,我们下次AI更新时再见。

Play Queue

☀️