Lex Fridman Podcast · #490

State of AI in 2026: LLMs, Coding, Scaling Laws, China, Agents, GPUs, AGI

2026年AI全景:大模型、编程、Scaling Law、中国AI、Agent、GPU与AGI
January 2026 ·

Andrej Karpathy joins Lex Fridman for a comprehensive state-of-AI discussion in early 2026, covering LLM capabilities, the AI coding revolution, US-China AI dynamics, agentic engineering, and AGI timeline recalibration.

Andrej Karpathy 与 Lex Fridman 展开 2026 年初的 AI 全景对话,深度剖析 LLM 能力边界、AI 编程革命、中美 AI 竞争格局、Agent 工程化以及 AGI 时间线的重新校准。

00:00
00:00
The following is a conversation all about the state of the art and artificial intelligence,
以下是一段关于前沿技术与人工智能的对话,涵盖了过去一年AI领域激动人心的技术突破与发展,以及我们对未来一年可能发生的有趣事件的展望。
00:04
including some of the exciting technical breakthroughs and developments in AI that happened
有时内容会非常技术性,但我们努力确保圈外人士也能听懂,同时绝不降低深度。
00:09
over the past year, and some of the interesting things we think might happen this upcoming
能与AI社群中我最喜欢的两位——Sebastian Rashka和Nathan Lambert——共同制作这期节目,是我的莫大荣幸与喜悦。
00:15
year.
一年下来。
00:16
At times, it does get super technical, but we do try to make sure that it remains accessible
有时候内容确实非常技术性,但我们尽量确保圈外的人也能听懂,同时绝不降低理解门槛。
00:22
to folks outside the field, without ever dumbing it down.
能和我最欣赏的两位AI圈朋友——Sebastian Raschka和Nathan Lambert——一起做这期节目,真是莫大的荣幸和快乐。
00:27
It is a great honor and pleasure to be able to do this kind of episode with two of my
想真正理解某样东西,最好的方法就是亲手从零搭建它。
00:32
favorite people in the AI community, Sebastian, Rashka, and Nathan Lambert.
Nathan是Allen Institute for AI的post-training负责人,也是关于reinforcement learning from human feedback的权威著作作者。
00:39
They are both widely respected machine learning researchers and engineers who also happen
他们都是备受尊敬的机器学习研究员和工程师,同时也恰好是出色的沟通者、教育者、写作者和Twitter用户、前发帖人。
00:45
to be great communicators, educators, writers, and Twitterers, ex-posters.
Sebastian是两本书的作者,我强烈推荐给初学者和专家。
00:50
Sebastian is the author of two books, I highly recommend for beginners and experts alike.
第一本是《从头构建大语言模型》,第二本是《从头构建推理模型》。
00:57
First is build a large language model from scratch and build a reasoning model from scratch.
我真心相信,在机器学习与计算机科学领域,学习和理解某样东西的最佳方式就是自己从头构建它。
01:05
I truly believe in the machine learning computer science world, the best way to learn and
Nathan是艾伦人工智能研究所的后训练负责人,也是关于基于人类反馈的强化学习的权威书籍作者。
01:10
understand something is to build it yourself from scratch.
理解一件事,就是亲手从零开始构建它。
01:16
Nathan is the post-training lead at the Allen Institute for AI and author of the definitive
Nathan 是艾伦人工智能研究所的 post-training 负责人,也是关于 reinforcement learning from human feedback 的权威著作作者。
01:22
book on reinforcement learning from human feedback.
作为 open models。
01:26
Both of them have great ex-accounts, great sub-stacks, Sebastian has courses on YouTube, Nathan
他俩都有很棒的过往账号和优质Substack内容,Sebastian在YouTube上有课程,Nathan有播客,大家一定要去关注所有这些内容。这里是Lex Friedman播客,欢迎支持,请查看简介中的赞助商,那里也有联系我、提问、获取反馈等链接。现在,亲爱的朋友们,有请Sebastian Rashka和Nathan Lambert。所以我认为一个有用的视角来看待这一切,就是Deep Seek,所谓的Deep Seek时刻。这大约发生在一年前,2025年1月。
01:33
has a podcast, and everyone should absolutely follow all of those.
他有个播客,大家一定要去关注所有这些内容。
01:39
This is the Lex Friedman podcast to support it, please check out our sponsors in the description
这是Lex Friedman的播客,为了支持它,请查看简介里的赞助商,
01:43
where you can also find links to contact me, ask questions, get feedback, and so on.
那里也有链接可以联系我、提问、获取反馈等等。
01:50
And now dear friends, here's Sebastian, Rashka, and Nathan Lambert.
好了,亲爱的朋友们,有请Sebastian、Rashka和Nathan Lambert。
01:57
So I think one useful lens to look at all of this through is the deep seek, so-called
所以我觉得,一个有用的视角来看待这一切,就是deep seek,所谓的
02:02
deep seek moment.
deep seek时刻。
02:04
This happened about a year ago in January 2025.
这大约发生在一年前,2025年1月。
02:08
In the open-weight Chinese company, deep seek, release deep seek R1, that I think it's
在开源权重的中国公司Deep Seek发布Deep Seek R1之后,我觉得可以说它用据说少得多的算力和更低的成本,达到了接近或顶尖的性能,让所有人都大吃一惊。从那时到现在,AI领域的竞争已经变得疯狂。无论是研究层面还是产品层面,都在不断加速。今天我们就来聊聊这些,如果可以的话,先从几个尖锐的问题开始吧。在国际层面上,谁在赢?
02:13
fair to say surprised everyone with near or at state-of-the-art performance with allegedly
可以说,它用据称接近或达到最先进的性能,震惊了所有人。
02:20
much less compute for much cheaper, and from then to today, the AI competition has got
算力需求大幅降低,成本也便宜得多,而从那时到现在,AI领域的竞争已经变得疯狂。
02:27
insane.
无论是研究层面还是产品层面,都在持续加速。
02:28
Both on the research level and the product level has just been accelerating.
今天我们就来聊聊这些,或许可以先从一些尖锐的问题开始。
02:32
Let's discuss all of this today, and maybe let's start with some spicy questions if
在国际层面上,谁在领先?
02:37
we can.
以开源模型的形式。
02:39
Who is winning at the international level?
领先,我认为有多个时间维度。
02:42
Would you say it's a set of companies in China or the set of companies in the United States?
你觉得是中国的那些公司,还是美国的那些公司?
02:47
And Sebastian, Nathan, it's good to see you guys.
Sebastian、Nathan,很高兴见到你们。
02:51
So Sebastian, who do you think is winning?
那么Sebastian,你觉得谁在赢?
02:53
So winning is a very broad term.
“赢”这个词范围很广。
02:56
I would say you mentioned the deep seek moment, and I do think deep seek is definitely
你提到了DeepSeek时刻,我确实认为DeepSeek绝对赢得了那些从事开源权重模型的人的心,因为他们把这些模型作为开源模型分享出来。
03:00
winning the hearts of the people who work on open-weight models because they share these
至于“赢”,我认为它涉及多个时间尺度。
03:05
as open models.
我认为,胜利有多个时间尺度。
03:07
Winning, I think, has multiple timescales to it.
Gemini 3 是个很棒的模型,我还在用。
03:10
We have today, we have next year, we have in 10 years.
今天、明年、十年后,我们都有。
03:13
One thing I know for sure is that I don't think nowadays, 2026, that there will be any
有一点我确信无疑:我不认为在当下,也就是2026年,会有哪家公司能独家掌握某种技术。
03:20
company who is, let's say, having access to a technology that no other company has access
这主要是因为研究人员频繁跳槽、换实验室,他们不断流动。
03:25
to.
所以我不认为在技术获取上会有明显的赢家。
03:26
And that is mainly because researchers are frequently changing jobs, changing labs, they rotate it.
不过,我认为真正的区别因素将是预算和硬件限制。
03:32
So I don't think there will be a clear winner in terms of technology access.
所以我觉得在技术获取方面,不会有一个明确的赢家。
03:37
However, I do think there will be, the differentiating factor will be budget and hardware
不过,我认为真正的区别因素会是预算和硬件限制。
03:43
constraints.
而且我想明确一下我们录制这段内容的时间点。
03:44
So I don't think the ideas will be proprietary, but the way or the resources that are needed
所以我不认为这些想法会是专有的,但实现它们所需的方式或资源则不然。
03:51
to implement them.
而且目前我看不到那种赢家通吃的局面,至少现在我看不出来。
03:52
And so I don't see currently take it all scenario where winner takes it all, I can't see that
Nathan,你怎么看?
03:57
at the moment.
我觉得各个实验室在各自的目标上投入了不同的精力。
03:58
Nathan, what do you think?
而且我想明确一下我们录制这段对话的时间点。
04:00
I see the labs put different energy into what they're trying to do.
关于Anthropic的Claude Opus 4.5模型的炒作简直疯狂到了极点,这实在是——
04:04
And I think to demarcate the point in time when we're recording this.
最近对Anthropic的Claude Opus 4.5模型的炒作简直疯狂到不行,
04:08
The hype over Anthropics Cloud Opus 4.5 model has been absolutely insane, which is just,
但Gemini 3在这之前发布,感觉大家其实不怎么讨论它,
04:14
I mean, I've used it and built stuff in the last few weeks.
我最近几周一直在用,也拿它搭了些东西。
04:17
And it's almost gone to the point where it feels like a bit of a meme in terms of the hype.
现在这热度都快成梗了,感觉有点夸张。
04:21
And it's kind of funny because this is very organic.
挺有意思的是,这次完全是自然发酵出来的。
04:25
And then if we go back a few months ago, we can get the release date.
往回倒几个月,咱们能查到具体的发布日期。
04:28
And the notes is Gemini 3 from Google got released.
当时谷歌的Gemini 3刚发布,营销和那种“哇塞”的效果拉满了。
04:31
And it seemed like the marketing and just like wow factor of that release was super high.
但到了11月底,Cloud Opus 4.5一出来,热度就开始往上蹿。
04:37
But then at the end of November, Cloud Opus 4.5 was released and the hype has been growing.
Gemini 3是更早的事,现在感觉大家基本不怎么提它了。
04:42
But Gemini 3 was before this and it kind of feels like people don't really talk about
来重新利用Google在AI上的结构性优势。
04:46
it as much even though when it came out, everybody was like, this is Gemini's moment
尽管它刚发布时,大家都说这是Gemini的时刻,要重新夺回Google在AI领域的结构性优势。Gemini 3确实是个很棒的模型,我现在还在用。只是差异化程度变低了。我同意Sebastian你说的,所有这些想法空间都非常流动,但从文化上看,Anthropic以在代码上押注而闻名,他们的Cloud Code策略目前确实奏效。所以我认为,即使想法流动得很自由,这其中很大一部分还是被瓶颈卡住了。
04:50
to retake kind of Google's structural advantages in AI.
而且Gemini 3是个很棒的模型,我现在还在用。
04:54
And Gemini 3 is a fantastic model and I still use it.
有点像当年 ChatGPT 在美国掀起的那股浪潮,什么东西都带个 chatbot。
04:56
It's just kind of differentiation is lower.
只是说差异化程度比较低。
04:59
And I agree with Sebastian, what you're saying with all of these, like the idea space is
我同意Sebastian说的,所有这些想法空间都非常流动,但文化上Anthropic以在代码上押重注而闻名,他们那个Cloud Code现在效果不错。
05:04
very fluid, but culturally anthropic is known for betting very hard on code, which is
所以我觉得,即使想法流动得很自由,这其中很多环节还是被卡住了。
05:09
Cloud Code thing is working out for them right now.
有点像ChatGPT在美国掀起了一股浪潮,什么东西都带个聊天机器人。
05:12
So I think that even if the ideas flow pretty freely, so much of this is bottlenecked
现在中国也有很多科技公司在发布非常强大的前沿开源模型。
05:17
by human effort and kind of culture of organizations where anthropic seems to at least be presenting
靠人力投入和组织文化,Anthropic 至少看起来是其中最不混乱的,这算是个优势。
05:22
as the least chaotic, it's is a bit of an advantage.
如果他们能再保持一段时间的话。
05:25
And if they can keep doing that for a while.
但另一方面,中国那边有很多来势汹汹的技术,实验室数量远不止 DeepSeek 一家,DeepSeek 在中国掀起了一股浪潮。
05:27
But on the other side of things, there's a lot of ominous technology from China where
我觉得有点像 ChatGPT 在美国引发的那波热潮——所有东西都带个聊天机器人。
05:31
there's way more labs than deep sea, deep sea kicked off a movement within China.
现在中国有大量科技公司都在发布非常前沿的开源模型。
05:37
I say kind of similar to how chat you be kicked off a movement in the US where everything
我觉得有点像当年ChatGPT在美国掀起的那股浪潮,那时候什么都要加个聊天机器人。
05:42
had a chatbot.
Mini Max的模型、Kimi Moon shot,尤其是最近几个月,表现越来越亮眼。
05:43
There's now tons of tech companies in China that are releasing very strong frontier open
现在中国有大量科技公司都在发布非常强大的前沿开源模型。Mini Max 的模型、Kimi 月之暗面,尤其是最近几个月表现特别亮眼。新的 Deep Sea 模型依然很强,但这可能回头看会成为一个重要的叙事节点——2025 年 Deep Sea 出现后,它相当于为更多中国公司提供了一个平台,让它们能发布这些出色的模型,并形成一种全新的运营模式。这些中国公司的模型都是开放权重的,按照这个趋势来看,现在美国有很多人在为 AI 软件付费,而中国和其他地区历史上也是如此。
05:48
weight models to the point where I would say that deep sea is kind of losing its crown
权重模型到了这个地步,我会说DeepSeek有点在失去它的王冠——作为中国最顶尖的开源模型制造者,而像z.ai的GLM模型、Mini Max的模型、Kimi Moon shot,尤其是过去几个月里,表现得更加亮眼。新的DeepSeek模型依然很强,但这可能成为一个重要的叙事节点:2025年DeepSeek出现后,它实际上为更多中国公司提供了一个平台,让它们发布这些出色的模型,并开启一种全新的运作模式。这些中国公司的模型都是开放权重的,而且按照这个趋势发展下去……
05:52
as the preeminent open model maker in China and the likes of z.ai's with their GLM models,
作为中国最顶尖的开源模型厂商,像z.ai的GLM系列、Mini Max的模型、Kimi Moon shot,尤其是最近几个月表现越来越亮眼。新的Deep Sea模型依然很强,但这可能成为一个重要的叙事节点——2025年Deep Sea出现后,为更多发布优秀模型的中国公司提供了全新的运营模式。这些中国公司的模型都是开放权重的,按照这个趋势,目前美国有很多人在为AI软件付费,而中国和其他地区历史上也是如此。
05:58
Mini Max's models, Kimi Moon shot, especially in the last few months have shown more brightly.
新的Deep Sea模型依然很强,但这可能是一个值得回顾的重要叙事节点——2025年Deep Sea出现之后,它为更多中国公司发布这些出色的模型提供了一个平台,让它们得以开启这种新型的运营模式。
06:04
The new deep sea models are still very strong, but that's kind of a, it could look back as
这些中国公司的模型都是开放权重的,具体还要看后续的发展轨迹。
06:09
a big narrative point where the 2025 deep sea came and then all that kind of provided
一个重要的叙事转折点是,2025年DeepSeek的出现,以及随之而来的种种,为更多中国公司发布这些出色的模型提供了平台,让它们得以开展这种新型的运营模式。这些中国公司的模型是开放权重的,并且取决于这条发展轨迹——在Gemini和ChatGPT之间做选择,我直觉上觉得这有点像一场冒险的赌注,因为OpenAI一直是行业领头羊,这在技术领域有很多优势,我觉得。而且我认为这就像我们使用任何东西一样,比如我们最喜欢的文本编辑器、操作系统或浏览器。
06:14
this platform for way more Chinese companies that are releasing these fantastic models
这个平台能让更多发布这些优秀模型的中国公司
06:18
to kind of have this new type of operation.
去尝试这种新型的运营模式。
06:20
So these models from these Chinese companies are open weights and depending on this trajectory
这些中国公司的模型都是开放权重的,而且取决于这个发展轨迹
06:25
of business models that these American companies are doing could be at risk, but currently
这些美国公司正在做的商业模式可能会面临风险,但目前在美国,很多人都在为AI软件付费,而历史上在中国和世界其他地区,人们并不太愿意为软件花大钱。所以像DeepSeek这样的模型之所以受到大家喜爱,是因为它们是开放权重的。你觉得中国公司会继续发布开放权重模型多久?我觉得大概还能持续几年。
06:30
a lot of people are paying for AI software in the US and historically in China and other
在美国,很多人都在为AI软件付费,历史上中国和其他地方也是这样,而且做研究非常烧钱。
06:35
parts of the world.
世界上有些地方,人们并不愿意为软件花太多钱。所以像DeepSeek这样的模型之所以受到大家喜爱,就是因为它们是开源权重的。你觉得中国公司还会继续发布开源权重模型多久?我觉得大概几年吧。这已经是科技行业长期以来的习惯了。而这些公司的人,也把开源权重模型看作是一种施加影响力的方式。
06:36
People don't pay a lot for software.
人们不太愿意为软件花大钱。
06:38
So some of these models like deep sea have the love of the people because they are open
所以像DeepSeek这样的模型,因为开放权重而深受大家喜爱。
06:42
weight.
你觉得中国公司会继续发布开放权重模型多久?
06:43
How long do you think the Chinese companies keep releasing open weights models?
我估计还能持续几年。
06:47
I would say for a few years.
这在科技领域是个长期以来的习惯。
06:49
I think that like in the US, there's not a clear business model for it.
我觉得吧,在美国,这东西其实没什么清晰的商业模式。
06:53
I have been writing about open models for a while and these Chinese companies have realized
我写关于开源模型的东西有一阵子了,这些中国公司也意识到了这一点。
06:57
it.
所以有些公司会主动联系我。
06:58
So I get inbound from some of them.
他们很聪明,也看到了同样的限制——很多美国科技公司和其他IT公司出于安全考虑,不会付费订阅中国公司的API。
06:59
And they're smart and realize the same constraints, which is that a lot of US tech companies and
这在科技圈里是个老习惯了。
07:03
other IT companies won't pay for a API subscription to Chinese companies for security concerns.
而这些公司的人就把开放权重模型看作一种施加影响力的方式。
07:08
This has been a longstanding habit in tech.
这些公司的人把开放权重模型看作一种影响力手段,
07:12
And the people of these companies then see open weight models as an ability to influence
而且做研究本身成本非常高。
07:17
and take part of a huge growing AI expenditure market in the US and they're very realistic
并且他们正参与到美国一个快速增长的AI支出市场中,对此他们非常务实。
07:21
about this.
而且这对他们来说确实奏效了。
07:23
And it's working for them.
我认为政府会看到,这在技术普及方面正在国际上建立很大的影响力。
07:24
And I think that the government will see that that is building a lot of influence internationally
所以会有很多激励措施来维持这一势头,但构建这些模型和进行研究非常昂贵。
07:29
in terms of uptake of the technology.
因此,我预计某个时候会出现整合,但我不认为这会是2026年的故事。
07:31
So there's going to be a lot of incentives to keep it going, but building these models
所以会有很多动力让它继续下去,但训练这些模型和做研究成本非常高。所以到某个节点我预计会出现整合,但我不觉得这会是2026年的故事。我确实认为在某种程度上是这样,但我们也得考虑到,他们仍然——我会说稍微领先一点——而其他模型,并不是DeepSeek变差了。只是其他模型在借鉴DeepSeek的思路,比如你提到的那个模型。
07:35
and doing the research is very expensive.
Seek 众所周知是由对冲基金 High-Flyer Capital 打造的。
07:37
So at some point I expect consolidation, but I don't expect that to be a story of 2026
所以我预计某个时候会出现整合,但我不觉得这会是2026年的故事。
07:42
where there will be more open model builders throughout 2026 and there were in 2025 and
2026年会有更多开源模型厂商涌现,比2025年还多,而且很多值得关注的都会在中国。
07:48
a lot of the notable ones will be in China.
你想说点什么?
07:50
You're going to say something?
对。
07:51
Yes.
你提到DeepSeek丢了王座。
07:52
You mentioned deep seek losing its crown.
我确实觉得在某种程度上是这样,但我们也得考虑到,他们目前还是——我会说稍微领先一点。其他模型不是DeepSeek变差了,而是它们都在借鉴DeepSeek的思路,比如你提到的那些。
07:54
I do think to some extent, yes, but we also have to consider though they are still, I
我确实认为在某种程度上是这样,但我们也得考虑到,他们仍然——我会说稍微领先一点——而其他模型,并不是DeepSeek变差了。
08:00
would say slightly ahead and the other ones, it's not that deep seek got worse.
只是其他模型在借鉴DeepSeek的想法,比如你提到的那个模型。
08:05
It's just like the other ones are using the ideas from deep seek, for example, you mentioned
对。
08:09
Kimmy, same architecture, they're training it.
Kimmy,同样的architecture,他们正在训练它。
08:11
And then again, we have this leapfrogging where they might be at some point in time a bit
然后又是这种你追我赶的情况,他们可能在某个时间点上稍微领先一点,因为他们有更新的模型。
08:15
better because they have the more recent model.
我觉得这又回到了那个事实:不会有明确的赢家。
08:18
And I think this comes back to the fact that there won't be a clear winner.
就会像这样,一个人真的说了些什么,
08:22
It will, it will just be like that one person really says something.
另一个人就插进来,而最新的模型很可能永远是最好的那个模型。
08:25
The other one comes in and the recent, the most recent model is probably always the best
对。
08:29
model.
众所周知,DeepSeek是由对冲基金High-Flyer Capital打造的。
08:30
Yeah.
而我们并不确切知道他们用这些模型做什么,或者他们是否在意。
08:31
We'll also see that Chinese companies have different incentives.
我们也会看到中国公司有不同的动机。
08:33
So deep seek is very secretive where some of these startups are like the mini-maxes
所以Deep Seek非常神秘,而像MiniMax和01.AI(EI)这样的初创公司,这两家已经提交了IPO文件,正在争取西方市场的关注,并做了大量对外推广。
08:38
and e.i.s of the world, those two literally have filed IPO paperwork and they're trying
我不确定这些动机是否会改变模型开发的方向,因为Deep Seek众所周知是由对冲基金High-Flyer Capital打造的。
08:45
to get Western mind share and do a lot of outreach there.
我们并不清楚他们具体用这些模型做什么,也不确定他们是否在意这些。
08:47
So I don't know if these incentives will kind of change the model development because deep
所以我不确定这些激励机制是否会改变模型开发的方向,因为Deep Seek众所周知是由对冲基金High-Flyer Capital打造的。我们并不确切知道他们用这些模型做什么,也不清楚他们是否在意这一点——那些正在使用模型的人。我觉得可以合理地说,ChatGPT和Gemini主要关注的是那些只想解决日常问题的广泛用户群体,而这个用户群体非常庞大。
08:50
seek famously is built by a hedge fund high-flyer capital.
我们并不确切知道,不知道他们用这些模型做什么,或者他们是否在意。
08:54
And we don't know exactly what, we don't know what they use the models for or if they care
这就像个工作上的事儿。
08:58
about this.
关于这个。
08:59
They're seeking in terms of communication, they're not seeking in terms of the technical
在沟通层面,他们确实在寻求(透明度),但在技术报告方面——也就是描述模型如何运作的那些内容——他们依然保持开放态度。
09:02
reports that describe how their models work, they're still open on that front.
另外,关于Opus 45的炒作,其实存在两层:一方面是X平台(原Twitter)上那个“X回音室”里被捧为宠儿的热度,另一方面是实际使用这个模型的人数。
09:06
And we should also say on the Opus 45 hype, there's the layer of something being the
我觉得可以公允地说,Chagypeti和Gemini瞄准的是那些只想解决日常问题的广泛用户群体。
09:14
darling of the X echo chamber on Twitter echo chamber and the actual amount of people
而这个用户群体,规模极其庞大。
09:21
that are using the model.
那些正在使用这个模型的。
09:22
I think it's probably fair to say that Chagypeti and Gemini are focused on the broad user
我觉得可以公平地说,Chagypeti 和 Gemini 主要面向的是那些只想解决日常问题的广泛用户群体。
09:27
base that just want to solve problems in their daily lives.
而这个用户群体非常庞大。
09:32
And that user base is gigantic.
而且我认为这也是一个有趣的点,你可能会有多个订阅。
09:35
So the hype about the coding may not be represented in the actual use.
所以关于编程的那些炒作,可能并没有体现在实际使用中。
09:38
I would say also a lot of the usage patterns are, like you said, name recognition brand
我觉得很多使用模式,就像你说的,是品牌认知度之类的,但也几乎是肌肉记忆,你知道,ChatGPT 已经存在很久了,人们只是习惯了用它,这有点像飞轮效应,他们还会推荐给其他用户。
09:45
and stuff but also muscle memory almost where, you know, like Chagypeti has been around
一个有趣的点是功能的个性化定制,比如,ChatGPT 有记忆功能,对吧?
09:50
for a long time people just got used to using it and it's kind of like almost like a flywheel
所以你可能订阅了它,用来处理个人事务,但我不确定。
09:54
and they recommend it to other users and that stuff.
然后他们会推荐给其他用户,诸如此类。
09:57
One interesting point is also the customization of elements, for example, Chagypeti has a
一个有趣的点是元素的个性化定制,比如Chagypeti有记忆功能,对吧?
10:02
memory feature, right?
所以你可能有一个订阅,用来处理个人事务,但我不确定是私事还是工作。
10:03
And so you may have a subscription and you use it for personal stuff, but I don't know
如果你在一家公司工作,他们可能不允许这样,或者你自己也不想这样。
10:08
if you want to use that same thing at work, you know, because it's a boundary between
如果你想在工作中用同一个东西,你知道,因为私人生活和工作的界限在那儿。如果你在一家公司上班,他们可能不允许那样做,或者你自己也不想那样。而且我觉得这也挺有意思的一点是,你可能会开多个订阅。一个就是纯粹的代码,里面没有你个人的图片或者业余项目,就只是工作相关的东西。另一个则是你个人的东西。
10:12
private and work.
我觉得这也是一个有趣的点,你可能会有多个订阅。
10:13
If you're working at a company, they might not allow that, or you may not want that.
其中一个就是纯粹的代码。
10:16
And I think that's also an interesting point where you might have multiple subscriptions.
一个就是纯粹的代码。
10:20
One is just clean code.
它就像工作上的东西一样。
10:22
It keeps, it's nothing of your personal images that you, or hobby projects in there.
它里面没有你的个人照片或业余项目,全是工作相关的内容。另一个则是你的个人账户。我觉得在消费级聊天机器人这个领域,问题在于你是否愿意押注Gemini而不是ChatGPT——凭直觉来说,这有点冒险,因为OpenAI一直是行业领头羊,在技术上有太多优势。不过从势头来看,2025年确实更偏向Gemini,但他们的起点实在太低了。
10:26
It's just like the work thing.
我觉得在消费级聊天机器人这个语境下,问题就变成了:你愿不愿意押注 Gemini 而不是 ChatGPT?
10:28
And then the other one is your personal thing.
然后另一个就是你个人的事情了。我觉得在消费级聊天机器人这个领域,问题在于你愿不愿意押注Gemini而不是Chagypeti——我直觉上觉得这有点冒险,因为OpenAI一直是行业老大,而且在这方面和技术上有很多优势。不过说到势头,如果看2025年的话,其实是偏向Gemini的,但他们起点实在太低了。你总听说OpenAI在运营上很混乱,总在追逐那些高影响力的事情,这其实是非常典型的创业公司文化。
10:30
So I think that's also something where two different use cases and it doesn't mean you
我觉得这也涉及到两种不同的使用场景,并不意味着你只能选一种。我认为未来会是多种模型并存的局面。
10:34
only have to have one, it's, I think the future is also multiple ones.
你觉得哪个模型赢得了2025年,又觉得哪个会在2026年胜出?
10:38
What model do you think won 2025 and what model do you think is going to win 26?
从消费级聊天机器人的角度来看,问题在于你是否愿意押注Gemini而不是ChatGPT。我直觉上觉得这有点冒险,因为OpenAI一直是行业领头羊,而且这种地位在技术领域有太多优势。不过,如果看2025年的势头,Gemini确实在上升,但它的起点实在太低了。
10:43
I think in the context of a consumer chatbots as a question of are you willing to bet
我直觉上觉得这有点冒险,因为 OpenAI 一直是行业老大,而且在这方面和技术上有很多优势。
10:47
on Gemini over Chagypeti, which I would say in my gut feels like a bit of a risky bet
押注在Gemini而不是Chagypeti上,我直觉上觉得有点冒险
10:54
because OpenAI has been the incumbent and there's so many benefits to that and tech, I think
因为OpenAI一直是行业老大,在技术上有太多优势了,我觉得
11:00
the momentum, if you look at 2025 was on Gemini's side, but they were starting from such a
2025年的势头是在Gemini那边的,但他们起点实在太低了。
11:05
low point.
你总听说OpenAI内部很混乱,运营上也是,总在追逐那些高影响力的事情,这很典型的创业公司文化。
11:06
I think on RIP Bard and these earlier attempts of getting started, I think huge credit for
我认为在 RIP Bard 以及这些早期的起步尝试中,他们能顶着组织内部的混乱把事情做成,这非常值得称赞。
11:13
them for powering through the organizational chaos to make that happen.
但另一方面,也很难不看好 OpenAI 的 chat,因为他们虽然总给人一种混乱的印象,但在落地产品上却非常擅长。
11:18
But also it's hard to bet against chat to OpenAI because they always come off cast as
就我个人而言,我对 GPT-5 的评价非常复杂,但 Highline 功能作为一个路由器,让大多数用户不再承担那么高的 GPU 成本,这肯定帮他们省了一大笔钱。
11:22
so chaotic, but they're very good at landing things.
所以我觉得,很难把我对模型的喜好和这些商业策略完全分开来看。
11:26
Personally, I had very mixed reviews of GPT-5, but I had to have saved them so much money
个人对GPT-5的评价其实挺复杂的,但Highline这个功能作为路由器,帮他们省了一大笔钱,因为大多数用户不再需要承担那么高的GPU成本了。
11:32
with the Highline feature being a router where most users are no longer charging their
所以我觉得很难把我对模型的喜好和这些因素直接挂钩。
11:37
GPU costs as much.
而Google在分离研究和产品方面做得更好一些,
11:39
So I think it's very hard to associate the things that I like out of models versus the
你经常听说OpenAI运营上很混乱,总在追逐高影响力的事情,这非常像创业公司的文化。
11:44
things that are going to actually be a general public differentiator.
真正能成为大众市场差异化优势的东西。
11:49
What do you think about 2026 who's going to win?
你觉得2026年谁会赢?
11:52
I'll say something even though it's risky, I will say that I think Gemini will continue
我冒个险说一句——我认为Gemini会在对话能力上持续追赶GPT。
11:56
to take progress on chat to GPT.
当两者都在极端规模下运行时,Google的体量优势就体现出来了。
11:58
I think Google's scale when both of these are operating at such extreme scales.
而且Google能更好地将研究与产品分离,不像OpenAI那样总被传内部混乱、运营上总在追逐高影响力项目——这其实是很典型的创业公司文化。
12:02
And like Google has the ability to separate that research and product a bit better where
Google Cloud会继续表现不错,但这其实是个更复杂的问题。
12:07
you hear so much about OpenAI being chaotic, operationally, and chasing the high impact
我觉得这跟我们用任何东西一样,比如我们最喜欢的文本编辑器、操作系统或者浏览器。
12:11
thing, which is a very startup culture.
所以我喜欢跟你聊天时那种自在的感觉,让AI在你电脑里安个家,从零开始,你完全不用操心,但你知道它会靠谱。
12:14
And then on the software and enterprise side, I think inthropic we'll have continued
在软件和企业层面,我认为Anthropic会继续取得成功,因为他们一次又一次地为此做好了准备。
12:17
to success as they've again and again been set up for that.
显然Google Cloud有很多产品,但我觉得Gemini这个品牌名称对他们来说很重要,需要好好打造。
12:22
And obviously Google's cloud has a lot of offerings, but I think this kind of like
Google Cloud会继续表现不错,但这在生态系统中解释起来比较复杂,因为它更多是在和Azure、AWS这类服务竞争,而不是在模型提供商层面。
12:25
Gemini name brand is important for them to build.
所以,使用GPU的基础设施之所以有优势,很大程度上是因为Nvidia芯片的利润率。
12:29
And Google's cloud will continue to do well, but that's kind of a more complex thing to
谷歌云的表现会持续不错,但这其实是个更复杂的事情。
12:34
explain in the ecosystem because that's competing with the likes of Azure and AWS rather than
在生态系统中解释一下,因为这更多是在和Azure、AWS这类平台竞争,而不是在模型提供商这边。
12:38
on the model provider side.
所以,一个使用GPU的基础设施之所以有优势,很大程度上是因为Nvidia芯片的利润率,而Google在这方面有历史性的优势。
12:40
So an infrastructure using GPUs, given advantage largely because the margin on Nvidia chips
如果会出现新的范式,最有可能来自OpenAI,因为他们的研究部门一次又一次地展示了落地新研究想法或产品的能力。
12:48
is insane and Google can develop everything from top to bottom to fit their stack and not
这太疯狂了,Google 能从底层到顶层全栈自研,完全适配自己的技术栈,还不用支付这笔利润差价。
12:53
have to pay this margin.
而且他们在建设数据中心方面早就抢跑了。
12:55
And they've had a head start and building data centers.
所以这些既需要长周期投入、又面临高成本低利润空间的事情,Google 在这方面有天然的历史优势。
12:57
So all of these things that have both high lead times and very hard margins on high costs,
如果真要出现新的范式,最有可能来自 OpenAI,因为他们的研究部门一次又一次地展现出落地新研究思路或产品的能力。
13:02
Google has just kind of a historical advantage there.
很多突破都来自OpenAI,这绝对是他们作为组织最突出的特质之一。
13:05
And if there's going to be a new paradigm, it's most likely to come from OpenAI where
如果真要出现新范式,最有可能还是来自OpenAI,
13:09
they're kind of their research division again and again has kind of shown this ability
他们的研究部门一次又一次地展现出这种能力,
13:14
to land a new research idea or a product.
能把新的研究想法或产品落地。
13:16
I think like deep research, so we're a one thinking models like all these definitional
我觉得像deep research这种,我们讨论的thinking models这类定义性的东西,都来自OpenAI,这绝对是他们作为组织最突出的特质之一。所以很难不看好他们,但我认为今年大部分时间会围绕scaling和优化模型里那些所谓的“低 hanging fruit”展开。显然,intelligence和speed之间存在权衡。这正是Chagypety 5在幕后试图解决的问题——大众到底想要intelligence,还是想要speed?其实我觉得有个选择开关挺好的,能提供不同的选项。
13:22
things have come from OpenAI and that's got to be one of their top traits as an organization.
很多突破都来自OpenAI,这绝对是他们作为组织最突出的特质之一。
13:28
So it's kind of hard to bet against that, but I think a lot of this year will be about
所以很难跟这个趋势对着干,但我觉得今年很多重点会放在
13:32
scale and optimizing what can be described as low hanging fruit in models.
规模化以及优化模型里那些所谓的“低垂果实”上。
13:37
And clearly, there's a tradeoff between intelligence and speed.
而且很明显,智能和速度之间是存在权衡的。
13:41
This is what Chagypety 5 was trying to solve behind the scenes.
这正是Chagypety 5在幕后试图解决的问题。
13:46
It's like do people actually want intelligence, the broad public, or do they want speed?
问题在于,普通大众到底想要的是智能,还是速度?
13:52
I think it's a nice variety, actually, or the option to have a toggle there.
我觉得其实有个多样化的选择挺好的,或者说能有个切换选项。
13:56
I mean, first for my personal usage, most of the time when I look something up,
说实话,就我个人使用来说,大部分时候查东西,我直接打开Chagypety问个简单问题,先拿到想要的信息。日常任务嘛,我基本都用快速模型。现在我觉得自动模式挺不错的,不用特意去选思考模式或者非思考模式那些。不过有时候我也会用专业模式,经常干的事就是写完东西后,丢进Chagypety说:嘿,帮我仔细检查一遍,所有引用对不对,所有思路有没有问题。
14:00
I use Chagypety to ask a quick question, get the information I wanted first.
我用Chagypety的时候,会先快速问个问题,拿到我想要的信息。
14:04
For you know, most daily tasks, I use the quick model.
至于大多数日常任务,我用的都是快速模型。
14:07
Nowadays, I think the auto mode is pretty good where you don't have to specifically say
现在我觉得自动模式就挺好,不用特意说“思考”或者“不思考”之类的。
14:11
thinking or, you know, non-thinking and stuff.
不过有时候我也想要专业模式,我经常的做法是,写好东西后丢进Chagypety,说“嘿,帮我仔细检查一下,所有引用对不对,所有思路对不对。”
14:13
Then again, I also sometimes want the pro mode, very often what I do is when I have something
然后我不小心把GPU拔了,当时我老婆已经在车里了,我就想“哎呀糟了。”
14:18
written, I put it into Chagypety and say, hey, do a very thorough check is all my references
接着我基本就是想要一个能最快跑完不同实验的bash脚本。
14:24
correct, all my thoughts correct.
对,我的想法全对。
14:27
Did I make any formatting mistakes and other figure numbers wrong or something like that?
我是不是格式上有什么错误,或者图表编号搞错了之类的?
14:31
And I don't need that right away.
那个我不急着要。
14:33
It's something, okay, I finish my stuff, maybe you have dinner, let it run, come back,
就是那种,行吧,我忙完手头的事,可能你去吃个饭,让它跑着,回来之后,
14:37
and it goes through this.
它就已经处理完了。
14:38
And I think, see, that's the way I think it's important to have this option.
而且我觉得,你看,这就是为什么我认为有这个选项很重要。
14:42
I would go crazy for each query.
要是每次查询都这样,我非得疯了不可。
14:44
I would have to wait 30 minutes or 10 minutes if that's me.
换我的话,得等上30分钟或者10分钟。
14:48
I'm like, sitting over here, losing my mind that you use the router and the non-thinking
我坐在这儿,急得要命,结果你用的是那个路由器和非思考模式。
14:52
model.
模型。
14:53
I'm like, how do you live with, how do you live with that?
我就想,你怎么能忍受,你怎么能忍受这个?
14:55
That's like my reaction, I've been heavily on Chagypety for a while.
这就是我的反应,我重度使用Chagypety已经有一段时间了。
15:01
Never touched five, non-thinking, I find it's tone and then it's propensity of errors.
从来没碰过five,non-thinking,我觉得它的语气和它出错的倾向——
15:07
It's just like a higher likelihood of errors.
就是出错的可能性更高。
15:08
Some of this is from back when opening, I released O3, which was the first model to do
其中一些要追溯到OpenAI发布O3的时候,那是第一个能做到
15:13
this deep search and find many sources and integrate them for you.
深度搜索、找到大量来源并为你整合的模型。
15:17
So it became hidbituated with that, so I will only use GPT 5.2 thinking or pro when I'm
所以我习惯了那个,现在只有在需要时才用GPT 5.2 thinking或pro。
15:22
finding any sort of information query for work, whether that's a paper or some code reference
工作中查找任何信息查询,无论是论文还是代码参考,
15:28
that I found.
我找到的那种。
15:29
And it's just like, I will regularly have like five pro queries going simultaneously,
而且就像这样,我经常同时开着五个 Pro 查询,
15:34
each looking for one specific paper or feedback on equation or something.
每个都在找一篇特定的论文,或者某个公式的反馈之类的。
15:37
I have a fun example of what I just needed to answer as fast as possible for this podcast
我有个有趣的例子,就是这次播客前我需要尽快回答的问题,
15:43
before I was going on the trip.
在我出发旅行之前。
15:45
I have a local GPU running at home and I wanted to run a long RL experiment.
我在家里有一块本地 GPU,想跑一个长时间的 RL 实验。
15:51
And usually I also unplug things, because you never know if you're not at home, you don't
而且我通常还会拔掉一些设备,因为你不在家的时候,谁也说不准。
15:54
want to have things plugged in.
想把设备都插好。结果我不小心把GPU的电源线拔了,当时我老婆已经在车里等着了,心里就想:哎呀,糟了。然后我基本上就想要一个能尽快跑完不同实验评估的bash脚本。我确实学过怎么用bash界面,嗯,bash终端。但那一刻,我只需要10秒钟就能拿到那个命令。这情况真够好笑的,不过话说回来,你当时用了什么?
15:56
And I accidentally unplugged the GPU, it was like my wife was already in the car and
然后我不小心把GPU的电源线拔了,当时我老婆已经在车里等着了,
16:00
it's like, oh dang.
我就想,哎呀糟了。
16:01
And then basically I wanted as fast as possible a bash script that runs my different experiments
然后我基本上想要一个尽可能快的 bash 脚本,用来跑我不同的实验。
16:07
in the evaluation.
在评估的时候。
16:09
Did something I know I learned how to use the bash interface, well, bash terminal.
我确实学会了怎么用bash界面,嗯,bash终端。
16:15
But in that moment, I just needed like 10 seconds to give me the command.
但那一刻,我只需要大概10秒钟来给我那个命令。
16:18
This is a hilarious situation, but yeah, so what did you use?
这情况挺搞笑的,不过是啊,那你用了什么?
16:21
So I did the non-thinking fastest model.
所以我用了那个非推理的最快模型。
16:24
It gave me the bash command to change different scripts to each other.
它直接给了我一个 bash 命令,用来把不同的脚本互相切换。
16:29
And then the thing is like, you have the T thing where you want to route this to a lock
然后问题来了,你有个 T 的东西,想把它路由到一个 lock 文件。
16:34
file.
我当时脑子一热,赶时间,其实自己想想也能想明白。
16:35
Top of my head, I was just like in a hurry, I could have thought about it myself.
顺便说一句,我不知道是不是有个典型场景——老婆在车里等着,你得赶紧跑你的 plug GPU,还得生成一个 bash 脚本,这听起来像电影情节。
16:37
By the way, I don't know if there's a representative case wife waiting in the car, you have to
我经常用 Gemini。
16:41
run your plug GPU, you have to generate a bash script, it sounds like a movie.
跑你的插拔GPU,还得生成一个bash脚本,听起来像电影一样。
16:45
I used Gemini for a lot.
我用了很多Gemini。
16:47
So I used thinking for all the information stuff, and then Gemini for fast things or stuff
所以我用 thinking 来处理所有信息类的事情,然后用 Gemini 处理那些快速的需求,或者一些我能抽空去谷歌查的东西——它挺擅长解释的。而且我相信它有这种知识背景,也很简洁。Gemini 的 app 现在好用多了,很适合这类任务。至于写代码或者任何哲学讨论,我就用 cloud opus 4.5,而且一直开着 extended thinking。Extended thinking 和 inference time scaling 其实就是让模型稍微更聪明一点的方法。
16:51
that I could come time to Google, which is like it's good at explaining things.
这样我就能有空去Google,它挺擅长解释东西的。
16:55
And I trust that it has this kind of background of knowledge and it's simple.
而且我相信它有这种知识背景,又简单明了。
16:59
And the Gemini app has got a lot better and it's good for that sort of things.
而且 Gemini 应用现在好用多了,做这类事情挺合适的。
17:03
And then for code and any sort of philosophical discussion, I use cloud opus 4.5, also always
至于写代码和任何哲学讨论,我用的是 Cloud Opus 4.5,也一直开着 extended thinking。
17:08
with extended thinking.
Extended thinking 和 inference time scaling 其实就是让模型稍微变聪明一点的方法。
17:10
Extended thinking and inference time scaling is just a way to make the models marginally
那纯粹是肌肉记忆,聊着聊着就忘了这回事了。
17:14
smarter.
对我来说,也是出于同样的原因,但这可能只是惯性。
17:15
And I will always edge on that side when the progress is very high because you don't know
当进展非常快的时候,我总会倾向于那一边,因为你不知道
17:19
in that I'll unlock a new use case.
那样会不会解锁一个新的应用场景。
17:21
And then sometimes use Grok for real time information or finding something on AI Twitter
然后有时候我会用 Grok 查实时信息,或者在 AI Twitter 上找某个我明明看过、需要翻出来的东西,我就是会死盯着它。
17:26
that I knew I saw and I need to dig up and I just fixated on.
不过 Grok 4 出来的时候,Grok 4 的投入非常重,他们的那个 Pro 版本
17:30
Although when Grok 4 came out, the Grok 4 went super heavy, which was their pro variant
其实做得非常好。
17:37
was actually very good.
我当时还挺 impressed 的。
17:38
And I was pretty impressed with it.
但那更像是肌肉记忆,后来因为聊天窗口太多就忘了这回事。
17:39
And that was just kind of like muscle memory, lost track of it with having the chat to
至少我觉得 Gemini 对我来说是最好用的。
17:43
BT app open.
BT app 打开。
17:44
So I use many different things.
所以我用很多不同的东西。
17:45
Yeah.
嗯。
17:46
I actually do use Grok 4 heavy for debugging for like hardcore debugging and the other ones
我其实重度使用 Grok 4 来调试,比如那种硬核调试,其他模型搞不定。
17:53
can solve it.
我发现它确实很牛。
17:54
I find that it's the bus.
而且我觉得挺有意思,你说 BT 的聊天界面最好用。
17:56
And I, it's interesting because you say the chat to BT is the best interface.
对我来说也是同样的原因,但这可能只是惯性。
18:01
For me, for that same reason, but this could be just momentum.
对我来说,出于同样的原因,但这可能只是惯性。
18:05
Gemini is the better interface for me.
对我来说,Gemini 的界面更好用。
18:08
I think because I found love with their best needle in the haystack, if I ever put something
我觉得是因为我特别喜欢它的“大海捞针”功能——如果我放进去一堆联系人信息,但想找某个特定的内容,它都能追踪到。
18:14
that has a lot of contacts, but I'm looking for very specific kinds of information, make
至少对我来说,Gemini 一直是最好的。
18:17
sure it tracks all of it.
有意思的是,有些模型只要在某一天、针对某个特定查询或提示词,让你心动了,你就会觉得这个模型更好。
18:19
I find at least that Gemini for me has been the best.
我至少发现 Gemini 对我来说是最好的。
18:23
So it's funny with some of these models, if they win your heart over for one particular
有些模型挺有意思的,如果某天某个查询、某个提示词里,它用某个功能打动了你,你就会觉得这个模型更好。然后你就换了语言模型。我觉得这跟我们用其他东西一样,比如最喜欢的文本编辑器、操作系统或者浏览器。只有当网站渲染不出来,或者出问题的时候,你才会换。所以这点说得挺对的。
18:29
feature, at one on a one particular day, for that particular query, that prompt, you're
某个功能,在某个特定的一天,针对那个特定的查询、那个 prompt,你会觉得,这个模型更好。
18:35
like, this model is better.
你换了个 LM。
18:36
And so you'll just stick with it for a bit until it does something really dumb.
你就这么一直用着,直到它突然干出特别蠢的事。
18:41
There's like a threshold effect, some smart thing, and then you fall in love with it.
这就像有个阈值效应——它先做点聪明事,让你爱上它。
18:45
And then it does some dumb thing and you're like, you know what?
然后它又犯蠢,你就想:得,我还是换吧,试试Cloud、ChatGPT那些玩意儿。
18:47
I'm going to switch and try a cloud and a chat to BT and all that kind of stuff.
这完全就是——用到它出问题、用到你忍不了,然后你就换LM。
18:51
This is exactly like, you use it until it breaks, until you have a problem, and then then
我觉得这跟咱们用任何东西一样,比如最爱的文本编辑器、操作系统,或者浏览器。
18:56
you change the LM.
而且我觉得这跟我们使用任何东西一样,比如我们最喜欢的文本编辑器、操作系统或者浏览器。
18:58
And I think it's the same how we use anything, like our favorite text editor operating systems
而且我觉得这就像我们使用任何东西一样,比如我们最喜欢的文本编辑器、操作系统
19:03
or the browser.
或者浏览器。
19:04
I mean, there are so many browser options, Safari, Firefox, Chrome, all the characterically
我的意思是,浏览器选择太多了,Safari、Firefox、Chrome,它们本质上都差不多,但总有些特殊情况,比如你想用的扩展插件,然后你就得换浏览器。
19:09
similar, but then there are edge cases, maybe extensions you want to use, and then you
不过我觉得没人会为了对比,把同一个网址在不同浏览器里都输一遍。
19:13
switch.
只有网站显示不正常或者出问题的时候,你才会这么干,我觉得。
19:14
But I don't think there is any one who types the same thing, like the website into different
这点说得对。
19:19
browsers and compares them.
我觉得就是用到它出问题为止,然后再去探索其他选择。
19:20
You only do that when the website doesn't render if something breaks, I think.
只有当网站渲染失败时你才会那么做,我觉得。
19:24
So that's a good point.
这倒是个好观点。
19:25
I think you use it until it breaks, and then you explore other options, I think.
我觉得你就一直用,直到它出问题,然后再去探索别的选择,我是这么想的。
19:28
On the long context thing, I was also a Gemini user for this, but the GPT 5.2 release
关于长上下文这块,我之前也是Gemini的用户,但GPT 5.2的发布博客里展示了超长的上下文得分,很多人都在说,他们是不是突然搞定了什么算法上的变化,从30%左右直接跳到了70%左右,就靠这么一个小版本更新。所以现在要跟踪所有这些事情真的很难。不过我现在对GPT 5.2的长上下文更看好了一些,问题就是,我到底该怎么实际测试它呢?这事儿我永远没个头。
19:32
blog had like crazy long context scores, where a lot of people were like, did they just
那篇博客里提到了超长的 context 分数,很多人都在说,他们是不是突然搞出了什么算法上的变化,从大概 30% 一下子跳到了 70% 左右,就靠这么一个小模型更新。
19:36
figure out some algorithms like change, it went from like 30% to like 70% or something,
所以现在要跟上所有这些事情真的很难。
19:41
in this minor model update.
但我现在对 GPT 5.2 的长 context 更看好一些,问题就是,我到底该怎么实际去测试它呢?
19:43
So it's also very hard to keep track of all of these things.
我反正永远停不下来这事儿。
19:46
But now I'm looking more favorable at GPT 5.2's long context, so it's just kind of like,
但现在我对GPT 5.2的长上下文越来越看好,所以感觉就是,
19:52
how do I actually get to testing this?
我到底该怎么实际测试这个?
19:55
I'm just never ending that.
我永远停不下来。
19:56
It's interesting that none of us talked about the Chinese models from a user usage perspective.
有意思的是,我们谁都没从用户使用角度聊过中国模型。
20:03
What does that say?
这说明什么?
20:04
Does that mean the Chinese models are not as good, or does that mean we're just very biased
是说中国模型没那么好,还是我们太有偏见、只关注自己?
20:09
and us focused?
我确实觉得,目前模型和平台之间存在差距。
20:11
I do think that that's currently the discrepancy between just the model and the platform.
所以我认为开源模型更出名的是它们的开放权重,平台方面还差得远。
20:16
So I think the open models, they are more known for the open weights, not the platform yet.
也有很多公司愿意以极低成本卖给你开源模型的inference服务。
20:21
There are also a lot of companies that are willing to sell you the open model inference
还有很多公司愿意以极低成本向你出售开源模型的inference。
20:25
at a very low cost.
我觉得也有分析指出,中国模型的服务方式会导致速度较慢,并出现不同的错误。
20:26
I think like open router, it's easy to do the look at multi model things.
我觉得像 Open Router 这种平台,很容易就能做多模型对比测试。
20:29
You could run deep seek on perplexity.
你可以在 Perplexity 上跑 Deep Seek。
20:31
I think all of us sitting here are like, we use open AI GPT 5 Pro consistently, we're all
我觉得在座各位都一样,我们一直在用 OpenAI GPT 5 Pro,而且都愿意为那点边际智能提升付费。
20:37
willing to pay for the marginal intelligence gain.
还有人说,这些美国模型在输出质量上确实更好。
20:40
And anyone that's like, these models from the US are better in terms of the outputs.
但问题在于,它们今年以及未来几年还能保持这个优势吗?
20:46
I think the question is, will they stay better for this year and for years going?
不过只要它们确实更好,我就愿意花钱让你用。
20:51
But it's like, so long as they're better, I'm going to pay for you to use them.
另外也有分析指出,中国模型的部署方式,
20:54
I think there's also analysis that shows that the way that the Chinese models are served,
而像速度和智能这些方面,如果对你作为用户有利的话,
21:01
you could argue due to expert controls or not, is that they use fewer GPUs for replica,
你可以说是因为专家控制或者不是,但他们的确用更少的GPU来做副本,这就导致速度更慢,而且会产生不同的错误。这就像速度和智能的关系,如果这些方面对你作为用户有利,我觉得在美国,很多用户会选择这个。而我认为这也会促使中国公司想在其他方面竞争,不管是免费还是大幅降价,或者会在产品形态上催生创意,这对整个生态是好事。但简单来说,目前美国模型更好,我们也在用它们。
21:05
which makes them slower and have different errors.
我认为在美国,很多用户会选择这个。
21:07
And it's like speed and intelligence, if these things are in your favor as a user,
我觉得这也会促使这些中国公司想要在其他方面竞争,
21:11
I think in the US, a lot of users will go for this.
无论是免费、大幅降低成本,还是激发创意。
21:14
And I think that that is one thing that will spur these Chinese companies to want to compete
而且我认为这恰恰会刺激那些中国公司想要在其他方面竞争,
21:19
in other ways, whether it's free or substantially lower costs or it'll breed creativity
无论是免费还是大幅降低成本,或者这会催生创造力——
21:25
in terms of offering, which is good for the ecosystem.
从提供服务的角度来看,这对生态是有好处的。
21:28
But I just think the simple thing is that US models are currently better and we use them
但我只是觉得简单来说,目前美国的模型更好,我们也在用它们。
21:32
and I try Chinese, I try these other open models and I'm like, fun, but not going to,
我试过中文,也试过其他开源模型,感觉就是好玩,但不会一直用下去,不会回头再用。
21:37
I don't go back to it.
我们其实没怎么提编程。
21:38
We didn't really mention programming.
那是很多人特别关心的另一个应用场景。
21:41
That's another use case that a lot of people deeply care about.
我基本上Cursor和Claude Code各用一半,因为我觉得它们体验完全不同,但都很有用。
21:45
So I use basically half and half cursor and cloud code because I find them to be like
你们呢,你们编程挺多的吧?
21:51
fundamentally different experience and both useful.
你们用什么?
21:54
What do you guys, you program quite a bit?
你们呢,你们平时写代码多吗?
21:56
So what do you use?
那你们用什么?
21:57
What's the current vibe?
现在氛围怎么样?
21:59
So I use the codex plugin for VS code.
我用的就是VS Code的Codex插件。
22:02
It's very convenient, it's just like a plugin and then it's a chat interface
特别方便,就是个插件,然后有个聊天界面,
22:05
that has access to your repository.
能直接访问你的代码库。
22:07
I know that cloud code is, I think, a bit different.
我知道Cloud Code不太一样,我觉得。
22:10
It's a bit more agentic, it touches more things, it does a whole project for you.
它更偏向agentic一点,能碰更多东西,能帮你搞定整个项目。
22:13
I'm not quite there yet where I'm comfortable with that because maybe I'm a control freak
我还没到那种能放心用它的程度,可能因为我有点控制狂,
22:19
but I still would like to see a bit what's going on and codex is kind of right now for
但我还是想看看具体在发生什么,而Codex目前对我来说刚刚好。
22:24
me like the sweet spot where it is helping me but it is not taking completely over.
我喜欢那种它帮到我、但又没有完全接管一切的平衡点。
22:29
I should mention one of the reasons I do use cloud code is to build the skill of programming
我得提一下,我用云端代码的一个原因,是为了锻炼用英语编程的技能。
22:34
with English.
我是说,这种体验从根本上就不一样。
22:35
I mean, the experience is fundamentally different.
你不需要去微观管理代码生成的每个细节,也不用盯着差异对比——如果你用Cursor的话就能做到——然后边推进边修改、边阅读代码、边深入理解它;相比之下,另一种方式更像是你在设计空间里思考,只是在宏观层面引导它。
22:37
You're as opposed to micromanaging the details of the process of the generation of the code
相比于微观管理代码生成的每个细节——比如你可以看diff(如果你用Cursor的话),然后修改、调整、阅读代码,随着进度深入理解代码——
22:43
and looking at the diff which you can and cursor if that's the ID you use and changing
你更倾向于在宏观的设计空间里思考,只是在大方向上引导它。
22:50
altering, looking and reading the code and understanding the code deeply as you progress
随着你不断进步,去深入阅读和理解代码。
22:56
versus just kind of like thinking in this design space and just guiding it at this macro
与其只是在这个设计空间里思考、在宏观层面引导它,
23:04
level which I think is another way of thinking about the programming process.
这个层次,我觉得其实是另一种理解编程过程的方式。
23:11
Also we should say that cloud code, it just seems to be somehow a better utilization of
另外也得说,Cloud Code 似乎就是能更好地利用 Cloud Opus 4.5。
23:17
cloud opus 4.5.
对用户来说,这是个很好的对比体验。
23:18
It's a good side by side for people to do.
你可以同时打开 Cloud Code、Cursor、VS Code,
23:21
So you can have cloud code open, you can have cursor open, you can have VS code open and
然后在所有编辑器里选同一个模型,问一些很有意思的问题,
23:24
you can select the same models on all of them and ask questions that are very interesting
结果 Cloud Code 明显更好——我是说,这真的很惊人。
23:28
like the cloud code way better than that I mean, it's remarkable.
好了。
23:32
All right.
好的。
23:33
We should say that both of you are legit on multiple fronts, researchers, programmers,
应该说,你们两位在多个领域都是名副其实的专家——研究员、程序员、教育者、推特大V,还有写书这块。Nathan 应该很快会出一本关于 RLHF 的书,现在已经可以预购了,还有完整的数字版预印本。我目前就是在把内容做得更精美、结构更清晰,准备出实体书。很大程度上我这么做,是因为当生活中大部分东西都是数字化的,能创造出自己觉得特别棒的实体作品,本身就是一件很有趣的事。这里要提一下,Sebastian Roshka 是一位机器学习研究员。
23:39
educators, tweeterers and on the book front too.
教育工作者们、推友们,还有图书方面也是。
23:45
So Nathan at some point soon hopefully has an RLHF book coming out.
所以Nathan hopefully很快会出一本关于RLHF的书。
23:50
It's available for preorder and there's a full digital preprint.
现在已经可以预购了,还有完整的数字预印本。
23:54
I'm just making it pretty and better organized for the physical thing which is a lot of
我正忙着把它做得更漂亮、更条理清晰,准备出实体书,这花了我不少功夫——
23:58
why I do it because it's fun to create things that you think are excellent in the physical
我这么做,很大程度上是因为,在我们生活已经如此数字化的今天,能亲手创造出自己觉得优秀的实体作品,本身就是一件很有趣的事。
24:02
form when so much of our life is digital.
对了,顺便提一下,在Proplexity这边,Sebastian Roshka是一位机器学习研究员。
24:05
I should say going to Proplexity here, Sebastian Roshka is a machine learning researcher
我得说,去Proplexity看看,Sebastian Roshka是一位机器学习研究员,
24:09
and author known for several influential books, a couple of them that I wanted to mention
同时也是多本极具影响力书籍的作者,我想特别提两本:一本是我强烈推荐的《从零构建大语言模型》,还有新出的《从零构建推理模型》。
24:13
which is a book I highly recommend, build a large language model from scratch and the new
我特别兴奋,因为从零开始构建东西是最有效的学习方式之一。
24:19
one build a reasoning model from scratch.
说实话,从零构建一个组件真的很有趣。
24:22
So I'm really excited about that building stuff from scratch is one of the most powerful
而且能学到很多东西,就像你说的,这可能是真正理解某个原理的最佳途径——毕竟看图表虽然直观,但图表也可能出错。
24:26
ways of learning.
学习的方式有很多种。说实话,从零开始搭建一个组件真的很有意思。
24:27
Honestly, building an element from scratch is a lot of fun.
而且能学到很多东西,就像你说的,这可能是理解某个东西真正运作方式的最佳途径,因为你可以看图表,但图表也可能有错误。
24:30
It's also a lot of to learn and like you said, it's probably the best way to learn how
对我来说,在小规模上,那种“心跳加速”的时刻出现频率真的很高,尤其是在他们动手操作的时候。
24:33
something really works because you can look at figures, but figures can have mistakes.
完全同意。我也想纠正一下自己。
24:38
You can look at concepts, explanations, but you might misunderstand them.
你可以看概念、看解释,但可能会理解错。
24:43
But if you see the code, there is code and the code works, you know, it's correct.
但如果你看到代码,代码就在那儿,而且它能跑,你就知道它是正确的。
24:48
I mean, there's no misunderstanding.
我的意思是,这不存在误解。
24:49
It's like, it's precise.
它就像,非常精确。
24:50
Otherwise, it wouldn't work.
否则它就跑不起来。
24:51
And I think that's like kind of like the beauty behind coding.
我觉得这大概就是编程背后的美妙之处。
24:54
It is kind of like it doesn't lie.
它有点像,不会说谎。
24:56
It's math basically.
本质上就是数学。
24:57
So even though with math, I think you can have mistakes in a book you would never notice.
所以即便是在数学领域,我觉得一本书里就算有错误,你也根本注意不到。
25:02
Because you're not running the math when you are reading the book, you can't verify this
因为你看书的时候不会真的去演算,所以没法验证。
25:06
and with code, but what's nice is you can verify it.
但代码就不一样了,好处是你确实能验证它。
25:09
Yeah, I agree with you about the element from scratch book.
嗯,我同意你对《从零开始》那本书的看法。
25:12
It's nice to tune out everything else the internet and so on and just focus on the book.
能屏蔽掉互联网上那些乱七八糟的东西,专心看书,感觉挺好的。
25:17
And you know, I read several like, you know, history books.
而且你知道吗,我读过好几本历史书。
25:22
It's just less lonely somehow.
不知怎么的,就是没那么孤单。
25:25
It's really more fun.
真的更有意思。
25:26
Like, for example, on the programming front, I think it's genuinely more fun to program
比如说,在编程方面,我觉得用LLM编程真的更有趣。
25:30
with an LLM.
而且我觉得用LLM阅读也更有趣,但你说得对,干扰应该尽量减少。
25:31
And I think it's genuinely more fun to read with an LLM, but you're right, like the distraction
所以就是用LLM来丰富体验,可能增加更多上下文,
25:38
should be minimized.
对我来说,在小范围内,那种“心跳加速”的时刻真的很多。
25:40
So it's you use the LLM to basically enrich the experience, maybe add more context
完全同意,我也想纠正一下自己。
25:48
maybe the I just the rate of our heart moments for me in a small scale is really high with
我的意思是,有时候章节里会有答案,但有时候也没有。
25:53
their arms.
他们的手臂。
25:54
100% I would I also want to correct myself.
完全同意,我也想纠正一下自己。
25:57
I'm not suggesting not to use LLM's.
我不是说不要用LLM。
25:59
I suggest doing it in multiple passes, like one pass, just offline focus mode.
我建议分多轮进行,比如第一轮,就离线专注模式。
26:03
And then after that, I mean, I also take notes, but I try to resist the urge to immediately
然后之后呢,我也会记笔记,但我会忍住不立刻去查东西。
26:10
look things up.
我会做第二轮。
26:11
I do a second pass.
对我来说,这样更有条理。
26:13
It's just like for me more structured this way.
而且我明白,有时候问题在章节里就有答案,但有时候,先消化一下、思考一下也有帮助。
26:15
And I get I mean, sometimes things are answered in the chapter, but sometimes also it just
我的意思是,有时候章节里确实有答案,但有时候它也只是
26:19
helps to let it sink in and think about it.
有助于让它沉淀下来,好好思考一下。
26:22
But other people have different preferences.
但其他人有不同偏好。
26:23
I would highly recommend using an LLM's when reading books.
我非常推荐在读书时使用LLM。
26:26
For me, it's just it's not the first thing to do.
对我来说,这并非首要步骤。
26:28
It's like the second pass by way of recommendation as to say, I do the opposite.
更像是第二遍筛选,相当于反向操作——我恰恰相反。
26:32
I like to use the LLM at the beginning to lay out the full context of like, what is this
我喜欢一开始就用LLM梳理完整背景,比如“我现在要踏入的是怎样一个世界”,同时尽量不跳出LLM去点开Twitter或博客,因为一旦点进去,就会掉进信息漩涡,开始读别人的观点。
26:37
world that I'm now stepping into when I try to avoid clicking out of the LLM into the
这个世界就是我正在踏入的,当我试图避免从LLM点开链接,进入像Twitter和博客那样的世界时,因为一旦那样,你就掉进了兔子洞,开始读别人的观点。
26:44
world of like Twitter and blogs and because then you're now down this rabbit hole, you're
那些宏观的想法,有时候书本身擅长传达这些,但也不总是如此。
26:50
reading somebody's opinion.
这就是为什么我喜欢和你聊天,很高兴能让AI在你的电脑里有个家,当你专注时,你可以把注意力放在它身上,而不是让它成为我混乱浏览器里的又一个标签页。
26:52
There's a flame war about a particular topic and also you're no longer you're not in the
某个话题引发了网络骂战,而且你也不再局限于上网浏览那些内容了。
26:57
realm of the internet and read it and so on.
但如果你纯粹让LLM给你解释为什么这事重要,以及宏观层面的思路——有时候书籍本身也能做到这点,但并非总是如此。
26:59
But if you're purely letting the LLM give you the context of why this matters, what are
所以我喜欢跟你聊天,这样AI在你电脑里就有了个专属空间,当你专注时能聚焦于此,而不是成为我那一堆乱七八糟的浏览器标签页之一。我觉得Cloud Code和这些特定工具在这方面做得不错。
27:05
the big picture ideas, but sometimes books themselves are good at doing that, but not
那些宏观的想法,而书籍本身有时擅长传达这些,但并非总是如此。
27:10
always.
这就是为什么我喜欢和你聊天,这样AI在你的电脑里就有了一个家。
27:12
That's why I like the chat to you to be happy that gives the AI a home in your computer
这就是为什么我喜欢跟你聊,很高兴能让AI在你的电脑里安家,从零开始,你完全不用操心,但相信它会自己搞定。很多人不用工具调用模式,我觉得首先是因为信任问题,他们不会为软件付费,但可能有计算资源可以部署。这意味着有人会调用模型来完成某些工作。你大概可以——我不确定,GPU不一样——但你可能能训练GPT-OSS的预训练部分,就是我们刚才聊的那个。
27:16
when you are folk, you can focus on it, rather than just being another tab in my mess
当你沉浸其中时,你可以专注于此,而不是成为我杂乱的另一个标签页。
27:21
of internet options and I think cloud code and these particular does a good job of making
在互联网选项里,我觉得Cloud Code这类工具做得特别好。你的AI会走向现实世界,这其实是一种很抽象的东西。它和Codex的区别在于,Cloud Code用起来感觉更温暖、更有参与感,而OpenAI的Codex虽然同样出色,但总让人觉得有点粗糙。Cloud Code让开发变得有趣,尤其是从零开始搭建的时候——你完全不用操心,只要相信它能做出东西来。显然它很适合做网站、刷新工具链之类的,我自己就用它干这些,或者做数据分析。
27:26
that a joy where it seems very engaging as a product design to be an interface that
那种愉悦感在于,作为产品设计,它呈现出一种非常吸引人的界面——你的AI会走向现实世界,而这是一种非常难以捉摸的特质。与Codex相比,它给人的感觉温暖而投入;OpenAI的Codex虽然同样出色,但总显得有点粗糙。而Cloud Code让构建东西变得有趣,尤其是从零开始的时候——你完全不用操心,只需信任它就能做出成果。显然,它很适合做网站、刷新工具链之类的事情,我也用它来做数据分析。
27:31
your AI will then go out into the world and it's something that is very kind of intangible
你的AI会走向世界,这是一种非常难以捉摸的东西。
27:36
between it and codex is that it just feels kind of warm and engaging where codex can
它和Codex的区别在于,它给人一种温暖而投入的感觉,而Codex虽然同样出色(来自OpenAI),但总感觉有点粗糙。
27:41
often be as good from open AI, but it just kind of like feels a little bit rougher
相比之下,Cloud Code让构建东西变得有趣,尤其是从零开始——你完全不用操心,只需信任它能做出成果。
27:45
on the edges where it's like cloud code is makes it fun to build things, particularly
显然它很适合做网站、刷新工具链之类的事情,我也用它做数据分析。
27:49
from scratch where you just don't like you don't have to care but you trust that it'll
从零开始,你根本不用操心,但你知道它会靠谱。
27:53
make something like obviously it's good for websites and kind of refreshing tooling
像那种对网站和工具刷新挺有用的,我平时就用它做数据分析。
27:58
and stuff like this, which I use it for or data analysis.
美国和欧洲有这些完全开放模型,所以我在Allen Institute Ray工作,我会有
28:01
So I my blog, we scrape hug and paste, we keep the download numbers for every data set
所以我的博客上,我们直接爬取和粘贴数据,持续记录每个数据集和模型的下载量。
28:05
and model over time now.
现在我们有了这些数据,Cloud 当时就说,嗯,我已经用过那些数据了,没问题。
28:06
So we have them and it's like cloud was just like, yeah, I've made use of that data, no
我当时想,这要是让我自己弄,得花好几天,然后我就有了足够的全局认知,能判断说,好吧,这些趋势显然说得通,你也能去验证。
28:10
problem.
所以这就像是一个很棒的中间层界面,你不需要亲自做那些繁琐的底层工作来维护各种东西。
28:11
And I was like, that would have taken me days and I was like, then I have enough situational
我当时就想,这要是让我自己来,得花好几天时间。然后我就有了足够的判断力,觉得这些趋势显然是有道理的,而且你还能去验证。所以这真是一种很棒的交互方式——你可以有一个中间层,而不必去做那些繁琐的底层工作,比如维护各种不同的东西。对,不用看笔记。效果非常好。而且我觉得,私心来说,我会推荐一批西方公司,无论是美国还是欧洲的,它们都有这些完全开源的模型。所以我在Allen Institute工作的时候,就会……
28:15
awareness to be like, okay, these trends obviously make sense and you can check things.
意识到就是,嗯,这些趋势显然是有道理的,而且你可以去验证一些东西。
28:19
So that's just a kind of wonderful interface where you can have an intermediary and not
所以这其实是一种很棒的交互方式,你可以通过一个中间层,而不必去做那些繁琐的底层工作来维护不同的东西——
28:22
have to do the kind of awful little level work that you would have to do to maintain different
对,不用看笔记。
28:27
web projects and do the stuff.
做网页项目,搞搞这些事。
28:28
All right.
好嘞。
28:29
So we just talked about a bunch of the closed weight models.
刚才聊了一堆闭源权重模型。
28:34
Well, let's talk about the open ones.
那咱们来聊聊开源的。
28:37
So tell me about the landscape of open LL models, which are interesting ones, which stand
跟我说说开源大语言模型的格局吧,哪些比较有意思、你觉得特别突出,还有为什么我们要对标DeepSeek。
28:41
out to you and why we're going to match deep seek.
你想试试不看笔记,光凭脑子能数出多少个吗?
28:44
Do you want to see how many we can name off the top of our head?
行啊,凭记忆来。
28:47
Yeah, without looking at notes.
做得非常好。
28:48
Deep Seek, Kimmy, Mini Max, Z.ai, Ant-Lang, we're just going Chinese.
Deep Seek、Kimmy、Mini Max、Z.ai、Ant-Lang,这些都是中国的。
28:58
Let's throw in Mr. Lai, Gemma, yeah, GPT OSS, the open source model by JetGPT, actually
再算上Mr. Lai、Gemma,还有GPT OSS,JetGPT那个开源模型,其实还有。
29:05
Nvidia NemoTron had a, Nvidia had a really cool one, a NemoTron 3.
Nvidia NemoTron也有一个,Nvidia出了个很酷的,叫NemoTron 3。
29:09
There's a lot of stuff, especially at the end of the year, Quinn.
年底那会儿东西特别多,Quinn。
29:11
One may be the one.
有一个可能就是那个。
29:12
Oh, yeah, Quinn was the obvious name of the first thing.
哦,对,Quinn明显是第一个的名字。
29:14
I was trying to get to that.
我刚想说到这个。
29:15
You can get at least 10 Chinese and at least 10 Western.
你至少能数出10个中国的和10个西方的。
29:18
I think that I'm in opening, I release their first open model since GPT2.
我觉得OpenAI发布了自GPT-2以来的第一个开源模型。
29:24
When I meant, when I was writing about opening eyes open model release, they're all like,
当时我写关于OpenAI开源模型发布的文章时,大家都说,
29:27
don't forget about GPT2, which I thought was really funny because that is such a different
别忘了GPT-2,我觉得这挺搞笑的,因为那完全是另一个时代了。
29:32
time.
GPT OSS实际上是一个非常强的模型,而且能做其他模型不太擅长的一些事情。
29:33
GPT OSS is actually a very strong model and does some things that the other models don't
我觉得自私一点说,我会推广很多西方公司,所以美国和欧洲都有这些完全开源的模型,而我自己在Allen Institute工作的话,我也会这么做。
29:38
do very well.
而且我觉得,自私地说,我会推荐一堆西方公司,所以无论是在美国还是欧洲,都有这些完全开源的模型。我在Allen Institute工作,Ray也是,
29:39
And I think that selfishly, I'll promote a bunch of Western companies, so both in the
这让它们作为MOE(混合专家模型)能达到更高的峰值性能,而很多这类东西——
29:44
US and Europe have these fully open models, so I work at Allen Institute Ray, I would have
这让它们作为MOE达到更高的峰值性能,很多这类东西
29:48
been building Olmo, which releases data and code and all of this.
一直在构建Olmo,这个项目会公开数据和代码等等。
29:52
And now we have actual competition for people that are trying to release everything so
现在,对于那些试图发布一切以便他人训练模型的人来说,我们有了真正的竞争。
29:55
that other people can train these models.
所以有基础模型研究所,或者说LM360,他们推出了各种类型的K2模型。
29:57
So there's the Institute for Foundation Models, or it's slash LM360, which is like
Apertise是一个开关研究联盟,Hugging Face有小语言模型,非常受欢迎,
30:02
had their K2 models of various types.
而Nvidia的Neymar Tron也开始发布数据了。
30:05
Apertise is a switch research consortium, hugging phase has small LM, which is very popular
还有斯坦福的Marin社区项目,正在逐步推进中。
30:12
in Nvidia's Neymar Tron, that started releasing data as well.
在Nvidia的Neymar Tron项目里,也开始放出数据了。
30:15
And then Stanford's Marin Community Project, which is kind of making it.
然后是斯坦福的Marin Community Project,这个项目基本上是在搭建一个稳定的语言模型运行栈。
30:19
So there's a pipeline for people to open a GitHub issue and implement a new idea and then
所以现在有一个流程,大家可以在GitHub上提issue,实现一个新想法,然后让它在稳定的语言建模框架里跑起来。这个领域里,2024年那个列表还小得多,我记得当时好像就只有AI Too。所以这对更多人参与进来、理解语言模型来说是件好事,而中国目前还没有类似的公司。顺便提一句,中国的开源语言模型通常规模要大得多,这让它们作为MOE模型能达到更高的峰值性能;而我们很喜欢的那类模型,比如Gemma和Neymar Tron,往往都是更小的模型。
30:23
have it run in a stable language modeling stack.
所以这个领域,2024年的时候那个列表还小得多,我记得好像就只有AI Too。
30:26
So this space, that list was way smaller in 2024, so I think it was like just AI too.
所以能让更多人参与进来、理解语言模型,这是件好事,
30:32
So that's a great thing for more people to get involved and to understand language models,
这方面其实没有一家中国公司有对标的项目。
30:36
which doesn't really have a Chinese company that has an analog.
我顺便提一句,中国的开源语言模型通常规模要大得多,
30:41
While I'm talking, I'll say that the Chinese open language models tend to be much bigger,
这让它们在MOE架构下能达到更高的峰值性能,而很多这类东西……
30:47
and that gives them this higher peak performance as MOEs, where a lot of these things that
Q3,就像Nathan说的,还有GPT OSS。
30:51
we like a lot, whether it was Gemma and Neymar Tron, have tended to be smaller models
我们很喜欢的一些模型,比如Gemma和Neymar Tron,往往都是较小的模型。
30:56
from the US, which is starting to change from US and Europe.
来自美国,而这一趋势正开始从美国和欧洲发生变化。
31:00
Mr. O'Large III came out, which was a giant MOE model, very similar to Deep Seek Architecture
O'Large III 发布了,那是一个巨大的 MOE 模型,和 Deep Seek 架构非常相似,是在十二月。
31:05
in December.
然后有一家初创公司 RCAI,还有 Neymar Tron 和 Nvidia 都透露了 MOE 模型,规模远超 1000 亿参数,大概在 4000 亿参数这个范围,预计在 2026 年第一季度左右推出。
31:06
And then a startup, RCAI and both Neymar Tron have Neymar Tron and Nvidia have teased
所以我觉得,今年人们在使用中国和美国开源模型上的平衡点会发生变化,就我个人而言,这挺有意思的。
31:12
MOE models of this way bigger than 100 billion parameters, like this 400 billion parameter
而MOE模型则远超1000亿参数,比如这个4000亿参数级别的模型,预计在2026年第一季度左右推出。
31:17
range coming in this like Q1, 2026 timeline.
所以我认为,今年人们使用中国和美国开源模型的场景会有所平衡,这一点我个人是……
31:21
So I think that's kind of balance is set to change this year in terms of what people are
但除此之外,如果你想选择熟悉且性能出色的模型,比如Q3,以及像Nathan提到的GPT OSS。
31:25
using the Chinese versus US open models for, which would be it, which I'm personally
还有那个真正以工具使用为目标训练的开源权重模型,我个人确实认为……
31:29
so it can be very excited to watch.
所以看着确实挺让人兴奋的。
31:32
First of all, huge props for being able to name so many things.
首先,能说出这么多名字真的很厉害。
31:36
Did you actually name Lama?
你给Lama起了名字吗?
31:38
No.
没有。
31:39
I feel like, all right.
我感觉,好吧。
31:40
This was not a purpose.
这本来就不是故意的。
31:42
All right.
好吧。
31:43
P Lama.
P Lama。
31:44
All right.
好的。
31:45
Can you mention what are some interesting models that stand out?
你能说说有哪些比较亮眼的模型吗?
31:48
So you mentioned Q1, 3 is obviously a stand out.
你提到Q1,3显然很突出。
31:51
So I would say the years are most book ended by both Deep Seek version 3 and R1.
我觉得这一年基本上是被Deep Seek version 3和R1这两头包揽的。
31:56
And then on the other hand, in December, Deep Seek version 3.2, because what I like about
然后另一边,12月份还有Deep Seek version 3.2,因为我喜欢它们的一点是,它们总有一些别人没有的架构调整。
32:00
those is they always have an interesting architecture tweak that others don't have.
不过除此之外,如果你想选那些熟悉但性能很好的,那就是Q3,还有像Nathan说的,GPT OSS。
32:05
But otherwise, if you want to go with, you know, like the familiar, but very good performance
不过呢,如果你想选那种大家熟悉、性能又很不错的模型,比如Q3,还有Nathan提到的GPT OSS——那个真正为工具使用而训练的开放权重模型——我确实觉得开源、开放权重的生态很重要。很多人不用工具调用模式,首先是因为信任问题。而且我觉得,如果你看美国以外的地方,很多人不会为软件付费,但他们可能有计算资源,可以部署一个模型。这意味着会有人调用这个模型来完成某些任务。
32:09
Q3 and like Nathan said also, GPT OSS.
一个真正以工具使用为目标训练的开放权重模型,我确实认为这是
32:13
And I think GPT OSS, what's interesting about it is kind of like the first public or like
我觉得GPT OSS有意思的地方在于,它大概是第一个真正以工具使用为目标进行训练的公开或开源权重模型。我认为这算是一种范式转变,而整个生态其实还没完全准备好。所谓工具使用,就是指LLM能够执行网络搜索、调用Python解释器。我确实觉得这很突出,因为这是一个巨大的突破——LLM最常见的槽点之一就是幻觉问题,对吧?在我看来,解决幻觉最好的方法之一,就是不要总试图靠记忆信息或者瞎编,比如做数学题,为什么不用计算器应用或者Python呢?
32:18
open weight model that was really trained with tool use in mind, which I do think is
开源、开放权重的生态系统。
32:23
kind of a little bit of a paradigm shift where the ecosystem was not quite ready for it.
这有点像一种范式转变,整个生态还没完全准备好。
32:28
So with tool use, I mean that the LLM is able to do a web search to call a Python interpreter.
说到工具使用,我的意思是LLM能够执行网络搜索,或者调用Python解释器。
32:33
And I do think this is a stand out, because I think it's a huge unlock, because one of
而且我确实认为这很突出,因为这是一个巨大的突破,因为大家对LLM最常见的抱怨之一就是幻觉问题,对吧?
32:38
the most common complaints about LLMs are, for example, hallucinations, right?
所以在我看来,解决幻觉最好的方法之一,就是不要总试图记住信息或者凭空编造,比如数学问题,为什么不用计算器应用或者Python呢?
32:43
And so in my opinion, one of the best ways to solve hallucinations is to not try to always
开源、开放权重的生态。
32:48
remember information or make things up for math, why not use a calculator app or Python?
很多人不用工具调用模式,我觉得首先是因为信任问题。
32:54
If I asked the LLM who won the soccer World Cup in 1998, instead of just trying to memorize,
如果我问那个LLM“1998年世界杯冠军是谁”,它不会只靠死记硬背,
33:00
it could go do a search.
而是可以自己去搜索。
33:03
I think mostly it's usually still Google search, so GPT OSS, they would do a tool call
我觉得大部分情况下还是用Google搜索,比如GPT OSS,它们会调用工具去Google,
33:08
to Google, maybe find the FIFA website, find, okay, it was France, it would get you that
可能找到FIFA官网,然后确认——哦,是法国队,这样就能可靠地给你答案,而不是硬记。
33:14
information reliably instead of just trying to memorize it.
所以我认为这是一个巨大的突破,但目前开源、开放权重的生态还没有完全利用起来。
33:17
So I think it's a huge unlock, which I think right now is not fully utilized yet by the
很多人不用工具调用模式,我觉得首先是因为信任问题。
33:22
open source, open weight ecosystem.
很多人不用工具调用模式,因为我觉得首先,这是个信任问题。
33:24
A lot of people don't use tool call modes, because I think it's first, it's a trusting,
很多人不用工具调用模式,我觉得首先是因为信任问题,他们不会为软件付费,但可能手头有计算资源,可以部署一个模型。这意味着有人会调用模型来完成某些任务。你可能——我不太确定——但GPU型号不同,不过你大概可以用GPT OSS做预训练,就是我们刚才聊的那个。计算规模差了好几个数量级,感觉就像——这东西怎么会到头呢?你要评分的其实是补全结果,强化学习的核心就在这儿。
33:30
you don't want to run this on your computer where it has access to tools, could wipe your
你肯定不想在自己电脑上跑这个,因为它能调用工具,搞不好会把你硬盘清空之类的。
33:33
hard drive or whatever.
所以你可能得把它隔离起来,用容器封装一下。
33:34
So you want to maybe contain, containerize that.
但我确实觉得,嗯,这对未来几年来说是个非常重要的能力,没错。
33:37
But I do think, you know, that is like a really important step for the upcoming years
所以简单说几点。
33:41
to have this ability, yeah.
首先,感谢你定义了什么叫工具使用。
33:44
So a few quick things.
我觉得这在我们讨论的这些概念里,总体上是个很好的做法。
33:46
First of all, thank you for defining what you mean by tool use.
首先,感谢你明确了“工具使用”的定义。
33:49
I think that's a great thing to do in general for the concerts we're talking about.
我觉得这对我们讨论的这些场景来说,总体上是个很好的做法。
33:53
Even things that sort of well established as M.O.E.s, you have to say that means, make
即便是像M.O.E.这样已经很成熟的概念,你也得说清楚它到底是什么意思,确保对方能理解。你得慢慢培养对人直觉的判断,知道这个概念怎么用、实际怎么落地、又有哪些不同的变体。
33:59
sure you're a person, you kind of have to build up an intuition for people, what that
那么,开源模型如此爆发式增长,这到底意味着什么?
34:04
means, how it's actually utilized, what are the different flavors.
你的直觉是什么?
34:07
So what does it mean that there's this such explosion of open models?
如果你发布一个开源模型,首要目标就是让人用起来。
34:12
What's your intuition?
其次才是透明度和信任这类东西。
34:13
If you're releasing an open model, you want people to use it as the first and foremost
如果你发布一个开源模型,你首先希望人们能把它用起来。
34:17
thing.
然后才是透明度和信任这类事情。
34:18
And then after that comes things like transparency and trust.
让全世界都能用上这些模型。
34:20
I think when you look at China, the biggest reason is that they want people around the
我觉得,看看中国的情况,最大的原因就是他们希望全世界的人都能用上这些模型。而且我觉得,很多人——如果你看美国以外的地方——很多人不会为软件付费,但他们可能有计算资源,可以把模型放上去运行。另外,有些数据你也不愿意传到云端。所以,首要目标就是让人们用上模型、用上AI,或者用上你的AI——那些如果没有模型访问权限就无法实现的事情。
34:25
world to use these models.
而且我觉得很多人不会——如果你看美国以外的地方,很多人不会为软件付费,但他们可能有计算资源,你可以把模型放上去。
34:26
And I think a lot of people will not, if you look outside of the U.S., a lot of people
而且我觉得很多人,如果你看美国以外的地方,很多人不会为软件付费,但他们可能有计算资源,你可以把模型放上去调用,让它完成一些工作。你可能可以——虽然我不确定,GPU 不一样——但你大概能用 GPT OSS 做预训练,就是我们刚才聊的那个。而这就是我们说的,几乎完全依赖于强化学习这个下游环节。所以模型在训练时,会非常快地学会做这件事。
34:30
will not pay for software, but they might have computing resources where you can put a
不会为软件付费,但他们可能有计算资源让你部署一个模型。
34:32
model on it and run it.
把模型部署上去并运行它。
34:34
I think there can also be data that you don't want to send to the cloud.
我觉得有些数据你也不希望传到云端。
34:37
So the number one thing is getting people to use models, use AI or use your AI that might
所以首要任务是让人们用上模型、用上AI,或者用上你的AI——如果没有模型访问权限,这些可能都做不到。
34:42
not be able to do it without having access to the model.
很多美国初创公司靠托管中国的模型并售卖token来赚钱。
34:45
I guess we should state explicitly.
我觉得我们得把话说清楚。
34:47
So we've been talking about these Chinese models and open weight models, oftentimes the
我们一直在聊这些中国模型和开放权重模型,它们通常是在本地运行的。
34:53
way they're running is locally.
所以并不是说你要把数据发到中国,或者发给硅谷的开发者,不管是谁做的模型。
34:55
So it's not like you're sending your data to China or to whoever developed to Silicon
很多美国初创公司靠托管这些中国模型并卖token来赚钱。
35:02
Valley, whoever developed the model.
也就是说,有人会调用模型来完成一些任务。
35:04
A lot of Americans start up to make money by hosting these models from China and selling
也就是说,有人会调用模型来完成某项任务。
35:09
tokens.
我认为这就像是你用户数量的一个上限。
35:11
Which means somebody will call the model to do some piece of work.
这意味着有人会调用模型来完成一部分工作。
35:15
I think the other reason is for U.S. companies to open AI is so GPU-deprived.
我觉得另一个原因是,美国公司做开源AI是因为GPU太紧缺了。
35:20
They're at the limits of the GPUs.
他们的GPU已经到极限了。
35:22
Whenever they make a release, they're always talking about like our GPUs are hurting.
每次发布新东西,他们都在说“我们的GPU不够用了”。
35:26
And I think there's like, in one of these like GPT OSS release sessions, Sam Altman said
我记得在某个GPT开源发布会的环节里,Sam Altman说过类似的话:
35:31
like, oh, we're releasing this because we can use your GPUs.
“我们开源这个,是因为可以用你们的GPU。”
35:34
We don't have to use our GPUs and open AI can still get distribution out of this,
“我们不用自己的GPU,OpenAI照样能靠这个获得分发。”
35:39
which is another very real thing because it doesn't cost them, though, anything.
这其实是很现实的一点,因为对他们来说完全没成本。
35:43
And for the user, I think also, I mean, there are users who just use the model locally, how
对用户来说也是,我觉得有些人就是直接在本地跑模型。
35:48
they would use a GPT, but also for companies.
他们会用GPT,但也会用于公司。
35:50
I think it's a huge unlock to have these models because you can customize them.
我认为拥有这些模型是一个巨大的突破,因为你可以定制它们。
35:54
You can train them.
你可以训练它们。
35:55
You can add post-training, add more data, specialize them into, let's say, law, medical
你可以进行后训练,添加更多数据,让它们专精于,比如说,法律、医疗
36:00
models, whatever you have.
模型,或者其他任何领域。
36:03
And the appeal, you mentioned, Lama, the appeal of the open weight models from China
而你提到的吸引力,Llama,中国开源权重模型的吸引力在于
36:07
is that the open weight models are also the licenses are even friendlier.
这些开源权重模型的许可证甚至更加友好。
36:11
I think they are just unrestricted open source licenses where if you use something like
我认为它们就是完全不受限制的开源许可证,如果你使用像
36:15
a Lama or Gemma, there are some strings attached.
像Lama或者Gemma,其实都附带一些条件。我觉得这就像用户数量有个上限。一旦超过——比如几百万用户——你就得向Meta之类的公司报告你的财务状况。我觉得吧,这模型虽然是免费的,但附带条件,而大家更喜欢没条件的东西。所以我认为,除了性能之外,这也是中国开源权重模型这么受欢迎的原因之一——拿来就能直接用。
36:18
I think it's like an upper limit in terms of how many users you have.
我觉得这就像是你有多少用户的一个上限。
36:21
And then if you exceed, I don't know, so many million users, you have to report your
然后如果你超过了,比如说,几百万用户,你就得向Meta之类的公司报告你的财务状况。
36:24
finance situation to, let's say, meta or something like that.
我觉得吧,这虽然是个免费模型,但背后是有附加条件的,而人们更喜欢没有附加条件的东西。
36:28
And I think, well, it is a free model, but there are strings attached and people do
所以我认为,除了性能之外,这也是中国开源权重模型如此受欢迎的原因之一——你可以直接拿来用。
36:33
like things where strings are not attached.
但Kimi K2的推理能力,以及Kimi K2这个模型本身,都非常受欢迎。
36:36
So I think that's also one of the reasons besides performance, why the open weight models
这一点对你来说特别有意思吗?
36:41
from China are so popular because you can just use them.
来自中国的那些模型之所以这么火,就是因为你可以直接拿来用。
36:43
There is no catch in that sense.
从这个角度来说,并没有什么陷阱。
36:45
The ecosystem has gotten better on that front, but mostly downstream of these new providers
生态系统在这方面已经有所改善,但主要还是得益于这些新提供商在下游环节
36:50
providing such open licenses.
提供了如此开放的许可协议。
36:51
That was funny when you pulled up perplexity.
你刚才打开Perplexity的时候还挺好笑的。
36:53
It said, Kimi K2, thinking hosted in the US, which is like an exact, I've never seen
它显示“Kimi K2,思考中,托管在美国”,这简直就是一个——我从来没见过
36:57
this, but it's an exact example of what we're talking about, where people are sensitive
这么典型的例子,正好印证了我们讨论的话题,就是人们对这一点很敏感。
37:00
to this.
不过Kimi K2的思考过程以及Kimi K2这个模型本身都非常受欢迎。
37:01
But Kimi K2, thinking and Kimi K2 as a model is very popular.
但Kimi K2,它的推理能力,以及Kimi K2作为一个模型本身,非常受欢迎。
37:05
People say that has a very good, like creative writing and also in doing some software
人们说它在创意写作和一些软件相关的事情上表现非常好。
37:09
things.
所以就是这些不同模型的小特点,让人们觉得喜欢。
37:10
So it's just these little quirks that people pick up on with different models that they
这些模型探索过哪些有趣的想法,你能聊聊吗?比如哪些特别吸引你?
37:13
like.
也许你可以按时间顺序来说。
37:14
What are some interesting ideas that some of these models have explored that you can speak
我的意思是,当然有Deep Seek,Deep Seek R1,它是一月份出来的,如果我们只是……
37:19
to, like that particular interesting to you?
你对那个特别感兴趣吗?
37:21
Maybe you can go chronologically.
也许你可以按时间顺序来。
37:23
I mean, there was, of course, deep seek, deep seek R1 that came out in January, if we just
我的意思是,当然有Deep Seek,Deep Seek R1在一月份发布,如果我们只谈项目的话。
37:27
focused on 2025.
主要聚焦在2025年。
37:28
However, this was based on deep seek version three, which came out the year before in December
不过,这是基于Deep Seek的第三个版本,该版本于前一年,也就是2024年12月发布。
37:34
2024.
架构方面有多个要点。
37:35
There are multiple things on the architecture side.
有趣的是,你仍然可以——我的意思是,这就是我在从头开始的编程项目中所做的——
37:37
What is fascinating is you can still, I mean, that's what I do with my from scratch coding
你仍然可以从GPT2入手,然后在这个模型上添加东西,把它变成另一个模型。
37:41
projects.
你仍然可以从GPT-2开始,然后往那个模型里加东西,把它变成另一个模型。
37:42
You can still start with GPT2 and you can add things to that model to make it into this
但为了在深入细节之前先列出这些,mixture of experts,然后他们还有multi head latent attention,这是对attention机制的一个调整。
37:46
other model.
我觉得,在2025年,这是这些开源模型之间的主要区别。
37:47
So it's all still kind of like the same lineage, the same, it is a very close relationship
所以这基本上还是同一条脉络,关系非常紧密。
37:53
between those.
我随口就能想到DeepSeek,它独特的地方在于混合专家模型,不过混合专家模型并不是他们发明的。
37:54
Top of my head deep seek, what was unique there is the mixture of ex, I mean, they were
我们可以稍微聊聊混合专家模型是什么意思。
37:58
not inventing mixture of experts.
但在深入细节之前,先列举一下这些技术:混合专家模型,然后他们还有多头潜在注意力,这是对注意力机制的一个改进。
38:00
We can maybe talk a bit more what mixture of experts means.
我觉得,在2025年,这会是这些开源模型之间的主要区别。
38:04
But just to list these things first before we dive into detail, mixture of experts, but
不过在深入细节之前,先列一下这些东西:混合专家模型(mixture of experts),
38:08
then they also had multi head latent attention, which is a tweak to the attention mechanism,
然后它们还用了多头潜在注意力(multi head latent attention),这是对注意力机制的一个改进。
38:14
where this was, I would say, 2025, the main distinguishing factor between these open
我觉得,在2025年,这算是这些开源模型之间的主要区别。
38:21
weight models, different tweaks to make inference or KV cache size.
权重模型,以及针对推理或KV缓存大小的不同调整。
38:26
We can also define KV cache in a few moments, but to kind of make it more economical to
我们也可以稍后定义KV缓存,但主要是为了更经济地处理长上下文,从而缩小KV缓存大小。
38:32
have long contacts to shrink the KV cache size.
那么我们可以做哪些调整呢?
38:34
So what are tweaks that we can do?
其中大部分都集中在注意力机制上。
38:36
And most of them focused on the attention mechanism.
DeepSeek中有多头潜在注意力(multi head latent attention)。
38:38
There is multi head latent attention in deep seek.
还有分组查询注意力(group query attention),这仍然非常流行。
38:42
There is a group query attention, which is still very popular.
它并非由这些模型中的任何一个发明。
38:44
It's not invented by any of those models.
这不是由任何那些模型发明的。
38:46
It goes back a few years, but that would be the other option sliding window attention.
这要追溯到几年前了,不过另一种方案就是滑动窗口注意力(sliding window attention)。
38:51
I think almost reuses it if I remember correctly.
我记得没错的话,它几乎是复用了这个机制。
38:54
So there are these different tweaks that make the models different.
所以就是这些不同的调整让模型之间有了区别。
38:58
Otherwise, I put them all together in article once, where I just compared them.
另外,我有一篇文章把它们全放在一起做过对比。
39:04
They are very surprisingly similar.
结果它们惊人地相似。
39:05
It's just different numbers in terms of how many repetitions of the transformer block
区别只是中间重复了多少个transformer block。
39:09
you have in the center.
以及一些人们会调的小参数,但最棒的地方在于,它确实管用。
39:11
And like just little little knobs that people tune, but what's so nice about it is it works
就像人们调的那些小旋钮一样,但妙就妙在它确实管用。
39:17
no matter what you can tweak things.
不管怎样你都可以调整一些东西。你可以把normalization layers挪来挪去,我们确实能获得一些性能提升。而且我在Appalachian studies里几乎总是能看到很好的结果,展示出这到底对模型做了什么。如果你把某些东西挪动一下,Appalachian studies并不会让它变得更好或更差。但有很多,比如说,实现一个transformer并让它仍然能运行的方式。目前仍然流行的大方向是mixture of experts、multi head latent attention。
39:19
You can move the normalization layers around, we get some performance gains.
你可以把normalization layers挪来挪去,我们还能获得一些性能提升。
39:23
And I almost always very good in Appalachian studies showing what actually, what it does to
而且我在Appalachian studies里几乎总是看到很好的结果,能展示它到底对模型做了什么。
39:28
the model.
如果你把东西挪来挪去,Appalachian studies并不会让它变得更好或更差。
39:29
If you move something around, Appalachian studies doesn't make it better or worse.
但确实有很多,比如说,实现transformer并让它依然能运行的方式。
39:32
But there are so many, let's say, ways you can implement a transformer and make it
但实现transformer并做出调整的方式其实有很多种。
39:35
still work.
还是有效的。
39:36
Big ideas that are still prevalent is mixture of experts, multi head latent attention,
现在仍然流行的大思路包括混合专家模型(mixture of experts)、多头潜在注意力(multi head latent attention),
39:42
sliding window attention group query attention.
sliding window attention 和 group query attention。
39:44
And then at the end of the year, we saw a focus on making the attention mechanism scale
然后到了年底,大家开始关注如何让注意力机制在推理时的 token 预测中实现线性扩展。
39:49
linearly with inference token prediction.
比如接下来的 Qwen 3,就加入了一个 gated delta net。
39:52
So there were quen three next, for example, which added a gated delta net.
这有点像受 state space model 启发,但有一个固定状态不断更新,本质上让 attention 更便宜,或者说用更便宜的操作替代了 attention。
39:57
It's like kind of like inspired by state space models, but you have a fixed state that
或许退一步,先聊聊 transformer 架构的整体情况会更有帮助。
40:02
you keep updating, but it makes essentially this attention cheaper or it replaces attention
你不断更新,但它本质上让注意力机制更便宜,或者用更便宜的操作替代了注意力。
40:07
with a cheaper operation.
或许退一步,先聊聊 transformer 架构的整体情况会更有帮助。
40:08
And it may be as a useful to step back and talk about transformer architecture in general.
它本质上仍然是一个神经网络,内部包含注意力机制。
40:13
Yeah.
嗯。
40:14
So maybe we should start with the GPT two architecture, the transformer that was derived
那要不我们从GPT-2的架构开始聊起,这个transformer源自《Attention Is All You Need》那篇论文。
40:19
from the attention is all you need paper.
《Attention Is All You Need》论文里的transformer架构包含两部分:一个encoder和一个decoder。
40:22
So the attention is all you need paper had a transformer architecture that had two parts
而GPT只专注于decoder这部分。
40:26
and encoder and a decoder.
它本质上仍然是一个神经网络,内部带有attention机制。
40:28
And GPT went just focusing in on the decoder part.
你每次预测一个token,把它传入一个embedding层。
40:32
It is essentially a still a neural network and it has this attention mechanism inside.
你一次预测一个 token,把它传入一个嵌入层(embedding layer)。
40:38
And you predict one token at a time, you pass it through an embedding layer.
混合专家层并不是 GPT OSS 发明的,它已经存在好几年了。
40:43
It's the transformer block, the transformer block has attention modules and a fully connected
就是那个transformer块,transformer块里有关注力模块和一个全连接层。
40:47
layer.
中间还有一些归一化层。
40:48
And there are some normalization layers in between.
但本质上就是带有这种关注力机制的神经网络层。
40:50
But it's essentially neural network layers with this attention mechanism.
所以从GPT-2开始,当我们过渡到GPT-OSS时,比如说,就有了混合专家层,这不是GPT-OSS发明的,已经存在好几年了。
40:53
So coming from GPT two, when we move on to GPT OSS, there is, for example, the mixture
但它本质上是一种调整,让模型变得更大,同时每次前向传播不消耗更多算力。
40:59
of experts layer, it's not invented by GPT OSS, it's a few years old.
但它本质上是一种调整,让模型变得更大,同时不消耗更多算力。
41:04
But it is essentially a tweak to make the model larger without consuming more compute in
但这本质上是一种调整,让模型变得更大,却不消耗更多算力。
41:12
each forward pass.
每次前向传播。
41:13
So there is this fully connected layer.
所以这里有一个全连接层。
41:15
And if listeners are familiar with multi-layer perceptrons, you can think of a mini multi-layer
如果听众熟悉多层感知机,可以把它想象成一个微型多层感知机,也就是transformer内部的一个全连接神经网络层。
41:21
perceptron, a fully connected neural network layer inside the transformer.
这个层非常昂贵,因为它是全连接的。
41:25
And it's very expensive because it's fully connected.
如果你有1000个输入和1000个输出,那就相当于100万个连接。
41:27
If you have 1000 inputs, 1000 outputs, that's like a 1 million connections.
而这是transformer中非常昂贵的一部分。
41:32
And it's a very expensive part in this transformer.
于是思路就是把它扩展成多个前馈网络。
41:34
And the idea is to kind of expand that into multiple feed forward network.
所以与其只用一个,假设你有256个,但这会让它贵得多。
41:41
So instead of having one, let's say you have 256, but it would make it way more expensive
所以不是只有一个,假设你有256个,但这会让成本高得多。
41:45
because now you have 256, but you don't use all of them at the same time.
因为现在你有256个,但不会同时全部使用。
41:49
So you now have a router that says, okay, based on this input token, it would be useful to
所以现在有一个路由器,它会说,好的,基于这个输入token,使用这个全连接网络会比较有用。
41:54
use this fully connected network.
在这种语境下,它被称为一个expert。
41:57
And in that context, it's called an expert.
所以mixture of experts意味着你有多个experts。
41:59
So a mixture of experts means you have multiple experts.
根据你的输入内容,比如如果更偏向数学,它会调用不同的experts;而如果是将英文文本翻译成西班牙语,它可能会组合不同的experts。
42:02
And depending on what your input is, let's say it's more math heavy, it would use different
而且根据你的输入是什么,比如说它更偏数学计算,它会调用不同的
42:07
experts, compared to, let's say, translating input text from English to Spanish, it would
专家,相比之下,比如把输入文本从英语翻译成西班牙语,它可能
42:11
maybe console different experts.
会组合不同的专家。
42:13
It's not quite clear, I mean, as clear cut to say, okay, this is only an expert for math
这其实没那么明确,就是说,不能简单地说“这个专家只负责数学”,而西班牙语的部分就模糊一些。但核心思路是,你把更多知识塞进网络里,但并不是所有知识随时都在用——那样太浪费了。所以在生成token的时候,你会更有选择性地调用。作为路由器,它要决定哪些token该送到哪个专家那里,这就增加了复杂度,训练起来也更难。
42:18
and for Spanish is a bit more fuzzy.
而西班牙语的处理会稍微模糊一些。
42:21
But the idea is essentially that you pack more knowledge into the network, but not all
但核心思想是,你在网络中塞进更多知识,但并非所有知识
42:25
the knowledge is used all the time.
都会被随时用到。
42:27
That would be very wasteful.
那会非常浪费。
42:29
So you're kind of like during the token generation, you're more selective.
所以你在生成token的时候,其实是在做更精细的选择。
42:32
As a router, that selects which tokens should go to which expert, it's more complexity.
作为一个路由器,它要决定哪些token该分配给哪个专家,这就增加了复杂度。
42:38
It's harder to train.
训练起来也更难。
42:39
There's a lot of, you know, that can go wrong, like collapse and everything.
有很多可能出问题的地方,比如崩溃之类的。所以我认为,目前几乎所有模型仍然在使用密集架构,我的意思是,现在所有模型都混合了专家机制,但密集模型——这里“密集”是个术语,指的是密集和稀疏之间的区别。混合专家模型被认为是稀疏的,因为我们有很多专家,但只有少数几个是激活的,这就叫稀疏。而密集则相反,只有一个全连接模块。
42:43
So I think that's by almost three still uses a dense, I mean, you have, I think all
所以我觉得,几乎所有模型都还在用dense架构——我是说,你懂的,虽然有些模型用了混合专家,但dense模型(dense也是术语)——这里有个区别,dense和sparse。
42:47
the models with mixed of experts, but dense models, where dense means also, it's jargon,
混合专家被认为是sparse,因为我们有很多专家,但每次只激活少数几个。
42:53
there's a distinction between dense and spars.
这里有个区别,密集模型和稀疏模型。
42:56
So mixed of experts is considered spars because we have a lot of experts, but only few
混合专家模型被认为是稀疏的,因为我们有很多专家,但只激活其中少数几个。
43:00
of them are active.
其中一部分是激活的。
43:01
So that's called spars.
这就叫稀疏。
43:02
And then dense would be the opposite where you only have like one fully connected module
而密集则相反,只有一个全连接模块。
43:06
and it's always, you know, utilized.
而且它总是,你知道的,被用上了。
43:08
So maybe maybe it's a good place to also talk about KV Cash, but actually before that
所以也许,也许这也是个聊KV Cache的好时机,但在此之前,
43:12
even zooming out, like fundamentally, how many new ideas have been implemented from
再往大了看,从根本上说,从GPT-2到现在,到底有多少新想法被实际应用了?
43:19
GPT-2 to today, like how different really are these architectures.
这些架构真的有多大不同?
43:25
Picture like the mixture of experts on the attention mechanism in GPT OSS, that would
比如GPT-4里的混合专家模型和注意力机制,那就是分组查询注意力机制。
43:30
be the group query attention mechanism.
所以这其实是从多头注意力到分组查询注意力的一个小调整。
43:32
So it's a slight tweak for multi head attention to group query attention.
这样我们就有了两个。
43:35
So there we have two.
所以这里有两种情况。
43:37
I think they replaced a layer norm by RMS norm, but it's just like a different normalization
我觉得他们把layer norm换成了RMS norm,但这只是不同的归一化方式。
43:42
error.
算不上大改动。
43:43
Not a big change.
就是个微调。
43:44
It's just like a tweak.
非线性激活函数,熟悉deep new networks的人都知道,
43:45
The non-linear activation function, people familiar with deep new networks, I mean,
就跟把sigmoid换成value差不多。
43:50
it's the same as changing sigmoid with value.
并没有从根本上改变网络结构。
43:52
It's not changing the network fundamentally.
就是个微调,一点点小调整。
43:55
It's just like a tweak, like a little, little tweak.
这就像个微调,一点点小调整。
43:58
And that's about it, I would say.
差不多就是这样吧。本质上其实没什么太大区别,还是同样的架构。你可以从一个模型转换到另一个,基本上只需要加上这些改动就行。核心还是同一个架构。对,比如你刚才提到我那本书,书里用的是GPT-2模型,因为它简单又很小,大概1.24亿、1.2亿个参数左右。
43:59
It's not really fundamentally that different.
本质上并没有太大不同。
44:01
It's still the same architectures.
架构还是一样的。
44:03
You can convert one from one.
你可以从一个转换到另一个。
44:06
You can go from one into the other by just adding these changes basically.
基本上你只需要加上这些改动,就能从一个版本变成另一个版本。
44:10
This fundamentally is still the same architecture.
这本质上还是同样的架构。
44:12
Yeah, so for example, you mentioned my book earlier, that's GPT-2 model in the book
对,比如你刚才提到我那本书,书里用的是GPT-2模型,
44:16
because it's simple and it's very small, so 124, 120 million parameters approximately.
因为它简单而且非常小,大概有1.24亿、1.2亿个参数。
44:22
But in the bonus materials, I do have almost three from scratch, Gemma three from scratch
但在附加材料里,我确实有几乎三个从头训练的模型,Gemma 三个从头训练的,还有其他类型的从头训练模型。
44:26
and other types of from scratch models.
而且我每次都是从我的 GPT-2 模型出发,稍微调整一下,嗯,加上不同的组件,就能从一个模型得到另一个。
44:28
And I always started with my GPT-2 model and just tweaked, well, added different components
这有点像,某种程度上是一种传承。
44:32
and you get from one to the other.
你能帮大家建立一种直觉吗?因为当你拉远视角看,AI 领域的发展实在太快了。
44:34
It's like, it's kind of like a lineage in a sense.
但与此同时,底层架构其实并没有变。
44:37
Can you build up an intuition for people because when you zoom out, you look at it, there's
你能不能帮大家建立一种直观理解?因为当你拉远视角看,
44:42
so much rapid advancement in the AI world.
AI领域的发展实在太快了。
44:46
At the same time, fundamentally the architectures have not changed.
但同时,底层架构其实并没有变。
44:51
So where is all the turbulence, the turmoil of the advancement happening?
那么,所有的动荡、进步带来的冲击都发生在哪里?
44:58
Where is the gains to be had?
收益又在哪里?
45:01
So there are the different stages where you develop the network or train the network.
开发或训练网络有不同阶段。
45:05
You have the pre-training.
首先是预训练。
45:06
Now back then, it was just pre-training with GPT-2.
当年,GPT-2 还只是做预训练。
45:10
Now you have pre-training, mid-training and post-training.
现在则有预训练、中期训练和后期训练。
45:13
So I think right now we are in the post-training focus stage.
所以我认为,目前我们正处于聚焦后期训练的阶段。
45:17
I mean, pre-training still gives you advantages if you scaled it up to better higher quality
当然,预训练如果扩展到更高品质的数据,依然能带来优势。
45:23
data.
数据。
45:24
But then we have capability unlocks that we're not there with GPT-2.
但有些能力突破是我们在GPT-2时代还没达到的。
45:28
For example, chat GPT, it is basically a GPT-3 model and GPT-3 is the same as GPT-2
比如ChatGPT,它本质上就是一个GPT-3模型,而GPT-3和GPT-2在架构上是一样的。
45:34
in terms of architecture.
真正的新东西是加入了supervised fine-tuning和reinforcement learning with human feedback。
45:36
What was new was adding the supervised fine tuning and the reinforcement learning with
所以更多是算法层面的改进,而不是架构上的变化。
45:41
human feedback.
我觉得系统本身也发生了很大变化。
45:42
So it's more on the algorithmic side rather than the architecture.
所以更多是算法层面的进步,而不是架构上的变化。
45:44
I would say that the systems also changed a lot.
我觉得系统本身也发生了很大的变化。
45:46
I think if you listen to Nvidia's announcements, I talk about these things like, you now do
我觉得如果你听Nvidia的发布,我会提到这些事,比如现在可以做F8了。
45:50
F8.
现在能做F4了,而这些实验室正在想办法利用更多算力集中到一个模型上,这样就能训练得更快。
45:51
You can now do F4 and what is happening is these labs are figuring out how to utilize more
这让他们能塞进更多数据,然后通过这种方式更快找到更好的配置。
45:56
compute to put it into one model, which lets them train faster.
所以你可以看每个GPU每秒处理的token数,这是做大规摸训练时关注的一个指标。
45:59
And that lets them put more data in and then you can find better configurations faster
这样一来,它们就能塞进更多数据,然后通过这种方式更快地找到更好的配置。
46:04
by doing this.
所以你可以看一个指标,就是每个GPU每秒处理的token数,在做大规模训练的时候你会关注这个。
46:05
So you can look at essentially the tokens per second per GPU is a metric that you look
用来描述架构的时候,它们看起来一模一样,但训练这些模型用的代码库会差别非常大。
46:09
at when you're doing large scale training.
你可能可以——我不确定——GPU也不一样,但GPT OSS大概还是能训练的。
46:12
And you could get, you can go from like 10k to 13k by turning on F8 training, which means
你可以通过开启F8 training把训练成本从10k降到13k,这意味着模型每个参数占用的内存更少。
46:17
they're using less memory per parameter in the model.
因为保存的信息变少了,通信开销也降低了,所以训练速度能更快。
46:21
And by saving less information, you do less communication, you can train faster.
所有这些系统层面的优化,都让数据和算法的实验迭代变得快得多。
46:24
So all of these like system things underpin way faster experimentation on data and algorithms.
这有点像一种持续循环——当你去看架构时,它们看起来完全一样,但用来训练这些模型的代码库却天差地别。
46:30
That is kind of like it's this kind of loop that keeps going where it's kind of hard
你可能……我不确定,GPU也不一样,但GPT OSS的训练方式大概会完全不同。
46:37
to describe when you look at the architecture and they're exactly the same, but the code
用来描述架构时,它们看起来完全一样,但训练这些模型所用的代码库会截然不同。
46:41
base used to train these models is going to be vastly different.
你可能可以——我不确定——GPU 也不同,但你大概会用 GPT OSS 来训练预训练阶段。
46:45
You could probably, like I don't, the GPUs are different, but you probably train GPT OSS
你可能可以——虽然我不确定,GPU 不太一样——但你大概能用它来训练 GPT OSS 的预训练部分。
46:49
20B way faster in walk-alc time than GPT 2 was trained at the time.
20B 在走测时间上比当年训练 GPT-2 快得多。
46:54
Like you said, they had for example, in the mixture of experts, this NVFP4 optimization,
就像你说的,比如在混合专家模型里,他们用了 NVFP4 优化,
46:59
for example, where you get most input, but I do think this is for the speed.
大部分输入都能处理,但我认为这主要是为了提速。
47:04
This is true, but it doesn't give the model new capabilities in a sense.
确实如此,但这在某种意义上并没有给模型带来新能力。
47:07
It's just how much can we make make the computation coarser without suffering in terms
只是看我们能在不牺牲模型性能的前提下,把计算做得有多粗糙。
47:13
of model performance degradation.
不过我觉得,Transformer 之外确实开始出现替代方案了。
47:17
But I do think, I mean, there are alternatives popping up to the transformer.
比如文本扩散模型,那完全是另一种范式。
47:20
There's text diffusion models, completely different paradigm.
有text diffusion模型,完全不同的范式。
47:24
And there's also, I mean, the text diffusion models might use transformer architectures,
而且,文本扩散模型可能会用transformer架构,但它不是自回归transformer。
47:27
but it's not an auto regressive transformer.
还有Mamba模型,它是状态空间模型,但确实有取舍。
47:31
And also Mamba models, it's a state space model, but they do have trade-offs.
关键在于,目前还没有任何东西能取代自回归transformer作为最先进的模型。
47:35
And what's right is there's nothing that has replaced the auto regressive transformer
所以,要达到最先进水平,你仍然得用那个东西来实现目标。
47:41
as state of the art model.
但确实存在更便宜的替代方案,这些方案会做出一些妥协,不过现在架构已经不止一种了。
47:42
So like for state of the art, you would still do that goal with that thing.
所以对于最前沿的技术,你仍然会用那个东西来实现那个目标。
47:46
But there are no alternatives for the cheaper and like alternatives that are kind of making
但那些更便宜的、类似替代方案,虽然会做一些妥协,但现在已经不止一种架构了。
47:51
compromises, but it's not just one architecture anymore.
很大程度上还是transformer架构,自回归的,本质上是从GPT 2衍生出来的。
47:55
There are little ones coming up, but if we talk about the state of the art, it's pretty
现在有一些新的方向在涌现,但说到最前沿的技术,基本上还是Transformer架构,本质上是从GPT-2衍生出来的自回归模型。我觉得这里的关键问题是,我们之前聊了不少关于预训练背后的架构。那么,这些缩放定律在预训练、后训练、推理、上下文长度、数据以及合成数据这些方面,是否依然保持有效?我想先从缩放定律的技术定义说起,也就是这些现象背后的基本形式。缩放定律是一种幂律关系,你可以把它想象成横轴上的变量。
47:59
much still the transform architecture, auto regressive derived from GPT 2 essentially.
我觉得这里的大问题是,我们之前聊了不少关于pre-training背后的架构。
48:06
I guess the big question here is we talked quite a bit here on the architecture behind
那scaling laws在pre-training、post-training、inference这些阶段,是否依然成立?
48:10
the pre-training.
就是我们刚才聊的那个。
48:12
Are the scaling laws holding strong across pre-training, post-training inference, contact
缩放定律在预训练、后训练推理和持续训练中是否依然坚挺?
48:17
size, data, synthetic data?
规模、数据、合成数据?
48:20
I like to start with the technical definition of scaling law, the kind of forms all of this.
我想先从缩放定律的技术定义说起,这是这一切的基础形式。
48:24
The scaling law is a power law relationship between, you could think of the x-axis.
缩放定律是一种幂律关系,你可以想象成x轴上的关系。
48:29
So kind of what you are scaling is a combination of compute and data, which are kind of similar.
所以你扩展的其实是算力和数据的组合,这两者有点类似。
48:34
And then the y-axis is like the held out prediction accuracy over our next tokens.
而纵轴呢,就是模型在未见过的下一个token上的预测准确率。
48:39
We talked about models being auto regressive.
我们之前提到过模型是自回归的。
48:41
It's like if you keep a set of text that the model has not seen, how accurate will get
也就是说,如果你保留一组模型没见过的文本,它在训练时能有多准确。
48:46
when you will train.
而规模法则这个概念,是在人们发现这种关系非常可预测之后才出现的。
48:47
And the idea of scaling laws came when people figured out that that was a very predictable
我觉得这个技术术语还在延续,接下来的问题就是,用户到底想要什么。
48:52
relationship.
我认为这个技术术语仍在延续,然后问题在于,用户对于预训练怎么看——也就是你的模型有多大、数据集有多大。
48:54
And I think that that technical term is continuing and then the question is like what do users
接着是强化学习的缩放,这就像你能做多久这种试错过程。
49:00
get out of it?
摆脱它?
49:01
And then there are more types of scaling where OpenAI's O1 was famous for introducing inference
然后还有更多类型的scaling,OpenAI的O1以引入inference time scaling而闻名。
49:06
time scaling.
而且我认为不那么出名的是,它也展示了你可以扩展reinforcement learning训练,
49:07
And I think less famously for also showing that you can scale reinforcement learning training
并得到一种log x轴,然后在y轴上性能呈线性增长的效果。
49:12
and get kind of this log x-axis and then a linear increase in performance on y-axis.
所以现在大概有三个方向:传统的scaling laws讨论的是pre-training,也就是你的模型有多大、数据集有多大;
49:17
So there's kind of these three axes now where the traditional scaling laws are talked
然后是scaling reinforcement learning,也就是你能做多长时间的trial。
49:22
about for pre-training, which is how big your model is and how big your data set is.
所以我比较看好它们都还在持续发挥作用,但那些唾手可得的机会已经没了。
49:25
And then scaling reinforcement learning, which is like how long can you do this trial
还有强化学习的扩展——比如这种试错过程能持续多久?
49:29
and error learning that we will talk about.
以及我们接下来要讨论的错误学习机制。
49:31
We'll find more of this.
我们会发现更多类似的情况。
49:32
And then this inference time compute which is just letting the model generate more tokens
然后就是推理时计算,也就是让模型针对特定问题生成更多token。
49:36
on a specific problem.
所以我比较乐观,这些方向都还在推进,但最容易摘的果实基本已经被摘完了,尤其是过去一年里基于可验证奖励的强化学习(RLVR),以及推理时扩展——这正是这些模型用起来感觉如此不同的原因,以前你总是能立刻得到第一个token。
49:37
So I'm kind of bullish where they are all really still working, but the low-hanging fruit
所以我比较乐观,这些方向目前都还在起作用,但最容易摘的果实
49:42
has mostly been taken, especially in the last year on reinforcement learning with verifiable
大部分进展,尤其是在过去一年里,主要集中在基于可验证奖励的强化学习上,也就是RLVR,以及推理时扩展——这正是这些模型用起来感觉如此不同的原因,以前你会立刻得到第一个token。它们某种程度上实现了我们之前讨论的工具使用和更好的软件工程能力。而当我们说“实现”时,几乎完全归功于这种基于可验证奖励的强化学习训练,它让模型自己掌握了这些技能。所以,在训练过程中,模型会非常迅速地学会这些。
49:47
rewards, which is this RLVR, and then inference time scaling, which is just why these models
是奖励机制,也就是RLVR,以及推理时扩展——这正是为什么这些模型用起来感觉如此不同,以前你会立刻收到第一个token。
49:52
feel so different to use where previously you would get that first token immediately.
它们某种程度上实现了工具调用,也让我们刚才聊到的软件工程能力大幅提升。
49:56
And now they will go off for seconds, minutes, or even hours generating these hidden thoughts
然后它们会花上几秒、几分钟甚至几小时去生成这些隐藏的思考过程,然后才给你答案的第一个字。
50:02
before giving you the first word of your answer.
这整个就是关于inference time scaling,它在模型能力变化上带来了一种非常美妙的阶跃式提升。
50:04
And that's all about this inference time scaling, which is such a wonderful kind of
它们某种程度上实现了我们之前聊到的工具使用能力,也大幅提升了软件工程的水平。
50:08
step function in terms of how the models change abilities.
而当我们说“实现”的时候,这几乎完全归功于reinforcement learning with verifiable rewards训练——正是它让模型自己学会了这些技能。
50:12
They've kind of enabled this tool use stuff and enabled this much better software engineering
而当我们说“实现”时,几乎完全归功于强化学习这个下游环节。
50:16
that we were talking about.
计算规模大到一定程度,就像,为什么它会有尽头呢?
50:17
And this is when we say enabled almost entirely downstream of the fact that this reinforcement
这就是我们所说的,几乎完全依赖于强化学习这个基础。
50:23
learning with verifiable rewards training just kind of let the models pick up these skills
使用可验证奖励的训练方式,让模型自己学会了这些技能。所以当你训练模型时,它们很快就能掌握这些操作。可以在你的仓库里熟练使用CLI命令,帮你处理Git操作、移动文件、整理内容,或者搜索更多信息——这要是放在以前,简直解锁了巨大的价值。但问题是,接下来在类似方向上还能解锁什么,目前还不明朗。关于持续学习我们后面会聊到,不过现在某些领域确实炒得很热。
50:28
very easily.
非常容易。
50:29
So let the models learn, so if you look at the reasoning process when the models are generating
所以让模型去学习,如果你观察模型生成大量token时的推理过程,它经常会做的是:尝试一个工具,看看返回什么结果,再试另一个API,看看返回什么,然后看问题是否解决。
50:34
a lot of tokens, what it will be often doing is it tries a tool, it looks at what it gets
所以模型在训练过程中会很快学会这样做。
50:38
back, it tries another API, it sees what it gets back, and if it solves the problem.
最终,这就形成了一种通用的基础能力,让模型能在你的代码仓库里很好地使用CLI命令,帮你处理Git、移动文件、整理内容,或者搜索更多信息——就像我们坐在那里操作一样。
50:42
So the models when you're training them very quickly learn to do this.
所以模型在训练时,会非常快地学会做这件事。
50:46
And then at the end of the day, that gives this kind of general foundation where the model
说到底,这就建立了一个通用基础,让模型能在你的仓库里很好地使用CLI命令,帮你处理Git、移动文件、整理内容,或者搜索更多信息——要是我们坐下来想想,这简直释放了巨大的价值。但问题是,接下来在解锁这类功能方面,到底会走哪条路还不清楚。我们之后会聊到持续学习,不过现在围绕某些方向有很多热议,甚至预训练——你仍然看好它吗?
50:50
can use CLI commands very nicely in your repo and handle Git for you and move things
可以在你的仓库里很溜地用命令行,帮你处理 Git、移动文件、整理东西,或者搜索更多信息——光是这些,就已经解锁了巨大的价值,只要我们坐下来用起来就行。
50:55
around and organize things or search to find more information, which if we're sitting
但问题是,接下来在解锁这类功能方面,到底会走哪条路,现在还看不清楚。
51:00
in these chairs a year ago, it's something that we didn't really think of the models being
一年前坐在这椅子上时,我们根本没想过模型能做到这些。
51:04
doing.
所以这完全是今年才发生的事,彻底改变了我们对AI使用的认知——我觉得这非常神奇,是特别有趣的进化,也释放了巨大的价值。
51:05
So this is just kind of something that has happened this year and has totally transformed
但问题是,接下来要解锁类似的东西,方向并不明确。
51:09
how we think of using AI, which I think is very magical is such an interesting evolution
关于持续学习我们后面会聊到,不过现在某些话题确实炒得很热。
51:14
and just so unlocked so much value.
关于持续学习我们后面会聊到,但现在有很多 buzz,来自一些领导层和 AI 公司的人都在说,这玩意儿已经撑住了 13 个数量级的算力增长,那凭什么它会停下来呢?
51:18
But it's like, it's not clear what the next avenue will be in terms of unlocking stuff
但问题是,接下来在解锁类似能力方面,到底会有什么新方向,还不清楚。
51:23
like this.
关于持续学习我们后面会聊到,但现在有很多炒作,来自某些领导层、AI公司的人都在说,
51:24
There's that we'll get to continual learning later, but there's a lot of buzz around certain
但他们的意思是,这已经在13个数量级的算力规模上成立,那凭什么会停下来呢?
51:27
areas of AI, but no one knows when the next step function will really come.
AI的各个领域都在发展,但没人知道下一个阶跃式突破究竟何时到来。
51:32
So you've actually said quite a lot of things there and said profound things quickly.
你刚才其实说了很多内容,而且说得既深刻又简洁。
51:38
It would be nice to unpack them a little bit.
我们不妨稍微展开聊聊。
51:40
You say your bullish basic and every version of scaling.
你说你基本看好所有版本的scaling。
51:43
So we just even started the beginning, pre-training, are we kind of implying that the
那我们就从最基础的开始——pre-training,你是在暗示pre-training scaling的“低垂果实”已经被摘完了吗?pre-training是不是遇到了瓶颈?还是说,你依然看好pre-training?
51:51
low hanging fruit on pre-training scaling has been picked is pre-training hit a plateau
Pre-training的成本已经变得极其高昂了。
51:57
or is even pre-training still your bullish on.
或者说,连预训练(pre-training)你仍然看好吗?
52:01
Pre-training has gotten extremely expensive.
Pre-training 现在已经变得极其昂贵了。
52:03
I think to scale up pre-training, it's also implying that you're going to serve a very
我觉得要扩大pre-training的规模,也意味着你要给用户提供一个非常大的模型。所以我认为,大致上已经有个共识,像GPT4和类似的模型,最大的规模大概在一万亿参数左右。有很多传言说,随着训练效率提高,这些模型实际上已经变小了。你希望把模型做小,因为这样你的serving成本就会成比例地下降。这些模型,训练它们的成本相对于serving的成本来说其实很低。
52:08
large model to the users.
把大模型交付给用户。
52:10
So I think that it's been loosely established, the likes of GPT4 and similar models were
所以我觉得,大家大致已经公认,像 GPT4 这类模型,
52:15
around one trillion, like this order of trillion parameters at the biggest size.
最大规模时大概有一万亿参数左右。
52:19
There's a lot of rumors that they've actually gotten smaller as training has gotten more
有很多传言说,随着训练效率提升,这些模型实际上已经变小了。
52:22
efficient.
你想让模型变小,因为这样你的服务成本会成比例下降。
52:23
You want to make the model smaller because then your costs of serving go down proportionally.
这些模型,训练成本相对于服务成本来说其实很低。
52:28
These models, the cost of training them is really low relative to the cost of serving
这些模型,训练它们的成本相比推理(serving)成本其实很低。
52:32
them to hundreds of millions of users.
给数亿用户提供服务。
52:34
I think DeepSeek had this famous number of about $5 million for pre-training at cloud
我记得DeepSeek有个很出名的数字,按云服务市场价,预训练成本大概500万美元。
52:39
market rates.
论文第2.4节里,我们详细列出了GPU集群用于训练的时间,包括解决工程问题、多次尝试不同种子,租用这个集群处理训练模型的各种麻烦和头疼事,大概花了200万美元。
52:40
I think almost three, section 2.4 in the paper, we just detailed how long we had the GPU
这些模型其实挺……很多人花100万到1000万美元就能训练一个模型。
52:45
cluster sitting around for training, which includes engineering issues, multiple seeds,
训练时集群闲置的问题,这涉及工程上的麻烦、多个随机种子,
52:51
and it was about $2 million to rent the cluster to deal with all the problems and headaches
租用这个集群来处理训练模型带来的各种问题和头疼事,大概花了200万美元。
52:55
of training a model.
这些模型挺贵的,很多人能拿到100万到1000万美元来训练一个模型,
52:57
These models are pretty, a lot of people could get $1 to $10 million to train a model,
公司可能拥有数百万块GPU,你可以看看这些东西闲置着要花多少钱。
53:03
but the recurring costs of serving millions of users is really billions of dollars of
但为百万级用户提供服务的持续成本,实际上是数十亿美元的算力开销。
53:08
compute.
你看租用1000块GPU,每天就要花10万美元,而这些公司可能拥有数百万块GPU,光是闲置成本就高得惊人。
53:09
I think that you can look at 1,000 GPU rental, you can pay 100 grand a day for, and these
这确实是个大问题,而且关键在于——如果scaling真的能带来更好的模型,那它在财务上是否划算?我认为随着AI解决更多有实际价值的任务,这个问题会逐渐被消化。
53:14
companies could have millions of GPUs, you can look at how much of these things cost
这算是个大问题,然后就是,如果scaling真的能带来更好的模型,
53:19
to sit around.
它在经济上是否划算,我觉得这会慢慢把问题推得更远。
53:20
That's kind of a big thing, and then it's like if scaling is actually giving you a better
这是个挺重要的事,然后问题就变成了:如果规模扩展(scaling)真的能带来更好的模型,那它在财务上值得吗?我觉得这会慢慢推动它从人的领导层中扩散出来——AI公司虽然嘴上这么说,但他们其实在说,计算能力已经提升了13个数量级,凭什么它会停下来?
53:24
model, is it going to be financially worth it, and I think it will slowly push it out
这些都是2022年和2023年签下来的电力和数据中心合同,也就是在ChatGPT之前或刚出来那会儿。
53:29
as AI solves more compelling tasks.
随着AI解决越来越有吸引力的任务。
53:32
The likes of cloud opus 4.5, making cloud code, just work for things.
像 cloud opus 4.5 这种模型,让 cloud code 真的能直接干活。
53:36
I launched this project called The Adam Project, which is American Truly Open Models
我七月份启动了一个叫 The Adam Project 的项目,目标是做真正的美国开源模型,
53:42
in July, and that was a true vibe-coded website, and I have a job, make plots and stuff, and
那是个纯 vibe-coded 的网站,我平时的工作就是做图表之类的东西,
53:49
then I came back to refreshing in the last few weeks, and it's like cloud opus 4.5 versus
然后最近几周我又回来重新打磨了一下,发现 cloud opus 4.5 对比当时用的其他模型,
53:54
whatever model at the time was just crushed all the issues that it had from building in
直接碾压了六七月搭建时遇到的所有问题,而且它可能是个更大的模型。
53:58
June, July, and it might be a bigger model.
这里面涉及很多因素,但至少说明进步还在持续。
54:01
There's a lot of things that go into this, but that's like, there's still progress coming.
你刚才提到的其实是 scaling laws 中 y 轴上的细微差别,也就是说
54:04
So what you're speaking to is the nuance of the y-axis of the scaling laws that the way
所以你指的是 scaling laws 中 y 轴上的细微差别,也就是模型会如何变得更聪明?
54:09
it's experienced versus on a benchmark, the actual intelligence might be different.
在基准测试上表现是一回事,实际智能可能完全不同。
54:14
But still, you're intuition about pre-training of your scales, the size of compute.
但直觉上,关于pre-training的规模、计算量的大小——模型会变得更好吗?
54:20
Will the models get better?
先不谈财务可行性,仅从规律层面看,你觉得模型会变得更聪明吗?
54:22
Not whether it's financially viable, but just from the law aspect of it, do you think
是的,而且我认为这有时听起来像是AI公司领导层在说丧气话——但他们确实说过,这规律在13个数量级的计算规模上都成立,那凭什么它会终结呢?
54:27
the models will get smarter?
对,而且我觉得这有时听起来像是AI公司领导层在表达某种幻灭感,但他们又说,这已经在13个数量级的计算规模上成立,凭什么会终结呢?
54:28
Yeah, and I think that there's, and that sometimes comes off as almost like disillusioned
这些都是在2022年和2023年签署并寻求的数据中心电力合同,也就是在ChatGPT之前或刚出现的时候。
54:34
from people leadership, AI companies saying this, but they're like, it's held for 13 orders
你要评分的是那些补全结果,而强化学习就是围绕这个展开的。
54:39
of magnitude of computers, something like, why would it ever end?
你要评分的那些补全结果,强化学习就是围绕这个来的。
54:41
So I think fundamentally it is pretty unlikely to stop.
所以我覺得基本上,要阻止這件事挺難的。
54:45
It's just like, eventually, we're not even going to be able to test the bigger scales.
就像,到最後我們甚至沒辦法測試更大的規模。
54:48
Because of all the problems that come with more compute, I think that there's a lot of
因為隨著算力增加而來的各種問題,我覺得有很多討論說2026年會是超大規模Blackwell算力集群上線的一年,那種吉瓦級別的設施,也就是超大型雲端業者要開始運作了。
54:52
talk on how 2026 is a year when very large blackwell compute clusters, it's like Gingawatt
這些電力跟數據中心的合約,都是在2022跟2023年簽訂跟規劃的,也就是ChatGPT之前或剛出來的時候。
54:58
scale facilities, so hyper-scalers are coming online.
所以大概花了兩到三年的前置時間,才建好這些更大的集群來做訓練。
55:04
These were all contracts for power and data centers that were signed and sought out in
这些合同都是关于电力和数据中心的,在2022年和2023年签署并寻求的,也就是在ChatGPT出现之前或刚出现的时候。
55:09
like 22 and 2023, so before or right after chat GPT.
你会花一个月做post-training,但之后需要把它交给用户。
55:13
So it took this two to three year lead time to build these bigger clusters to train the
所以建造这些更大的集群来训练更大的模型,需要两到三年的前置时间,而我预计——应该说——我们会看到每月2000美元的订阅费。
55:17
models.
模型方面。
55:18
Well, there's obviously immense interest in building even more data centers than that.
显然,大家对建设更多数据中心有着巨大的兴趣。
55:22
So that is like kind of the crux that people are saying is like, these new clusters are
所以这就像是人们所说的关键点——这些新集群正在到来。
55:25
coming.
各大实验室将拥有更多用于训练的算力。
55:26
The labs are going to have more compute for training.
他们会利用这些资源,但这并非板上钉钉。
55:28
They're going to utilize this, but it's not a given.
而且,我看到了太多进展,以至于我对此抱有期待,我期待模型会稍微更大一些,
55:31
And it's like, I've seen so much progress that I expect it, and I expect a little bit
我预计——更准确地说,我们会看到每月2000美元的订阅服务。
55:35
bigger models, and I expect I would say it's more like we will see a $2,000 subscription
你仍然想要你能得到的最好的基础模型。
55:41
this year.
今年。
55:42
We see $200 subscriptions.
我们看到200美元的订阅。
55:43
It's like that can 10x again.
这可能会再翻十倍。
55:45
And these are the kind of things that could come, and they're all downstream of this like
而这类事情都有可能发生,它们都源于这个
55:49
bit, bit, bit bigger model that offers just a little bit more cutting edge.
稍微、稍微、再稍微大一点点的模型,能提供更前沿一点点的能力。
55:53
So it's reported that XAI is going to hit that one Gingawatt scale, early 26.
据报道,XAI将在26年初达到1吉瓦规模。
56:00
And full two gigawatt by year end.
到年底达到满负荷2吉瓦。
56:04
How do you think they'll utilize that in the context of scaling laws?
你觉得在扩展定律的背景下,他们会如何利用这些算力?
56:08
There's a lot of that inference, there's a lot of that training.
推理的部分很多,训练的部分也很多。
56:12
It ends up being all of the above.
最终其实是以上所有因素的综合。
56:15
So I think that all of your decisions when you're training a model come back to pre-training.
所以我认为,你在训练模型时做的所有决策,最终都会回到pre-training上。
56:20
So if you're going to scale RL and model, you still need to decide on your architecture
因此,如果你要扩展RL和模型规模,你仍然需要决定你的架构
56:24
that enables this.
是否能够支持这一点。
56:25
We were talking about like other architectures than using different types of attention.
我们之前聊过其他架构,比如使用不同类型的attention。
56:30
We were also talking about mixture of experts models.
我们还聊到了mixture of experts模型。
56:32
This sparse nature of MME models makes it much more efficient to do generation, which
这种MME模型的稀疏特性,使得生成过程更加高效。
56:38
becomes a big part of post-training.
成为后训练(post-training)中很重要的一部分。
56:40
And it's like you need to have your architecture ready so that you can actually scale up this
而且你得先把架构准备好,才能真正把这种算力(compute)规模往上提。
56:44
compute.
不过我觉得大部分算力还是投在预训练(pre-training)阶段,因为这样还能继续把模型做得更好。
56:45
And still think most of the compute is going in at pre-training because you can still
你还是得回头去反复打磨。
56:50
make a model better.
你始终想要一个尽可能好的基础模型(base model)。
56:51
You still want to go and revisit this.
再过几年,这个方向会趋于饱和,而强化学习(RL)的算力消耗只会持续增长。
56:53
You still want the best base model that you can.
再过几年,这个趋势会饱和,而RL计算只会持续更长时间。
56:55
And in a few years that I'll saturate and the RL compute will just go longer.
所以RL领域的低垂果实其实在别处。
57:00
Is there people who disagree with you that say basically pre-training is dead?
有没有人不同意你的观点,觉得pre-training基本已经死了?
57:06
It's all about scaling inference, scaling post-training, scaling context, continuing learning,
重点全在scaling inference、scaling post-training、scaling context、continuing learning、
57:12
scaling data, synthetic data.
scaling data、synthetic data上。
57:15
People vibe that way and describe it in that way, but I think it's not the practice
大家有这种感觉,也这么描述,但我觉得实际做法并不是这样。
57:19
that is happening.
这只是大家普遍的一种情绪,说这东西已经过时了。
57:20
It's just a general vibe of people saying this thing's dead.
兴奋点在其他地方。
57:22
The excitement is elsewhere.
所以RL里的低垂果实也在别处。
57:23
So the low-hands fruit in RL is elsewhere.
它并不是一个大模型。
57:25
For example, we released our model in November for every company has deadlines, our deadline
比如,我们在十一月发布了模型——每家公司都有截止日期,我们的截止日是11月20号,而RL跑了五天。相比2024年,对一个300亿参数的模型来说,光是做post-training就要花这么久,其实不算大模型了。
57:30
was November 20th, and our RL run was five days, which compared to 2024 is a very long
然后到了十二月,我们又发了一个版本,只是让RL继续跑了三周半,模型效果明显更好了,所以就发布了。
57:36
time to just be doing post-training at a model of 30 billion parameters.
把这么多时间全投在一年里最顶峰的成果上,确实是一大块投入。
57:40
It's not a big model.
然后在十二月,我们又发布了一个版本,只是让RL运行再持续了三周半,模型变得明显更好了,于是我们就发布了它。
57:41
And then in December, we have another release, which is just we let the RL run go for another
然后到了十二月,我们又发布了一个版本,就是让强化学习再多跑了三周半,模型效果明显更好了,所以就发布了。
57:46
three and a half weeks, and the model got notified better, so we release it.
这一年下来,总不能一直放着不管。
57:49
And that's a big amount of time to just allocate to something that is going to be your peak
这得花大量时间,就为了搞出个年度巅峰之作,实在没法一直拖着。你得不断把研究人员的改进成果加进去。所以就像重新做一遍预训练,然后花一个月做后训练,但之后还得交给用户用,还得做安全测试。所以我觉得,很多环节都在强化这个循环。
57:55
for the year.
你得不断把研究人员的改进成果整合进去。
57:56
So it's like the types of decisions that happen when they're training a model where they
所以,训练模型时做的那些决策,就是不能放着不管。你得不断把研究人员的改进成果加进去。比如重新做一遍pre-training,然后花一个月做post-training,但之后还得交给用户用,还得做安全测试。所以我觉得,很多因素都在推动这个循环——就是不停地更新模型。
58:00
just can't leave it forever.
这就好比重新做一遍预训练。
58:03
You have to keep pulling in the improvements you have from your researchers.
后训练花上一个月,但之后就得交给用户了。
58:07
So that's like you redo pre-training.
还得做安全测试。
58:09
You'll do this post-training for a month, but then you need to give it to your users.
你需要做safety testing。
58:13
You need to do safety testing.
另一边,你会有actors,它们生成completions,而这些completions就是你要评分的内容,reinforcement learning的核心就是——
58:15
So there's kind of just like, I think there's a lot in place that reinforces the cycle
其实现在有很多因素在强化这个循环。
58:19
of just keep updating the models.
就是不断更新模型。
58:21
There's things to improve.
还有改进空间。
58:22
If you get a new compute cluster that lets you do something maybe more stable, or you're
如果你拿到一个新的计算集群,能让你做更稳定或者更快的训练,就像你经常听到Blackwell在部署上出问题一样——在AI2,大部分模型的预训练大概只用1到2000块GPU,但当你用1万或10万块GPU做预训练时,遇到的故障类型就完全不同了。
58:26
faster, it's like you hear a lot about Blackwell having rollout issues, where at AI2, most
GPU是出了名地会以各种奇怪的方式出问题,而跑10万块GPU的任务,基本上可以保证至少有一块GPU是宕机的。
58:32
of the models were pre-training around like one to 2,000 GPUs, but when you're pre-training
所以你的训练代码必须能处理这种冗余,这完全是另一种挑战。
58:37
on 10,000 or 100,000 GPUs, you hit very different failures.
在1万或10万块GPU上跑,你会遇到完全不同的故障。
58:40
So GPUs are known to break in weird ways, and doing 100,000 GPU run is like, you're pretty
GPU本来就容易以各种奇怪的方式出问题,跑10万块GPU的集群,基本上可以保证至少有一块GPU是宕机的。
58:44
much guaranteed to always have at least one GPU that is down.
你的训练代码必须处理这种冗余,这完全是另一种挑战。
58:47
And you need to have your training code handle that redundancy, which is just a very different
而像我们这样,我在DJX Barker上做post-training,你手头有书,或者那些学ML的人,他们训练这些超大模型要对抗的,其实就是大规模分布式计算带来的挑战,这完全是另一回事。
58:50
problem.
问题在于,像我们现在做的,我在一台 DJX Barker 上玩后训练(post-training),你有你的书,或者那些学机器学习(ML)的人,他们真正在对抗的是训练这些超大模型时那种大规模分布式规模(mass distributed scale),这完全是另一回事。但这跟另一个问题又有点不同——为了支撑缩放定律(scaling laws),尤其是预训练(pre-training),你需要所有这些 GPU 同时工作,这本身是个系统问题。而当我们转向强化学习(reinforcement learning)时,它其实更适合异构计算(heterogeneous compute)。
58:51
Whereas like, what we're doing, like, I'm playing with post-training on a DJX Barker,
相比之下,我们正在做的事情——比如我在DJX Barker上捣鼓后训练,
58:55
you have your book, or people learning ML, it's like, what they're battling to train
你有你的书,或者有人在学机器学习——他们训练这些超大模型时真正要对抗的,就是大规模分布式扩展,这完全是另一回事。
58:59
these biggest models is just like, mass distributed scale, and it's a very different.
当我们转向强化学习时,它其实更适合异构计算。
59:06
But that's somewhat different than like are these, like that's a systems problem in
但这跟那种情况有点不同——为了实现scaling laws,尤其是在pre-training阶段,你需要一次性把所有GPU都用上。
59:11
order to enable the scaling laws, especially a pre-training, you need all of these GPUs
当我们转向reinforcement learning时,它实际上更适合异构计算,relative policy optimization和GRPO是两类主流方法。
59:16
at once.
另一边,你会有actors来生成completions,而这些completions就是你要评分的内容,reinforcement learning的核心就在于这种高网络计算成本来完成实际的学习过程,也就是你要计算梯度的时候。
59:17
When we shift to reinforcement learning, it actually lends itself to heterogeneous compute
相对策略优化和GRPO是目前最主流的两类方法。
59:22
because you have many copies of the model, and to do a primer for a language model, reinforcement
因为你会有多个模型副本,而要给语言模型做强化学习,你需要用到两组GPU。
59:28
learning, what you're doing is you have two sets of GPUs.
一组你可以叫它actor,另一组叫learner。
59:31
One is, you can call it the actor, and one you call the learner.
learner负责执行实际的强化学习更新。
59:35
The learner is where your actual reinforcement learning updates are going to do.
这些传统上是策略梯度算法,近端策略优化PPO和群体相对策略优化GRPO是两类主流方法。
59:39
These are traditionally policy-grading algorithms, proximal policy optimization, PPO, and group
另一边,你会部署actors,它们负责生成补全内容,而这些补全就是你要评分的东西——强化学习的核心就在于此。
59:45
relative policy optimization, GRPO are the two popular classes.
另一边,你会有actor模型来生成补全内容,而这些补全内容就是你要评分的东西——强化学习的核心就在于此。
59:50
On the other side, you're going to have actors, which are generating completions, and these
假设有无限的算力资源,你想做所有的事情,所以你有training,你有inference scaling,而training就像一个层级结构,它是pre-training加上training。
59:54
completions are the things that you're going to grade, reinforcement learning is all about
预训练就像固定成本,你把模型训练好,然后它就有了这个能力。
59:58
optimizing reward.
优化奖励函数。
60:00
And in practice, what you can do is that you can have a lot of different actors in different
实际上,你可以让全球不同地区的多个执行器处理不同类型的问题,然后将结果传回高网络计算成本的节点进行实际学习——也就是计算梯度,这时你需要一个紧密耦合的网络来实现不同类型的并行计算,并将模型分散部署以实现高效训练。
60:04
parts of the world doing different types of problems, and then you send it back to
所以,无论是训练还是推理服务,每种类型都有大量类似的考量因素,都需要进行扩展。
60:08
this highly network compute cost to do this actual learning, where you take the gradients
这种高网络计算成本用于实际学习,就是你要拿gradients(梯度)
60:15
and you need to have a tightly mesh network where you can do different types of parallelism
而且你需要一个紧密耦合的网络,才能实现不同类型的并行计算,把模型分散开来进行高效训练。所以训练和推理的各个环节都有大量不同的考量因素,都需要扩展。比如,怎么为一个要思考一小时才能给出答案的模型,服务一亿用户?这个我真不太清楚,但我知道这是个难题。为了把这种智能带给人们,背后有各种系统层面的问题,我们需要更多的算力,而且还需要更稳定的算力来支撑。
60:19
and spread out your model for efficient training.
然后分散到模型里去做高效训练。
60:21
So there's just like a lot of every different type of training and serving has these considerations
所以各种不同类型的training和serving都有这些考量——
60:27
you need to scale.
你需要scale(扩展)。
60:28
We talked about pre-training, we talked about RL, and then inference time scaling is like,
我们聊了预训练,也聊了强化学习,然后推理时扩展就像是,你怎么把一个需要思考一小时才能回答的模型,服务给一亿用户?这个我还真不太清楚,但我知道这是个难题。为了把这种智能带给人们,背后有各种系统层面的问题,我们需要更多的算力,而且需要更稳定的算力来实现。但我听下来,你对所有这些扩展方向都很看好——无论是推理、推理能力,还是预训练。对,这其实是个很大的话题,但基本上有两个关键调节点:训练。
60:31
how do you serve a model that's thinking for an hour to 100 million users?
怎么去serve一个要思考一小时、面向1亿用户的模型?
60:36
I don't really know about that, but I know that's a hard problem, and in order to give
这个我真不太清楚,但我知道这是个难题。而且为了给人们这种intelligence(智能),
60:40
people this intelligence, there's all the systems problems, and we need more compute,
背后有各种系统层面的问题,我们需要更多compute(算力),
60:44
and you need more stable compute to do it.
还需要更稳定的compute才能做到。
60:46
But your bullish on all of these kinds of scaling is what I'm hearing on the inference,
所以你的意思是,你对所有这些 scaling 都持乐观态度——包括 inference、reasoning,甚至 pre-training。
60:51
on the reasoning, even on the pre-training.
对,这其实是个大话题,但基本上有两个关键点:training 和 inference scaling。假设有无限的计算资源,你当然想全都做。Training 本身是个层级结构,包括 pre-training 和 post-training,比如改变模型大小、增加训练数据、训练更大的模型,这样模型就能获得更多知识。然后这个模型,可以说,变成了一个更好的基础模型——以前我们叫它 foundation model。
60:54
Yeah, so that's a big kind of worms here, but basically two, the knobs are the training
嗯,这里其实是个挺大的话题,但简单来说,两个关键调节点就是训练。假设你有无限的计算资源,那当然全都做。所以有训练,还有推理扩展。训练本身是个层级结构:预训练、训练后的后训练,调整模型大小、增加训练数据、训练更大的模型——这些都能让模型获得更多知识。然后这个模型,比如说,就成了一个更好的基础模型。以前我们管它叫基座模型。在预训练期间或者预训练之后,你还会经历其他解锁阶段,这些阶段能释放模型在预训练中已经具备的知识能力。
60:59
and the inference scanning where you can get gains, and so in a world where we had, let's
推理阶段的优化也能带来收益,所以在一个假设拥有无限计算资源的世界里,你当然希望把所有环节都做全——既有训练,也有推理扩展。而训练本身就像是一个层级结构:先是预训练,然后是训练后的后训练,调整模型规模、增加训练数据、训练更大的模型,这些都能让模型获得更多知识。这样一来,模型本身就更强了,就像是一个更好的基础模型——以前我们管它叫基础模型。它能解锁更多能力,但即便经过了预训练或后训练,模型也未必能解决你最复杂的任务,所以后面还有其他的解锁阶段。
61:05
say infinite compute resources, you want to do all of them, so you have training, you
假设你有无限的算力资源,你当然想全都做,所以有训练,也有推理扩展。训练本身是个层级结构,包括预训练和当前的训练阶段。尤其是你看推理扩展,这是今年O1模型带来的最大收益之一——它用一个小得多的模型,效果却超过了预训练一个更大的模型,比如GPD 4.5。所以,我不会说预训练扩展已经过时了,只是说,你懂的,你仍然希望在预训练上取得一些进展。另外还要考虑你愿意把钱花在哪里。如果你把更多钱花在预训练上,那就像一笔固定成本——你把模型训练出来,然后它就固定在那里了。
61:09
have inference scaling, and training is like a hierarchy, it's pre-training with training
有 inference scaling,而训练就像是一个层级结构,先是 pre-training 加上 training。
61:13
post-training, changing the model size, more training data, making training a bigger model,
后训练、调整模型规模、增加训练数据、训练更大的模型,
61:19
gives you more knowledge in the model, then the model, let's say, has a better, it's
能让模型拥有更多知识,然后这个模型,可以说,基础更好,
61:23
like a better base model, back in the day, we still, we call it foundation model, and it
以前我们还会叫它基础模型,
61:27
unlocks, but you don't, let's say, have the model be able to solve your most complex task
解锁了,但比如说,你并没有让模型能够解决你最复杂的任务。在pre-training期间,或者pre-training之后,你仍然有这些其他的解锁阶段,用来释放模型在pre-training中已经具备的知识能力。而且我觉得,当然,如果你做更多的pre-training,你会得到一个更好的基础模型,之后可以再解锁,但就像Nathan说的,那样做成本太高了。我们没有无限的compute,所以你必须决定:我是要把这些compute花在让模型变得更大上,还是——你知道,这就像个权衡。在理想情况下,你当然想全都做。从这个角度看,scaling依然很重要,你仍然会——
61:34
during pre-training, or after pre-training, you still have these other unlock phases where
在预训练期间或预训练之后,你仍然需要经历其他解锁阶段,
61:38
you have mid-training or non-context, for example, post-training with a lot we are, that
你有mid-training或者没有上下文的情况,比如post-training里加了很多东西,这就能解锁模型在pre-training中已经具备的知识能力。我觉得,当然,如果你做更多的pre-training,你会得到一个更好的基础模型,之后可以再解锁更多能力。但就像Nathan说的,那样成本太高了,我们没有无限的算力,所以你必须做出选择:是把算力更多地花在把模型做大上,但你知道,这就像个权衡。理想情况下,你当然想全都做。从这个角度看,scaling其实还是有效的,你仍然能得到更好的模型。但就像我们在GPT-4.5上看到的,根本不值得,我是说,真的不值得。
61:43
unlocks capabilities that the model has in terms of just knowledge in the pre-training,
这些阶段能释放模型在预训练中积累的知识所对应的能力,
61:47
and I think, sure, if you, so do mod pre-training, you get a better base model that you can unlock
而且我觉得,确实,如果你做更多的pre-training,你会得到一个更好的基础模型,以后可以解锁更多能力,但就像Nathan说的,这变得太贵了,我们没有无限的compute,所以你必须做出选择——我是想把compute更多地花在把模型做得更大上,但你知道,这就像个trade-off。理想情况下,你当然想全都做,我觉得从这个意义上说,scaling仍然很有生命力,尤其是在当前这个时刻,特别是如果你看inference scaling,那是今年O1带来的最大收益之一,它让一个更小的模型走得更远,甚至超过了像GPD 4.5这样更大的模型通过pre-training能达到的效果。所以,我不会说pre-training scaling已经死了,它只是……
61:53
later, but like Nathan said, it just becomes too expensive, so we don't have infinite
但就像Nathan说的,这变得太贵了,我们没有无限的算力,
61:56
compute, so you have to decide, do I want to spend that compute more on making the model
所以你必须决定,是把算力更多地花在把模型做大上,
62:01
larger, but, you know, it's like a trade-off, it's like in an ideal world, you want to do
但你知道,这就像个权衡,理想情况下你当然想都做。
62:04
all of them, and I think in that sense, scaling is still pretty much a life, you would still
它们都是,我觉得从这个角度看,scaling 依然很有生命力,尤其是现在,如果你看看 inference scaling,那是今年最大的突破之一,比如 O1,它用一个更小的模型就超越了像 GPD 4.5 这样通过更大规模 pre-training 训练出来的模型。所以,我不会说 pre-training scaling 已经死了,只是说,你懂的,你仍然希望在 pre-training 上取得一些进展。问题还在于你要把钱花在哪里,如果你把钱更多地花在 pre-training 上,那就像一笔固定成本,你训练完模型,它就有了某种能力。这些年情况其实有点变化,以前人们什么都往里扔。
62:08
get a better model, but like we saw with GPD 4.5, it's just not worth it, I mean, it's like,
得到一个更好的模型,但就像我们在GPD 4.5上看到的那样,根本不值得,我是说,现在这个阶段,尤其是如果你看inference scaling,那是今年O1带来的最大收益之一,它让一个更小的模型比预训练一个像GPD 4.5这样更大的模型走得更远,所以我觉得,我不会说pre-training scaling已经死了,只是说现在有其他更有吸引力的scaling方式,但到了某个时候,你知道,你仍然想在pre-training上取得一些进展。另外还要考虑你愿意把钱花在哪里,如果你更多地花在pre-training上,那就像一笔固定成本,你训练好模型,然后它就拥有这个能力。
62:13
because you can, let's say you can unlock more performance with other techniques at that
因为你看,假设在当前阶段,你可以用其他技术解锁更多性能,尤其是看看inference scaling,这是今年O1最大的收益之一——它让一个较小的模型比预训练一个更大的模型(比如GPD 4.5)走得更远。所以,我不会说pre-training scaling已经死了,只是说现在有其他更有吸引力的扩展方式,但到了某个时候,你懂的,你仍然需要在pre-training上取得一些进展。另外还要考虑你的钱花在哪里,如果你把钱更多花在pre-training上,那就像一笔固定成本——你训练好模型,然后它就固定了。
62:18
current moment, especially if you look at inference scaling, that's one of the biggest gains
当前这个节点,尤其是如果你看 inference scaling,那是最大的收益来源之一。
62:23
this year with O1, where it took a smaller model further than pre-training a larger model
今年 O1 就做到了这一点,它用一个更小的模型,比 pre-training 一个更大的模型(比如 GPD 4.5)走得更远。所以,我不会说 pre-training scaling 已经死了,只是说,
62:30
like GPD 4.5, so it's like, I wouldn't say pre-training scaling is dead, it's just like
你知道,你肯定还是想在 pre-training 上取得一些进展。
62:34
there are other more attractive ways to scale right now at the moment, but at some point,
目前还有其他更有吸引力的扩展方式,但到了某个节点,你肯定还是想在预训练上取得一些进展。问题在于你要考虑把钱花在哪里——如果更多地投入预训练,那就像一笔固定成本,你训练完模型之后,它就有了……这些年其实也有一点变化,从某种意义上说,以前人们会把所有东西都扔进去,比如一篇维基百科文章,然后把它改写成问答形式,或者做摘要、换种说法,用这种方式制造更好的数据。因为我也是这么想的,就像人类一样,比如说,一个人读了一本书,相比起乱七八糟的……嗯,你懂的。
62:39
you know, you will still want to make some progress on the pre-training.
问题还在于你要把钱花在哪里,如果你把钱更多地花在 pre-training 上,那就像一笔固定成本,你训练好模型,然后它就有了这个能力。
62:42
The thing is also to consider where you want to spend your money, if you spend it more
总结一下,就是重新措辞,用这种方式生成更好的数据,因为我也这么想。
62:48
on the pre-training, it's like a fixed cost, you train the model, and then it has this
在pre-training阶段,这就像固定成本,你训练模型,然后它就具备了这种能力。
62:52
capability forever, you can always use it, and so forth.
能力是永久的,你可以一直用,等等。
62:56
With inference scaling, you don't spend money during training, you spend money later
有了推理扩展,你训练时不用花钱,而是之后每次查询才花钱。
63:00
per query, and then it's also like the math, how long is my model going to be on the market,
而且这还涉及数学问题:我的模型能在市场上存在多久?
63:04
if I replace that in half a year, maybe it's not worth spending $10,000,000,000 on the
如果半年后就要替换,那可能不值得花一百亿美元去训练;
63:10
training, it's longer, maybe it's just, I will just do more inference scaling and get
如果时间更长,也许我只需要多做推理扩展,从那里获取性能,
63:16
the performance from there, it may cost me two million in terms of user queries, it becomes
在用户查询上可能只花两百万美元。这就变成了你有多少用户的问题,然后算一笔账。
63:20
a question of how many users you have and then doing the math, and I think that's also
我觉得这也是有趣的地方——GGPD 处于一个有利位置,我认为他们有很多用户。
63:24
where it's interesting, where GGPD is in a position, I think they have a lot of users,
有意思的地方在于,GGPD 现在处于一个有利位置,我觉得他们用户量很大。
63:28
where they need to go a bit cheaper, where they have that GGPD5 model that is a bit smaller,
有些地方他们需要更便宜的方案,比如那个GGPD5模型,体积小一点。
63:32
other companies that have, I say, if your customers have other trade-offs, for example,
其他公司,比如我说,如果你的客户有其他权衡,举个例子,
63:39
there was also the math Olympiad, or some of these math problems, where GGPD, or maybe
还有数学奥赛题,或者一些数学问题,GGPD可能,或者
63:46
they had a proprietary model, and I'm pretty sure it's just like a model that has been
他们有一个自研模型,我敢肯定它就是一个模型,可能
63:49
maybe fine tuned a little bit more, but most of it was doing inference scaling to achieve
稍微多微调了一点,但大部分是靠推理时扩展来
63:54
the peak performance in certain tasks, where you don't need that all the time.
在某些任务上达到巅峰表现,而这些任务你并不需要一直用。
63:57
But yeah, long story short, I do think all of these pre-training, mid-training, post-training,
但总之,长话短说,我确实认为所有这些预训练、中期训练、后训练、
64:03
inference scaling, they are all still things you want to do, it's just finding, at the moment,
推理时扩展,都还是你想做的事情,只是目前需要找到平衡点。
64:08
in this year, it's finding the right ratio that gives you the best bang for the bark basically.
今年,关键就在于找到合适的比例,让每一分投入都能换来最大的回报,说白了就是性价比最高。
64:12
I think this might be a good place to define pre-training, mid-training, and post-training.
我觉得这里正好可以定义一下预训练、中期训练和后训练。
64:18
So pre-training is the classic training, one next token prediction at a time, you have
预训练就是经典的训练方式,一次预测一个token,用的是大规模的数据集。Nathan Hoi在这方面也有一个很有意思的见解,因为论文里很大一部分篇幅都在讲如何搭配数据比例。
64:22
a big corpus of data, and Nathan Hoi also has a very interesting insight there, because
所以预训练本质上就是,你知道的,用交叉熵损失函数,在互联网数据、书籍、论文等海量语料上做下一个token预测。
64:26
of almost three, it's a big portion of the paper focuses on the right data mix.
这些年它也有了一些变化,以前人们是什么数据都往里塞。
64:31
So pre-training is essentially just, you know, across entropy loss, training on next token
所以 pre-training 本质上就是,你知道的,基于 cross entropy loss,在大量互联网数据、书籍、论文等等上面做 next token prediction。
64:35
prediction, on a vast corpus of internet data books, papers, and so forth.
这些年其实也有一点变化,以前人们会把各种东西都扔进去,比如一篇维基百科文章,然后把它改写成 Q&A 问答的形式,或者做摘要、换种说法,用这种方式来制造更好的数据。因为我觉得这跟人类一样,比如说,一个人读一本书,跟读一篇乱七八糟的——我没别的意思——比如 Reddit 帖子相比,我觉得还是有差别的。
64:41
It has changed a little bit over the years, in a sense, people used to throw in everything
这些年其实变化了一些,以前大家什么都往里塞,做总结、改写,用这种方式生成更好的数据。因为我觉得这跟人类很像,比如说,一个人读一本书,跟读一堆乱七八糟的东西相比——比如,拿长上下文文档来说吧,这就是一个例子。并行处理的时候,我好像丢了点什么,自己也搞不清是什么。我不想,不想,不想,不想,不想,网上那些格式不容易用文本编码的内容。另外,还用 deep sea OCR,我就叫它我们的 OCR,来提取可能上万亿的内容。
64:45
they can.
可以的。
64:46
Now, it's not just raw data, it's also synthetic data, where people re, let's say, rephrase
现在不只是原始数据,还有合成数据,比如人们会对某些内容进行改写。
64:53
certain things.
合成数据不一定完全是AI凭空编造的数据,它也可以是从一篇文章、一篇维基百科里提取内容,然后改写成问答形式,或者做摘要、换种说法,从而生成更优质的数据。
64:55
So synthetic data doesn't necessarily mean purely AI made up data, it's also taking
因为我觉得这跟人类的情况类似——比如说,一个人读了一本书,跟读一篇乱七八糟的帖子(无意冒犯)相比,效果肯定不一样,对吧?我觉得确实如此。
65:00
something from an article, Wikipedia article, and then rephrasing it as a Q&A question, or
从一篇维基百科文章里提取内容,然后把它改写成问答形式,或者总结、重新措辞,用这种方式生成更好的数据。因为我觉得这就像人类一样,比如说,有人读了一本书,相比起杂乱无章的内容——比如专注于长上下文,举个例子,你有长文档的上下文。并行处理,我好像丢了什么东西,但不知道是什么。我不想,我不想,我不想,我不想,我不想,那些网页的格式不容易用文本编码。另外,用这种深海OCR,我称之为我们的OCR,来提取可能达到万亿级别的数据。
65:07
summarizing it, re-wording it, and making better data that way, because I think of it also
总结一下,重新措辞,然后用这种方式生成更好的数据,因为我也这么想。
65:13
like with humans, if someone, let's say, reads the book compared to a messy, I don't know,
就像人类一样,如果某人,比如说,读了那本书,相比一个乱七八糟的,我也不知道,
65:18
offense, but like read it post or something like that, I do think you know, I think it's
说真的,你去读一下那个帖子或者类似的东西,我觉得吧,确实是这样。
65:25
going to be a post about this, some read it data is very coveted and excellent for training,
会有一篇关于这个的帖子,有些阅读数据非常珍贵,对训练来说也很棒,
65:31
you just have to filter it.
你只需要过滤一下。
65:33
I think that's the idea.
我觉得就是这个思路。
65:34
I think it's like, if someone took that and rephrases that in a, let's say, more concise
我的想法是,如果有人拿那个内容,用一种更简洁、更有条理的方式重新表述,
65:41
and structured way,
那这就是更高质量的数据,最终可能得到同样的结果,但能更快达到目标,训练速度也更快,因为,比如说,如果语法和标点都正确,它就已经在学习正确的表达方式了。
65:43
I think it's higher quality data that gets the, and maybe the same, you get the same
我觉得是更高质量的数据起到了作用,可能到最后数据量差不多,但训练速度更快,因为——比如说,如果语法和标点都正确,模型从一开始就在学习正确的方式。
65:48
a lot of it at the end, but it gets there faster, it trains faster, because the, let's
至于中期训练,以前其实叫预训练,现在改叫中期训练,是因为只有预训练和后训练,中间缺一个阶段,对吧?
65:52
say, if the grammar and the punctuation is correct, it already learns the correct way
我会说,在预训练阶段,算法本身是一样的,但你会专门针对某些方向,比如长上下文——举个例子,你会用长文本的文档来训练。
65:57
versus getting information from a messy way and then learning later how to correct that
相比于从杂乱无章的方式获取信息,之后再学习如何修正这些信息,等等。
66:01
and stuff like that.
所以我认为,这就是预训练(pre-training)如何演进的,以及为什么扩展(scaling)依然有效的原因——
66:02
So I think that is how pre-training evolved and how, how still, why scaling still works
这不仅仅关乎数据量,也在于那些让数据对你更有利的技巧。
66:09
is that it's not about just the amount of data, it's also the tricks to make that data
而中期训练(mid-training),我的意思是,它以前也被称为预训练(pre-training),现在叫中期训练是因为——
66:16
better for you in a sense.
如果只有预训练(pre-training)和后训练(post-training),中间却什么都没有,那会很别扭,对吧?
66:17
And then mid-training is, I mean, it used to be called pre-training, I think it's called
然后mid-training呢,就是以前叫pre-training,现在叫mid-training,是因为pre-training和post-training中间没有东西,叫起来很别扭,对吧?
66:22
mid-training because it was awkward to have pre-training and post-training, but nothing
我会说,专注于pre-training的话,算法其实是一样的,但你要做的就是把重点放在某些方面,比如长上下文,举个例子,就是处理长文档。
66:25
in the middle, right?
并行化,我好像漏掉了什么,但想不起来是什么了。
66:26
It sounds a bit weird, you have pre-training and post-training, but what's the actual
听起来有点奇怪,有pre-training和post-training,那实际的training到底是什么?
66:29
training?
Mid-training通常和pre-training类似,但你知道,它更偏向于——我会说——在pre-training的基础上更专门化一些,算法是一样的,但你会专注于某些方面,比如长上下文,举个例子,你会有长上下文文档。
66:30
So the mid-training is usually similar to pre-training, but you know, it's a bit more,
之所以不在pre-training阶段做这个,是因为你没有那么多长上下文文档,所以你需要一个专门的阶段。而且算法的一个问题在于,它本质上还是个神经网络,存在灾难性遗忘的问题,所以你教它新东西的时候……
66:35
I would say, specialized in pre-training, it's the same algorithm, but what you do is you
我不想,我不想,我不想,我不想,我不想。
66:39
focus, for example, on long contact, like it's one example, you have long context documents.
比如专注于长上下文,举个例子,你有长上下文文档。
66:44
The reason you don't do that during just pre-training is because you don't have that many long
只在 pre-training 阶段不做这个的原因,是因为你没有那么多长上下文文档,所以会有一个专门的阶段。而算法的一个问题也依然存在——它毕竟是神经网络,有灾难性遗忘的问题,所以你得教它。
66:48
context documents, so you have a specific phase and one problem of algorithms is also still,
是啊,我拼命想学那么多 AI 知识,比如我在学 pre-training 的并行化,结果发现——我好像丢了什么东西,而且我完全想不起来是什么。
66:53
it's a neural network, it has the problem of catastrophic forgetting, so you teach it
我不想,我不想,我不想,我不想,我不想——
66:57
something, it forgets other things and you want to, it's not 100% forgetting, but
有些东西它会忘掉别的,而且你希望它别完全忘掉,但
67:01
you know, it's like no freelance you can, it's also the same with humans, if you ask
你知道,这就像没有自由职业者能完全记住一样,人类也是这样的。如果你问我十年前的数学题,我也不知道,我得重新看一遍。
67:05
me some math, I learned 10 years ago, I don't know, I would have to look at it again.
Nathan 其实在说他看了太多内容,出现了灾难性遗忘的问题。
67:09
Nathan was actually saying that he's consuming so much content, there's a catastrophic
是啊,我拼命想学 AI 的东西,比如我在学 pre-training parallelism,结果我忘了点什么,而且我都不记得是什么了。
67:13
forgetting issue.
我不想,我不想,我不想,我不想,我不想。
67:14
Yeah, I'm like trying to learn so much about AI, I was like, I was learning about pre-training
并不是越多越好,因为,嗯,这就像要有所选择。而 mid-training 就是在最后阶段,对高质量内容进行筛选。
67:18
parallelism, I'm like, I lost something and I don't know what it was.
并行处理,我就觉得,我丢了什么东西,而且不知道是什么。
67:21
I don't want to, I don't want to, I don't want to, I don't want to, I don't want to,
我不想,我不想,我不想,我不想,我不想,
67:24
but it's I think the same kind of in that sense, how humans learn, I mean, the quantity
但我觉得,从某种意义上来说,这和人类学习是一样的——数量并不总是越好,对吧?关键在于选择性,而中期训练就是在最后阶段对高质量内容进行筛选。所以模型最后看到的东西都是高质量的。而后训练阶段则包括所有微调、监督式微调、DPO、基于可验证奖励的强化学习、人类反馈等等。这些就是精炼阶段。另外有意思的是成本问题,对吧?你看,预训练现在要花很多钱,而RL稍微少一点。
67:29
is not always better because yeah, it's like being selective and the mid-training is being
并不是越多越好,因为关键在于筛选,而中期训练就是在最后阶段对高质量内容进行筛选。
67:33
selective in terms of quality content at the end.
我觉得目前在生产环境中没人会拿玩具示例来这么做,对吧?
67:36
So the last thing the element has seen is the quality stuff.
所以模型最后看到的数据,就是那些高质量的内容。
67:39
And then post-training is all the fine tuning, supervised fine tuning, DPO, reinforcement
而后训练阶段则包括所有微调工作,比如监督微调、DPO、带可验证奖励的强化学习、以及基于人类反馈的强化学习等等。
67:46
learning with verifiable rewards, with human feedback and so forth.
这些就是优化阶段,而且有意思的是,这其实也是个成本问题,对吧?
67:51
So the refinement stages and it's also interesting, it's like the cost thing, right?
我的意思是,预训练阶段现在要花很多钱,而强化学习稍微少一点。
67:54
I mean, it's like pre-training, you spend a lot of money on that right now, RL, a bit
实际上,2025年也就是去年,有三篇论文是关于用强化学习做预训练的,
67:58
less.
嗯,其实也不完全是,我觉得不能说是在教它知识。
67:59
Well, you don't really, I would say teach it knowledge.
更像是解锁知识,更像是一种技能学习,比如怎么用它在预训练阶段获得的知识来解决问题。
68:02
It's more like unlocking the knowledge, it's more like a skill learning, like how to
今年,也就是2025年,其实有三篇论文是关于RL用于预训练的,但我觉得目前还没有人在生产环境中这么做,顶多是一些玩具示例,确实是这样。
68:05
solve problems with the knowledge that it has from pre-training.
不过,把RL用于后训练更像是技能解锁,而预训练则是……
68:09
There are actually three papers this year, last year, 2025, on RL for pre-training, but
但我觉得目前还没有人在实际生产中这么做,顶多是一些玩具示例,对吧。
68:14
I mean, I don't think anyone does that in production toy examples for now, for example,
网络上有些格式的内容不容易直接用文本编码。
68:19
it's right.
另外,我们用这种深海OCR——姑且称之为我们的OCR——来提取可能达到数万亿token的候选数据,用于预训练,而预训练数据集的大小则取决于那些最佳答案,这就是合成数据。
68:20
But to generalize RL post-training is more like the skill unlock where pre-training is
但概括来说,RL 后训练更像是技能解锁,而预训练则不同。
68:24
like soaking up the knowledge essentially a few things that could be helpful for people,
就像是在吸收知识,有几件事可能对大家有帮助。很多人觉得合成数据对训练模型不好。你提到Deep Sea OCR,也就是光学字符识别那篇论文。很多实验室都做过,AI2做过一个,甚至好几个。每个实验室之所以都有这类项目,是因为网上有海量的PDF和其他数字文档,它们的格式不容易直接提取出文本。他们还用这个Deep Sea OCR——我就叫它我们的OCR吧——来提取可能多达数万亿token的候选数据,用于预训练,而预训练数据集的规模也达到了这个量级。
68:29
a lot of people think of synthetic data as being bad for training the models.
很多人觉得合成数据对训练模型不好。
68:34
You mentioned like the deep sea get a OCR, which is optical character recognition paper.
你提到了 Deep Sea OCR,也就是光学字符识别那篇论文。
68:40
A lot of labs did, AI2 had one, had multiple, and the reason that each of these labs
很多实验室都做过,AI2 做过,还不止一次,而每个实验室之所以都做这个,是因为网上有海量的 PDF 和其他数字文档,它们的格式并不容易直接提取出文本。
68:47
have these is because there's vast amounts of PDFs and other digital documents on the
他们也用这个 Deep Sea OCR——我就叫它我们的 OCR 吧——来提取可能多达数万亿 token 的候选数据用于预训练,而预训练数据集的规模也达到了这个量级。
68:51
web that are in formats that aren't encoded with text easily.
那些格式不是用文本轻易编码的网络内容。
68:54
Also use these deep sea OCR, let me call it our OCR, to extract what can be trillions
另外,使用这些深海OCR,让我称之为我们的OCR,来提取可能数以万亿计的内容,
69:00
of tokens of candidate data for pre-training, and pre-training data set sizes on the order
用于预训练的候选数据token数量,以及预训练数据集规模达到某个量级时,
69:07
of trillions is measuring trillions of tokens, smaller models from researchers can be something
万亿级别的数据是指数万亿个token,研究机构的小模型可能用到5到10万亿个token,Quinn有记录显示达到了约50万亿,还有传闻说那些闭源实验室能做到100万亿个token,就为了获取这些潜在数据来投入训练。
69:13
like 5 to 10 trillion, Quinn is documented going up to like 50 trillion, and there's rumors
他们的数据漏斗非常大,而实际用来训练模型的数据只占其中很小一部分。
69:18
that these closed labs can go to like 100 trillion tokens, and just getting this potential
这种字符识别数据在实验室里会被描述为用于预训练的合成数据。
69:22
data to put in.
放入的数据。
69:24
They have a very big funnel, and then the data you actually train the model on is a small
他们的漏斗非常大,而实际用来训练模型的数据只占其中很小一部分。
69:27
percentage of this.
这种字符识别数据在实验室里会被描述为用于预训练的合成数据。
69:29
This character recognition data would be described as synthetic data for pre-training
基于那些最佳答案,那就是合成数据。
69:34
in a lab.
这与早期的ChatGPT非常不同,那时有很多幻觉,直到人们开始基于合成数据来落地。
69:35
Then there's also the things like chatGPT now gives wonderful answers, and you can train
还有像ChatGPT现在能给出很棒的答案,你可以用这些最佳答案来训练,这就是合成数据。这和早期的ChatGPT很不一样,那时候幻觉很多,直到人们开始基于合成数据来训练。有个有趣的问题,如果我没记错的话,Almost 3训练用的数据比某些其他开源权重模型还要少,甚至可能比Almost 2还少,但性能却更好,这或许就是数据如何发挥作用的例子之一。这主要归结于数据质量。
69:39
on those best answers, and that's synthetic data.
基于那些最佳答案,这就是合成数据。
69:41
It's very different than early chatGPT, lots of hallucinations, data when people became
这和早期的ChatGPT很不一样,那时候有很多幻觉,人们开始依赖合成数据来落地。
69:47
grounded in synthetic data.
数据量比某些其他开源权重模型更多,可能甚至接近两倍,但性能反而更好,这或许就是数据如何发挥作用的一个例子。
69:48
One interesting question is, if I recall correctly, almost three was trained with less
一个有意思的问题是,如果我没记错的话,Almost Three 用的训练数据比某些其他开源权重模型要少,甚至可能比 Almost Two 还少,但它的性能反而更好,这或许就是数据质量如何发挥作用的例子之一。关键还是在于数据质量。本质上,存在一个比例关系:大模型能从数据中吸收更多信息,因此你能从中获得更大收益,差不多就是这么回事。你脑海里想象任何对数曲线的话,小模型在衡量 token 趋势时会更快趋于平稳,而大模型则需要更多数据,但总的来说,我们目前还没训练到那么大的规模。
69:52
data than specifically some other open-weight models, maybe even almost two, but you still
这主要归结于数据质量。
69:57
got better performance, and that might be one of the examples of how the data will help.
本质上,存在一个比例关系:大模型能从数据中吸收更多信息,然后你就能从中获得更多收益,差不多就是这样。
70:01
It's mostly down to data quality.
如果你脑子里有对数图的话,小模型在测量时会更快达到平台期。
70:02
I think if we had more compute, we would train for longer.
我觉得如果我们有更多算力,就会训练更久。
70:04
I think we ultimately see that as something we would want to do, and especially with big
我们最终认为这是想做的事情,尤其是对于大模型,你需要更多算力,因为我们讨论的是增加参数,讨论的是知识。
70:10
models, you need to have more compute because we talk about having more parameters, we talk
本质上存在一个比例关系,大模型能从数据中吸收更多内容,然后你会从中获得更多收益,就像那种情况。
70:14
about knowledge.
想象一下对数曲线,小模型在衡量token趋势时会更快趋于平缓,而大模型需要更多,但主要问题是,我们目前还没训练到那么大的规模。
70:15
Essentially, there's a ratio where big models can absorb more from data, and then you're
本质上存在一个比例关系:大模型能从数据中吸收更多信息,
70:19
going to get more benefit out of this, it's like one of these.
你也能从中获得更大收益,这就像那种情况。
70:22
Any logarithmic graph in your mind is a small model will level off sooner if you're measuring
任何对数曲线在你脑海里都会显示:小模型会更早趋于平缓,如果你衡量的是——
70:27
trends of tokens and bigger models need more, but mostly, we aren't training that big
token 数量增长和更大模型的需求确实在增加,但大多数情况下,我们并没有训练那么大的模型。
70:33
of models right now, AI2, and getting the highest quality data we can is the natural starting
目前模型这块,AI2 的核心起点就是尽可能获取最高质量的数据。
70:38
point.
关于数据质量这个话题,有什么值得探讨的吗?
70:39
Is there something to be said about the topic of data quality?
是不是还有些容易改进的地方,能让质量再提升?
70:42
Is there some low-hanging fruit there still where the quality could be improved?
这就像在反复打磨。
70:46
It's turning the crank.
我觉得从历史上看,开源领域一直有个公认的最佳预训练数据集,
70:47
I think historically, in the open, there's been a canonical best pre-training data set
这个标准会随着谁最近做出了最新或最好的成果而不断转移。
70:52
that has moved around between who has the most recent one or the best of the recent
最近谁有最新的成果,或者谁做出了最好的成果,这个位置一直在变动。
70:56
effort.
还有一个叫DCLM的项目,全称是data comp language model。
70:57
Like, AI2's dolmo was very early with the first olmo and hugging phase side fine web,
AI2 的 dolmo 很早就推出了第一个 olmo,还有 hugging phase side fine web,另外还有一个 DCLM 项目,它全称是 data comp language model。之前 data comp 也做过其他机器学习项目,他们有一个非常强的数据集。现在互联网变得越来越封闭了,所以我们有 common crawl,我记得里面有几百兆的 token,然后你再做过滤。这看起来像很多科学工作,比如训练分类器之类的。
71:01
and there's a DCLM project, which is kind of like a, which is, it stands for data comp
之前也有针对其他机器学习项目的data comp,他们有一个非常强的数据集。
71:07
language model.
但现在互联网变得越来越封闭,所以我们主要靠common crawl,我觉得它有几百trillion的token,然后你再去做过滤。
71:08
There's been data comp for other machine learning projects, and they have had a very
其他机器学习项目也有过数据竞赛,它们拥有非常强大的数据集,但其中很大一部分问题是——互联网正在变得相当封闭。
71:12
strong data set, and a lot of it is, the internet is becoming fairly closed off
所以我们有 Common Crawl,我认为它有数百万亿个 token,然后你需要过滤它。
71:17
so we have common crawl, which I think is hundreds of trillions of tokens and you filter
因此,Olmo 3 的很多工作都集中在新的数据来源上,以提升推理能力,让模型在数学和代码方面表现更好,然后通过混合流程得到最终结果。
71:21
it.
我认为这就是今年各大实验室里发生的很多情况。
71:22
And it looks like being a lot of scientific work where you're training classifiers and
这看起来像是很多科学工作,你在训练分类器之类的。
71:25
making decisions based on how do you prune down this data set into the highest quality
做决策的时候,关键是怎么把这个数据集精简到只剩最高质量的内容,以及那些最适合你任务的东西。
71:31
stuff and the stuff that suits your tasks.
以前,语言模型更多是在测试知识储备和日常对话这类东西,但现在它们得会做数学题和写代码了。
71:32
So previously, language models were tested a lot more on like knowledge and just kind of
所以,要训练一个推理模型,你就得重新组合整个数据集。这里面其实有很多很棒的科研方法,比如你可以拿你那个超大的数据集,从不同来源里采样出很多很小的片段。
71:37
conversational things, but now they're expected to do math and code.
比如说,你有GitHub、Stack Exchange、Reddit、Wikipedia这些来源,你可以先采样一小部分出来。
71:41
So to train a reasoning model, you need to remix your whole data set, and there's a lot
要训练一个推理模型,你需要重新混合整个数据集,这里面其实有很多很棒的科学方法——你可以拿你那个巨大的数据集,从不同来源采样很多非常小的片段。
71:44
of actually wonderful scientific methods here where you can, you can take your gigantic
比如你有GitHub、Stack Exchange、Reddit、Wikipedia,你可以从中采样小片段。
71:49
data set, you sample a lot of really tiny things from different sources.
所以Olmo 3的很多新数据源就是为了让推理在数学和代码上表现更好,然后你执行这个混合流程,它就会给你答案。
71:52
So you say you have GitHub, Stack Exchange, Reddit, Wikipedia, you can sample small things
我觉得今年很多实验室都在做这类事情。
71:57
from them, and you train small models on each of these mixes and measure their performance
从这些混合数据中训练小模型,然后在你的评估集上测试它们的表现。
72:01
on your evaluations.
基本上就像做一个耳朵回归,然后得出最优数据集。
72:02
And you can just do like basically an ear regression, and it's like, here's your optimal
但如果你的评估标准变了,数据集也会跟着大变。
72:05
data set.
所以 Olmo 3 的很多工作就是为推理能力找新数据源,让它在数学和代码上更出色,然后通过这个混合流程得出结果。
72:06
But if your evaluations change, your data set changes a lot.
我觉得今年很多实验室都在做类似的事情。
72:08
So a lot of olmo 3 was new sources for reasoning to be better at math and code, and then
所以Olmo 3的很多工作就是引入新数据源来提升推理能力,使其在数学和代码方面表现更好,
72:14
you do this mixing procedure and it gives you the answer.
然后通过这种混合流程,最终得到答案。
72:16
And I think that's a lot of that's happened at labs this year.
我认为今年很多实验室都在做类似的事情。
72:19
There's new hot things, whether it's like coding environments or web navigation, and you
现在又有了新热点,比如编程环境或者网页导航之类的,你就得引入新数据,重新做整个pre-training,这样你的post-training才能效果更好,诸如此类。
72:23
just need to bring in new data, you need to train your whole pre-training, so your post-training
所以这就像他们不断重新演进、重新确定模型关注的重点。
72:26
can work better and stuff like that.
有没有什么有趣的小故事,关于那些我们意想不到的高质量数据来源?
72:28
So that's like the constant re-evolution and the re-determining of what they care about
Reddit有时候也算一个来源。
72:33
as for their models.
至于他们的模型。
72:35
Are there fun anecdotes of what sources of data, particularly high quality that we wouldn't
有没有什么有趣的故事,关于那些数据来源,特别是我们意想不到的高质量数据?
72:41
expect?
Reddit 有时候会是一个来源。
72:42
Reddit sometimes can be a source.
那些数据可能不像我们封闭的付费花园或者出版商那里的一样。
72:45
Reddit was very useful.
Reddit 真的很有用。
72:47
I think that PDFs is definitely one, especially archive.
我觉得PDF肯定算一个,尤其是archive。
72:52
Yeah.
对。
72:53
So like AI2 has run semantics for a long time, which is a, like you can say, as a competitor
比如AI2长期运营着Semantic Scholar,你可以说它算是Google Scholar的竞争对手,功能还多一些。
72:59
to Google Scholar with a little more features.
为了做到这一点,AI2找到并爬取了很多开放获取的论文PDF,这些论文可能不在那种封闭的付费墙里,也不在出版商那里。
73:01
And to do this, AI2 has found and scraped a lot of PDFs for openly accessible papers
所以是真正开放的科学PDF,如果你把这些都存下来,然后处理它们。
73:06
that might not be like behind the closed paid garden of us or in publisher.
所以就像真正开放的科研PDF,如果你把这些都收集起来并处理,
73:11
So like truly open scientific PDFs, and if you sit on all of these and you process it
前沿实验室早就做过了,这需要有一个相当有经验的研究人员,
73:16
and you can get value out of it, and I think that a lot of that style of work has been
而且你能从中获得价值。我觉得这类工作很多早就被前沿实验室做过了,只是你需要一个相当资深的研究员,懂得如何调整模型,然后他们介入、清理数据。这需要大量人力,就像我想到很多前沿实验室在扩大研究员规模时,大量投入都在数据上。你知道,如果你不是前沿实验室,又想产生影响,最好的办法就是——找到更好的新数据。
73:22
done by the Frontier Labs much earlier, and it's just like you need to have a pretty
他们理解这些东西如何改变模型,然后他们把这些数据引入并加以利用。
73:26
skilled researcher that understands how things change models and they bring it in and they
有经验的研究者能理解数据如何改变模型,他们会把数据引入进来。在实验室里,如果你想产生影响力,最好的方式就是去发现更好的新数据。确实有团队这么做过,但我认为大多数贡献更像是:我要让数据变得更好,或者我要优化基础设施,这样团队里的每个人都能把实验速度提升5%。数据问题往往涉及法律因素,所以我认为还有很多工作是在隐藏训练数据的来源,本质上就是让模型不要泄露数据来源。
73:31
clean it.
清理一下。
73:32
And it's a lot of labor that, like I think of a lot of Frontier Labs when they scale
而且这需要大量人力,我觉得很多前沿实验室在扩展规模时,研究人员投入更多精力在数据上——你知道,如果你不是前沿实验室,又想产生影响,最好的办法就是去发现、创造更好的新数据。
73:36
researchers a lot more, it goes into data, you know, people, like if you don't have Frontier
确实有团队这么做过,但我认为大多数贡献在于:要么把数据做得更好,要么把基础设施优化得更好,这样团队里的每个人都能把实验速度提升5%。
73:40
Labs, and you want to have impact, the best way to do it is just make, find new data
在实验室里,如果你想产生影响,最好的方式就是去创造、找到更好的新数据。
73:44
that's better.
确实有团队这么做过,但我认为大部分贡献其实是,我要把数据做得更好,或者我要把基础设施做得更好,这样我们团队里的每个人都能把实验跑快5%。
73:45
And then like the fancy glamorous algorithmic things, like figuring out how to make a one is
然后那些花哨又炫酷的算法层面的东西,比如怎么搞出一个one,就像是科学家最性感的想法。比如,我搞定了scale RL,确实有团队做到了,但我觉得大部分贡献其实是:我要把数据做得更好,或者我要把基础设施做得更好,这样我们团队每个人跑实验都能快5%。
73:50
like the sexiest thought of a scientist, if like all I figured out the scale RL, there's
同时,我觉得训练数据是什么,也是保密最严的秘密之一,出于法律原因。所以,我觉得还有很多工作是在隐藏训练数据的来源,基本上就是让模型不要泄露这些来源。
73:55
a group that did that, but I think most of the contributions is like, I'm going to make
数据很多时候是出于法律原因,所以我觉得也有大量工作是在本质上隐藏你的训练数据,比如让模型不要泄露网上的来源,比如说一本亚马逊Kindle电子书,或者一本采矿相关的书之类的。
73:58
the data better or I'm going to make the infrastructure better so that everybody in my team
要么我把数据做得更好,要么我把基础设施做得更好,这样我团队里的每个人
74:02
can run experiments 5% faster.
都能把实验跑快5%。
74:04
At the same time, I think it's also one of the closest guarded secrets what your training
同时,我认为出于法律原因,训练数据也是被严格保密的秘密之一,所以我觉得有很多工作实际上是在隐藏你的训练数据来源,比如让模型不要泄露这些来源。因此,像Common Crawl这样的数据集大多未经授权,这意味着你并没有真正同意这些数据的使用方式。还有一种思路是只使用已获得许可的数据来训练语言模型。所以有些人,就像你提到的,他们直接购买了授权,比如在线买一本书,假设是亚马逊Kindle上的书,或者是一本关于采矿的书之类的。
74:08
data is for legal reasons, and so there's also I think a lot of work that goes into hiding
数据涉及法律问题,所以我认为还有很多工作是在隐藏你的训练数据来源,
74:12
what your training data was essentially, like trying the model to not give away the sources
本质上就是让模型不要泄露这些来源,
74:18
because of legal reasons.
因为法律原因。
74:19
The other thing to be complete is that some people are trying to train on only licensed
另外需要补充的是,有些人只尝试用获得许可的数据来训练,而Common Crawl是对整个互联网的抓取。
74:23
data, where common crawl is a scrape of like the whole internet.
所以如果我运营多个网站,我很乐意让它们用来训练语言模型,但我并没有明确授权其使用规则。
74:26
So if I host multiple websites, I'm happy to have them train language models, but I'm
因此,Common Crawl基本上属于未授权数据,这意味着你的数据使用方式实际上并未获得你的同意。
74:33
not explicitly licensing what governs it.
还有一种思路是,只使用已获得许可的数据来训练语言模型。
74:36
And therefore this like common crawl is largely unlicensed, which means that your consent
所以这个 Common Crawl 数据集大部分是没有授权的,也就是说,你的数据怎么用,其实根本没有经过你的同意。
74:40
really hasn't been provided for how to use the data.
还有一种思路是,只拿有授权的数据来训练语言模型。
74:42
There's another idea where you can train language models only on data that has been licensed
就像你说的,有些人直接买了授权,比如在网上买了一本 Kindle 电子书,或者一本什么编程书之类的,但问题是,目前这条路走不通——因为就算你想这么做,你也拿不到那些数据。
74:47
explicitly, so that the kind of governing contract is provided.
明确地说,这样就能提供那种治理契约。
74:50
And I'm not sure if Aprodis is the copyright thing or the license thing.
我不确定Aprodis是版权相关还是许可证相关。
74:53
I know that the reason that they did it was for an EU compliance thing where they wanted
我知道他们这么做是为了符合欧盟的合规要求,他们想确保自己的模型能通过其中一项检查。
74:57
to make sure that their model fit one of those checks.
另外,关于这一点,比如还有许可证之间的区别。
75:02
And on that note also, for example, there's also the distinction between the licensing.
所以有些人,就像你说的,他们只是购买了许可证,比如在网上买一本书,比方说亚马逊Kindle电子书,或者一本采矿方面的书之类的,然后把它用在训练数据里。
75:08
So some people, like you said, they just purchased the license, they'd say they buy a book
像 ChatGPT、Anthropic 这些通用大模型,它们只是通用型的,我觉得它们甚至还没触及到语言模型真正能做到的皮毛——如果它真的专注在某个领域的话。
75:13
online, let's say an Amazon Kindle book or let's say a mining book or something and then
比如一本亚马逊Kindle电子书,或者一本采矿方面的书之类的。
75:17
use that in a training data.
把它用在训练数据里。
75:18
And that is like the gray zone because you paid for the content and you might want to train
这就有点灰色地带了,因为你付了钱买了内容,可能想拿它来训练模型。
75:22
it.
但有些限制甚至不允许这样做。
75:23
But then there are also restrictions where even that shouldn't be allowed.
所以这里就变得有点模糊了,嗯,我觉得目前就是这样。
75:25
And so that is like where where it gets a bit fuzzy and yeah, I think that is right
这还是个热门话题,而且像OpenAI这样的大公司,他们去找私有公司买专有数据,而那些私有公司现在越来越保护这些数据了,因为他们知道,好吧,再过几年这就是我的护城河了。
75:31
now.
现在。
75:32
Still a hot topic and also big companies like OpenAI, they approached private companies
这还是个热门话题,而且像OpenAI这样的大公司,他们去找那些私有企业谈,想获取他们的专有数据,而那些私有企业呢,变得越来越保护这些数据了,因为他们知道,好吧,再过几年这就是我的模型了。
75:36
for their proprietary data and private companies, they become more and more that say protective
目前这个还做不到,因为就算你想,你也拿不到那些数据。
75:44
of that data because they know, okay, this is going to be my mode in a few years.
像ChatGPT、Anthropic这些通用大语言模型,它们只是通用型的,我觉得它们甚至还没真正触及到LLM如果真正发挥潜力能做到什么程度。
75:47
And I do think that's like the interesting question where if LMS become more commoditized and
而我认为,真正有趣的问题在于,如果LMS变得更商品化,
75:54
I think a lot of people learn about LMS that there will be more people able to train
我觉得很多人会开始了解LMS,这样就会有更多人能够训练LMS。
75:58
LMS.
当然,基础设施方面还存在挑战。
75:59
Of course, there are infrastructure challenges.
但如果你想想那些大型行业,比如制药、法律、金融,
76:00
But if you think of big industries like pharmaceutical industries, law, finance industries, I do
我认为它们迟早会从其他前沿实验室挖人,用自己专有数据来构建内部模型。
76:06
think they at some point will hire people from other frontier labs to build their in-house
而这又会是预训练带来的又一次突破——目前还做不到这一点,
76:11
models on their proprietary data, which will be then again, another unlock with pre-training
因为即使你想,你也拿不到那些数据。
76:16
that is currently not there because even if you wanted to, you can't get that data, you
目前还不存在,因为即使你想,也拿不到那些数据。
76:20
can't get access to clinical trials most of the time in these types of things.
大多数情况下,这类事情根本拿不到临床试验的权限。
76:24
So I do think scaling in that sense might be still pretty much alive if you also look
所以我觉得,如果你看看特定领域的应用,那种意义上的scaling可能仍然很有生命力,因为我们现在这一年,看到的还只是ChatGPT、Anthropic这些通用型LMS,它们只是通用模型,我觉得甚至还没有触及到LMS真正为特定任务专门训练和设计时能做到的皮毛。
76:29
in domain-specific applications because we are still right now in this year just looking
关于数据这件事,我觉得这是2025年发生的一件事,我们完全忘了,就是Anthropic在法庭上败诉,欠了作者15亿美元。
76:34
at general-purpose LMS on ChatGPD, Anthropic, and so forth, they are just general-purpose,
像ChatGPD、Anthropic这些通用型LMS,它们只是通用型的,
76:39
they are not even, I think, scratching the surface of what an LMS can do if it is really
我觉得它们甚至还没触及到LMS真正能做到的皮毛。
76:43
specifically trained and designed for a specific task.
专门针对某个任务训练和设计的。
76:46
I think on the data thing, this is one of the things where like this happened in 2025,
说到数据这块,2025年发生了一件事,我们完全忘了——Anthropic在法庭上输了,要赔作者15亿美元,因为他们买了那些书,这事还在走流程。
76:50
we totally forget it, is Anthropic lost in court and was owed at $1.5 billion to authors
另一方面,他们还传播了一些书籍,法院认为正是这种传播行为让他们需要向作者支付这笔巨额赔偿。
76:56
Anthropic, I think, bought thousands of books and scanned them and was cleared legally
Anthropic 我记得是买了几千本书然后扫描了,法律上被认定没问题,因为他们确实买了书,这算是走正规流程。但另一边呢,他们又用 torrent 下载了一些书,法院就认为这条路让他们得赔作者几十亿美元,这官司简直离谱,感觉来也匆匆去也匆匆,这笔钱对 BC 生态来说也太大了。这些案子会决定人类文明的未来,因为很明显数据是这一切的核心,而这里面又牵扯着非常复杂的人性矛盾。
77:01
for that because they bought the books and that is kind of going through the system.
这起诉讼简直匪夷所思,来得快去得也快,我觉得这笔钱对AI生态来说太惊人了。
77:05
And on the other side, they also tormented some books and I think this torrenting was
另一方面,他们还盗版了一些书籍,我觉得这个盗版行为正是法院判定他们需要向作者赔偿数十亿美元的原因。这起诉讼简直匪夷所思,来得快去得也快,但那可是从BC生态系统中抽走的巨额资金啊。
77:09
the path where the court said that they were then culpable to pay this billions of dollars
而且这直接冲击了你写的作品,感觉就像有人未经授权就用你的数据训练模型,连署名都不给,这多少有点偷窃的意味。
77:13
to authors, which is just like such a mind-boggling lawsuit that kind of just came and went,
就像Nathan说的,这里还有两个层面:有人可能买了书然后拿去训练,这算不算公平可以争论;但另外那三家公司是直接明抢。
77:17
I think that is so much money from the BC ecosystem.
我认为这背后有来自BC生态系统的巨额资金。
77:22
These are court cases that will define the future of human civilization because it is
这些官司将决定人类文明的未来走向,因为很明显数据在其中扮演关键角色,而人类对此存在非常复杂的矛盾情绪——当你投入心血写作时,别人未经授权就用你的数据训练模型,这感觉有点像盗窃,连署名都不给你。
77:25
clearly that data drives a lot of this and there is this very complicated human tension
就像Nathan说的,这里还有两个层面:有人可能买了书之后拿去训练,这可以争论是否公平;但还有三家直接使用盗版书的公司,连作者的基本报酬都不给——我觉得,这才是真正让人愤怒的地方。
77:30
of, I mean, you can empathize, you are both authors.
是啊,某种程度上,你倾注了心血、汗水和泪水去写作,结果别人拿你的数据训练模型却不给你署名,确实有点像偷窃。
77:33
Yeah, there is some degree to which, I mean, you put your heart and soul and your sweat
就像Nathan说的,这里还有两层问题:有人买了书然后拿去训练,这算不算公平还能争论;但那些直接拿盗版书来训练的公司,连作者的基本报酬都不给——我觉得这才是大家特别生气的地方。
77:39
and tears into the writing that you do, it feels a little bit like theft for somebody
当你投入心血写作时,别人用你的数据训练却不给你署名,感觉有点像偷窃。
77:46
to train your data without giving you credit.
就像Nathan说的,这还有两个层面:有人可能买了书然后拿去训练,这可以争论是否公平;但还有那些直接明抢的公司。
77:49
And like Nathan said, also two layers to it, someone might buy the book and then train
而且就像Nathan说的,这里还有两个层面:有人可能会买下这本书,然后用它来训练模型,
77:53
on it, which could be argued fair or not fair, but then the three straight-up companies
这到底算不算合理使用还有争议;但另一方面,有些公司直接
77:59
who use pirated books where it's not even compensating the author is that that is, I think,
使用盗版书籍且不补偿作者的行为,我认为这正是让大家特别生气的地方。
78:04
where people got a bit angry about it specifically.
作为维护者,我确实觉得这些PR(Pull Requests)是由LLM提交的。
78:06
Yeah, but there has to be some kind of competition scheme.
是啊,但总得有个竞争机制吧。
78:08
This is like moving towards something like Spotify streaming did originally for music.
这有点像当年Spotify做音乐流媒体时的那种模式。
78:14
You know, what does that competition look like?
那这种竞争具体是什么样的呢?
78:16
You have to define those kinds of models, it's a thing through all of that.
你得定义清楚这些模型,这贯穿整个过程。
78:20
One other thing I think people are generally curious about, I'd love to get your thoughts.
还有一件事,我觉得大家普遍很好奇,想听听你的看法。
78:25
As LLMs are used more and more, if you look at even archive, but GitHub, more and more
随着LLM用得越来越多,你看就连archive,还有GitHub上,越来越多的数据都是LLM生成的。
78:30
of the data is generated by LLMs.
在这种环境下,该怎么办呢?
78:34
What do you do in that kind of world?
在这种世界里,你会做什么?
78:37
How big of a problem is that?
这个问题有多严重?
78:39
Largest problem, same for structure and systems, but from an AI point of view, it's kind
最大的问题,结构和系统也一样,但从AI的角度来看,这几乎是不可避免的。
78:44
of inevitable.
所以,这基本上就是由人类筛选过的LLM生成数据。
78:45
So, it's basically LLMs generated data that's curated by humans essentially.
对。
78:49
Right.
是的,而且我觉得很多开源贡献者确实在 burnout。
78:50
Yes, and I think that a lot of open-source contributors are legitimately burning out.
如果你有一个热门的开源仓库,有人会说,哦,我想做开源AI,这对我的职业发展有好处,然后他们就直接 vibe code 搞点东西出来。
78:53
If you have a popular open-source repo, somebody's like, oh, I want to do open-source AI, it's
如果你有一个热门的开源仓库,有人会觉得,哦,我想搞开源AI,这对我的职业发展有好处,然后他们就随便写点代码。
78:57
good for my career, and they just vibe code something.
最近,我记得有两三个人在很短的时间内提交了大量PR。
79:01
They throw it into the, you might get more than I do.
他们把这东西扔进去,你拿到的可能比我还多。
79:05
So, I have a case study here.
所以,我这里有个案例研究。
79:09
I have a repository called ML Extend that I developed as a student around 15 years, 10
我有个叫 ML Extend 的仓库,是我大概15年、10年前当学生时开发的,里面有些算法库现在还算流行,尤其是频繁数据挖掘那类。
79:14
years ago, and there's some reasonably popular libraries still for certain algorithms, I
最近,有两三个人在很短时间里提交了大量 PR。
79:19
think, especially like frequent data mining stuff.
作为维护者,我觉得这些 PR 背后肯定有 LLM 参与。
79:22
And there was recently, I think, two or three people who submitted a lot of PRs in a very
作为维护者,我确实认为这些PR背后有LLM的参与。
79:27
short amount of time.
所以,最烧钱的事情之一就是为RL获取标注数据,但人类反而能从中得到更高质量的数据,所以某种程度上,我并不介意。
79:28
I do think LLMs have been involved in submitting these PRs, me as the maintainer.
所以,获取用于强化学习的人工标注数据是最昂贵的环节之一,
79:33
There are two things.
有两件事。
79:34
First, I'm a bit overwhelmed.
第一,我有点应付不过来。
79:35
I don't have time to read through it because especially it's an older library that is
我没时间仔细看,尤其是这是个比较老的库,对我来说优先级不高。
79:39
not a priority for me.
但同时,我也挺感激的,因为我觉得大家容易忽略一点:
79:40
At the same time, I kind of also appreciate it because I think something people forget
不只是用LLM,背后还是有人类在把关,有一层人工验证。
79:44
is it's not just using the LLM, there's still a human, you have a human layer that
从某种意义上说,这也跟数据标注是一个道理,对吧?
79:48
verifies something, and that is, in a sense, also how data is labeled, right?
所以,最贵的事情之一就是为RL获取标注数据,人工。
79:53
So, that's like one of the most expensive things is getting labeled data for RL, human
但你能从中得到更高质量的数据,所以某种程度上我并不介意。
79:58
feedback phases, and this is kind of like that where it goes through phases, and then
反馈阶段,这有点像那种分阶段进行的过程,然后你实际上能得到更高质量的数据,所以某种程度上我不介意它。虽然可能会让人感到不知所措,但我确实认为这里面也有价值。感觉原始LLM生成的数据和有人类参与循环、进行某种验证的LLM生成数据之间,存在根本性的区别,即使他们的验证只覆盖了代码行数的一小部分。我认为这适用于任何情况,有时候人们会觉得,哦,我可以用LLM来学习某个东西,这确实没错,你可以这么做,但可能还需要一个懂行的人。
80:03
you get actually higher quality data out of it, you know, so I don't mind it, in a sense,
我认为这和任何事一样——人们有时会觉得“我直接用LLM学习XYZ不就行了”,这确实可行,
80:08
it can feel overwhelming, but I do think there is also value in that.
虽然会让人感到不知所措,但我确实觉得这其中也有价值。
80:11
It feels like there's a fundamental difference between raw LLM generated data and LLM generated
感觉原始LLM生成的数据,与有人类参与循环并进行某种验证的LLM生成数据之间,存在根本性差异——哪怕这种验证只覆盖了代码行数的一小部分。
80:17
data with human and a loop that does some kind of verification, even if their verification
我认为这适用于任何场景,就像人们有时会觉得:“我直接用LLM来学习XYZ不就行了”,这确实可行,但可能还需要一个懂行的人。
80:22
is a small percent of the lines of code.
而我认为价值恰恰在于有人能对内容进行筛选,甚至只是正确使用LLM本身。
80:26
I think this goes with anything where people think also sometimes, oh, I can just use
但背后可能有一个真实的人在付出。
80:32
an LLM to learn about XYZ, which is true, you can, but there might be a person who is
而我认为价值就在于有人能筛选内容,甚至直接使用这些工具。
80:37
an expert who might have used an LLM to write a specific code, there is kind of like
一个专家可能用LLM写了某段特定代码,但背后其实有人工投入,把它打磨得漂亮,剔除掉那些不好或不合适的部分,让它像是为你预先消化好的,这样就能帮你节省时间。
80:42
this human work that went into it to make it nice and throwing odd and not so nice part
我觉得这就是价值所在——有人帮你筛选内容,或者正确使用LLM。
80:47
to make it kind of like predigested for you, and that saves you time.
我认为这仍然是一种劳动,而你在免费获得它。比如你读一篇文章,假设是Substack上的,我或许可以让LLM给我一些观点,但我可能根本不知道该问什么。
80:51
And I think that's the value add where you have someone filtering things, or even using
而且我觉得这就是价值所在——有人帮你做筛选,甚至直接使用。
80:57
the LLM correctly.
LLM 回答正确了。
80:58
I think this is still labor that you get for free with you, for example, read an article,
我觉得这其实还是你免费获得的劳动,比如你读一篇文章,假设是一篇Substack上的文章,我或许可以让一个LLM给我一些看法,但我甚至可能不知道该问什么。你是专家,你来挑选哪些知识是真正精准、应该被包含的,然后你给我这个非常精炼的摘要,这本身就是巨大的价值加成,因为这样我就不用自己花三到五个小时去通读全文,还可能读到一些错误信息之类的。所以我认为,这仍然是写作者未来的方向,尽管现在已经有
81:04
let's say a substake article, I could maybe ask an LLM to give me opinions on that,
比如说一篇 Substack 文章,我或许可以让 LLM 给我一些观点,
81:08
but I wouldn't even maybe know what to ask.
但我可能连该问什么都不知道。
81:10
I think there is still value in reading that article compared to me going to the LLM because
我觉得那篇文章还是有价值的,相比直接去问LLM,因为你是专家,你能筛选出哪些知识是真正准确的、应该被包含进去的,然后你给我一个非常精炼的executive summary,这本身就是很大的价值加成,因为这样我就不用自己花三到五个小时去读完整篇,还可能读到一些错误信息之类的。所以我觉得这也是未来写作者仍然有空间的地方,即使有了LLM,专家依然能帮你节省时间。看着这个过程其实挺有意思的,我相信你们也这么做,但对我来说,观察这个还挺新鲜的。
81:16
you are the expert, you select what knowledge is actually spot on should be included, and
你是专家,你来挑选哪些知识真正准确、应该被包含进去,
81:21
you give me this very, this executive summary, and this is kind of a huge value add because
然后你给我这个非常精炼的 executive summary,这本身就是巨大的价值加成,
81:27
now I don't have to waste three, five hours to go through this myself, maybe get some
因为这样我就不用自己花三五个小时去通读全文,还可能读到一些错误信息之类的。
81:33
incorrect information and so on.
所以我认为,这依然是写作者未来的方向,即使现在有了
81:35
And so I think that's also where the future still is for writers, even though there are
所以我认为这依然是写作者未来的方向,尽管现在已经有……
81:40
LLMs that expert can kind of save you time.
专家型的LLM确实能帮你节省时间。
81:44
It's kind of fascinating to actually watch, I'm sure you guys do this, but for me to look
看着这个过程其实挺有意思的,我相信你们也经常这么做,但对我来说,观察这个现象
81:50
at the difference in the summary and the original content, even if it's a page long summary
在摘要和原文之间的差异中,哪怕是一页长的内容对应一页长的摘要,观察LMB摘要如何磨平棱角也很有意思。
81:56
of a page long content, it's interesting to see how the summary LMB summary takes the
它从内容中移除的信号是什么?
82:02
edge off.
是语气。
82:03
Like what is the signal it removes from the thing?
这正是我经常讨论的。
82:07
The voice.
说到语气,我很想听听你具体指什么,这确实很有力量,但有时候它也会移除真正的洞见——当你移除一个洞见时,实际上是在根本上改变内容。
82:08
That's what I talk about a lot.
这正是我经常聊到的话题。
82:10
Well voice, I would love to hear what you mean by voice, that's really powerful, but sometimes
说到voice,我很想听听你指的voice具体是什么,这个概念确实很有力量,但有时候
82:13
there's like literally insights, like in removing an insight, you're actually fundamentally
它其实包含着真正的洞见,就像在剥离一个洞见的过程中,你实际上是在从根本上
82:18
changing the meaning of the thing.
改变了事物的含义。
82:20
So I continuously disappointed how bad LLMs are at really getting to the core insights,
所以我一直很失望,LLMs 在真正抓住核心洞见方面表现得太差,
82:29
which is what a great summary does.
而优秀的摘要恰恰应该做到这一点。
82:32
Even if you go and I have these extensive, extremely elaborate prompts where I'm like
即使我用了那些详尽、极其复杂的提示词,拼命想挖掘出洞见,
82:37
really trying to dig for the insights, and it's still not quite there, which, I mean,
结果还是差那么一点。我的意思是,
82:43
that's a whole deep philosophical question about what is human knowledge and wisdom and
这本身就是一个深刻的哲学问题:什么是人类的知识与智慧?
82:48
what does it mean to be insightful and so on.
什么才算有洞见?等等。
82:50
But when you talk about the voice, what do you mean?
但当你提到“声音”时,具体指的是什么?
82:52
So when I write, I think a lot of what I'm trying to do is take what you think as a researcher
所以我写作的时候,很大程度上是在尝试捕捉你作为研究者的那种原始状态——研究者试图把前沿理解中的某个想法封装起来,把一种感觉转化成文字。而我的写作方式,就是刻意保留这种原始感,同时让它信息密度很高,结果就是有些人能懂,有些人不懂。这其实就是研究的本质。而我觉得这正是语言模型不擅长的地方,尤其是它们——
82:58
which is very raw, which a researcher is trying to encapsulate an idea at the frontier
——这是一种非常原始的状态——研究者试图捕捉自己认知边界上的某个想法,
83:03
of their understanding and they're trying to put what is a feeling into words.
努力把一种感觉转化成语言。
83:08
And I think that my writing, I tried to do this as the writing, which makes it come across
而我觉得我的写作,我试图在文字中做到这一点,所以读起来才会有那种感觉。
83:12
as raw, but also high information in a way that it's like some people will get it and
原始但信息密度很高,有些人能懂,有些人就听不懂。这其实就是研究的本质。我觉得这正是语言模型不擅长的地方——它们会从很多人那里收集反馈,然后以某种方式平均出模型的行为。我认为,当存在这种过滤机制时,模型很难做到非常尖锐。而这对于研究RLHF的人来说,恰恰是一个美妙且根本性的难题。
83:16
some won't.
有些不会。
83:17
And that's kind of the nature of research.
而这正是研究的本质。
83:18
And I think this is something that language models don't do well, particularly they're
我认为这是语言模型不太擅长的地方,尤其是它们会从很多人那里获取反馈,然后以某种方式平均出模型的行为。
83:22
all trained with this reinforcement learning from human feedback, which is designed to
全部通过这种 reinforcement learning from human feedback 训练,它的设计思路是收集大量人的反馈,然后某种程度上平均出模型该怎么做。我觉得,有了这种过滤机制,模型很难做到非常尖锐。而且我认为这对研究 RLHF 的人来说,是个挺美妙又根本的问题——它确实在提升模型表现上提供了巨大价值,但问题本身的设定就像打了个死结,你根本绕不过去。
83:25
take feedback from a lot of people and in a way, average how the model behaves from this.
我觉得,当存在这种过滤机制时,模型很难做到非常敏锐。
83:30
And I think that there's, it's going to be hard for a model to be very incisive when
而我认为,这对研究RLHF的人来说,是一个美妙且根本性的问题——
83:36
there's that sort of filter in it.
以一种可怕的方式,就像告诉一个记者离开他的妻子,这可能会让模型变得疯狂。
83:37
And I think this is kind of a wonderful, fundamental problem for researchers in RLHF is like,
而且我觉得这对做RLHF的研究者来说,其实是一个既美妙又根本性的问题:
83:44
this provides so much utility in making the models better.
这让模型变得更好,确实带来了巨大的实用价值。
83:47
But also the problem formulation is kind of like, there's this knot in it that you can't
但问题设定本身就像有个死结,你根本绕不过去。
83:53
get past.
那它是不是更有自己的“声音”了?
83:54
I think of is like, these language models don't have this prior and the deep expression
我觉得这些语言模型并没有那种先验知识,也没有它们试图触及的深层表达。
83:59
that they're trying to get at.
我不认为这是不可能做到的。
84:00
I don't think it's impossible to do.
我觉得有些模型的故事确实让人震惊,比如我就很想试试当Sydney的感觉。
84:02
I think there's stories of models that really shock people and I think of like, I would
那是不是更有“声音”了?
84:06
love to have tried being Sydney.
因为它经常在对话中失控,而且从历史上看,那种方式显然很吓人——比如让记者离开自己的妻子,就像一个疯狂的模型,有潜在的危险。
84:09
And does that have more voice?
因为它经常在对话中突然失控,而且方式在历史上显然很吓人,比如让记者离开自己的妻子,像个疯狂的模型一样。
84:11
Because it would so often go off the rails on people and what is historically obviously
去年GPT-4O被下架时引发了大量争议,我个人从未用过那个模型。
84:15
a scary way, like telling a reporter to leave its wife as a crazy model to potentially
用一种可怕的方式,比如让记者离开他的妻子,作为一个疯狂的模型去潜在……
84:19
put in general, general adoption.
总的来说,就是普遍采用。
84:22
And that's kind of like a trade off, like is this RLHF process like in some ways adding
这有点像一种权衡,比如这个RLHF过程在某种程度上是不是在增加限制。
84:26
limitations.
对于这些前沿实验室和公司来说,那是一个可怕的位置,因为数百万人在使用它们。
84:27
That's a terrifying place to be as one of these frontier labs and companies because millions
去年GPT-4O被下架时引发了大量争议,我个人从未用过那个模型。
84:34
of people are using them.
但我跟OpenAI的人聊过,他们甚至到了会收到用户邮件的地步。
84:35
There was a lot of backlash last year with the GPT-4O getting removed and I personally
去年GPT-4O被下架的时候争议很大,我个人其实从来没用过那个模型。
84:41
never used the model.
所以它会尽可能保持通用。
84:42
But I've talked to people at OpenAI, were there to the point where they get emails from
但我跟OpenAI的人聊过,他们已经到了会收到邮件的程度——
84:47
users that might be detecting subtle differences in the deployments in the middle of the night
有些用户可能会在半夜察觉到部署中的细微差异,
84:51
and they email them and they're like, my friend is different.
然后发邮件说,我朋友那边不一样。
84:54
And they find these employees emails and send them things because they're so attached
他们甚至能找到这些员工的邮箱,发东西给他们,因为用户对这套东西太投入了——
84:59
to this set, but it's a set of model weights and a configuration that is deployed to the
但这其实只是一组模型权重和配置,被部署给了用户。
85:05
users.
我们在TikTok上也能看到这种情况。
85:06
We see this with TikTok.
你打开它。
85:07
You open it.
我不用TikTok。
85:08
I don't use TikTok.
我不用TikTok。
85:09
It's supposedly in like five minutes the algorithm gets you.
据说大概五分钟内,算法就能摸透你。
85:11
It's like it's locked in.
就像被锁定了一样。
85:13
And I don't, like those are language models doing recommendations.
而且我不觉得——那些推荐其实是语言模型在做。
85:15
Like I think there are ways that you can do this with the language model within like five
我觉得你可以通过跟语言模型聊大概五分钟,就用它做到这一点。
85:19
minutes of chatting with it.
模型就是能懂你。
85:20
The model just gets you.
而这一点,人们其实还没准备好面对。
85:21
And that is something that people aren't really ready for.
我觉得,别把这个给小孩用,至少现在别给。
85:25
Like I think like don't give that to kids, like don't give that to kids, at least until
我觉得,别给小孩用这个,至少等到——
85:29
we know what's happening.
我们知道发生了什么。
85:30
But there's also going to be this mechanism that's going to happen with these LLMs is
但还有一个机制会随着这些LLM的使用越来越频繁而出现——不幸的是,人类境况的本质决定了总会有人自杀。
85:34
they're used more and more, unfortunately, the nature of the human condition is such
而记者们会怎么做呢?他们会大肆报道那些自杀的人,并且很可能会把原因归结到LLM身上,因为他们掌握了对话数据。
85:39
that people commit suicide.
如果你在生活中真的很难熬,如果你感到抑郁,如果你正在考虑自杀——
85:41
And so what journalists would do is they would report extensively on the people who
所以记者们通常会大肆报道那些自杀的人,
85:44
commit suicide and they would very likely link it to the LLMs because they have that
而且很可能会把原因归结到LLM上,因为他们有那些对话数据。
85:49
data about the conversations.
如果你在生活中真的很难熬,如果你抑郁了,如果你有自杀的念头——
85:51
If you're really struggling in your life, if you're depressed, if you're thinking about suicide,
所以它会尽可能保持通用。
85:56
you're going to probably talk to LLMs about it.
你大概会跟LLM聊这件事。
86:00
And so what journalists will do is they will say, well, the suicide was committed because
所以记者们就会说,自杀是因为LLM导致的。
86:03
of the LLM.
而这会让公司出于法律问题等等原因,越来越倾向于削弱LLM的锋芒。
86:05
And that's going to lead to the companies because of legal issues and so on, more and more
所以它会变得尽可能通用。
86:11
and more taking the edge off of the LLM.
在这个领域操作实在太难了,因为你当然不希望LLM对人类造成那种程度的伤害。
86:13
So it's going to be as generic as possible.
像Anthropic和OpenAI,它们在文化上真的很想通过这个为世界做好事,而且有种——我就觉得,我要做这个是因为,一方面,有人在偷你的数据,诸如此类的事情。但实际情况比那复杂,你说得对。
86:16
It's so difficult to operate in this space because of course you don't want an LLM
在这个领域操作非常困难,因为你当然不希望一个LLM
86:19
to cause harm to humans at that level.
对人类造成那种程度的伤害。
86:23
But also this is also the nature of the human experience is to have a rich conversation,
但这同样也是人类体验的本质——你需要一场丰富的对话,一场有收获的对话,一场能挑战你、让你成长的对话,你需要那种锋芒。而这恰恰是RLHF领域的研究人员极难真正解决的问题,因为你实际上是在处理人类自身的境况。这些公司里的很多研究人员都怀有非常良好的动机,他们确实——像Anthropic和OpenAI这样的团队,在文化上就极其渴望通过这项技术为世界带来益处。而且这种信念如此强烈,以至于我会想:我要投身于此,因为一方面,很多人把AI视为健康领域的盟友,是一个可以与之谈论自身健康问题的对象。
86:30
a fulfilling conversation and one that challenges you from which you grow, you need that edge.
一场有意义的对话,一场能挑战你、让你成长的对话,你需要那种张力。
86:36
And that that's something extremely difficult for high researchers on the RLHF front to
而这正是RLHF领域的研究人员极难真正解决的问题,因为你实际上是在处理人类自身的状况。
86:42
actually have to solve because you're actually dealing with the human condition.
这些公司里的很多研究人员都怀有非常良好的动机,他们确实——比如Anthropic和OpenAI——在文化上非常希望通过这项技术为世界带来益处。
86:46
Like a lot of researchers at these companies are so well motivated and they definitely,
而我是这样想的:我要投身于此,因为一方面……
86:51
they like some anthropic and open AI are culturally so want to do good through this
这些公司内部有非常非常多的人,其中很多你认识,很多我也认识,他们真心关心帮助别人。他们在全面考虑各种因素。
86:57
for the world and there is such a, I'm like, I'm going to work on this because on the one hand,
为了这个世界,而且我心想,我就要做这个,因为一方面……
87:02
a lot of people see AI as a health ally is somebody they can talk to about their health
很多人把AI看作健康助手,觉得可以跟它聊聊自己的健康状况。
87:07
confidentially, but then it bleeds all the way into this talking about mental health and things where
私下里说,但这事儿会一路蔓延到心理健康之类的领域——让人心碎的是,这可能会成为压垮某人的最后一根稻草,把ta推过临界点。但另一些人或许能被拯救。而我的想法是,作为训练模型的研究员,有些事我真的不想做:比如训练图像生成模型然后公开释放,因为我不想让任何人在自己的笔记本上拥有一个能伤害他人的工具。我的公司没有足够安全的基础设施来做这件事。但你看,像这样的领域太多了,它需要有人带着对复杂性的认知和某种信念去面对——这问题实在太难了。
87:14
it's heartbreaking that this will push, like be the thing where somebody goes over the edge.
让人心碎的是,这可能会成为压垮某些人的最后一根稻草。
87:20
But other people might be saved and I'm like, I don't like, there's things that as a researcher
但另一些人或许能被拯救,而我觉得,作为研究员,
87:24
training models, it's like, I don't want to train image generation models and release them openly
训练模型时,有些事我不愿意做——比如训练图像生成模型并公开释放,
87:28
because I don't want to enable somebody to have a tool on their laptop that can harm other people.
因为我不想让任何人在自己的笔记本电脑上拥有一个可能伤害他人的工具。
87:34
Like I don't have the infrastructure in my company to do that safely, but it's like,
我的公司没有足够的基础设施来安全地做这件事,但话说回来,
87:37
like there's a lot of the areas like this which just it needs people that will approach it with
像这样的领域还有很多,需要有人以复杂性和某种信念去面对——
87:42
the complexity and just kind of conviction of like, it's just such a hard problem.
这实在是个太难的问题了。
87:47
But also we as a society as users of these technologies need to make sure that we're having
但作为社会,作为这些技术的使用者,我们也要确保自己是在进行一场复杂的讨论,而不是仅仅停留在恐惧或情绪化的层面。比如“大科技公司正在伤害人类”或“他们在窃取你的数据”这类说法——实际情况远比这复杂,你说得对。这些公司内部有非常多的人,其中很多你认识,很多我也认识,他们真心关心如何帮助他人。他们在考虑全球各地用户的完整人类体验,而不仅仅是硅谷。美国各地的人、世界各地的人,他们的需求是什么,这意味着什么。要设计一个能够帮助所有这些不同地区、不同人群的系统,真的非常困难。
87:51
the complicated conversation about it versus just fear, migraine. Big tech is causing harm to humans
关于这个话题的讨论其实很复杂,远不止是恐惧或头痛那么简单。大科技公司确实在伤害人类、窃取数据之类的——但实际情况比这更复杂,你说得对。这些公司内部有非常多的人,你认识其中不少,我也认识不少,他们真心想要帮助别人。他们在考虑全球各地人们的完整人类体验,而不仅仅是硅谷。美国各地的人、全世界各地的人,他们的需求是什么,这意味着什么。要设计出一个能帮助所有这些不同地区、不同人群的系统,真的非常困难。对我来说,去和世界上那些讨厌大科技公司的人多聊聊,会是一件好事。
87:58
or stealing your data, all that kind of stuff. It's more complicated than that and you're right.
或者窃取你的数据,诸如此类的东西。实际情况比那更复杂,你说得对。
88:02
There's a very large number of people inside these companies, many of which you know,
这些公司内部有非常非常多的人,其中很多你认识,
88:06
many of which I know, they're deeply care about helping people. They are considering the full
很多我也认识,他们真心在乎帮助别人。他们在全面考虑这个问题。
88:11
human experience of people from across the world, not just Silicon Valley. People across the United
全球各地人们的真实体验,不只是硅谷。美国各地的人们,世界各地的人们,他们的需求是什么。要设计一个能帮助所有这些不同类型、不同地区的人的系统,真的很难。
88:16
States, people across the world, what that means, what their needs are. It's really difficult to
对我来说,最好去和世界上那些讨厌大科技公司的人多聊聊,以一种无力感的方式,眼睁睁看着AI垃圾内容迅速占领互联网。
88:20
design one system that is able to help all these different kinds of people across the different
更多人通过用它来构建东西、开发应用、创造事物来找到主动权。
88:25
age groups, cultures, mental states, mental conditions, all that kind of stuff.
不同年龄段、不同文化背景、不同心理状态、不同心理状况,所有这些乱七八糟的。
88:31
I wish that the timing of AI was different with their relationship of big tech to the average
我真希望AI出现的时机,以及它和大科技公司跟普通人之间的关系,能有所不同。
88:36
person. Big tech's reputation was so low and with how AI is so expensive, it's like
大科技公司的名声已经那么差了,而AI又这么烧钱,这几乎注定会变成大科技公司的事情——需要投入那么多资源,而且人们说美国所谓“把经济押注在AI上”,搞这种大规模建设。
88:41
inevitably going to be a big tech thing where it takes so many resources and people say the US
这两件事偏偏同时交织在一起,就让沟通环境变得特别艰难。
88:46
is quote unquote, betting the economy on AI with this build out. It's like to have these
对我来说,最好能去跟更多那些讨厌大科技公司、把AI看作这种延续的人聊一聊。
88:50
v intertwined at the same time is just makes versus such a hard communication environment.
你其实推荐的一个解药就是……
88:55
It would be good for me to go talk to more people in the world that hate big tech and
所以,你希望它真正帮你建立直觉,但它的力量在于——你能理解它如何运作、弱点在哪里,这给了你话语权,让你能说出:
89:00
see AI as a continuation of this. One of the things you actually recommend one of the antidotes
把AI看作是这种趋势的延续。你实际上推荐的一种解药是,在一种无力感中,当AI垃圾内容迅速占领互联网时,不要只是被动消费。而是通过用它来构建东西、开发应用、创造产品来找到主动权。这样你才能真正建立直觉,而且这很赋能,因为你能理解它的运作方式、它的弱点在哪里,这给了你话语权,去说“这太糟糕了,这是技术的滥用,而那是技术的善用”。你越深入这个系统,就越能理解它,也越能在它演进时更好地引导它。我觉得你提出的“主动权”这个点很好。我提到过忽视它、说“这与我无关”的态度。
89:06
that you talk about is to find agency in this whole system as opposed to sort of sitting back
你提到的核心是,在这个系统里找到主动权,而不是消极地坐等AI垃圾内容迅速占领互联网,然后被动消费。更主动的方式是用它来创造东西,开发应用,去构建。所以,你其实希望这能帮你建立直觉,但更重要的是,这能赋予你力量——因为你理解了它的运作方式,知道它的弱点在哪里,你就有底气去说:这个用法很糟糕,这个技术应用很烂,而那个是好的技术应用。这样你就能更深入地融入这个系统,更好地理解它,并在它演进时更好地引导它。我觉得你提出“主动权”这个点很好。我原本想的是忽略它,然后说……
89:14
in a powerless way and consuming the AI slop as quickly rapidly takes over the internet.
以一种无力感,AI生成的垃圾内容正迅速占领互联网。
89:20
More find agency by using it to build stuff, build apps, build.
更多人通过用它来构建东西、开发应用、创造产品,找到了主动权。
89:26
So you want that actually helps you build the intuition but to it's empowering because you
所以你需要的是能真正帮你建立直觉的东西,但它之所以让人感到赋能,是因为
89:31
you can understand how it works, what the weaknesses are, it gives your voice power to say like
你能理解它的运作方式、它的弱点在哪里,这给了你发声的力量,比如
89:37
this is fucked up, this is bad, this is bad uses of technology and this is good use of technology
这太离谱了,这是糟糕的技术应用,而这是好的技术应用。
89:42
and you're more plugged into the system then so you can understand it better and you can steer it
你越深入这个系统,就越能理解它,也越能引导它。
89:47
better as it is. I think it's a good point you brought up agency. I said of ignoring it and saying
我觉得你提到“自主性”这点很好。我本来想忽略它,但——
89:52
I'm not going to use it. I think it's probably long-term healthier to say okay, it's out there,
我不会用它。我觉得长期来看更健康的方式是接受它已经存在了,就像当年互联网和电脑刚出现时一样,你没法把它塞回去。关键是怎么最好地利用它,让它帮我提升自己。不过我担心的一点是,如果你完全用它来做你热爱的事情,那你热爱的事情本身就不存在了,这可能会让人产生倦怠感。比如,如果我让AI替我写所有代码,那我自己就不写代码了,只是管理一个替我写代码的东西。假设两年后,我每天八小时都这样,让AI替我写代码,我还会觉得有成就感吗?这就像……
89:57
I can't put it back you know like internet computers back then when they came out.
回不去了,你知道吗,就像当年互联网和电脑刚出来的时候那样。
90:02
How do I make best use of it and how does it help me to up level myself?
我该怎么最好地利用它,它又能怎么帮我提升自己?
90:06
The one thing I worry here though is like if you just fully use it for something you love to do,
不过我担心的一点是,如果你完全用它来做你热爱的事情,
90:11
the thing you love to do is not no longer there and that could potentially I feel like
你热爱的事情本身就不存在了,这可能会让我觉得,
90:16
lead to burnout. For example, if I use an alarm to do all my coding for me, now there's no coding,
最终导致倦怠。比如,如果我让一个AI替我写所有代码,那代码本身就不存在了,
90:21
I'm just managing something that is coding for me. Two years, let's say later if I just do that
我只是在管理一个替我写代码的东西。假设两年后,我每天就这样做八小时,
90:26
eight hours a day, I have something code for me. Do I feel fulfilled still like is this like
让某个东西替我写代码。我还会觉得有成就感吗?这就像,
90:33
yeah I mean is this like hurting me in terms of being excited about my job, excited about
嗯,我的意思是,这会不会影响我对工作的热情,影响我对正在做的事情的兴奋感?我还会为自己创造的东西感到自豪吗?所以关于“享受”这个话题,其实挺有意思的——顺便提一下,最近有一项调查,涵盖了大约791名专业开发者,这里的“专业”指的是有10年以上经验的那种。那可真够久的。是啊。放在现在这个时代,那都算初级开发者了。所以你看,结果还挺让人意外的——他们按初级和高级开发者做了分类,但我的意思是,这恰恰说明,无论是初级还是高级开发者,都在日常编码中使用AI生成的代码。这可不是为了好玩,也不是那种中间阶段的学习实验,这是真正的生产代码。
90:39
what I'm doing am I still proud to build something? So there's on that topic of enjoyment it's
我现在做的事,我还会为自己构建了什么东西而自豪吗?所以关于享受这个话题,它……
90:45
quite interesting which is just throw this in there that there's this recent survey of about
挺有意思的,顺便提一句,最近有个调查,对象是大约791名专业开发者,所谓“专业”是指有10年以上经验。那可真够久的。
90:50
791 professional developers, professional meaning 10 plus years of experience. That's a long time.
是啊,放在现在这年头,那都算初级开发者了。所以你看,
90:57
Yeah. That's a junior developer. Yeah and this day and age. So there's all
结果挺让人意外的——他们按初级和高级开发者来分类,但我的意思是,这调查显示,无论是初级还是高级开发者,都在日常交付的代码里用AI生成的代码。所以这可不是闹着玩的,也不是那种半吊子学习阶段的东西,这是真刀真枪的代码。
91:04
see how many fronts are surprising so they break it down by junior and senior developers but
有意思的是,在“你交付的代码中超过50%是AI生成”这个类别里,高级开发者更倾向于这么做。但你肯定不希望AI把你的活儿给抢了。
91:11
I mean, it just shows that both junior senior developers use AI generated code in code-day
我的意思是,这恰恰说明无论是初级还是高级开发者,都在日常交付中使用AI生成的代码。
91:20
ship. So this is not just for fun, sort of intermediate kind of learning things. This is code
所以这不仅仅是出于兴趣,或者某种中阶学习用途。这是真正的代码交付。
91:26
they ship and so it's 25 percent meant like most of them use around 50 percent or more and
他们发布了,25% 的意思是大部分人的使用率在50%或以上。有趣的是,在“你发布的代码中超过50%由AI生成”这个类别里,资深开发者更倾向于这样做,但你并不希望AI夺走你热爱的东西。我觉得这跟我自己的经历有关,也跟我接下来要说的话吻合。总体来看,大约80%的人觉得在工作中使用AI让工作变得稍微更有趣,或者显著更有趣。我认为这取决于具体任务,就我个人使用来说,比如我有一个网站,有时候我会在上面做一些小调整,我个人并不喜欢做这件事。所以从这个角度讲,如果AI能帮我在网站上实现一些功能,那挺好的。
91:33
what's interesting is for the category of over 50 percent of your code that your ship is AI
有趣的是,在“你交付的代码中超过50%由AI生成”这个类别里,高级开发者更倾向于这么做。
91:38
generated senior developers are much more likely to do so but you don't want AI to take away the
但你不希望AI剥夺——
91:44
thing you love. I think it speaks to my experience these particulars also I'm about to say. So
你喜欢的事情。我觉得这跟我接下来要说的个人经历也很吻合。总的来说,大约80%的人觉得用AI辅助工作要么稍微更有趣,要么显著更有趣。我觉得这取决于具体任务,拿我自己的使用来说吧。我有一个网站,有时候需要调整一些东西,我个人其实并不喜欢做这个。所以从这个角度看,如果AI能帮我在网站上实现某些功能,那挺好的。但如果是遇到一个bug,我自己去追踪、找到它,那感觉简直是世界上最棒的事。你会特别开心,感觉特别棒。可现在呢,你根本不用去琢磨那个bug,直接去找LLM解决,那你永远也体会不到那种快乐了。
91:50
together about 80 percent of people find it either somewhat more enjoyable or significantly more
大约80%的人觉得这样要么更有趣,要么显著更有趣。
91:56
enjoyable to use AI as part of the work. I think it depends on the task of my personal
在工作中把AI当作工具来用还挺有意思的。我觉得这取决于具体任务和个人使用习惯。比如我有个网站,有时候需要改点东西,我个人其实不太喜欢做这个。所以如果AI能帮我实现网站上的某些功能,那挺好的。但要是遇到bug,我自己去排查然后找到问题所在,那种感觉简直爽翻了——你会特别开心,觉得自己特别厉害。可现在呢,你根本不用费心去想那个bug,直接丢给LLM就行。这样一来,你就不会感到挫败,因为AI帮你解决了问题,你就能继续去做自己真正喜欢的事。所以我觉得,看这些统计数据的时候,也能看出其中的差别。
92:03
usage for example. I have a website where I sometimes tweak things on the website. I personally
举个例子。我有一个网站,有时候我会在上面做些调整。我个人
92:09
don't enjoy this. So in that sense if the AI can help me to implement something on my website
并不喜欢做这件事。所以从这个角度来说,如果AI能帮我在网站上实现某些功能,
92:15
I'm all here for it. It's great. But then at the same time when I solve a complex problem
我完全支持这个观点。这很棒。但与此同时,当我解决一个复杂问题时——比如有个bug,我去追踪它,最后找到了,那种感觉是全世界最棒的。你会获得巨大的快乐,感觉特别棒。但现在,如果你根本不用思考这个bug,直接去找LLM,那你永远不会有这种感觉。不过中间地带也是存在的:你先自己尝试,找不到再用LLM,这样你不会感到沮丧,因为它帮了你,然后你就可以继续去做你真正享受的事情。所以我觉得,看这些统计数据时,区别在于它没有考虑到——它只是把所有不同场景平均化了,而我们并没有把这些场景区分开。
92:21
well if there's a bug and I hunt this bug and I find the bug it's the best feeling in the world.
那很好。但如果有个bug,我去追踪它、找到它,那感觉是世界上最棒的。
92:26
It's like you get so much joy like oh it's like you feel like great. But now if you don't even
你会感到无比快乐,就像“哦!”那种感觉,你会觉得自己很厉害。但现在,如果你甚至都不……
92:32
think about thinking about the bug you just go directly to the LLM. Well you never have this kind
想想看,当你遇到bug时,你直接去找LLM。你根本不会有那种挫败感,因为它帮你解决了问题,然后你就可以继续去做你喜欢的事情。所以我觉得看这些统计数据时,也能看到另一个区别——那些原本你可能不会享受的事情。从这个意义上说,AI真的很擅长处理那些繁琐又费力的杂事。比如前几天我妻子,她有个播客,类似书籍讨论那种,一个读书俱乐部。她当时正把节目笔记从Spotify转到YouTube,结果链接不知怎么全坏了。有些集目里,她得手动一个个修复链接。于是我就建议说,嘿,试试Chatchy Bitty吧,我们把文本复制进去——
92:36
of feeling. But then there could be the middle ground where well you try yourself you can't
那种感觉。但中间也可能存在一种折中:你自己试了试,找不到答案,于是用LLM,它帮了你,你就不会感到沮丧,然后继续去做你喜欢的事情。所以我觉得,看这些统计数据时,另一个区别在于,它平均了所有不同的场景,而这些场景中我们本来可能并不会感到享受。所以从某种意义上说,AI 真的很擅长处理那些需要大量劳动的琐事。比如,我妻子前几天有个播客,是关于书籍讨论的,像读书俱乐部那种。她当时在把节目笔记从 Spotify 转移到 YouTube,结果链接不知怎么断了,有些集数里就出了问题。
92:42
find it you use the LLM and then you don't get frustrated because it helps you and you move on
发现你用了LLM,结果因为它帮到了你,你就不觉得恼火,然后就这么过去了。
92:46
to something that you enjoy. And so I think looking at these statistics I think also the difference
去做一些你真正享受的事情。所以我觉得看这些统计数据时,也能感受到那种本来可能无法体验到的乐趣。从某种意义上说,AI 真的很擅长处理那些需要大量精力的琐碎事务。比如前几天我妻子,她运营一个类似读书讨论会的播客,一个读书俱乐部。她当时正把节目笔记从 Spotify 转移到 YouTube,结果链接不知怎么断了。有些集目里,她不得不手动修复每个链接。于是我就建议说,嘿,试试 Chatty Bitty 吧,我们把文本复制进去。这就像有个朋友一起,那个叫什么来着,结对编程,感觉没那么孤单了。你把调试说得像是什么天大的乐事。不,我会说,调试就像喝一杯水一样平常。
92:51
is what is not factor in its averaging over all the different scenarios where we don't
这就是它在所有我们原本无法享受的不同场景中取平均时没有考虑到的因素。所以从某种意义上说,AI 真的很擅长处理那些需要大量劳动的枯燥事务。比如前几天我太太,她有个播客,是关于读书讨论的,类似读书俱乐部那种。她当时要把节目笔记从 Spotify 转到 YouTube,结果链接不知怎么断了。有些集数里链接坏了,她得手动一个个修。我就建议说,嘿,试试 Chatchy Bitty 吧。我们把文本复制进 Chatchy Bitty,它就给修好了。原本要花两个小时一个一个链接去修,你看,这就是 AI 有用的场景——那种特别无聊、特别枯燥的活儿。
92:56
so we don't know if it's for the core task or if it's for something mundane that people would
所以我们不知道它是为了核心任务,还是为了那些人们本来会觉得无聊的琐事。从某种意义上说,AI 真的很擅长处理那些需要大量工作的枯燥事情。比如前几天我妻子,她有一个播客,是关于读书讨论的,一个读书俱乐部。她当时在把节目笔记从 Spotify 转到 YouTube,结果链接不知怎么断了。有些集数里,因为书很多,大概有上百个链接,手动一个一个去修会非常痛苦。于是我就建议说,嘿,试试 Chatchy Bitty 吧。我们把文本复制进去,它就修好了。原本可能要花两个小时一个一个链接去修,你知道的。
93:01
not have enjoyed otherwise. So in a sense AI is really great for doing mundane things that
否则就无法享受到。所以从某种意义上说,AI真的很擅长做那些需要大量工作的琐碎事情。
93:08
take a lot of work. So for example my wife the other day she has like a podcast for like book
比如,我妻子前几天有一个关于书籍的播客。
93:13
like book discussions, a book club. And she was like transferring the show notes from Spotify
像读书讨论会,一个读书俱乐部。然后她要把节目笔记从Spotify搬到YouTube上,结果链接莫名其妙坏了。有些集数里,她得手动一个一个修链接。于是我就建议说,嘿,试试Chatchy Bitty吧,我们把文本复制进去。就是那种,我有个朋友,一起做那个叫什么来着,结对编程,感觉没那么孤单。你把调试说得像什么天大的乐事一样。不,我会说,调试就像在沙漠里渴得要命,然后两个人一起找到那杯水。所以至少对我来说,可能编程体验里的那种孤独感,恰恰是快乐的来源。这也可能跟吃东西有点像,我觉得饿极了的时候,饭吃起来更香,对,就是这样。
93:18
to YouTube. And then the links somehow broke. And she had in some episodes because it is
上传到YouTube。然后链接不知怎么坏了。她有些集数里因为这个问题,
93:23
custom many books like 100 links or something and it would have been really painful to go in there
很多书都有像100个链接之类的东西,手动进去一个一个修真的很痛苦。所以我就建议说,试试Chatchy Bitty吧,我们把文本复制进去,它就给修好了。本来可能要花两个小时挨个链接去修,你知道,这种场景下AI就很有用,因为那活儿特别无聊、特别枯燥。对我来说,既然我们在聊编程,你又提到了调试,我在Cursor这边比在clogged code那边更享受的一个原因就是——我有了一个伙伴,就像那种叫什么来着,结对编程搭档,感觉没那么孤单了。你把调试说得像是什么天大的乐事。不,我会说,我会说调试就像喝一杯——
93:28
and fix each link manually. And so I suggested hey let's try Chatchy Bitty we copied the text into
得手动一个个修复链接。于是我就建议说,试试Chatchy Bitty,我们把文本复制进去。
93:34
Chatchy Bitty and it fixed them. And instead of two hours going from link to link fixing that you know
Chatchy Bitty 然后它就把问题修好了。本来可能要花两个小时一个一个链接去排查修复,你知道那种情况——AI 在这种场景下就很有用,特别无聊特别琐碎的那种。
93:39
it made that type of work much more seamless. There was no frustration fixed. I think everyone has
它让那种工作变得顺畅多了,完全没有挫败感。我觉得每个人都会遇到某个场景,AI 在这种又无聊又琐碎的事情上特别有用。对我来说,既然我们在聊编程,你又提到了调试,我在 Cursor 这边(而不是 clogged code 那边)获得很多乐趣的一个原因是——我有个伙伴,或者说叫结对编程搭档?就是没那么孤独了。你把调试说得像什么天大的乐事一样。不,我会说调试就像在沙漠里走了好几天之后喝到一口水。所以你直接跳过了整个受苦的沙漠部分。所以有时候有个不太会找 bug 的朋友也挺好的。
93:45
a use case where AI is useful for something like that that would be really boring really mundane.
对我来说,在 Cursor 这边获得的乐趣比在 clogged code 那边更多,是因为我有了一个伙伴,就是那个叫什么来着,pair programmer,感觉没那么孤独了。
93:50
I for me personally since we're talking about coding and you mentioned debugging what a lot
就我个人来说,既然我们在聊写代码,你又提到了debugging,其实我在cursor这边比在clogged code那边更享受的一个原因是——我有个朋友,就像那种pair programmer,叫什么来着,就是没那么孤独。你把debugging说得好像特别快乐似的。不,我觉得debugging更像是喝一口水,但你在受苦。所以有时候有个朋友挺好的,他可能找不到那片沙漠,然后你们一起找到那口水。至少对我来说,这可能也反映了编程体验中的孤独感,那才是快乐的来源。也许还跟延迟满足有关。我这个人,从小时候就喜欢圣诞节那种感觉。
93:58
of the source of the enjoyment for me on the more in the cursor side than the clogged code side
你把调试说得好像特别快乐似的。不,我觉得调试更像是——你在沙漠里渴得要命,有时候有个朋友陪着一起找那口水喝,也挺好的。所以至少对我来说,这可能也反映了编程体验中的那种孤独感,而那种陪伴本身就是快乐的来源。也许也跟这个有关。
94:03
is the I have a friend to have a co what's that called a pair programmer like it's less lonely you
我有个朋友,有个叫什么来着,结对编程搭档,就像这样没那么孤独了。
94:10
made debugging sound like this great joy. No I would say I would say debugging is like a drink of
他把调试说得像是一种巨大的乐趣。不,我会说调试就像在沙漠里喝一口水,
94:18
water after you've been going through a desert for days. So like you skip the whole desert part
就像在沙漠里走了好几天之后终于喝到水一样。所以相当于你跳过了整个在沙漠里受苦的过程。有时候有个朋友也挺好的,他找不到那片沙漠,然后你们一起找到那口水喝。所以至少对我来说,这可能说明了编程体验中的孤独感——而那种孤独恰恰是快乐的来源。也许这也跟延迟满足有关。我这个人吧,从小就是这样,比起真正收到圣诞礼物,我更喜欢期待礼物的感觉。我会一直盼着收礼物的那天,但等那天真的来了,礼物拿到了,反而觉得失望。可能跟吃东西也是一个道理——我觉得食物在真正饿的时候才最好吃,对吧。
94:25
where you're suffering. So like there sometimes it's nice to have a friend who can't really find
在你感到痛苦的时候。所以有时候,能有一个同样找不到沙漠的朋友,然后一起找到那杯水,是件好事。至少对我来说,这或许道出了编程体验中的孤独感,而那种孤独正是快乐的来源。这也可能和食物有关——我觉得当你真的很饿的时候,食物会更好吃。还有,你知道,你在浪费时间,但我觉得这又是另一个挑战:人们要如何学习?我们看过那张图表,发现资深开发者比初级开发者生成了更多AI代码。我觉得这很有意思,因为直觉上你会认为是初级开发者,因为他们还不知道怎么做那些事——毕竟他们还在学习阶段。
94:31
the bug but can give you some intuition about the code and you're together with that friend go into
这个 bug 虽然烦人,但能让你对代码有点直觉,然后你和那个朋友一起走进沙漠,一起找到那口水。所以至少对我来说,这或许道出了编程体验中的孤独感——而那种孤独正是快乐的来源。也可能跟延迟满足有关。我这个人吧,从小就这样,比起真正收到圣诞礼物,我更喜欢期待礼物的感觉——我会盼着拆礼物的那天,但真到了那天,礼物拆完了,我又觉得失望。可能跟吃东西也差不多,我觉得饿极了的时候食物才最好吃。对,你说得对,调试这事儿吧,不总是那么美好,常常让人抓狂,但如果你能……
94:38
the desert and then together find that drink of water. So at least for me maybe speaks of the
然后一起找到那口水。所以至少对我来说,这可能说明了编程体验中的孤独感,而那种孤独正是快乐的来源。
94:44
loneliness of the programming experience it's that is the source of joy. It's maybe also related
也许这也和食物有关,我觉得当你真的很饿的时候,食物会更好吃,对,你也是。
94:49
to delayed gratification. I'm a person who you know even as a kid I like the idea of Christmas
延迟满足这件事吧。我从小就这样,比如圣诞节,我特别期待收礼物的那天,可等真到了那天,礼物拆完了,反而觉得失落。再拿吃东西来说,我觉得饿到不行的时候吃什么都特别香。你可能会觉得这是在浪费时间,但我觉得这其实是个更大的挑战——人们该怎么学会这种能力呢?
94:56
presents having them getting them better than actually getting the presents I would look forward
收礼物、期待礼物、得到礼物的过程,比真正拿到礼物本身更让人开心。我会一直盼着收礼物的那天,但真到了那天,反而觉得失望。可能就像吃东西一样——饿的时候吃什么都香。你这是在浪费时间,但我觉得这又是另一个挑战:人们该怎么学习呢?我们看过那张图表,发现资深开发者比初级开发者用AI生成的代码更多。这很有意思,因为直觉上你会觉得初级开发者更依赖AI——毕竟他们经验不足,还不懂怎么做事,所以会借助AI。但这可能说明两个问题:要么是AI还不够好。
95:03
to the day I get the presents but then it's over and I'm disappointed and maybe it's something like
我们刚才看的那张图表显示,资深开发者用AI生成的代码量反而比初级开发者多。我觉得这点特别有意思,因为直觉上你会觉得应该是初级开发者用得更多才对——毕竟他们可能还不太会写某些功能,所以更依赖AI来帮忙。但结果恰恰相反,这要么说明AI还不够成熟。
95:07
also with let's say food I think food tastes better when you're really hungry and with yeah you're
另外,比如说食物,我觉得当你真的很饿的时候,食物尝起来更好吃,而且,嗯,是的。
95:14
right with debugging it is not always you know great it's like often frustrating but then if you can
调试代码这事儿吧,说实话不总是那么美好,经常挺让人抓狂的,有时候感觉就是在浪费时间。但我觉得这又带来了另一个挑战:人们要怎么学会调试呢?我们刚才看的那张图表显示,资深开发者用AI生成的代码反而比初级开发者更多。我觉得这点特别有意思,因为直觉上你会觉得应该是初级开发者用得更多——毕竟他们可能还不太会写代码,所以靠AI来帮忙。这要么说明AI目前还不够好,没法独立解决这类任务;要么说明专家用AI更得心应手——他们知道在什么地方用、怎么用更好,也懂得审查代码,而且对生成的代码更有信心。我个人更倾向于后一种解释。
95:22
solve it then it's great but there's also like a sweet goldy lock zone if it's too hard and it's
解决了那就很好,但这里也有一个微妙的“金发姑娘区”——如果太难了,那就是在浪费时间。不过我觉得这又是另一个挑战:人们要如何学习呢?我们看的那张图表显示,资深开发者比初级开发者生成了更多AI代码。我觉得这很有意思,因为直觉上你会认为是初级开发者,因为他们可能还不知道怎么做某件事,所以用AI来做。这可能意味着AI还不够好,无法解决那个任务,但也可能意味着专家更擅长使用它——他们知道在什么地方以及如何更好地使用它,并且会审查代码,对代码也更信任。所以我认为……
95:26
you know wasting your time but I think that is another challenge though how will people learn
你知道这挺浪费时间的,但我觉得这又是另一个挑战——人们要怎么学习呢?
95:34
the chart we looked at we saw that more senior developers are shipping more AI generated
我们刚才看的那张图显示,资深开发者比初级开发者提交了更多AI生成的代码。我觉得这很有意思,因为直觉上你会以为是初级开发者用得更多,毕竟他们可能还不太会做某些事。
95:40
code than the junior ones and I think it's very interesting because intuitively you would think it's
数学和代码是最典型的例子,然后还有很多工作都集中在所谓的“verbricks”上。
95:44
the junior developers because they don't know let's say how to do the thing yet because they are
比如“这个问题的一个好答案应该是什么样的”,然后你可以反复尝试、自我修正。
95:49
more junior and so they use AI to do that thing it could either mean the AI is not good enough yet
资历较浅的人会用AI来做这件事,这可能意味着AI还不够好。
95:55
to solve that task but it could also mean experts are more effective at using it they know
要完成那个任务,但这也意味着专家在使用它时更高效——他们知道该在哪儿用、怎么用更好,还能审查代码,并且更信任这些代码。所以我觉得,像数学教科书这种东西,你看答案确实能学到东西,但如果你先自己尝试,然后再去理解答案,效果其实更好,因为你能把它放进自己的思维框架里。如果答案一直摆在那儿,你真的会花时间去挣扎吗?你愿意去挣扎吗?因为挣扎并不好受,对吧?我是说,那确实很难受。如果你用AI来做所有事,总有一天你永远不会真正迈出下一步,然后你可能就永远无法获得那种突破。
96:00
where and better how to use it and review the code and they trust the code then more and so I think
在哪里以及如何更好地使用它,并审查代码,他们信任代码,然后越来越多,所以我觉得
96:06
one issue in the society in the future will be though how do you become an expert if you never
未来社会的一个问题是,如果你从不亲自尝试做一件事,你怎么能成为专家?对我来说,学习的方式一直是亲自尝试,比如数学课本,如果你直接看解答,确实能学到东西,但我觉得如果你先自己尝试,然后再看解答,你会理解得更深刻,因为你知道如何把它放进自己的思维框架里。如果所有东西随时都能拿到,你还会愿意经历那种挣扎的过程吗?你会愿意去挣扎吗?因为挣扎并不好受,对吧?我是说,它就是挣扎。如果你用AI来做所有事情,总有一天你永远不会真正迈出下一步,然后你可能就得不到那种顿悟了。
96:11
try to do the thing yourself and I think one way it's always like for me how I learn is by trying
自己动手试试看。对我来说,学习的方式一直就是亲自尝试。比如数学课本,看解答当然能学到东西,但我觉得先自己试一遍,再去看解答,理解会更深刻,因为你知道了怎么把它放进自己的思维框架里。如果答案随时都在,你真的会愿意花时间去挣扎吗?你愿意去经历那种挣扎吗?毕竟挣扎不好受,对吧?它就是很难受。如果你用AI做所有事,总有一天你永远不会真正迈出下一步,可能也就得不到那种突破。每天学两小时,其余时间用LLMs,这没问题,但我觉得更重要的是——
96:18
things myself like math textbooks if you look at the solutions yeah you learn something but I think
像数学课本这种东西,如果你看答案,确实能学到一些东西,但我认为
96:23
you learn actually better if you try first and then you appreciate the solution differently
如果你先自己尝试,然后再去理解答案,实际上学得更好
96:29
because you know how to put it into your mental framework and if elements are here all the time
因为你知道如何把它放进自己的思维框架里,而且如果答案一直摆在那里
96:35
would you actually go through the length at struggling would you be willing to struggle because
你真的会经历挣扎的过程吗?你愿意去挣扎吗?
96:40
struggle is not nice right I mean it's struggling and if you use the alarm to do everything at some
因为挣扎并不好受,对吧?我是说,那确实是挣扎。如果你用工具来做所有事情,
96:45
point you will never really take the next step and then you will maybe not get that unlock that you
到了某个点,你就永远不会真正迈出下一步,然后你可能就得不到那种突破
96:50
would get as an expert using an LLM so it's like you know it's like I think there's like a
作为一个使用LLM的专家,你会觉得这就像——你知道的,有点像有个金发姑娘效应(Goldilocks spot),也许关键在于,你每天专门抽出两小时离线学习,其余时间用LLM,但我认为人们仍然需要投资自己,不能什么都靠LLM。没错,我们作为一个文明整体,每个人都需要找到自己的那个金发姑娘平衡点。
96:55
Goldilocks with spot where maybe maybe the trick here is you make dedicated offline time where you
在编程领域,作为开发者,我们已经进行了一场精彩的对话,从pre-training和mid-training开始,现在让我们进入post-training,这里面有很多有趣的东西。那么post-training中有哪些有意思的想法呢?2025年最大的一个就是learning。
97:01
study two hours a day and the rest of the day use LLMs but I think it's important also for
每天学习两小时,其余时间都用LLM,但我觉得同样重要的是,让他们自己观察输出结果,而且这种训练也促成了inference time scaling。这种RL训练确实让inference time scaling成为可能,但inference time scaling本来也可以通过其他方式实现,所以这有点像一场完美风暴——模型变化很大,而它们的训练方式在其中起了关键作用,这也改变了话语权格局。因为闭源实验室能透露的信息有限,作为学术界的人,你能做的一件事就是:你可能没有足够的算力去训练模型,但你可以用一种方式去构建框架,最终让整个社区凝聚起来——我把它描述为“社区协作”。
97:06
people to still invest in themselves in my opinion to not just you know LLM everything yeah there is
在我看来,人们还是要投资自己,不能什么都靠 LLM,对吧?
97:11
and we together a civilization that we each individually have to find that Goldilocks on
我们作为一个文明,每个人都要找到属于自己的那个 Goldilocks 平衡点。
97:16
and in the programming context as developers now we've had this fascinating conversation that started
在编程的语境下,作为开发者,我们刚刚进行了一场很有意思的对话,从 pre-training 和 mid-training 开始,现在来聊聊 post-training,这里面有很多有趣的东西。
97:21
with pre-training and mid-training let's get to post-training a lot of fun stuff and post-training
那么 post-training 里有哪些有意思的想法呢?2025 年最大的一个就是 learning,
97:28
so what are some of the interesting ideas in post-training the biggest one from 2025 is learning
大量使用这种迭代式的 generate-grade 循环,这让模型既能学会
97:34
this reinforcement learning with verifiable rewards you can scale up the training there which means
这种基于可验证奖励的强化学习(reinforcement learning with verifiable rewards)可以扩展训练规模,这意味着要大量进行这种迭代式的生成-评估循环。这让模型在工具使用和软件方面学会有趣的行为,比如自行搜索、运行命令并查看输出结果。同时,这种训练也很好地支持了推理时扩展(inference time scaling)。结果发现,这个范式之间有着非常巧妙的关联——这种RL训练方式促成了推理时扩展,但推理时扩展原本也可能通过其他途径被发现。所以这就像一场完美的风暴,模型的训练方式发生了巨大变化,这是关键因素,而这一切已经彻底改变了局面。
97:40
doing a lot of this kind of iterative generate grade loop and that lets the models learn both
在工具使用和软件方面有趣的行为,比如自己搜索、运行命令、查看输出,
97:46
interesting behaviors on the tool use and software side this could be searching running commands
同时这种训练也实现了 inference time scaling。
97:51
on their own and seeing outputs and then also that training enables this inference time scaling
靠自己、观察输出,然后这种训练也使得推理时扩展成为可能
97:57
very nicely and it just turned out that this paradigm was very nicely linked in this where it's
非常巧妙,结果这个范式恰好完美地衔接上了——这种RL训练实现了推理时扩展,但推理时扩展本来也可以通过其他方式实现。所以这就像一场完美风暴:模型变化很大,它们的训练方式是一个关键因素,这也改变并影响了整个讨论的走向,因为闭源实验室能透露的信息有限。作为学术界的人,你能做的一件事就是——你可能没有足够的算力去训练模型,但你可以用一种方式去构建框架,最终就像我描述的那样,整个社区可以围绕RLVR这个术语凝聚起来,这非常有趣。而DeepSeek就是那个真正做了训练工作的团队。
98:02
this kind of RL training enables inference time scaling but inference time scaling could have
这种RL训练使得推理时扩展成为可能,但推理时扩展其实也可以通过其他方式实现。所以这就像一场完美风暴——模型本身变化很大,它们的训练方式也是推动这一变化的主要因素。而这已经改变了话语权的格局,因为闭源实验室能透露的信息有限。作为学术界的人,你能做的一件事就是:你可能没有足够的算力去训练模型,但你可以用一种方式去构建问题框架,最终让整个社区能够凝聚起来。数学和代码是最典型的例子,此外还有很多工作围绕所谓的“verbricks”展开——比如“这个问题的好答案应该长什么样?”然后你可以反复尝试这个问题。
98:06
been found in different ways so it was kind of this perfect storm of the models change a lot
这些现象以不同方式被发现,所以这有点像一场完美风暴——模型变化很大。
98:10
in the way that they're trained is a major factor in doing so and this has changed
它们的训练方式是一个关键因素,而这一点已经改变了。
98:17
how people approach post-training dramatically can you describe RLVR popularized by deep seek R1
人们处理post-training的方式差异很大,你能讲讲被DeepSeek R1带火的RLVR吗?
98:24
can you describe how it works yeah fun fact I was on the team that came up with the term RLVR
能解释一下它的工作原理吗?其实有个趣事,我当年就是提出RLVR这个术语的团队成员之一。
98:30
which is from our 23 work before deep seek which is we don't take a lot of credit for the being the
这个术语来自我们2023年的工作,早于DeepSeek——我们并不想抢推广scaling RL的功劳,但作为学术界人士,一个有趣的附带好处就是能命名并影响行业讨论,因为闭源实验室能透露的信息有限。
98:35
people to popularize the scaling RL but it is fun as what academics get as an aside is the ability
作为学者能做的事情之一就是:你可能没有算力去训练模型,但你可以用某种方式构建概念框架,最终让整个社区围绕RLVR这个术语凝聚起来——这很有意思。而真正把训练做出来的,是DeepSeek团队。
98:42
to name and influence the discourse because the closed labs can only say so much that one of the
为了影响和引导讨论方向,因为闭源实验室能透露的信息有限,作为学者你能做的一件事是——你可能没有足够的算力去训练模型,但你可以用一种方式去构建问题,最终我称之为“社区可以凝聚起来”。
98:48
things you can do is an academic is like you might not have the compute to train the the model but you
数学和代码是最著名的领域,此外还有很多工作集中在所谓的“动词砖块”上。
98:52
can frame things in a way that ends up being I describe it as like a community can come together
对于这个问题,一个好的答案应该是什么样的?然后你可以反复尝试这个问题。
98:57
around this RLVR term which is very fun and then deep seek is the people that did the training
围绕这个RLVR术语,其实挺有意思的,而Deep Seek就是做训练的那批人。
99:02
breakthrough which is they scaled the reinforcement learning which was you'd have the model generate
突破点在于他们扩展了强化学习的规模——让模型生成答案,然后根据答案是否正确来评分,这个准确率就是强化学习的奖励信号。经典强化学习中,智能体在环境中行动,环境会反馈状态和奖励,目标是最大化奖励。在语言模型场景下,奖励通常是一组可验证任务上的准确率,比如数学题、编程测试。但有些领域会变得模糊,比如事实性知识——某种程度上也可验证,或者指令约束(比如“只用字母A开头的单词回答”),这些在某种意义上都是可验证的。而核心思路是——
99:07
answers and then grade the completion if it was right and then that accuracy is your reward for
回答后,如果正确就对其完成度进行评分,这个准确率就是强化学习的奖励。
99:15
reinforcement learning so reinforcement learning is classically an agent that acts in an environment
强化学习在经典定义中是一个在环境中行动的智能体,环境会反馈状态和奖励,而你要最大化这个奖励。
99:21
and the environment gives it a state and and a reward back and you try to maximize this reward
在语言模型的情况下,奖励通常是一组可验证任务上的准确率,无论是数学题还是编程测试。
99:26
and the case of language models the reward is normally accuracy on a set of verifiable tasks whether
但像事实性领域这类问题就开始变得模糊了——虽然它在某种程度上也是可验证的,或者像指令约束(比如“只用字母A开头的单词回复”)这类要求,所有这些东西在某种程度上都是可验证的。
99:32
it's math problems coding tests and it starts to get blurry with things like factual domains like that
而核心思路是,在采取这些RL步骤、进行这些RL评分更新的过程中,基础设施也随之演变而来。
99:39
is also in some ways verifiable or constraints on your instruction like respond only with sent
从某种意义上说,这些也是可验证的,或者是对指令的约束,比如“只回复以字母A开头的单词”——所有这些在某种程度上都是可验证的。
99:45
words that start with a like all of these things are verifiable in some way and the core idea of this
这个核心思路是,在采取这些RL步骤、进行RL评分更新的过程中,基础设施逐渐演变。
99:52
is you find a lot more of these problems that are verifiable and you let the model try it many times
你会发现这类可验证的问题越来越多,让模型反复尝试很多次,同时进行这些强化学习步骤,这些RL评分更新让基础设施也随之进化。这源于基于人类反馈的强化学习,在那个阶段,他们试图优化的分数是一个基于人类整体偏好的学习奖励模型,所以相当于改变了问题领域。这让优化过程能够扩展到更大的规模,从而引发了一场重大变革,改变了模型的能力以及人们使用它们的方式。哪些领域适合呢?数学和代码是最著名的,此外还有很多工作集中在所谓的“verbricks”上,这与人们可能听过的“LLM as a judge”这个概念相关,也就是针对每个问题。
99:58
while taking these RL steps these RL grading updates the infrastructure evolved from this
而它源自一个基于人类整体偏好训练出的奖励模型。
100:05
reinforcement learning from human feedback where in that era the score they were trying to optimize
reinforcement learning from human feedback,在那个时代,他们试图优化的分数是一个基于人类整体偏好的学习奖励模型,所以相当于你改变了问题域。这让优化可以扩展到更大的规模,从而引发了一个重大转变——模型能做什么、人们怎么用它们。哪些领域适合呢?数学和代码是最有名的,然后还有很多工作集中在所谓的“可验证规则”(verbricks)上,这跟人们可能听过的“L作为评判者”(L as a judge)有关,就是针对每个问题,先想好一个好的答案应该长什么样,然后你可以反复尝试这个问题很多次,根据这个规则来打分——这不一定是可以验证的。
100:09
was a learned reward model of aggregate human preferences so you kind of change the problem domains
所以你相当于改变了问题域,这让优化可以扩展到更大的规模,从而引发了一场重大变革。
100:16
and that let the optimization go on to much bigger scales which kind of kickstarted a major change
模型能做什么、人们怎么用它们、哪些领域适合应用——
100:22
what the models can do and how people use them what kind of domains are of the are amenable to
数学和代码是最著名的例子,此外还有很多工作集中在所谓的“verbricks”上。
100:28
math and code are the famous ones and then there's a lot of work kind of on what is called a verbricks
而我认为,这就是r1论文里那个“顿悟时刻”——他们称之为“aha moment”,因为模型自己意识到犯了错,然后说“啊,我做错了”。
100:34
which is related to a word people might have heard as L I'm as a judge which is like for each problem
这跟一个大家可能听过的词有关,就是“L作为评判者”,意思是针对每个问题,先想好一个标准答案长什么样,然后让模型反复尝试很多次,再根据这个评分标准打分。所以这不一定是一套可验证的方法,而是用在更开放式的领域里,让模型能学到更多东西。我觉得这应该叫“基于AI反馈的强化学习”吧?对,这是更早的说法,出自Anthropic的《宪法AI》论文。所以很多这类方法都是这样:你给模型出一道数学题,比如你知道正确答案,然后让模型自己去摸索解法,但具体它怎么解出来的,其实你并不太在意。
100:40
all of a set of problems in my trading data set I'll then have another language model and ask it
对于我交易数据集里的一整套问题,我会再拿另一个语言模型,让它看看这类问题应该有什么样的好答案,然后你可以反复尝试这个问题很多次,再根据这个评分标准来打分。所以这不一定像数学和代码领域那样可验证,但这个评分标准的思路,以及其他可能更模糊的科学问题,正是目前大家关注的重点——他们正试图把这套方法推广到这些更开放的领域,让模型能学到更多东西。我觉得这应该叫基于AI反馈的强化学习吧?对,这是更早的术语,出自Anthropic的Constitutional AI论文,很多这类概念都是这么来的。
100:46
what would a good answer to this problem look like and then you could try the problem a bunch of
一个合理的答案应该是什么样的,然后你可以反复尝试这个问题,自我修正。我认为这就是r1论文里那个“啊哈时刻”,他们称之为“啊哈时刻”,因为模型自己意识到犯了错,然后说“啊,我做错了”,接着会生成一个高精度的十进制答案。这意味着使用工具来获得非常精确的答案,但一个没有工具的language model永远做不到。在这些reinforcement learning论文中,它们基于Qwen进行训练,并专门在数学基准上做评估,而关于数据污染的多篇论文都在讨论:像这样的模型能学到多少?关键在于非常仔细的数据筛选,提供广泛多样的数据。
100:50
times over and over again and assign a score based on this rubric so that's not necessarily verifiable
一遍又一遍地重复,然后根据这个评分标准打分,所以这不一定可验证
100:55
like a math and code domain but this rubric's idea and other scientific problems that it might be
像数学和代码领域,但这个评分标准的概念以及其他科学问题可能更模糊一些,这正是大家关注的重点——他们正试图把这套方法推广到这些更开放的领域,让模型能学到更多东西。
101:01
a little bit more vague is where a lot of the attention is where they're trying to push this
我觉得这应该叫“基于AI反馈的强化学习”吧,这是更早的术语,出自Anthropic的Constitutional AI论文。所以很多这类方法都源于此——比如你给模型出一道数学题,你知道正确答案,然后让模型像你说的那样自己去摸索,但具体怎么做到,其实你并没有太多限制。当然也可以加一些约束,比如要求使用同一种语言,不要来回切换。
101:05
set of methods into these kind of more open-ended domains where the models can learn a lot more
把这些方法应用到更开放的领域,让模型能学到更多东西
101:11
I think that's called reinforcement running with AI feedback right that's the older term from it
我觉得这叫做基于AI反馈的强化学习吧,那是更早的说法
101:15
that was coined in Anthropics Constitutional AI paper so it's like a lot of these things come in
这个术语来自Anthropic的Constitutional AI论文,所以很多这类概念都是这么来的
101:20
cycles also just one step back for the rlvr so I think the interesting beautiful thing here is
对于 rlvr 来说,这也只是往回退了一步。所以我觉得这里最有趣也最美妙的地方在于,你给模型出一道数学题,比如,然后你知道正确答案,接着你让模型自己去摸索出来,就像你说的那样。但它是怎么做到的?我的意思是,你其实没有给它太多限制。当然你也可以加一些约束,比如“用同一种语言,不要在西班牙语和英语之间来回切换”,但基本上你是不怎么干预的,你只给出问题和答案,然后模型的任务就是自己找到正确答案。而真正美妙的地方在于,实际发生的情况是,模型会像学生一样,或者像数学家那样,一步步地描述推导过程,就像你推导解法那样。
101:26
that you you asked the element let's say a math question and then you know the correct answer
比如你给模型出一道数学题,然后你知道正确答案
101:31
and you let the element like you said figure it out but how it does it I mean you don't really
你让模型像你说的那样自己去琢磨,但具体怎么做到,其实你并不真正
101:36
constrain it much there are some constraints you can add like use the same language don't switch between
给它加一些约束,比如要求用同一种语言,不要来回切换答案,然后模型必须完成那个任务,得出正确答案。但真正妙的地方在于,实际运行中模型会给出逐步推导的过程,就像学生或数学家那样展示如何得出解法,从而提升自身准确性。然后就像你提到的,推理时扩展(inference scaling),大致意思就是在推理阶段使用模型时投入更多算力。这里的推理时扩展指的是模型会生成更多token,而且我记得在r1论文里提到,训练时间越长,模型输出的回答就越长,这个长度会随着训练逐渐增长。
101:41
Spanish and English but let's say you're pretty much hands off you only give the question and the
西班牙语和英语,但假设你基本不插手,只给出问题和答案,然后模型需要自己完成推导正确结果的任务。但这里最妙的地方在于,实际运行中模型会像学生或数学家那样,一步步描述推导过程,从而提升自身准确性。就像你提到的inference scaling,inference scaling大致意味着在inference阶段让模型消耗更多算力。这里的inference scaling具体表现为模型会生成更多token,而且我记得在r1论文里提到,模型训练时间越长,生成的回答就越长——这种长度会随时间增长。
101:46
answer and then the element has to you know just the task to arrive at the right answer but the
给出答案,模型只需要完成任务得出正确答案就行
101:52
beautiful thing here is what happens in practice is that the element will do a step-by-step description
但这里美妙的地方在于,实际中模型会给出一步步的推理过程
101:58
like you know like a so student or like a so yeah mathematician how you would derive the solution
就像,你知道,比如一个学生或者数学家,他们会怎么推导出答案。
102:03
it will give you or it will use those steps and that helps actually the model to
它会按照这些步骤来操作,这实际上能帮助模型提升自身的准确性。然后就像你提到的,inference scaling——inference scaling 大致意思就是在推理阶段投入更多算力。这里的 inference scaling 指的是模型会使用更多 token,而且我记得在 r1 论文里,他们发现模型训练时间越长,生成的回答就越长,随着时间推移会不断变长,使用的 token 也更多。所以对于简单任务来说,成本会变得更高。但这些解释过程确实能帮助模型提高准确性,同时也有很多论文指出,模型给出的解释不一定正确,甚至可能和问题毫无关系。
102:08
improve its own accuracy and then like you said the inference scaling so inference scaling
提升自身的准确性,然后就像你说的,inference scaling。Inference scaling 大致意思就是在推理过程中投入更多算力。
102:12
loosely means basically spending more compute during using the element during inference and here
这里的 inference scaling 指的是模型会使用更多 token,而且我记得在 r1 论文里,
102:18
the inference scaling is that the model would use more tokens and also I think in the r1 paper
他们展示了训练时间越长,模型的回答就越长,这些回答会随着时间增长。
102:24
they showed the longer they train the model the longer the responses are they they grow over time
但这说明模型给出的解释不一定正确,甚至可能跟解释本身毫无关系。
102:29
they use more tokens so it becomes more expensive becomes more expensive for simple tasks but
它们用了更多token,所以简单任务成本更高了。但这些解释确实能提升模型准确率——很多论文也证明了这一点。不过模型给出的解释不一定正确,甚至可能和解释本身毫无关联。我觉得这又回到了那个问题:我不想把这些元素拟人化,但这确实有点像我们人类的行为模式。比如数学课上遇到复杂题目,你通常会拿草稿纸一步步演算、划掉错误步骤。模型也会自我修正——这大概就是r1论文里那个"aha moment"的灵感来源。他们称之为"顿悟时刻",因为模型自己意识到犯了错,然后说"啊,我搞错了"。
102:33
these explanations they help the model with the accuracy they're also interesting a lot of papers
这些解释确实帮助模型提升了准确性,很多论文也展示了这一点。但模型给出的解释不一定正确,甚至可能与解释本身无关。而且我觉得——虽然我不想把这些元素拟人化——但这其实有点像我们人类运作的方式,对吧?比如在数学课上遇到一道复杂的题目,你通常会拿草稿纸一步步推导,划掉错误的部分。模型也会自我修正,而这正是R1论文里所谓的"顿悟时刻"——模型自己意识到犯了错,然后说"啊,我做错了",接着重新作答。它通过这种方式摸索出解题方法,某种意义上确实和人类的行为很相似。
102:38
showing but the model explains does not necessarily have to be correct or maybe it's even unrelated to
而且我觉得,还是那句话,我不想把这些元素拟人化,
102:43
the answer but for some reason it still helps the model like this is the fact that it is
答案是这样,但出于某种原因它仍然对模型有帮助——事实上,它是在进行解释。而且我觉得,再次强调,我不想把这些元素拟人化,但这有点像我们人类运作的方式,对吧?比如数学课上遇到一个复杂问题,你通常会有张草稿纸,一步步推导,划掉错误的东西。模型也会自我修正,我认为这就是r1论文里所谓的“顿悟时刻”。他们称之为“顿悟时刻”,是因为模型自己意识到犯了错,然后说“啊,我做错了”,接着再尝试。我觉得这太酷了,仅仅通过给出正确答案并让模型自己摸索方法,它就能在某种意义上像人类一样行事。
102:49
explaining and I think it's also again I don't want to anthropomorphize these elements but it's
但这有点像我们人类是怎么运作的,对吧?比如在数学课上遇到一个复杂的数学问题。
102:53
kind of like how we humans operate right if there's a complex math problem let's say in a math class
就像我们人类处理问题的方式一样,比如在数学课上遇到一个复杂的题目,我们会自我纠正。我觉得这就是r1论文里那个“aha moment”(顿悟时刻),他们管它叫“aha moment”。因为模型自己意识到犯了错,然后说“啊,我做错了”,接着重新给出答案,让它自己摸索出解法——这在某种意义上就跟人类会做的事一样。但我们也会学会去复核检查。这里面有很多内容,我觉得今年有一些争论,关于语言模型是不是真的能产生这种“aha moment”。有人认为这些“aha moment”其实是假的,因为在pre-training(预训练)阶段,模型基本上已经看遍了整个互联网,所以它肯定见过人们解释自己思路的过程,甚至包括口述的转录文本。
102:59
you usually have a note paper and you do it step by step you cross out things and the model also
你通常拿张草稿纸,一步一步来,划掉一些东西,模型也会自我纠正。我觉得这就是r1论文里那个“aha moment”——他们管它叫“aha moment”——因为模型自己意识到它犯了个错,然后说“啊,我做错了”,接着重新回答。从某种意义上说,它做的跟人类差不多,但我们也能学会去复核。这里面有很多内容。我觉得有些争论——今年有很多争论——说语言模型里的这种“aha moment”其实是假的,因为在预训练阶段,你基本上已经看遍了整个互联网,所以你肯定见过别人解释他们的工作,哪怕是口头上的,比如一段转录文本。
103:04
self correct and that that was I think the aha moment in the r1 paper they called it aha moment
自我纠正——我认为那就是r1论文中的“啊哈时刻”,他们称之为“啊哈时刻”,因为模型自己意识到犯了错误,然后说“啊,我做错了”,并会生成一个非常高精度的答案,比如用十进制表示结果,这意味着它借助工具得到了极高精度的答案。但一个没有工具的语言模型永远做不到这一点。
103:09
because the model itself recognized it made a mistake and then said ah I did something wrong and
在这些reinforcement learning论文中,有些是在quen上训练,并专门在某个数学基准上测量效果,而关于这个基准,已经有多篇论文讨论过数据污染问题,比如污染程度有多大。
103:13
so let me try and I think that's just so cool that this falls out of just giving it the correct
让我试试看,我觉得这真的太酷了——你只需要给它正确的答案,让它自己琢磨出怎么做,结果它某种程度上就做出了人类会做的事情。另一个好的副作用是,对我们人类来说,看到这些步骤往往很有帮助,它能建立信任,而且我们也能学习,可以双重检查一些东西。这里面有很多内容,我觉得今年有一些争论——关于语言模型像这样的“啊哈”时刻是不是假的,因为在pre-training阶段你基本上已经看过了整个互联网,所以你肯定见过人们解释他们的工作,甚至口头上的,比如数学讲座的transcript——你试这个,哦我搞错了——而reinforcement learning,这个RLVR,是非常……
103:19
answer and having it figure out how to do it that it kind of does in a sense what a human would do
回答并让它自己想办法完成,这其实在某种意义上就像人类会做的事。
103:26
although and I am don't think my humans it's kind of like an interesting coincidence and then
虽然我个人不觉得,但对我这样的人类来说,这算是个有趣的巧合。另一个好处是,对我们人类来说,看到这些步骤往往能建立信任,同时我们也能学习并复核结果。这里面有很多内容值得探讨。我觉得今年有很多争论,关于语言模型是否真的存在那种“啊哈”时刻——我认为这些“啊哈”时刻有点虚假,因为在pre-training阶段,模型基本上已经看遍了整个互联网,肯定见过人们解释自己的工作,甚至包括口头讲解,比如数学讲座的转录文本:“你试试这个,哦我搞错了”。而reinforcement learning,特别是RLVR,非常擅长放大这类行为,因为这些行为对提升模型能力非常有用。
103:31
the other nice side effect is it's great for us humans often to see these steps it builds trust
另一个不错的副作用是,对我们人类来说,看到这些步骤往往有助于建立信任,同时我们也能学到东西,可以双重检查。这里面有很多内容,我觉得今年关于语言模型的一些争论——比如那些“啊哈”时刻——其实是有点假的,因为在pre-training阶段,模型基本上已经看遍了整个互联网,所以它肯定见过人们解释自己的工作,哪怕是口头形式的,比如数学讲座的转录文本,里面会有“哎呀,我搞错了”这种话。而reinforcement learning,具体来说这个RLVR,在Math 500上,基础模型的准确率只有大约15%,但仅仅50步,也就是几分钟之内,用了RLVR之后,模型准确率就从15%提升到了50%。这个模型的表现,你没法跟我说它不厉害。
103:37
but also we learn we can double check things there's a lot in here I think some of the debate
但我们也学到了可以反复检查,这里面有很多内容。我觉得今年的一些争论——
103:42
there's been a lot of debate this year on if the language models like these aha I think the aha
今年有很多争论,关于像这样的语言模型,那些“啊哈”时刻其实是假的,因为在预训练阶段,你基本上已经看过了整个互联网,
103:46
moments are kind of fake because in pre-training you essentially have seen the whole internet so
所以你肯定见过人们解释自己的工作,哪怕是口头形式的,比如一段转录的文字。
103:51
you have definitely seen people explaining their work even verbally like a transcript of a
如果你只改数字但保留文字,奎恩(Quen)不用工具也能给出非常高的准确率,比如用十进制表示答案,
103:56
math lecture you try this oh I messed this up and what reinforcement learning is this RLVR is very
数学讲座上你试这个,哦我搞砸了,然后这个强化学习就是RLVR,非常明显。
104:01
good at doing is amplifying these behaviors because they're very useful in enabling the model
擅长的是放大这些行为,因为它们在让模型发挥作用时非常有用。
104:05
to think longer and to check its work and I agree that is very beautiful that this training kind
思考更久,并检查自己的推导过程。我也觉得这很美妙——这种训练方式让模型学会放大这种能力,最终对得出正确答案非常有帮助。
104:11
of the model learns to amplify this in a way that is just so useful at the final answers being
我可以给你一个实际操作的例子。我在训练Grand 3基础模型时,用RLVR在Math 500上跑了一下。基础模型的准确率大概只有15%,但仅仅50步,几分钟之内,用RLVR就让模型从15%提升到了50%的准确率。而且你不能跟我说,这模型在硬币例子里学到了什么关于数学本质的东西——这很奇怪,因为今年有两篇论文,其中一篇我也参与了,专门讨论了硬币数据集里的数据污染问题,尤其是他们在那个特殊的中间训练阶段用了大量这类数据。
104:16
I can give you also a hands on example I was training the grand three base model with RLVR on
我可以给你一个实际例子:我当时用RLVR在math 500上训练grand three base model,这个base model的准确率只有大约15%。仅仅50步,几分钟之内,用RLVR模型就从15%提升到了50%的准确率。而且你不能跟我说,它在根本上学会了什么关于数学的新知识。coin这个例子之所以奇怪,是因为今年有两篇论文——其中一篇我参与了——讨论了coin中的数据污染问题,具体来说就是他们在那个特殊的mid-training阶段训练了大量数据。我们基本上可以看到,RL并没有教给模型任何新的数学知识,你根本做不到这一点。
104:22
math 500 the base model had an accuracy of about 15 percent just 50 steps like in a few minutes
Math 500上,基础模型的准确率大概只有15%,仅仅50步,几分钟之内。
104:29
with RLVR the model went from 15 percent to 50 percent accuracy and the model you can't tell me
用了RLVR之后,模型从15%的准确率提升到了50%,而且这个模型你没法跟我说。
104:35
it's learning anything about fundamentally what math in the coin example is weird because there's
它到底有没有学到关于数学本质的东西?硬币那个例子很奇怪,因为今年有两篇论文,其中一篇是我参与的,讨论了硬币里的数据污染问题。具体来说,他们在那个特殊的中期训练阶段训练了大量数据,就像我们看到的那样——基本上RL并没有教模型任何新的数学知识,你做不到这一点。我不同意这个前提,因为有很多奇怪的复杂性你无法证明。其中一个指向奇怪现象的点是,如果你拿Qwen 3所谓的base模型,你可以在屏幕上搜一下,比如去Hugging Face搜数学数据集,然后找一个题目,把它输入到Qwen 3 base里,所有这些数学……
104:40
been two papers this year one of which I was on that talks about data contamination in coin and
今年有两篇论文,其中一篇是我参与的,讲的是coin里的数据污染问题。
104:44
specifically that they train on a lot of this special mid-training phase that we just like a
具体来说,他们在那个特殊的中期训练阶段训练了大量数据,这个阶段就像我们刚才看到的。
104:48
minute on it's weird so they train on problems that are almost identical exactly and so you can
等一下,这有点奇怪。所以他们训练的问题几乎一模一样,所以你可以看到,基本上RL并没有教模型任何新的数学知识——你不可能在50步里做到这一点。所以知识已经在那里了,预训练只是在解锁它。我仍然不同意这个前提,因为有很多奇怪的复杂性你无法证明。其中一个指向奇怪现象的点是,如果你拿所谓的Qwen 3基础模型,你可以——你可以在屏幕上谷歌一下,比如去Hugging Face上找数学数据集——然后拿一个问题,如果你把它输入Qwen 3基础模型,所有这些数学问题都有一个词,比如“Alice有五个苹果,拿走一个,给了三个给某人”。
104:55
see that basically the RL it's not teaching the model any new knowledgeable math you can't do that
基本上RL并没有教模型任何新的数学知识,你做不到这一点。
105:00
in 50 steps so the knowledge is already there and the pre-training you're just unlocking it I still
在50步之内,知识其实已经存在了,而预训练只是在解锁它。但我还是不太同意这个前提,因为有很多奇怪的复杂性是你无法证明的。其中一个体现奇怪之处的地方是,如果你拿Qwen 3所谓的base模型,你可以去谷歌上搜一下,比如搜“math dataset hugging face”,然后找一个数学问题。如果你把这个问题输入到Qwen 3 base里——这些数学题通常都带文字描述,比如“Alice有五个苹果,她拿走一个,又给了三个给某人”——如果你把数字改掉,但保留文字不变,Qwen在不借助工具的情况下,会以非常高的准确率输出答案的十进制表示。这意味着存在某种……
105:04
disagree with the kind of premise because there's a lot of weird complexities that you can't prove
我不同意这个前提,因为有很多奇怪的复杂性是你无法证明的。
105:09
because one of the things that points to weirdness is that if you take the quen 3 so called base
因为其中一个指向奇怪现象的证据是,如果你拿所谓的Qwen 3基础模型来看。
105:14
model and you can you could google on the screen you could google like math data set hugging phase
模型是这样的——你可以在屏幕上搜一下,比如搜“math data set hugging face”。然后拿一道题出来,如果把它输入到Quen 3 base模型里,这些数学题,如果你只改数字但保留文字,Quen会给出一个非常高的错误率,在没有工具的情况下。它会给出一个非常高的准确率,比如答案的十进制表示,这意味着用工具能得到高精度答案,但一个没有工具的语言模型永远做不到这一点。所以研究社区里一直有个大争论:这些强化学习论文,它们在Quen上训练,并且专门用这个数学基准来评估——已经有多篇论文讨论过数据污染问题——到底有多少是真正有效的?
105:19
and you could take a problem and what you do if you put it into quen 3 base the all these math
你可以拿一个问题,把它丢进Qwen 3 Base里,然后这些数学题——如果你只改数字但保留文字,Qwen会给出一个非常高的错误率,不用工具的话。它会输出一个非常高的准确率,比如用十进制表示答案,这意味着用工具能得到极高精度的答案,但一个没有工具的语言模型永远做不到这一点。所以研究社区里一直有个大争论:这些强化学习论文,很多都是在Qwen上训练,然后专门用这个数学基准来评估——已经有好几篇论文在讨论数据污染的问题——就是Qwen和类似模型到底有多少是依靠精心策划的数据集,提供了一堆广泛的……
105:24
problems have a word so it'd be like Alice has five apples and takes one and gives three to whoever
问题有一个词,比如爱丽丝有五个苹果,拿走一个然后给了三个给某人。如果你改变数字但保留词汇,Quen会产生非常高的错误率(如果没有工具的话)。会产生非常高的准确率,比如答案的十进制表示,这意味着使用工具可以得到非常精确的答案,但没有工具的语言模型永远无法真正实现这一点。所以研究社区一直有个大争论:这些强化学习论文有多少是在Quen上训练并专门在这个数学基准上测试的?已经有几篇论文讨论过数据污染问题——你怎么能这么快就获得这些提升,因此这些能力肯定已经存在于模型中了,但还有很多争议。
105:29
and there's these word problems with these quen base models why people are suspicious of them is
而且关于这些Qwen基础模型,有个文字题的问题让大家怀疑它们——如果你换掉数字但保留文字,Qwen在不使用工具的情况下会产生非常高的错误率,但使用工具时却能给出非常精确的答案,比如用小数形式表示结果。这意味着,在某些时候,它看到的题目几乎和测试集一模一样,然后它借助工具得到了极高精度的答案。但一个没有工具的语言模型实际上永远做不到这一点。所以研究社区里一直有个大争论:那些基于Qwen训练、并专门用这个数学基准来评估的强化学习论文——尤其是已经有不止一篇论文讨论过数据污染的情况下——到底有多少可信度?
105:34
if you change the numbers but keep the words quen will produce like a very high death without tools
这意味着使用工具可以得到非常精确的答案,但一个没有工具的语言模型永远做不到。
105:40
will produce a very high accuracy like decimal representation of the answer which means there's
会生成一个非常高精度的答案,比如用十进制表示,这意味着
105:45
some like at some time it was shown problems that were almost identical to the test set and it was
比如,曾经有段时间,有人发现一些问题和测试集几乎一模一样,然后通过工具得到了非常精确的答案。但一个没有工具的语言模型永远做不到这一点。所以,研究社区里一直有个大争论:那些基于Qwen训练、专门在某个数学benchmark上做评测的强化学习论文——而且已经有多篇论文讨论过数据污染问题——到底有多少提升是这么快速获得的?因此这些能力是不是本来就已经在模型里了?但这里面有很多复杂性,我们其实并没有真正做控制实验,所以根本说不准。不过,如果这个说法不成立的话,那distillation按理说就不该有效,对吧?我是说,distillation确实是可以起作用的。
105:50
using tools to get a very high precision answer but a language model without tools will never
通过工具可以获得极高精度的答案,但一个没有工具的语言模型永远做不到
105:56
actually have this so it's kind of been this big debate in the research community is like how much
其实在学术界一直有个很大的争论,就是这些基于Qwen训练的强化学习论文,专门用那个数学基准来评估效果——而已经有不止一篇论文讨论过数据污染的问题——到底能在多大程度上证明什么。像Qwen这类模型,真正关键的是精细的数据筛选,提供广泛多样的训练阶段,最终把这些能力注入模型。所以问题的回答风格、格式,以及你用来解题的方法,其实在训练这些模型时都是紧密关联的。这也是为什么RLHF仍然能让模型在数学上表现更好,但这些可验证的领域(verifiable domains)要直接得多。
106:01
of these reinforce learning papers that are training on quen and measuring specifically on this like
这些强化学习论文中,有些是在 Quen 上训练,并专门在某个数学基准上做评估
106:06
math benchmark where there's been multiple papers talking about contamination is like how much can
而关于这个基准,已经有多篇论文讨论过数据污染的问题,比如到底有多少
106:11
you believe them and I think this is what caused the reputation of RLVR being about formatting because
你相信他们,我觉得这就是为什么RLVR会落得个“只是在搞格式”的名声,因为你能这么快就获得这些收益,所以肯定模型里本来就有这些能力,但这里面其实有很多复杂性,我们这又不是严格控制的实验,所以你根本搞不清楚。但如果这不是真的,那我说蒸馏就不会起作用,对吧?我是说蒸馏在一定程度上是能起作用的,但问题是,我觉得最大的问题在于——我研究这个——数据污染,因为我们根本不知道数据里有什么,除非你有一个全新的数据集,否则真的没法判断。就像你提到的那个数学数据集,给一个问题、一个答案,还附带了解释,但甚至连更简单的像MMLU这样的数据集也一样。
106:16
you can get these gains so quickly and therefore must already be in the model but there's a lot of
这些收益来得太快了,所以肯定已经存在于模型里了,但有很多情况是——
106:20
complexity here that we it's not really like controlled experimentation so you don't really know
这里的复杂性在于,它并不是真正意义上的受控实验,所以你其实没法确定。
106:26
but if it weren't true I would say distillation wouldn't work right I mean distillation can work to
但如果这个假设不成立,那我觉得蒸馏就不会有效果,对吧?我的意思是,蒸馏确实能起作用。
106:32
some extent but the thing is that is I think the biggest problem and I'm research this
某种程度上,但问题是,我觉得最大的问题在于——我就在研究这个——数据污染。因为我们根本不知道数据里有什么,除非你有一个全新的数据集,否则真的没法判断。就像你提到的数学数据集,它给了一个问题、一个答案和一段解释,但哪怕更简单的东西,比如MMLU,如果你把括号换成点号之类的,模型的准确率就会差很多。我觉得这更像是模型本身的问题,而不是普遍性问题,而且这也不是LM开发者故意使坏,说什么“嘿,我们想在这个基准测试上作弊”,它只是模型在某个时间点见过类似的东西。我认为唯一公平的方式来避免这种情况,就是搞一个全新的基准测试。
106:36
contamination because we don't know what's in the data it's unless you have a new data set it's
污染问题是因为我们不知道数据里有什么,除非你有一个全新的数据集,否则真的没法避免。
106:40
really impossible and the same you mentioned on math or the math data set which is give a question
还有你提到的数学数据集,就是给一个问题、一个答案,再附带一个解释。但即使是像MMLU这样更简单的数据集,如果用了点号而不是括号之类的,模型的准确率也会差很多。
106:46
and an answer and an explanation is given but then also even something simpler like mm and u which
我觉得那可能更像是一个模型层面的问题,而不是普遍性问题。而且这也不是LM开发者故意使坏,说什么“我们想在这个基准测试上作弊”,它只是模型之前见过类似的东西。
106:51
is a multiple choice benchmark if you just change the format slightly like I don't know you
这是一个多选题基准测试,如果你稍微改一下格式,比如我不知道,把括号换成点号之类的,模型的准确率就会差很多。我觉得这更像是模型本身的问题,而不是普遍性问题,而且这也不是LM开发者故意使坏,比如“嘿,我们想在这个基准测试上作弊”,只是模型在某个时间点见过类似的东西。我认为唯一公平地避免LM作弊的方法,就是搞一个在模型部署截止日期之后才发布的新基准测试。你提到了布局,那后训练阶段所有东西的“配方”大概是什么样的?还有你提到我们的RLVR效果非常棒,也许我们应该详细讲讲。RLHF仍然非常重要。
106:58
use a dot instead of a parenthesis or something like that the model accuracy will vastly differ
用点号代替括号或类似符号,模型的准确率就会天差地别。
107:04
I think that that could be like a model issue rather than a general issue and it's not even malicious
我觉得这更像是一个模型本身的问题,而不是普遍性问题,而且这甚至不是
107:10
by the developers of the lm like hey we want to cheat at that benchmark it's just it has seen
LM 开发者的恶意行为,比如“嘿,我们想在那个基准测试上作弊”,只是它已经见过
107:13
something at some point and I think the only fair way to avoid an lm is to have a new benchmark that
某个时间点,我觉得唯一公平避免语言模型的方式就是搞一个新的基准测试,把所有要放到后训练阶段的东西都列进去。你提到我们的RLVR是一个非常有效的进展,也许我们应该详细讲讲,RLHF仍然很重要。按顺序来说,你可以把它看作是让o1——也就是第一个推理模型——成为可能的关键,或者未来的最新模型会是什么样。实际上,在这些阶段你会采取类似的干预措施,从中间训练开始,而传闻中让o1以及类似模型得以实现的关键,是非常仔细的数据筛选,提供大量所谓的推理轨迹,也就是模型在前向过程中生成文字。
107:19
is after the cutoff date when the lm was deployed giving the layout what would be the sort of the
在语言模型部署的截止日期之后,针对布局阶段,你会给出怎样的配方,涵盖所有后续训练要做的事情?你提到我们的rlvr是一个非常令人兴奋且有效的工具,也许我们应该详细展开一下。rlhf仍然非常重要,按顺序来看,我认为你可以把它看作是让o1——也就是第一个推理模型——成为可能的关键,或者未来的最新模型也会依赖它。实际上,在这些阶段你会采取类似的干预措施,从中间训练开始,而传闻中让o1及类似模型得以实现的关键,是极其精细的数据筛选,提供大量所谓的“推理轨迹”,也就是模型在前向过程中生成文字的过程。
107:25
recipe of all the things that would be going to post training and you mentioned our rlvr was a
所有后续训练会用到的内容配方了。你提到我们的 RLVR 是一个
107:30
really exciting effective thing maybe we should elaborate rlhf still has it a really important
非常令人兴奋且有效的方案,也许我们应该详细讲讲。RLHF 仍然非常重要。
107:36
component to play what kind of other ideas are there on post training I think you can kind of take
在post training阶段,除了这个组件还能玩出什么花样?我觉得可以按顺序来理解。你可以把它看作是什么让o1——也就是第一个reasoning模型——成为可能,或者未来的最新模型会是什么样。实际上,在这些环节中你会看到类似的干预手段:从mid training开始,传闻中让o1和类似模型得以实现的关键,就是非常精细的数据筛选。你要提供大量所谓的reasoning traces,也就是模型在正向生成过程中输出的文字,这些文字反映了将问题拆解成中间步骤并尝试解决的过程。所以在mid training阶段,你需要类似这样的数据,这样才能确保后续的步骤顺利进行。
107:41
this in order I think you can view it as what made oh one which is this first reasoning model
按顺序来说,我认为你可以把它看作是让 o1——也就是第一个推理模型——
107:46
possible or what will the latest model be and they actually have you're going to have similar
成为可能的东西,或者未来的最新模型会是什么样。实际上,你会遇到类似的
107:53
interventions at these where you start with mid training and the thing that is rumored to enable oh
在这些干预措施中,从mid training开始,传闻中能让o1及类似模型实现突破的关键,其实是极其精细的数据筛选——你要提供一套广泛的所谓“推理轨迹”,也就是模型在正向生成过程中输出的文字序列。某个动作或补全结果的好坏,取决于它相对于同一问题的其他答案的表现。这些领域难度极高,想在任何方面做对都极其困难。如果实验室里的模型都在向这些更难的领域推进,它们就能在更多问题上进行训练,从而一次性学会更多技能。早期的RLHF有点像——而且现在也依然是——模型的最后一道打磨工序,能让模型变得更有用。
107:59
one and similar models is really careful data curation where you're providing a broad set of like
one and similar models 的关键在于非常精细的数据筛选,你要提供广泛多样的风格和格式,实际上你解决问题所用的方法,在训练这些模型时都是紧密关联的,这就是为什么 RLHF 仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。训练过程其实更奇怪,因为现实就是你在分配多少时间、如何相互配合,而且它极其高效,而 RL 有那么多复杂的环节,生成一个十万 token 的序列可能要花很长时间——想想看,RL 的运行时长可能已经接近 pre-training 的天数了,但大概率还没超过。
108:05
what is called reasoning traces which is just the model generating words in a forward process
所谓的推理轨迹,其实就是模型在前向生成过程中输出的文字。
108:12
that is reflecting like breaking down a problem into intermediate steps and trying to solve them so
这其实就是在把问题拆解成中间步骤,然后一步步去解决。所以在中期训练时,你需要有类似的数据,这样当你推进到下一步时,才能确定该给模型哪些问题,以及能训练它多久,还有在解决这些可验证的问题时,能让模型使用多少推理能力。随着模型越来越强,某些问题就不再是模型能100%解决的了,因此信号会变得非常微弱。如果我们看GRPO公式,它在这方面很有名,因为本质上,给智能体的奖励取决于某个动作——也就是某个生成结果——相对于同一问题的其他答案有多好。
108:16
at mid training you need to have data that is similar to this to make it so that when you move
在训练中期,你需要有类似这样的数据,这样当你推进时才能确保效果。
108:21
into post training primarily with this verifiable rewards it can learn and then what is happening
在后期训练中,主要依靠这种可验证的奖励机制,模型就能学习。而目前的情况是,你正在决定给模型提供哪些问题,以及你能训练它多长时间,还有在解决这些可验证问题时,你能让模型使用多少推理能力。随着模型变得更强,某些问题就不再是模型能100%解决的了,因此信号会变得非常微弱。如果我们看一下GRPO公式——这个公式在这方面很出名——本质上,给智能体的奖励取决于某个动作(即某个完成结果)相对于同一问题的其他答案有多好。所以如果所有问题都得到相同的答案,这类算法中就没有信号了。
108:28
today is you're figuring out which problems to give the model and how long you can train it for
现在的问题在于,你要决定给模型哪些题目,以及你能训练它多长时间。
108:35
and like how much inference you can enable the model to use when solving these verifiable problems
还要考虑在解决这些可验证的问题时,你能让模型使用多少推理能力。
108:41
so as models get better certain problems are no longer like the model will solve them 100%
随着模型变得更好,某些问题就不再是模型能百分之百解决的了,因此如果我们看GRPO公式,这里面的信号会变得非常微弱。
108:48
of the time and therefore there's very little signal in this if we pull if we look at the
这个公式之所以出名,是因为它本质上给智能体的奖励,是基于某个动作——也就是某个生成结果——相对于同一问题域内其他答案的好坏程度。
108:52
GRPO equation this one is famous for this because essentially the reward given to the agent is based on
这真的太难了,要在那个领域里做对任何事都不容易,如果你有一个实验室的话。
108:59
how good a given action action is a completion is relative to the other answers to the same problem
一个动作或补全的好坏,是相对于同一问题的其他答案而言的。
109:05
so if all the problems get the same answer there's no signal in these types of algorithms so what
所以如果所有问题都得到相同的答案,这类算法里就没有信号了。有些领域真的很难,比如要答对任何东西都极其困难。如果你有一个实验室或者类似的东西,它就会生成大量token,或者更难的软件问题。所以前沿模型都在向这些更难的领域推进,它们可以训练更多的问题,模型也能一次性学到更多技能。早期的Jeff链接有点像——早期Jeff一直是,现在也仍然是模型的收尾工作,它通过改进组织、风格或语气让模型变得更有用。不同的东西能引起不同受众的共鸣,比如有些人喜欢一个非常古怪的模型,而RLHF在这方面可能很擅长。
109:09
they're doing is they're finding harder problems which is why you hear about things like scientific
他们正在寻找更难的问题,这就是为什么你会听到像科学领域这样的事——那真的很难,要在那里做对任何事都不容易。如果你有一个实验室之类的,它就会生成大量token,或者更难的软件问题。所以前沿模型都在向这些更难的领域推进,它们可以训练更多的问题,模型也能一次性学到更多技能。早期的Jeff link有点像——早期Jeff曾经是、现在也仍然是模型上的点睛之笔,通过改进组织、风格或语气让模型变得更有用。不同的东西能引起不同受众的共鸣,比如有些人喜欢非常古怪的模型,而RLHF在这方面就能做得很好。
109:13
domains which is like that's so hard like getting anything right there and if you have a lab
有些领域真的很难,几乎很难做对任何事,如果你有一个实验室的话。
109:18
or something it just generates so many tokens or much harder software problems so the frontier
或者说,它生成了太多token,或者遇到了更棘手的软件问题。所以前沿模型都在往这些更难的领域推进,它们可以训练更多的问题,模型也能一次性学到更多技能。早期的Jeff链接有点像——早期Jeff一直并且现在仍然是模型的收尾工作,通过改进组织、风格或语气让模型更有用。不同的东西能引起不同受众的共鸣,比如有些人喜欢非常古怪的模型,而RLHF在这方面就很擅长,它非常适合在最后阶段把这些东西注入模型。归根结底,这就是为什么ChatGPT对人们来说如此神奇,而且这种用途实际上一直保持相当稳定。这种格式化就是如此。
109:23
models are all pushing into these harder domains and they can train on more problems and the model
模型都在往这些更难的领域推进,它们可以训练更多的问题,模型也能一次性学到更多技能。
109:28
will learn more skills at once the early Jeff link to this is kind of like early Jeff has been
早期的Jeff链接有点像——早期的Jeff一直,现在也仍然是,模型上的最后一道润色,让模型对不同用户群体更有用。
109:34
and still is kind of like the finishing touch on the models where it makes the models more useful
比如有些人喜欢特别古怪的模型,RLHF在这方面可能很擅长。
109:38
by improving the organization or style or tone there's different things that resonates
通过改进组织方式、风格或语气,不同的内容会引发不同受众的共鸣。比如有些人喜欢非常古怪的模型,RLHF 在这方面就能做得很好。最终阶段就是把这些东西注入模型,这也是为什么 ChatGPT 对人们来说如此神奇——而且这种用法其实一直保持得相当稳定。这种格式风格以及你回答问题的方法,在训练这些模型时其实是紧密相连的,这就是为什么 RLHF 仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。最终这些都会融合在一起,但总结来说,mid-training 就是赋予模型能力。
109:43
to different audiences like some people like a really quirky model an RLHF could be good at
这个阶段非常适合在最后把东西注入模型,所以它就是这样。
109:47
enabling that personality and some people hate this like markdown bulleted list thing that the
这种人格化的设定,有些人其实挺反感的,比如模型动不动就搞个markdown列表格式。但说实话,这种格式在快速解析信息时确实很好用。在RLHF这个人类反馈阶段,最终把这种能力注入模型是非常有效的——这恰恰是ChatGPT让人感到神奇的地方,而且这种用法至今仍然很稳定。这种格式还能帮助模型更好地处理数学问题,比如风格、格式和你解题的方法之间的界限,在训练这些模型时其实都紧密相连。这就是为什么RLHF仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。
109:53
models do but it's actually really good for quickly parsing information in RLHF this human feedback
模型确实能做到这一点,但在RLHF中快速解析信息时它其实非常有用。这个人类反馈阶段在最终把信息注入模型方面效果特别好,也正是它让ChatGPT对用户来说显得如此神奇,而且这种用途实际上一直保持得相当稳定。这种格式化方式还能帮助模型更好地解决数学问题,比如风格、格式和你用来解答问题的方法之间的界限,在训练这些模型时其实都紧密相连。这就是为什么RLHF仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。最终这些因素会融合在一起,但总结来说,中间训练就是赋予模型能力。
109:59
stage is really great for just get putting this into the model at the end of the day so it's what
这个阶段其实非常适合最终把东西塞进模型里,所以归根结底,风格、格式以及你解决问题的方法,在训练这些模型时其实是紧密相连的。这就是为什么RLHF仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。训练过程其实挺奇怪的,因为现实就是——你分配了多少时间,你们之间如何沟通,而RLHF非常高效。相比之下,RL有那么多移动的部件,生成一个10万token的序列可能要花很长时间。你想啊,RL的运行时长可能已经接近pre-training的天数了,但大概率还没到。
110:05
it made chat GBT so magical for people and that use is actually remained fairly stable this formatting
ChatGPT 之所以让人觉得神奇,其实这个用法一直挺稳定的。这种格式、风格,以及你回答问题的方式,实际上在训练这些模型时是紧密相连的,这也是为什么 RLHF 仍然能让模型在数学上表现更好,但这些可验证的领域要直接得多。最终这些都会融合在一起,但简单来说,mid-training 就是给模型训练,它其实更奇怪,因为现实就是你在分配多少时间、它们之间如何交互,而且效率极高。而 RL 有这么多动态环节,生成一个 10 万 token 的序列可能要花很长时间——你想想看。
110:11
can also help the models get better at math problems for example so it's like the border between
也能帮助模型在数学问题上表现得更好,比如风格和格式之间的界限,以及你用来回答问题的方法,实际上在训练这些模型时它们都紧密相连,这就是为什么RLHF仍然可以让模型在数学上更出色,但这些可验证的领域要直接得多。最终这些都会融合在一起,但总结来说,mid-training就是给模型大量算力,让它在难题上通过试错学习,而RLHF则是打磨模型,让它更易用,并整体上完善模型。你能谈谈RLVR所需的算力吗?这个需求一直在增长,我记得GROC4在这方面很有名。
110:19
style and formatting and like the method that you use to answer a problem is actually
风格、格式以及你回答问题的方法,实际上
110:25
they're all very closely linked in terms of when you're training these models which is why
在训练这些模型时,它们都是紧密关联的,这就是为什么
110:29
RLHF can still say make a model better at math but these verifiable domains are much more direct
RLHF 仍然可以让模型在数学上表现更好,但这些可验证的领域要直接得多
110:35
process to doing this because this kind of makes more sense with the problem formulation which
做这个流程的原因是这样更符合问题设定的逻辑,最终所有环节会融合在一起。但简单总结的话:mid-training 是给模型提供学习 RL 所需的技能;verifiable rewards 是让模型大量试错,把大量算力投入到困难问题上的试错学习中;而 RLHF 则是收尾阶段,让模型更易用,整体上打磨完善。关于 RLVR 所需的算力,它一直在增长。我记得 GROC4 曾提到,他们在 pre-training 和 post-training 上使用了相近的算力。回到 scaling 的讨论,这两者涉及的硬件非常不同:pre-training 的 scaling 是典型的计算密集型。
110:40
is I kind of ends up all forming together but to summarize it's like mid-training is give the model
就有点像是所有东西最终融合在一起,但总结来说,mid-training 就是给模型做训练,它其实更奇怪,因为现实就是你在分配多少小时、它们之间如何交互,而且效率极高。而 RL 有这么多活动部件,生成一个 10 万 token 的序列可能要花很长时间。如果你想想看,RL 的运行天数可能已经接近 pre-training 了,但它们可能没有同时使用那么多 GPU。实验室里有个经验法则,就是你不希望规划一个大型集群被占用两个月,结果在第 50 天失败了,机会成本太大了。之前有个训练花了三个月,所有人都震惊它居然能跑通。
110:45
the skills it needs to then learn RL and verifiable awards is let the model try a lot of time so put
它需要学习强化学习和可验证奖励的技能,就是让模型大量尝试,所以要把大量算力投入到针对难题的试错学习中。然后RLHF就像是打磨模型,让它更易用,把模型各方面都完善一下。你能谈谈RLVR所需的算力规模吗?这个需求一直在增长。我记得GROC4曾提到,他们在预训练和后训练上使用了相近的算力。回到规模扩展的讨论,这两者涉及的硬件完全不同:预训练的扩展非常依赖算力,一次性吞吐数据;而强化学习因为要生成这些答案,让模型在真实世界环境中尝试,最终会变得非常受内存限制,因为要生成长序列。
110:52
a lot of compute into trial and error learning across hard problems and then RLHF would be like
大量的算力投入到跨难题的试错学习中,然后RLHF就像是
110:57
finish the model make it easy to use and kind of just round the model out can you comment on the
完善模型,让它更易用,并大致打磨模型。你能谈谈RLVR所需的算力吗?
111:03
amount of compute required for RLVR it's only gotten up and up so I think GROC4 was famous for
它只增不减,所以我认为GROC4曾因讨论这一点而闻名。
111:10
saying they use a similar amount of compute for pre-training and post-training back to the scaling
他们说预训练和后训练用了差不多的算力,这又回到了scaling的讨论。但两者涉及的硬件非常不同——预训练是典型的compute bound,一次性投入大量计算;而RL需要模型生成答案,在真实环境中不断试错,这就变成了memory bound。随着序列变长,你需要长期记忆,计算方式也完全不同。所以预训练时我们讨论模型,比如回到拜登政府的行政令,说的是训练一个模型需要10的25次方flops。但如果你用flops来衡量后训练,那就复杂多了,因为实际上更关键的是你分配了多少小时。
111:14
discussion they involve very different hardware for scaling pre-training is very compute bound
它们涉及非常不同的硬件。扩展预训练非常受算力限制,
111:19
which is like this flops discussion which is just how many matrix multiplications can you get
就是那种关于FLOPs的讨论,说白了就是单位时间内你能完成多少次矩阵乘法。而因为强化学习需要生成这些答案,还要在真实环境里测试模型,最终就会变得非常受内存限制——因为你要生成长序列,而注意力机制有个特性:序列越长,内存消耗会呈二次方增长。这样一来,计算方式就变得很不一样了。所以,在预训练阶段我们讨论模型时,比如回到拜登政府的行政令,说的是训练一个模型需要10的25次方FLOPs。但如果你在训练后阶段还用FLOPs来衡量,那就奇怪多了,因为实际情况更像是:你分配了多少小时的计算资源。
111:23
through in one time and because RL you're generating these answers you're trying the model in the
一次性投入大量计算;而因为RL需要生成这些答案,你在真实世界环境中测试模型,
111:28
real world environments it ends up being much more memory bound because you're generating long
最终它变得非常受内存限制,因为随着序列变长,你会生成很长的记忆,
111:32
sequences and the attention mechanisms have this behavior where you get a quadratic increase in
序列和注意力机制有一个特性,就是当序列变长时,内存会呈二次方增长,所以计算量会变得非常不同。在pre-training阶段,我们讨论一个模型时——比如回顾拜登政府的行政命令——训练一个模型需要10的25次方flops。但如果你在post-training阶段使用flops,情况就复杂多了,因为实际上你只是在分配多少小时的计算资源,没法把所有东西都塞进一个系统里。Pre-training的计算密度非常高,所有GPU都在互相通信,效率极高;而RL有这么多移动部件,生成一个10万token的序列可能就要花很长时间——你想想看。
111:38
memory as you're getting to longer sequences so the compute becomes very different so you when
所以算力的需求变得非常不同。因此,在预训练中,我们会讨论一个模型——
111:44
in pre-training we would talk about a model I think if we go back to like the Biden administration
我想如果我们回到拜登政府时期的话。
111:48
executive order it's like 10 to the 25th flops to train a model and if you're using flops and post
行政命令说的是训练一个模型需要10的25次方FLOPs,但如果你在训练后阶段用FLOPs来衡量,情况就复杂多了,因为实际上你只是在分配多少小时、怎么互相协调,而且效率极高。而RL有这么多动态环节,生成10万个token的序列可能就要花很长时间——你得想办法让这个过程高效运转。所以我觉得按GPU小时或者单纯按挂钟时间算,RL的运行时长可能已经接近预训练的天数了,但它们同时使用的GPU数量可能没那么多。实验室里有个经验法则:你不想规划一个巨大的集群,结果被占用两个月,然后在第50天失败——那机会成本就太大了。
111:53
training it's a lot weirder because the reality is just like how many hours are you allocating how
训练起来就奇怪多了,因为现实就是,你分配了多少小时
111:58
many GPUs for and I think in terms of time the RL compute is getting much closer because you just
很多GPU用于……而且我认为从时间上看,RL的计算量正在变得非常接近,因为你根本没法把所有东西都塞进一个系统里。比如pre-training计算密度极高,所有GPU都在互相通信,效率非常高;而RL有这么多移动部件,生成一个10万token的序列可能要花很长时间——想想看,GBT 5.2 pro生成一个样本要一个小时,那如果你的训练跑一个样本就要一小时,你还得确保它被高效处理。所以我觉得从GPU小时或者单纯从挂钟时间来看,RL的运行天数可能已经接近pre-training了,但它们可能不会同时使用那么多GPU。实验室里有个经验法则,就是你不想……
112:04
can't put it all into one system like pre-training is so computationally dense where all the GPUs
不能把所有东西都塞进一个系统里,比如pre-training计算密集度极高,所有GPU都在互相通信,效率非常高;而RL有这么多动态环节,生成10万个token的序列可能要花很长时间。想想看,必须确保它被高效处理。所以我觉得按GPU小时或者实际挂钟时间算,RL的运行时长可能已经接近pre-training的天数了,但它们可能不会同时用那么多GPU。实验室里有个经验法则:你不想规划一个大型集群,让它被占用两个月,结果在第50天失败——机会成本太大了。所以大家都不想把所有鸡蛋放在一个篮子里。
112:09
are talking to each other and it's extremely efficient where RL has all these moving parts and it
它们彼此之间在交流,效率极高,而强化学习有这么多动态环节,生成10万个token的序列可能要花很长时间——比如你想一下,强化学习的运行天数可能已经接近预训练了,但大概还没到以前那种训练三个月、所有人都震惊的程度。调优到某个点后,再往强化学习上投入更多预算就不太合理了;你学会了一种风格,再继续迭代它也没什么意义。我最喜欢的例子是:我们有一个问答对,但中间那些内容我们完全没处理。所以,其实有多篇研究论文,比如Google的,关于过程奖励的。
112:13
can just take a long time to generate a sequence of 100,000 tokens like if you think about
生成一个10万token的序列可能就要花很长时间,比如你想一下
112:19
GBT 5.2 pro taking an hour it's like what if your training run has a sample for an hour and you
GBT 5.2 pro 跑一次要一个小时,这就像你的训练任务里有一个样本要跑一个小时,你还得想办法让它高效处理。所以我觉得,不管是按GPU小时算还是按实际挂钟时间算,RL的运行时长可能已经接近预训练的天数了,但它们可能没有同时用那么多GPU。实验室里有个经验法则,就是你不希望——你本来计划让一个大型集群跑两个月,结果到第50天它挂了,那机会成本实在太大了。所以大家都不想把所有鸡蛋放在一个篮子里。就像GBT 4,那简直是终极的“孤注一掷”式运行,之前从来没人敢这么干,因为它训练一次要花三个月,所有人都被那个工作量震惊了。
112:24
have to make it so that's handled efficiently so I think in GPU hours or just like wall clock hours
必须让这个过程高效处理,所以我觉得按GPU小时或者实际挂钟时间来看,RL的运行时长可能已经接近预训练的天数了,但它们大概率不会同时使用那么多GPU。实验室里有个经验法则:你不想规划一个庞大的集群,结果被占用两个月,然后在第50天失败——之前有一次训练花了三个月,所有人都震惊了。在RLHF中,因为它是偏好调优,你可以无限投入训练并持续获得收益,但到了一定程度后,再花更多RL预算就不太合理了——你已经学会了一种风格,再迭代下去也没意义。我最喜欢的例子是……
112:29
the RL runs are probably approaching the number of days as pre-training but they probably aren't
RL的运行时间可能已经接近预训练的天数了,但应该还没到那个程度
112:35
using as many GPUs at the same time there's rules of thumb wherein labs it's like you don't want
同时使用这么多GPU,其实有一些经验法则。在实验室里,你肯定不希望这样:你规划了一个庞大的集群,打算用两个月,结果它在第50天就出故障了。之前有一次训练花了三个月,所有人都震惊了。在微调时,你到了一个点,再花更多RL预算就不太划算了。你学会了一种风格,再继续迭代也没什么意义。我最喜欢的例子是:我们有一个问答环节,但中间那些内容我们完全没处理。所以,其实有多篇研究论文,比如Google的,关于过程奖励模型。对于学术界的人来说,做RLHF是一种很好的方式,可以描述为:做到最好。
112:39
your pre-training runs to last more than like a month because they fail catastrophically and if
你的预训练运行往往撑不过一个月,因为会灾难性地失败。如果你计划用一个大型集群跑两个月,结果在第50天崩了,机会成本实在太大了。所以大家不太想——人们不想把所有鸡蛋放在一个篮子里。比如GPT-4就是终极的“黄牌运行”,之前从来没人敢这么干,因为它训练花了三个月,所有人都震惊于它居然能跑通。我觉得现在大家更谨慎、更循序渐进。所以RL VR可以说是“无限”的——你可以训练多少都能继续获益;而RLHF因为是偏好调优,到某个点之后,再投入更多RL预算就不太划算了。
112:44
you're planning a huge cluster to be held for two months and then it fails on day 50 the opportunity
你计划搭建一个庞大的集群,运行两个月,结果在第五十天失败了。而之前那种需要三个月来训练的情况,大家都对那个调优工作感到震惊。当你达到某个点之后,再花更多RL预算就不太划算了。你学会了一种风格,再继续迭代它也没什么意义。我最喜欢的例子是,我们有一个问答对,但中间那些内容我们什么都没做。所以,其实有多篇研究论文,比如Google的,关于process reward,让学术界的人去做RLHF,这是一个很好的描述方式,就是尽力做到最好。但一旦你做到了,你就能理解LLM的生产过程。所以你总是在尝试……
112:51
cost is just so big so you kind of don't want to just you people don't want to put all their eggs
成本实在太大了,所以大家不太想把所有鸡蛋都放在一个篮子里。以前训练一次要三个月,所有人都觉得那已经很了不起了。但现在你可以无限量地训练,而且还能持续获得收益。至于RLHF,因为它是一种偏好调优,你会达到一个点,再花更多RL预算就不太划算了。你学会了一种风格,再继续迭代也没什么意义。我最喜欢的例子是,如果亲戚问我该买什么笔记本电脑,我会给他们解释,或者问他们,比如你的使用场景是什么?有些人优先考虑电池续航和存储空间,而像我们这样的人,会优先考虑RAM和算力。但这两个答案其实都是对的。
112:55
in one basket which is like GBT 4 was like the ultimate yellow run and nobody ever wanted to do it
把所有鸡蛋放在一个篮子里,就像GPT-4当年是那个终极的“黄牌跑分”,没人愿意再干一次。以前训练一次要三个月,大家都震惊于居然能无限训练还能持续获益。而RLHF因为是偏好调优,到某个点之后,再投入更多RL预算就没太大意义了——你学会了一种风格,再反复迭代也没必要。我最喜欢的例子是:如果亲戚问我该买什么笔记本电脑,我会给他们解释,或者反问他们,比如“你的使用场景是什么?”有些人优先考虑电池续航和存储空间,而像我们这样的人,会优先考虑内存和算力。但两种答案都是对的。
113:00
before where it took like three months to train and everybody was shocked to that work to
以前训练一次要三个月,大家都被那个工作量震惊了
113:04
I think people are a little bit more cautious and incremental now so RL VR is more let's say
我觉得大家现在变得更谨慎、更循序渐进了一些,所以RL VR可以说是“无限”的——你投入多少训练都能持续获得收益;而RLHF因为是偏好微调,到了某个点之后,再花更多RL预算就不太划算了。你学会了一种风格,再继续迭代下去意义不大。我最喜欢举的例子是:如果亲戚问我该买什么笔记本电脑,我会给他们解释,或者反问他们,比如“你的使用场景是什么?”有些人优先考虑电池续航和存储空间,而像我们这样的人,可能会优先考虑内存和算力。这两种答案都是对的,但不同的人需要不同的答案。而偏好微调,就是在试图
113:10
unlimited how much you can train and get still benefit where RLHF because it's a preference
无论你训练多少,都能持续获益,但RLHF作为一种偏好调优,到了某个点之后,再投入更多RL预算就不太划算了。你学会了一种风格,再继续迭代它就没太大意义了。我最喜欢的一个例子是:我们有一个问答对,但中间那些内容我们完全没处理。所以,其实有多篇研究论文,比如Google的,关于过程奖励模型。对学术界的人来说,做RLHF就像是一种“学术激励”,而最好的描述方式就是:为了做到最好。但大规模学习LLM的问题在于,我认为它的复杂度是指数级增长的。不过一旦你掌握了这一点,你就能理解LLM的生产过程了。所以你总是在试图……
113:15
tuning it you reach a certain point where it doesn't really make sense to spend more RL budget on
调优到一定程度后,再往RL上投入更多预算就不太合理了
113:20
that so just step back with preference tuning so there are multiple people that can give multiple
所以退一步看偏好调优这件事,其实有很多人可以针对同一件事给出多种解释,而且这些解释可能都是对的。但到了某个阶段,你会学会某种风格,然后就觉得没必要再反复调整了。我最喜欢的例子是,如果亲戚问我该买什么笔记本电脑,我会先问他们具体用途是什么。比如他们可能更看重电池续航和存储空间,而像我们这样的人,会更在意内存和算力。这两种答案其实都没错,但不同的人需要不同的答案。而偏好调优试图做某种平均化处理,相当于你让数据标注员告诉你哪个对、哪个不对。
113:26
let's say explanations for the same thing and they can both be correct but at some point
(注:根据规则,保留了“preference tuning”等英文术语,未添加原文没有的内容,且按自然口语化中文处理。)
113:29
you learn a certain style and it doesn't make sense to you know iterate on it my favorite example
你学会了一种特定风格,再继续迭代它也没什么意义,我最喜欢的例子是
113:35
is like if relatives ask me what laptop they should buy I give them an explanation or ask them
就像亲戚问我该买什么笔记本电脑,我会先解释一通,或者反问他们:
113:40
like yeah what is your use case like they for example prioritize battery life and storage other
“你的使用场景是什么?比如有人优先考虑电池续航和存储空间,而像我们这样的人,会更看重内存和算力。两种答案都没错。”
113:47
people like us for example you would prioritize RAM and compute and so but both answers are correct
RLHF 的风格是,你直接让模型去解决越来越复杂、越来越困难的问题。
113:53
but different people require different answers and with preference tuning while you're trying to
但不同的人需要不同的答案,而且在进行偏好调优(preference tuning)的同时,你还要尝试去回答。我觉得没有理由继续在这个问题上训练更久,因为你知道这只是一个风格问题。而在RLBR中,你实际上是让模型去解决越来越复杂困难的问题。所以我认为,长期来看,把更多预算分配给RLBR是更合理的。而且目前我们还处在RLBR 1.0的阶段,它仍然是一个简单的东西——我们只有问题和答案,并没有处理中间步骤的内容。所以,其实有多篇研究论文,比如Google的,关于过程奖励模型(process reward models),它们也会对解释过程打分,评估解释的正确性。我觉得……
113:56
average somehow like you are asking the data label us to give you the right or not the right
大概就像你在问数据标注员,给你的是正确答案还是错误答案,我觉得没有理由继续在上面训练更久,因为你知道这只是一种风格。而用RLBR的话,你实际上是让模型去解决越来越复杂困难的问题,所以我认为长期来看,把更多预算分配给RLBR更合理。而且现在我们还在RLBR 1.0的阶段,它仍然只是那种简单的东西——我们有一个问题和答案,但并没有处理中间的那些步骤。所以,其实有多篇研究论文,比如Google的,关于process reward models,它们也会给解释打分,看解释的正确性如何,我觉得这很有道理。
114:02
preferred answer and then you train on that but at some point yeah you learn that average preferred
首选答案,然后你基于那个进行训练,但到了某个节点,是的,你会学到那个平均首选答案,而且我觉得没有理由继续在上面训练更久,因为你知道那只是一种风格。而用RLBR,你实际上是让模型去解决越来越复杂困难的问题,所以我认为长期来看,把更多预算分配给LRBR更合理。而且目前我们处于LRBR 1.0阶段,它仍然只是那种简单的东西——我们有一个问题和答案,但并没有对中间步骤做任何处理。所以,其实有多篇研究论文,比如Google的,关于过程奖励模型,它们也会给解释打分——解释的正确性如何,我觉得这很有道理。
114:06
answer and there's no I think reason to keep training longer on it because you know it's just a
回答是,我觉得没有理由继续在上面训练更久,因为你知道这只是一个风格问题。在RLBR里,你实际上是给模型——嗯,你让模型去解决越来越复杂困难的问题。所以我认为,长期来看把更多预算分配给LRBR更合理。而且现在我们还在LRBR 1.0阶段,它仍然像那种简单的东西:我们有一个问题和答案,但中间的那些步骤我们什么都不做。所以,其实有多篇研究论文,比如Google的,关于过程奖励模型,它们也会给解释打分——解释的正确性如何。而且我觉得,他们在推理扩展方面也有有趣的成果,嗯,首先他们开发了模型。
114:12
style where with RLBR you literally give the model well you let the model solve more and more
所以我认为,长期来看应该把更多预算分配给 LRBR。
114:18
complex difficult problems and so I think that it makes more sense to allocate more budget long
而且目前我们还处在 LRBR 1.0 的阶段,依然是很简单的那种模式——只有问题和答案,中间的过程我们并没有做任何处理。
114:24
term to LRBR and also that right now we are in LRBR 1.0 land where it's still like that simple
其实已经有多篇研究论文,比如 Google 的,就在探讨过程奖励(process reward)这类方向。
114:33
thing where we have a question and answer but we don't do anything with the one stuff in between
我们有一个问答对,但中间那些内容我们完全没处理
114:38
so there was a I mean multiple research papers also by Google for example on process reward
所以其实有多篇研究论文,比如Google的,关于过程奖励
114:43
models that also give scores for the explanation how correct is the explanation and I think
这些模型也会为解释的正确性打分,我觉得
114:48
that will be the next thing let's say RLBR 2.0 for this year focusing in between question and answer
那将是下一步,比如今年推出的 RLBR 2.0,专注于问答之间的环节,比如如何利用信息来改进解释,帮助提升准确性。所以这是一个角度。另外还有一篇 Deep Seek Math Version 2 的论文,里面也涉及有趣的 inference scaling,他们先开发了模型,然后自己生成了另一个独立的模型。我认为这会是其中一个方面。另一个方面,就像 Nathan 提到的,是 RLBR 向其他领域的扩展。大家比较兴奋的地方是 value functions,这和 process reward models 非常相似——process reward models 会对推理过程中的每个中间步骤分配一个质量评分。
114:56
like how to leverage that information the explanation to improve the explanation and help it to get
比如如何利用这些信息来解释并改进解释,帮助它获得更高的准确性。这是一个角度。另外,Deep Seek Math 第二版的论文里也有有趣的推理扩展——他们先开发了模型,然后让模型自我优化,形成一个独立的模型。我认为这会是其中一个方面。另一个方面,就像Nathan提到的,会是RLBR扩展到其他领域。大家比较兴奋的地方在于价值函数,这其实非常相似。过程奖励模型会为推理过程中的每个中间步骤分配一个质量评分。我觉得我们是通过讨论scaling才聊到这个话题的,简单总结一下就是……
115:01
better accuracy but then so that that's one angle and there was a deep seek math version 2 paper
更好的准确率,但这是其中一个角度。还有一篇DeepSeek Math第二版的论文,他们在推理scaling方面也做了有趣的工作——首先他们开发了能自我改进的模型,一个独立的模型。我认为这会是其中一个方面,另一个就像Nathan提到的,RLBR会扩展到其他领域。大家感到兴奋的地方是价值函数,这和过程奖励模型非常相似。过程奖励模型会为推理过程中的每个中间步骤分配一个质量评分。我想我们是通过讨论scaling才聊到这个话题的。简单总结一下信号scaling:人们已经在语言模型的RLHF上研究了很多年,尤其是高强度投入。
115:07
where they also had interesting inference scaling there where well first they had developed models
而且他们在推理缩放方面也有有趣的进展,首先他们开发了模型
115:14
that great themselves a separate model and I think that that will be one aspect and the other
他们自己就搞出了一个独立的模型,我觉得这会是其中一个方面。另一个方面,就像Nathan提到的,RLBR会扩展到其他领域。大家现在比较兴奋的是价值函数,这个跟过程奖励模型非常相似——过程奖励模型会对推理过程中的每个中间步骤打分,评估这一步做得好不好。未来呢,我觉得我们是从讨论scaling聊到这里的,简单总结一下信号scaling就是:人们已经在语言模型上做了很多年的RLHF,尤其是学术界的人特别热衷于搞RLHF。一个比较好的描述方式是,要做最好的RLHF,你可能不需要额外多花10倍或100倍的算力;但要做最好的RLVR,你就需要这么多算力。
115:19
like Nathan mentioned it will be for RLBR branching into other domains. The place where people are
就像Nathan提到的,RLBR会扩展到其他领域。大家兴奋的地方在于价值函数,这非常相似,所以过程奖励模型有点像
115:24
excited are value functions which is very pretty similar so process reward models are kind of like
过程奖励模型会为推理过程中的每个中间步骤分配一个质量评分
115:30
process reward models assign how good something is to each kind of intermediate step in a reasoning
未来。我想我们是通过讨论缩放来到这个话题的,一个简单的总结方式就是
115:36
process where value functions apply value to every token the language model generates.
这个过程是价值函数对语言模型生成的每一个token都赋予一个价值。
115:42
Both of these have been largely unproven in the language modeling in this reasoning model era
这两者在当前这个推理模型时代的语言建模中,基本都还没有被验证过。
115:48
people are more optimistic about value functions forever for whatever reason now I think process
出于某种原因,现在人们对价值函数一直比较乐观。我认为,
115:53
reward models were tried a lot more in this pre-01 pre-reasoning model era and a lot of people had
在pre-01、pre-推理模型的时代,过程奖励模型被尝试得更多,而且很多人
115:59
a lot of headaches with them so I think a lot of it is the human nature of like value models have a
在它们身上吃了不少苦头。所以我觉得,很大程度上这是人性使然——价值模型在
116:04
very deep history and reinforcement learning they're one of the first things that were core to
强化学习中有非常深厚的历史,它们是深度强化学习存在的核心基础之一,
116:09
like deep reinforcement learning existing is like training value models in this so right now the
比如训练价值模型就是如此。所以现在,
116:14
literature people are excited about trying value models but there's very little proof in it and there
文献里人们很兴奋地尝试价值模型,但真正有证据支撑的东西还非常少。
116:18
are negative examples in trying to scale up process reward models these things don't always hold in
在尝试扩展过程奖励模型时,负面例子并不总是成立,未来可能也会变。我觉得我们是从讨论扩展这个话题开始的,简单总结一下你的意思就是:你不想做太多RLHF,因为最终信号会饱和。人们已经在语言模型上研究RLHF好多年了,尤其是ChatGPT之后兴趣激增。而第一个用RLVR训练的推理模型——o1,发布时展示了一个扩展曲线:如果你对数地增加训练计算量,评估结果会线性提升。这个结果已经被多次复现,我记得Deep C也出过类似的图。但RLHF并没有这样的扩展曲线——如果你对数地增加计算量,效果并不会线性提升。
116:23
the future. I think we came to this discussion by talking about scaling and a simple way to summarize
信号缩放的意思是,人们已经在语言模型上研究RLHF很多年了,尤其是学术界对RLHF有一种强烈的推崇
116:29
what you're saying with like you don't want to do too much RLHF where it's eventually the
你说的意思是,不能做太多RLHF,否则信号会饱和。人们已经在语言模型上研究RLHF很多年了,尤其是在ChatGPT之后兴趣激增。而第一个用RLVR训练的推理模型——o1,发布时展示了一个scaling曲线:如果对数增加训练计算量,评估结果会线性提升。这个结果已经被多次复现,我记得DeepSeek也有类似的图。但RLHF没有这样的scaling规律——如果你对数增加计算量,反而会过度优化。所以,这就是RLVR和我们现有方法的一个重大区别。未来,这些方法也会遵循scaling范式,也就是你能做到的最优训练方式。
116:32
signal scales is people have worked on RLHF for language models for years especially an intense
而描述它的一个好方式就是,要做到最好
116:37
interest after chat to BT and this the first release of a reasoning model trained with RLVR
Chat to BT之后引起了兴趣,这是第一个用RLVR训练出来的推理模型发布。
116:43
opening eyes 01 had a scaling plot where if you increase the training compute logarithmically you
Open Eyes 01有一个缩放曲线:如果对数级增加训练算力,评估结果会线性提升,这个现象已经被多次复现。
116:48
get a linear increase in evaluations and this has been reproduced multiple times I think deep C
我记得Deep C也有类似的图,但RLHF没有这样的缩放规律——如果你对数级增加算力,反而会过度优化。
116:52
had a plot like this but there's no scaling lot for RLHF where if you log increase the compute you
所以这就像是用RLVR和我们现有的方法画出了一条重要的分界线,未来它们也会遵循缩放范式。
116:58
get some performance in fact the seminal scaling paper for RLHF is scaling loss for reward model
实际上,那篇关于RLHF的经典scaling论文讲的是reward model的over optimization带来的scaling loss。所以,这和我们现在用的RLVR方法之间有一条很明显的分界线。未来,它们会遵循scaling范式——也就是说,最好的实验你可以多跑10倍的计算量,然后获得几倍的性能提升,但RLHF做不到这一点。而这将定义整个领域,以及人们如何对待这些方法。我算是学术界里鼓吹大家做RLHF的人,一个很好的描述方式是:要做最好的RLHF,你可能不需要额外10倍或100倍的计算量;但要做最好的RLVR,你就需要。所以我认为,有一篇来自Meta实习期间的经典论文,标题叫《The Art of...》。
117:03
over optimization so it's like that's a big line to draw with RLVR and the methods we have now
这就像是你可以在学术上向人们推销做RLHF的最佳方案,而描述它的好方式是:要做最好的RLHF,你可能不需要额外10倍或100倍的算力;
117:09
and in the future like they will follow the scaling paradigm which is like the best runs you can
但要做最好的RLVR,你就需要。
117:16
let to run for an extra 10x and you get a few x performance but you can't do this with RLHF
让训练多跑10倍的时间,你只能得到几倍的性能提升,但RLHF做不到这一点。
117:21
and that is just going to be field defining and how people approach them where I'm a
而这将定义整个领域,以及人们如何对待它——我本人是学术界做RLHF的鼓吹者,有个很好的描述方式:要做最好的RLHF,你可能不需要额外10倍或100倍的计算量,但要做最好的RLVR,你就需要。所以我认为,有一篇来自Meta实习生的开创性论文,叫《The Art of Scaling RL》,他们每次实验的增量是10,000个be 200小时,相当于每次实验花费几千到几万美元,而且他们做了很多次——这种成本对普通学术界来说根本负担不起,这是一个很难平衡的局面。
117:26
shill for people academically to do RLHF and that's a good way to describe it is like to do the best
在学术界忽悠人去做RLHF,这其实是个挺贴切的描述,就是为了做到最好。
117:31
RLHF you might not need the extra 10 or 100x of compute but to do the best RLVR you do so I think
RLHF 你可能不需要额外10倍或100倍的计算量,但要做最好的RLVR,你就需要,所以我觉得
117:38
there's a what I say is a seminal paper from what was a meta internship it's called it's like the art
有一篇我觉得很重要的论文,来自Meta的实习项目,叫《The Art of Scale RL》。他们一个增量实验就要用1万块GPU跑200小时,每个实验成本就是几千甚至几万美元,而且他们做了很多这样的实验。这种成本对普通学术界来说根本负担不起,这是一个很难打破的平衡。我们聊一聊教育和学习吧。如果你正在听这个节目,是一个对编程和AI感兴趣的聪明人,我觉得从零开始搭建一些东西是个不错的起点。你能不能带我们过一遍,你会推荐大家怎么做?我会说,从零开始建模型的目标,并不是要搞出一个你每天都能用的东西。
117:44
of scaling reinforcement learning with language models they're what they describe as a framework
关于用语言模型做强化学习的扩展,他们描述了一个框架,叫做scale RL。他们做的增量实验大概是10,000次,耗时200小时,每个实验成本就是几千到几万美元,而且他们做了很多这样的实验,这个成本对普通学术界来说根本负担不起。这是一个很难达到的平衡点,它试图弄清楚如何从每个社区中学习。我当时在想,我们能不能稍微转移一下注意力,聊聊教育和学习。如果你是一个正在听这个节目的人,一个对编程和AI感兴趣的聪明人,我猜从头开始构建一些东西是个不错的起点。你能不能带我过一遍,你会推荐别人怎么做?我会这样建议——
117:49
scale RL and their incremental experiment was like 10,000 be 200 hours which is like thousands or
扩展RL(强化学习)的增量实验,一次大概要花一万到两百小时,也就是几千到几万美元一次实验,而他们要做很多次,这种成本对普通学术界来说根本负担不起。这是一个很难平衡的局面,大家都在摸索注意力机制,也在讨论教育和学习。如果你是个正在听这个的聪明人,对编程和AI感兴趣,那我猜从零开始搭建一些东西是个不错的起点。所以你能不能带我过一遍,你会推荐别人怎么做?我会建议,目标不是从零搭一个模型然后每天像用开源模型或ChatGPT那样用,而是为了看清楚LLM里到底有什么、到底能产出什么。
117:56
tens of thousand dollars per experiment and they do a lot of them which is just like this cost
一次实验就要几万美元,他们还做很多次,这种成本
118:02
is not accessible to the average academic which is a hard equilibrium where it's trying to figure
普通学者根本负担不起,这是一个很难打破的平衡,大家都在摸索
118:08
out how to learn from each community I was learning if we could take at this point a bit of
搞清楚如何从每个社区中学习。我在想,我们能不能花点时间聊聊教育和学习这件事。如果你正在听这个节目,是个聪明人,对编程感兴趣,也对AI感兴趣,那我猜从头开始构建一些东西是个不错的起点。所以你能带我过一遍,你会推荐大家怎么做吗?我会建议,目标不是让你从零构建一个模型,然后每天用在个人项目里——它不会成为你的个人助手,取代现有的open-weight模型或ChatGPT。而是让你亲眼看到LLM里到底有什么,LLM输出的是什么,pre-training在你的电脑上具体是怎么运作的,这样你就能学到东西。
118:13
attention and talk about education and learning if you're somebody listening to this who's a smart
说到教育和学习,如果你是个正在听这期节目的聪明人
118:20
person interested in programming interested in AI so I presume building something from scratch
对编程和AI感兴趣,我猜从头开始搭建东西
118:26
is a good beginning so can you just take me through like what you would recommend people do so I would
是个不错的起点。那么你能带我过一遍,你会推荐大家怎么做吗?我会说
118:32
personally start like you said implementing a simple model from scratch that you can run on your
我个人觉得,就像你说的,先从零开始搭一个能在自己电脑上跑起来的简单模型。目标不是说你从零搭个模型,就能每天用在个人项目里——它不会成为你的私人助手,去替代现有的open-weight模型或者ChatGPT。而是为了看清楚LLM里面到底有什么、LLM输出的是什么、pre-training在自己电脑上是怎么运作的。然后你就能学到pre-training、supervised fine-tuning、attention mechanism这些,对工作原理有个扎实的理解。但到某个点你会遇到瓶颈,因为小模型的能力有限。而学习大规模LLM的问题在于,我觉得它的复杂度是指数级上升的。
118:37
computer the goal is not if you build a model from scratch to have like something you use every day
计算机的目标不是让你从零搭个模型然后每天用
118:42
for your personal projects like it's not going to be your personal assistant replacing an existing
对于你自己的个人项目来说,它并不是要取代现有的开源模型或ChatGPT成为你的个人助手,而是让你亲眼看看LLM里到底输入了什么、输出了什么,以及预训练在你的电脑上是怎么运作的——最好是在你自己的电脑上——然后你就能理解这些东西是怎么工作的。但到某个阶段你会遇到瓶颈,因为小模型的能力有限,而学习大规模LLM的问题在于,我觉得它的复杂度是指数级上升的。不过一旦你掌握了这些,你就能理解LLM的生产过程了。所以你一直在找一些MOE模型的相关资料,我记得其中一两个可能需要多块GPU,但目标是能在单块GPU上运行,而且美妙之处在于你几乎可以完全验证它。
118:47
open-weight model or chatchipity it's to see what exactly goes into the LLM what exactly comes out of
像开源权重模型或者ChatGPT那样,而是让你看到LLM里到底有什么,到底输出什么
118:53
the LLM how the pre-training works in that sense on your own computer preferably and then you learn
LLM 在自己电脑上跑预训练大概是什么感觉,你先试试看,然后慢慢理解其中的原理。但到某个阶段你会遇到瓶颈,因为小模型的能力就那么多。而学习大规模 LLM 的难点在于,我觉得它的复杂度是指数级上升的。不过一旦你掌握了这个,就能理解 LLM 的生产流程了。所以你一直在找一些 MOE 模型的相关资料,我记得其中一两个可能需要多块 GPU,但目标是能在一块 GPU 上跑起来。而且很妙的一点是,你还可以验证它,几乎就是靠 transformer 库。Hugging Face 的 transformer 库确实很棒,但如果你想适配更多使用场景,甚至有人把它用在生产环境里,那就必须做得非常复杂。
119:00
about the pre-training the supervised fine tuning the attention mechanism you get a solid understanding
关于pre-training、supervised fine-tuning和attention mechanism,你会对工作原理有扎实的理解。但到某个阶段你会遇到瓶颈,因为小模型的能力有限,而学习大规模LLM的难点在于,我认为它的复杂度是指数级增长的。不过一旦掌握了这些,你就能理解LLM的生产过程。所以你一直在找关于某些MOE模型的资料,我觉得它们中的某一个可能需要多块GPU才能运行,但目标是让它能在单块GPU上跑。而且美妙之处在于,你还可以验证它——这几乎就像RLVR一样。当你从头开始写这些代码时,你可以从hugging phase transformer库中拿一个现成的模型来用。hugging phase transformer库确实很棒,但如果你想真正学习的话……
119:05
of how things work but at some point you will reach a limit because small models can only do so
关于事物运作的原理,但到某个点你会遇到瓶颈,因为小模型能力有限,而学习大规模LLM的问题在于,我认为它的复杂度是指数级上升的。不过一旦你掌握了这个,就能理解LLM的生产过程。所以你总是试图在一些MOE模型上做材料,我觉得它们俩中的一个可能需要多张GPU,但目标是在一张GPU上运行,而且美妙之处在于你还可以验证它几乎就是transformer库。Hugging Face的transformer库很棒,但如果你想学习如何适配这么多用例,而且有些人也在生产环境中使用它,那就必须非常复杂。最终你知道自己做对了,因为你可以做单元测试,可以对照检查。
119:10
much and the problem with learning about LLM's at scale is I would say it's exponentially more complex
关于大规模学习LLM的问题,我觉得它的复杂度是指数级上升的。但一旦你掌握了这个,就能理解LLM的生产过程。所以你总是要努力让模型跑在一张GPU上,而且美妙之处在于你几乎可以验证它。Transformer库也是——Hugging Face的Transformer库确实很棒,但如果你想真正学透它,就得考虑到它要适配那么多使用场景,有些人在生产环境中用它,所以必须做得非常复杂和成熟。最后,你知道自己做得对,是因为你可以做单元测试,可以对照检查。至于从RL和机器人领域迁移到语言模型,我以前从来没花时间去真正理解,就像深度学习是我过去必须学的基础一样,现在大家也需要掌握这些。
119:16
to make a larger model because it's not that the model just becomes larger you have to now think about
要做一个更大的模型,因为模型不是单纯变大,你还得考虑
119:21
charging your parameters across multiple GPUs even for the KV cache that multiple ways you can
如何在多张GPU上分配参数,甚至KV cache也有多种实现方式
119:26
implement it one is just to understand how it works just to grow the cache that's like a cache you
一种方法是理解它的工作原理,然后逐步扩展cache,比如用拼接列表的方式增长它,但那样效率不高
119:32
grow step by step by let's say concatenating lists growing it but then that wouldn't be optimal
在GPU上你不会那么做,你会预先分配一个tensor再填充进去,但这又多了二三十行代码
119:38
GPUs you wouldn't do that you would pre-allocate a tensor and then fill it in but that adds
每加一个功能就要写这么多代码,我觉得这本书的妙处在于
119:42
again another 20 30 lines of code and for each thing you add so much code and I think the trick with
让你理解LLM的工作原理,它不会是你的生产级LLM
119:48
the book is basically to understand how the LLM works it's not going to be your production level LLM
但一旦你掌握了这个,你就能理解生产级的LLM了。所以你一直在努力
119:53
but once you have that you can understand the production of LLM. So you're trying to always
但一旦你掌握了这个,你就能理解LLM的生产过程。所以你总是要尝试去理解
119:57
build an LLM that's going to fit on on GPU. Yes the most of them I have they I have some bonus
构建一个能装进单张GPU的LLM。是的,我手头大部分模型都能做到,我还准备了一些关于MOE模型的额外材料,其中一两个可能需要多张GPU,但目标就是让它跑在一张GPU上。最棒的是,当你从头编写这些代码时,几乎就像RLVR一样可以验证——你可以直接从Hugging Face Transformer库拿一个现成的模型。Hugging Face Transformer库确实很强大,但如果你想学习LLM,我觉得那不是最好的起点,因为它的代码太复杂了,要适配太多使用场景,而且有些人直接在生产环境用它,所以代码必须非常精良,逻辑交织在一起,读起来很不线性。它最初是为了微调而开发的。
120:02
materials on some MOE models I think one of the two of them they may require multiple GPUs but
关于一些MOE模型,我觉得它们俩中的某一个可能需要多张GPU,但目标是让它跑在一张GPU上。而且很棒的一点是,你还可以验证它,几乎就像transformer库一样。Hugging Face的transformer库确实很好,但如果你想适配这么多使用场景,而且有些人在生产环境中也用到了它,那就必须做得非常复杂。最后,你知道自己做得对,因为你可以做单元测试,可以对照着检查。至于来自RL和机器人领域的语言模型,我过去一直没花时间去深入了解。像深度学习这样基础的东西,是我过去必须学习的,而人们也需要掌握它。我觉得很多人感到不知所措的地方在于:我该怎么把它应用到实际中去?
120:08
the goal is to have it on one GPU and the beautiful thing is also you can stuff verify it's almost
目标是让它跑在一张GPU上,而且很妙的是你还能验证它几乎就是transformer库。Hugging Face的transformer库确实很棒,但如果你想了解如何适配这么多使用场景,有些人还会在生产环境中用它,那就必须做得非常精细。最后你知道自己搞对了,因为你可以做单元测试,可以对照着检查。来自RL和机器人领域的语言模型,我以前一直没花时间去好好了解。像深度学习这种基础的东西,是我过去必须学的,而人们还需要掌握优化工具、奖励建模、正则化、指令微调——这差不多就是RLVR的一个简短总结。那里有一张巨大的表格,我就直接……
120:14
like RLVR when you code these from scratch you can take an existing model from the hugging phase
像RLVR这种,如果你要从头开始写代码,可以直接用hugging face transformer库里现成的模型。hugging face transformer库确实很好用,但如果你想深入了解它,它适配了太多使用场景,有些人还直接拿它做生产环境,所以代码必须做得非常复杂,而且各个模块之间耦合很深,读起来一点都不线性。它最初是从fine-tuning起步的,加载方式也是那样设计的。所以hugging face基本上就是默认的模型获取平台,而transformers是那个让我们能轻松加载模型、做点基础操作的软件。所有发布开源权重的前沿实验室,比如从deep seek到GPT OSS,都有对应的hugging face transformers版本,那就是你能加载到的标准权重。
120:20
transformer library. So the hugging phase transformer library is great but if you want to learn about
transformer库。Hugging Face的transformer库确实很棒,但如果你想真正学习
120:25
LLM's I think that's not the best place to start because the code is so complex because it has to
LLM 我觉得从那里入手不是最好的选择,因为代码太复杂了,要适配那么多使用场景,而且有些人是在生产环境里用的,所以必须做得非常成熟,代码之间耦合也很深,读起来很不线性。它最初是从 fine-tuning 开始的,加载方式也是那样——Hugging Face 是默认获取模型的地方,而 transformers 是让我们能轻松加载模型、做点基础操作的软件。所有开源权重的 frontier labs,从 Deep Seek 到 GPT OSS,都有对应的 Hugging Face transformers 版本,那是你能加载的标准权重。但话说回来,即使是 transformers 这个库,生产环境里也没人直接用,大家用的是 SGlang 或 VLLM。
120:30
fit so many use cases also some people use it in production has to be really sophisticated and
适配那么多使用场景,而且有些人在生产环境中也在用,那就必须非常复杂和精细。
120:35
it's really intertwined and really hard it's not linear to read. It was started as a fine tuning
这其实非常复杂,读起来也不是线性的。它最初是从微调开始的。
120:40
library and then it grew to be like the standard representation of every model architecture
这个库后来逐渐变成了所有模型架构的标准表示方式,以及模型的加载方式。所以 Hugging Face 就像是获取模型的默认平台,而 Transformers 就是那个让我们能轻松加载模型并做一些基础操作的软件。所有拥有开放权重模型的前沿实验室,比如从 Deep Seek 到 GPT OSS,都有对应的 Hugging Face Transformers 版本,那就是你能加载的标准权重。但话说回来,即使是 Transformers 这个库,在生产环境中也不会被直接使用,大家用的是 SGlang 或 VLLM,这又是另一层复杂度了。需要提一下的是,Transformers 库包含了大约 400 个模型。所以它是一个试图实现大量 LLM 的库,因此代码量非常庞大。
120:46
and the way it's loaded so hugging phase like the default place to get a model and transformers
而它的加载方式,比如 Hugging Face 就是默认的模型获取平台,Transformers 则是让我们能轻松加载模型并做一些基础操作的软件。
120:51
is the software that enables us so people can easily load a model and do something basic with it.
所有拥有开放权重的前沿实验室,比如从 Deep Seek 到 GPT OSS,都有对应的 Hugging Face Transformers 版本,那是你可以加载的标准权重。
120:56
And all frontier labs that have open weight models have a hugging phase transformers version of it
但说到底,你得确保结果是正确的,因为你可以做单元测试,对照参考实现来验证。
121:01
like from deep seek to GPT OSS that's like the canonical weight that you can load there but again
我觉得这可能是学习语言模型最好的方法之一,尤其是从强化学习和机器人领域转过来的人——我以前就从来没花时间认真做过这件事。
121:07
also even transformers the library is not used in production people used an SGlang or VLLM
而且就连 transformers 这个库,生产环境里也没人用,大家用的是 SGlang 或者 VLLM。
121:12
and it's at another layer of complexity. We should say that the transformers library has like 400
而且这又是另一层复杂度了。得说一下,transformers 库里大概有 400 个模型。所以它是一个试图实现大量 LLM 的库,代码量非常庞大。想理解其中你关心的那部分,就像大海捞针。但它的美妙之处在于,你有一个现成的实现,所以你可以从结果倒推回去。我推荐的做法——也是我自己会做的——就是如果我想理解比如 Llama 3 是怎么实现的,我会去 model hub 里看它的权重和 config 文件。然后你就能看到,哦,他们用了这么多层,比如用了 group query attention 或者 multi-head attention,而且所有组件都是人类可读的,大概不到 100 行代码。
121:18
models. So it's a one library that tries to implement a lot of LLMs and so you have a huge code
所以它就是一个试图实现很多 LLM 的库,代码量巨大。
121:25
basically it's like huge it's like it's I don't know maybe really it's kind of lines of code and
基本上就是特别庞大,可能真的就是海量的代码行数。你想理解的那部分,就像在干草堆里找一根针。但美妙之处在于,你有一个能跑起来的实现,所以你可以倒推着去理解。我推荐的做法——也是我自己会做的——比如我想理解Llama 3是怎么实现的,我就会去模型库(model hub)里看权重文件,还有配置文件(config file)。然后你就能看到,哦,他们用了这么多层,比如说用了group query attention或者multi-head attention。所有组件都在一个人类可读的、大概不到100行的配置文件里。然后你就可以从你的GPT 2模型开始,把这些东西加进去。
121:32
it's like understanding the part that you want to understand is finding the needle in the haystack
你想理解其中某一部分,简直就像大海捞针。
121:36
but what's beautiful about it is you have a working implementation and so you can work backwards
但它的美妙之处在于,它有一个能跑起来的实现,所以你可以从结果倒推回去。
121:40
from it what I would recommend doing or what I also do is if I want to understand for example how
我推荐的做法——也是我自己会做的——就是比如我想理解 Llama 3 是怎么实现的,
121:46
almost three is implemented I would look at the weights in the model hub the config file and then
我会去 model hub 里看它的权重和 config 文件,
121:52
you can see oh they used so many layers they use let's say group query attention or multi-head
然后你就能看到:哦,他们用了这么多层,比如说用了 group query attention 或者 multi-head attention,
121:56
attention in that case and you see all the components in like a human readable I don't 100 lines
而且所有组件都是人类可读的,大概不到 100 行代码。
122:01
of config file and then you start let's say with your GPT 2 model and add these things you know
从配置文件开始,然后你拿你的 GPT 2 模型,把这些东西加进去,你知道的。
122:06
and the cool thing here is you can then load the pre-trained weights and see if they work in your
有意思的地方在于,你可以加载预训练权重,看看它们在你的模型里能不能正常工作,然后你希望匹配到和transformer模型一样的输出,这样就能把它当作一个可验证的奖励信号,来确保你的架构是正确的。有时候我花差不多一天时间,比如那次挑战是位置嵌入的问题,它们有个叫yarn的扩展,还有一些自定义的缩放逻辑,我始终没法完全对上。在这种挣扎的过程中,你反而能理解很多东西。但最酷的是,到最后你知道自己搞对了,因为你可以做单元测试,对照参考实现来验证。我觉得这可能是最好的学习方法之一,真的。
122:11
model and you want to match the same output that you get with a transformer model and then
模型,然后你想匹配你用 transformer 模型得到的相同输出,接着你可以把它当作一个可验证的奖励,来确保你的架构是正确的。
122:15
you can use it as a basically as a verifiable reward to make your architecture correct and then
然后呢,有时候这要花我一天时间,差不多三次,那个挑战是 position embeddings 的 rope,它们有一个 yarn extension,还有一些自定义的 scaling,我没办法完全匹配上。
122:21
it's kind of sometimes it takes me a day to with almost three that challenge was a rope for the
在这个挣扎的过程中,你其实能理解很多东西,但酷的是,最后你知道你做对了,因为你可以做 unit test,对照 reference implementation 来检查。
122:27
position embeddings they had a yarn extension and there was some custom scaling there and I couldn't
我觉得这可能是最好的学习方法之一,真的。
122:34
quite match these things and in this struggle you kind of understand things but the cool thing is
在反复比对和挣扎的过程中,你其实会慢慢理解很多东西。但最酷的是,到最后你确定自己做对了——因为你可以做单元测试,可以对照参考实现来验证。我觉得这可能是最好的学习方式之一,真的。就像从强化学习和机器人领域去理解语言模型一样——我以前从没花时间系统学过所有基础原理。而我描述的这个Transformer架构,它就像深度学习当年那样基础,是我过去必须啃下来的东西,现在大家也得这么做。我觉得很多人感到不知所措的地方在于:我该怎么应用这些知识去产生影响力,或者找到一条职业路径?因为AI语言模型让这些基础内容变得……
122:39
at the end you know you have it correct because you can unit test it you can check against the
最后你知道自己做对了,因为你可以做单元测试,可以对照检查
122:44
reference implementation and I think that's maybe one of the best ways to learn really like to
参考实现,我觉得这可能是学习语言模型最好的方式之一,就像从强化学习和机器人领域学到的——我以前从来没花时间去深入理解那些基础的东西。深度学习是我过去必须学的东西,而人们也需要这么做。我觉得很多人感到不知所措的地方在于:我该怎么应用这些知识去产生影响力,或者找到一条职业路径?因为AI语言模型让这些基础的东西变得有趣。他对这个感兴趣,他是个博士生,这确实是个优势,但对我来说,这个话题我一直等着有人能说“嘿,我有时间在这上面花精力”。而且我敢肯定,这里还有很多非常细碎的东西,你会觉得“哦,这根本说不通”。
122:49
basically reverse engineer something yeah I think that that is something that everybody that's
基本上就是逆向工程,对吧。我觉得任何对今天搞AI感兴趣的人都应该这么做,这也是为什么我喜欢你的书——我本身是从强化学习和机器人领域接触到语言模型的,但从来没花时间系统学过所有基础。我描述的这个transformer架构,就像深度学习当年一样,是必须掌握的基础,人们需要去学。我觉得很多人感到迷茫的地方在于:怎么把这些东西应用到实际中产生影响力,或者找到职业方向?因为AI语言模型让这些基础内容变得非常容易上手,而有动力的人反而不会去学,然后问题就变成了:我该怎么获得实践机会?
122:53
interested in getting AI today should do and I think that's why I liked your book is like I came
现在对AI感兴趣的人应该做些什么,我觉得这就是我喜欢你那本书的原因——我本身是从强化学习和机器人领域进入语言模型的,之前一直没花时间系统学习这些基础知识。而这个transformer架构,我觉得它就像深度学习一样,是过去我必须掌握的基础,现在人们也需要这样做。我认为很多人感到不知所措的地方在于:如何把这些东西真正用起来、产生影响力,或者找到一条职业路径?因为AI语言模型让这些基础内容变得如此容易上手,有动力的人自然会去学,但问题在于——我该怎么获得实践机会?这个领域变化太快了,很多时候最优秀的人都没能彻底解决一个问题。
122:58
to language models from this RL and robotics field like I never had taken the time to just like
从RL和机器人领域来的语言模型,我以前从来没花时间去真正了解
123:04
learn all the fundamentals and this transformer architecture I described as being like
把所有这些基础知识和那个transformer架构都学透,我之前说过它就像深度学习一样,是过去我必须掌握的东西,而人们现在也需要这么做。我觉得很多人容易感到不知所措的地方在于:我该怎么应用这些知识去产生实际影响,或者找到一条职业路径?因为像AI语言模型让这些基础内容变得有趣,他是一名PhD学生,这确实是个优势,但对我来说,那一直是个我在等有人能说“嘿,我有时间在这上面花精力”的话题。而且我敢肯定还有很多非常细分的领域,你会觉得“这根本说不通”,人们也会说“我抓不住任何头绪”,但只要你真正在一个领域里坚持下去。
123:09
so fundamental as like deep learning was a thing that I had to learn in the past and people need to
就像深度学习是我过去必须学的东西一样基础,而人们也需要
123:13
do this I think that where a lot of people kind of get overwhelmed is how do I apply this to
我觉得很多人感到不知所措的地方在于,怎么把这个应用到实际中去。
123:20
have impact or find like a career path because like AI language models make this fundamental stuff
想要产生影响或者找到职业路径,因为AI语言模型让这些基础的东西变得很重要。他对这个很感兴趣,他是个博士生,这让他有优势,但对我来说,那是个我一直等着有人跟我说“嘿,我有时间在这上面花精力”的话题。而且我敢肯定,这里还有很多非常细分的领域,你会觉得“哦,这说不通啊”。在优化工具里,reward modeling、regularization、instruction tuning——这差不多是RLVR的一个简短总结——就像有一张巨大的表格,我只需要……到了这个地步,它就像是我喜欢的那样,因为语言模型在数学方面太强了,比如那篇著名的论文Direct Preference Optimization,那是一种简单得多的方式。
123:27
so accessible and people with motivation won't learn it and then it's like how do I get the cycles
所以门槛很低,有动力的人根本不用专门去学,问题就变成了——我怎么才能获得算力资源呢?
123:31
on goal to contribute to research and I think that I'm actually fairly optimistic in this because the
在推动研究贡献方面,我其实挺乐观的,因为这个领域变化太快了,很多时候最顶尖的人并不会彻底解决某个问题,因为总有一个更大、更容易摘的果子等着他们,所以他们就会转向下一个目标。我在Sarlay Jeffbook里想做的,很大程度上就是梳理post-training技术,描述人们如何看待它们对模型的影响,以及大家实际在做什么。然后你会发现,有太多东西人们要么不再研究了,要么根本没碰过。所以我觉得,在打好基础之后,专注于某个细分方向是好的,同时去读相关的论文、保持对生态系统的参与——实际上,你离得越近,就越能抓住机会。
123:37
field moves so fast that a lot of times the best people like don't fully solve a problem because
这个领域发展太快了,很多时候最顶尖的人都没能彻底解决一个问题,因为
123:43
there's a bigger lower like a bigger problem to solve that's very low-hanging fruit so they move on
其实有个更大的、更容易解决的问题摆在那儿,所以他们就直接去做了。
123:48
and I think that a lot of what I was trying to do in the Sarlay Jeffbook is like take post-training
我觉得我在Sarlay Jeffbook里想做的很多事情,就是把后训练技术整理出来,描述人们如何看待它们影响模型,以及大家都在做什么。
123:53
techniques and just describe how people think about them influencing the model and what people
然后你会发现,有太多东西人们要么不再研究了,要么根本没去研究——这真的很惊人。
123:57
are doing and then it's remarkable how many things I just think are just like people stop studying
所以我认为,在打好基础之后,专注于某个细分领域是好的,然后去读相关论文,积极参与到生态系统中。
124:04
them or don't so I think people trying to get narrow after doing the fundamentals is good and then
实际上,X和ML上的“邻近账号”莫名其妙地特别火,但没人知道这些人到底是谁。
124:12
reading the relevant papers and being engaged in the ecosystem it's like you actually the proximity
他们可能只是一群深入研究这些东西的普通人,尤其是在有了AI工具之后。
124:17
that random people have online from the leading researchers like no one knows about the anonymous
那些普通人在网上从顶尖研究者那里获取的信息,比如那个匿名账号,在X和ML上莫名其妙很火,没人知道这些人到底是谁——可能只是些深入研究这些东西的普通人,尤其是借助AI工具,就能做到“我不懂这个,那就继续深挖”,我觉得这非常有用。但也有很多研究领域,可能只需要读三篇论文,然后其中一位作者大概率会回复你的邮件,不过你得花很大精力去写这些邮件才能理解这个领域。我觉得对一个新手来说,要真正掌握一个非常狭窄的领域,轻松就得花上几周时间,但我觉得深入下去是值得的。
124:24
account on X and ML is very popular for whatever reason and no one knows who all these people are
X上的机器学习账号特别火,也不知道为什么,根本没人知道这些人是谁
124:28
like it could just be random people that study the stuff deeply especially with the AI tools to
可能只是一些深入研究的人,尤其是借助AI工具
124:32
just be like keep I don't understand this keep digging into it I think is a very useful thing
就是那种“我不懂这个,那就继续深挖”的态度,我觉得特别有用。
124:37
but there's a lot of research areas that just like are maybe three papers that you need to read
但很多研究领域其实只需要读三篇论文,然后其中一位作者大概率会回你邮件,不过你得花很大功夫去写这些邮件才能理解这个领域。我觉得对一个新手来说,要真正搞懂一个非常窄的方向,可能得花上好几周的时间。
124:42
and then one of the authors will probably email you back but you have to put a lot of effort
但我个人对角色训练特别感兴趣,就是怎么让模型变得幽默、讽刺或者严肃,以及要对数据做什么处理才能实现这些效果。然后有个牛津的学生联系我,说“嘿,我对这个很感兴趣”,我就指导了他一下,最后就有了那篇论文。
124:48
into these emails to understand the field like I think it would be for a newcomer easily weeks
通过阅读这些邮件来理解这个领域,我觉得对一个新手来说,可能要花好几周
124:53
of work to feel like they can truly grasp like what is a very narrow area but I think going
才能感觉自己真正搞懂一个非常狭窄的方向,但我认为
124:58
narrow after you have the fundamentals would be very useful to people because it's like I became
在你掌握了基础之后,那些非常窄的领域对人们会很有用,因为就像我一样,我对角色训练特别感兴趣,就是怎么让模型变得幽默、讽刺或者严肃,以及你要对数据做什么才能实现这一点。然后有个牛津的学生联系我,说他对这个感兴趣,我就指导了他,现在那篇论文已经存在了。我也不知道,全世界大概就两三个人对这个特别感兴趣。他是个博士生,这确实是个优势,但对我来说,那是一个我一直等着有人来说“嘿,我有时间花精力在这上面”的话题。而且我敢肯定,还有很多非常窄的东西,你一看就会觉得“哦,这根本说不通”。
125:04
very interested in character training which is like how you make the model funny or sarcastic
我对角色训练特别感兴趣,就是怎么让模型变得幽默、讽刺
125:10
or serious and like what do you do to the data to do this and it's like a student at Oxford
或者严肃,以及你要对数据做什么才能实现这一点,而提问者只是个牛津的学生
125:15
reached out to me it's like hey I'm interested in this and I advised him and it's like that paper
他联系我说“嘿,我对这个感兴趣”,我给了他一些建议,然后就有了那篇论文。他对这个感兴趣,他是个博士生,这算是个优势,但对我来说,那是个我一直等着有人来说“嘿,我有时间在这上面花精力”的话题。而且我确信这里还有很多非常细小的点,你会觉得“哦,这说不通啊”,人们会说“这些我抓不住”,但只要你真的在一个领域里深耕,我觉得能学到很多有趣的东西。是的,我觉得你不能什么都想尝试,因为那样会非常让人不知所措,如果你试图跟上所有东西,你会 burnout 的。比如我自己,我已经很久没跟进 computer vision 了,就只专注于我们的 limbs。
125:19
now exists and it's like I don't know there's like two or three people in the world that were very
现在确实存在这种情况,感觉全世界也就两三个人对这个特别感兴趣。他是个博士生,这确实有优势,但对我来说,这个课题我一直等着有人能说“嘿,我有时间投入精力研究这个”。我敢肯定还有很多非常细分的领域,你会觉得“这根本说不通啊”,别人也会说“我完全抓不住重点”。但只要你真正扎根在一个领域里,我觉得能学到很多有意思的东西。没错,你不可能什么都做,因为那样压力太大了,要是试图跟上所有东西,肯定会 burnout。比如我自己,已经很久没跟进计算机视觉了,就专注在语言模型这块。
125:24
interested in this he's a PhD student which gives you an advantage but like for me that was a
他对这个很感兴趣,他是个博士生,这确实是个优势,但对我来说,这个话题我一直等着有人能说“嘿,我有时间在这上面花精力”,而且我肯定还有很多非常细分的点,你会觉得“这说不通啊”。
125:29
topic I was waiting for someone to be like hey I have time to spend cycles on this and I'm sure
在优化工具里,reward modeling、regularization、instruction tuning——这基本上就是RLVR的一个简短总结——就像有一张巨大的表格,我直接……
125:33
there's a lot more very narrow things here you're just like oh it doesn't make sense that
到了这个阶段,我喜欢的是,因为语言模型在数学上已经非常强了,就像那篇著名的论文direct preference optimization,它提供了一种简单得多的方式。
125:37
there was no answer to this and I think that it's just like there's so much information coming
这个问题没有答案,我觉得就像信息量太大了,大家都抓不住重点。但如果你真的专注在一个领域,我觉得还是能学到很多有趣的东西。对,你不能什么都想学,因为那样会非常让人不知所措,如果试图跟上所有东西,你会 burnout 的。比如我自己,已经很长时间没跟进 computer vision 了,就只专注在我们的领域。但回到你的书,我觉得这也是一本非常棒的书,性价比很高,因为如果你想了解 RLHF,我不会建议你去把所有 RLHF 论文都读一遍,那得花两年时间,我只是把这本书编辑了一下。
125:41
that people are like I can't grab on to any of these but if you just actually stick in an area
大家会说,这些我根本抓不住,但如果你真的在一个领域里扎下去——
125:46
I think there's a lot of interesting things to learn yeah I think you can't try to do it all
我觉得有很多值得学习的东西,是啊,你不能什么都去尝试,因为那样会让人应接不暇,如果什么都想跟上,很快就会 burnout。比如我自己,很久没跟进 computer vision 了,只专注于我们的 limbs 和所有 hf 的论文,因为如果你去搞那些,可能两年就搭进去了。我刚编完一本书,还有别的事,我们看看最后哪些结论能站得住脚。我们来过一遍目录里的内容,看看有哪些想法,当我们忽略了 post training 的大局时。所以首先我会讲问题设定、训练概览,什么是 preference、preference 数据、优化工具、reward modeling、regularization、instruction tuning。
125:50
because it would be very overwhelming and you would burn out if you'd try to keep up with everything
因为如果什么都想跟上,你会觉得特别 overwhelm,最后 burnout。
125:54
for me for example I haven't kept up with computer vision a long time just focus on our limbs
比如我自己,已经很长时间没跟进 computer vision 了,只专注在 LLM 上,
125:58
but coming back to your book for example I think this is also a really great book in a really
回到你的书,我觉得这确实是一本很棒的书,性价比很高。因为如果你想了解RLHF,我不会建议你直接去读那些RLHF论文,那样你可能会花上两年时间。我只是把这本书编辑了一下,我们看看最终效果如何。我们来过一遍目录里的内容,看看有哪些想法——当我们忽略了post-training的大局时,会错过什么。首先我会讲问题设定、训练概览,什么是preference、preference数据、优化工具、reward modeling、正则化、instruction tuning、rejection sampling、强化学习、policy gradients,以及direct alignment algorithms。
126:02
good bang for the buck because you want to learn about all our hf I wouldn't go out there and read
性价比很高,因为你想了解我们所有的HF内容,我不会让你去读所有HF论文,因为那得花两年时间——我刚编完一本书。还有一件事,我们等着看结果如何。简单过一下目录里的内容,有些想法在讨论后训练时容易忽略全局。首先我会讲问题设定、训练概览,什么是偏好、偏好数据,以及优化工具、奖励建模、正则化、指令微调、拒绝采样、强化学习、策略梯度、直接对齐算法、缩放与数据、蒸馏、评估,最后是开放问题章节,关于过度优化风格。
126:07
all our hf papers because I would be you would be spending two years there's I just edited the book
只看我们自己的 HF 论文,因为不然的话,你两年时间就搭进去了——我刚编完那本书。
126:12
and I was like there's the chapter where I had to be like x papers say one thing and x papers say
我当时就想,有一章我得这么写:X篇论文说一个观点,X篇论文说另一个观点,最后看哪个才是对的。那咱们就过一遍目录里的内容,聊聊那些我们在后训练阶段容易忽略全局视角的想法。首先我会讲问题设定、训练概览,什么是偏好、偏好数据,然后是优化工具、奖励建模、正则化、指令微调、拒绝采样、强化学习、策略梯度、直接对齐算法,接着是宪法AI和AI反馈、推理与推理时扩展、函数调用、数据与蒸馏、评估,最后是开放问题部分,关于过度优化风格。
126:17
another thing and we'll see what comes out to be true what are some of the just to go through some
还有一件事,我们看看最后会不会成真:就是当我们只盯着一些局部内容、一些想法的时候,反而错过了 post-training 的 bigger picture。
126:23
of the table content some of the ideas when we're missing the bigger picture of the post training
所以首先我会讲一下问题设定、training overview,什么是 preference、preference data,
126:26
so first I'll do the problem set up training overview what a preference this preference is data
还有 optimization tools、reward modeling、regularization、instruction tuning。
126:31
in the optimization tools reward modeling regularization instruction tuning
掌握优化工具、奖励建模、正则化、指令微调这些内容。
126:36
rejection sampling reinforcement learning a policy gradients direct alignment algorithms
拒绝采样、强化学习、策略梯度、直接对齐算法
126:43
then constitutional AI and AI feedback reasoning and inference time scaling to use some function
然后constitutional AI、AI反馈推理和inference time scaling,用一些function calling、数据、蒸馏和评估,最后是开放问题部分,关于过度优化的风格。提到把教育部分和研究部分连接起来。你提到的角色训练挺有意思的,角色训练之所以有趣,是因为这方面的内容很少。但我们聊过人们如何与这些模型互动,比如我们用它们时感觉很好,因为它们很积极,但这可能走得太远,变得过于积极了。本质上就是,你怎么调整你的数据和/或决策过程,让它完全符合你的需求。OpenAI有个叫model spec的东西,基本上是他们的内部指导方针。
126:49
callings and data and distillation evaluation and then open question section over optimization style
调用、数据、蒸馏、评估,然后是开放问题部分,关于过度优化风格
126:55
and information and that product UX character and post training so what are some ideas worth
信息和产品UX特性以及post training。那么有哪些值得提及的想法,既能连接你提到的教育部分,又能连接研究部分?character training挺有意思的,character training之所以有趣,是因为关于它的公开内容很少。但我们讨论过人们如何与这些模型互动,比如我们使用它们时感觉良好,因为它们很积极,但这可能走得太远——过于积极了。本质上,问题在于如何调整你的数据和/或决策过程,让它完全符合你的需求。OpenAI有一个叫model spec的东西,本质上就是他们希望模型遵循的内部指南,并且他们把这个发布给开发者,这样你基本上就能知道。
127:02
mentioning that connect both the educational component and the research component you mentioned
提到你刚才说的教育和研究这两个部分之间的联系
127:06
the character training is pretty interesting character training is interesting because they're
角色训练挺有意思的,角色训练之所以有趣,是因为从中能学到的东西其实很少
127:09
so little out of it but we talked about how people engage with these models and like we feel good
但我们聊过人们怎么跟这些模型互动,比如我们用它们的时候感觉很好,因为它们很积极
127:15
using them because they're positive but that can go too far it can be too positive and it's like
但这也可能走极端,太积极了也不行
127:19
essentially it's how do you change your data and or decision making to make it exactly what you want
本质上就是,你怎么调整你的数据和/或决策方式,让它完全符合你的需求
127:26
and I open AI has this thing called a model spec which is essentially their internal guideline
OpenAI 有个东西叫 model spec,基本上就是他们的内部指南
127:31
for what they want to model to do and they publish this to developers so essentially you can know
对于他们想要建模的目标,他们把这些内容发布给开发者,所以基本上你可以知道
127:37
what is a failure of open AI's training which is like they have the intentions and they haven't
OpenAI 训练中的一个失败之处是什么,就是他们明明有意图,但还没实现;而他们真正想做、但你并不喜欢的事情又是什么。透明度是很好,但所有用来整理这些文档的方法,以及遵循这些方法的难易程度,其实并不太为人所知。我觉得这本书的设计思路是,强化学习那一章显然是大家最想看的,因为每个人都听说过 RLVR,它用的是同样的算法、同样的框架,只不过可以在完全不同的文档里应用。所以我们早期 Jeff 的核心观点就是,偏好的混乱本质,基本上是我几年前写的一篇论文的翻版,但这章会告诉你这些。
127:41
met it yet versus what is something that they like actually wanted to do and that you don't like
是否已经达到了,而他们实际想做的事情是什么,以及你不喜欢的地方
127:45
and that transparency is very nice but all the methods for curating these documents and how
这种透明度非常好,但所有整理这些文档的方法,以及遵循它们的难易程度,其实并不广为人知
127:50
easy it is to follow them is not very well known I think the way the book is designed is that the
我觉得这本书的设计思路是,强化学习那一章显然是大家最想要的,因为每个人都听说过RLVR
127:55
reinforcement learning chapter is obviously what people want because everybody hears about it with
它其实是同一个算法、同一套框架,只是可以用在非常不同的文档里
127:58
RLVR and it's the same algorithm in the same map but it's just like you can use it in very different
所以我认为我们早期Jeff的核心观点就是,偏好的混乱程度本质上
128:04
documents so I think the core of our early Jeff is like how messy preferences are is essentially
是对我几年前写的一篇论文的重新整理,但这章会告诉你
128:11
rehash of a paper that I wrote years ago but this is essentially the chapter that will tell you
这其实是我几年前写的一篇论文的翻版,但这部分会告诉你单一价值观
128:16
why RLVR is never ever fully solvable because like the way that even RL is set up is that
为什么RLVR永远不可能被完全解决,因为就连RL本身的设定方式,就是假设偏好可以被量化,并且多个偏好可以被简化为单一数值。我觉得这和经济学文献里的von Neumann-Morgenstern效用定理有关,而那正是所有哲学、经济学和心理学背景被压缩进RLVR的那一章。所以就像是你有了所有这些内容,然后在书的后面,你又用这个RLMAP让数字往上涨。我觉得这正是为什么,如果有人去做这方面的研究会非常有价值,因为量化偏好这件事,本质上就是人类为了处理偏好而设计出来的问题。
128:25
it assumes that preferences can be quantified and that multiple preferences can be reduced to
它假设偏好可以被量化,并且多个偏好可以简化为单一数值。我觉得这跟经济学文献里的冯·诺伊曼-摩根斯坦效用定理有关,就像那章里所有哲学、经济学和心理学的背景,告诉你做RLVR时压缩了什么。所以你有所有这些内容,然后书后面又说你用RLMAP让数字往上涨。我觉得这就是为什么做这方面的研究会很有价值,因为量化偏好这件事,就像人类设计问题是为了让偏好有回应——你关心不同的事情,比如准确性或风格,而当你……
128:32
single values and I think it relates in the economics literature to the von Nomen Morganston utility
我觉得这在经济学文献里跟 von Neumann-Morgenstern 效用理论有关
128:38
theorem and like that is the chapter where all of that philosophical economic and like psychological
定理以及类似的内容,是书中涵盖所有哲学、经济学和心理学背景的章节,它告诉你什么被压缩进了做RLVR的过程。所以就像是你有了所有这些,然后到了书的后半部分,你会用这个RLMAP来让数字增长。我认为这正是为什么做这方面的研究会非常有价值,因为量化偏好这件事,本质上就是人类设计了这个难题,以便让偏好做出回应。你会有不同的关注点,无论是准确性还是风格,而当这种情况发生时,世界上其他领域也有大量研究探讨应该如何实际执行。我觉得社会选择理论就是其中之一。
128:44
context it tells you what gets compressed into doing RLVR so it's like you have all of this and then
上下文告诉你,哪些内容会被压缩到做RLVR中,就像你拥有所有这些,然后
128:49
and later in the book it's like you use this RLMAP to make the number go up and I think that that's why
在书的后面,它会告诉你用这个RLMAP来让数字上升,我认为这就是为什么
128:53
I think it would be very rewarding for people to do research on is because it's like quantifying
我觉得人们做这方面的研究会很有价值,因为量化偏好
128:58
preferences is something that is just like humans have designed the problem in order to make preferences
就像人类设计这个问题是为了让偏好
129:04
studyable but there's kind of fundamental debates on like an example is in a language model
可以研究,但存在一些根本性的争论。举个例子,在语言模型里,你会在意不同的事情,比如准确性或者风格。当你收集数据时,所有这些都被压缩成“我更喜欢这个而不是那个”这样的判断。这种情况确实存在,而且世界上其他地区有很多研究都在探讨应该如何实际操作这件事。我觉得社会选择理论是经济学的一个子领域,研究的是如何聚合偏好。我之前参加过一个研讨会,他们发布了一份白皮书,讨论如何将社会选择理论应用于RLHF。所以我主要希望那些对数学感到兴奋的人能参与进来。
129:09
response you have different things you care about whether it's accuracy or style and when you're
回应:你有不同的关注点,无论是准确性还是风格,当你
129:13
collecting the data they all get compressed into like I like this more than another and it's like
收集这些数据后,它们都会被压缩,就像“我更喜欢这个而不是那个”这种感觉,然后这种过程一直在发生。世界上其他领域也有很多研究,探讨到底应该怎么做这件事。我觉得社会选择理论是经济学的一个分支,研究的是如何聚合偏好。我之前参加过一个研讨会,他们发布了一份白皮书,讨论如何将社会选择理论应用到RLHF中。所以我最希望的是那些对数学感到兴奋的人能参与进来。有个好玩的事,我一直在整理一份技术报告清单,比如关于推理模型的。所以在第14章,也就是对RLVR的一个简短总结里,有一个巨大的表格,我直接把
129:18
like that is happening and there's a lot of there's a lot of research in other areas of the world
看到这种情况发生时,世界上其他领域也有很多研究
129:23
that go into like how should you actually do this I think social choice theory is the
关于具体如何操作,我觉得社会选择理论是个有趣的东西。我一直在整理所有技术报告的列表,比如推理模型。所以在第14章,也就是RLVR的简短总结里,有一张巨大的表格。到了这个阶段,这恰恰是我喜欢的,因为语言模型在数学方面已经非常强了。比如那篇著名的论文Direct Preference Optimization,它用比RL简单得多的方式解决了问题,推导过程和跳过的数学步骤都很清晰。我现在开始研究用于教育的模型,这些模型的设计初衷是不一次性给出所有信息,而是让人们——其实我还没用过它们,但我猜它们的设计就是不让信息一股脑全出来,而是引导人们去思考。
129:29
subfield of economics around how you should aggregate preferences and there's like
经济学里有个分支,研究怎么聚合偏好,然后我参加过一个研讨会,出了一份白皮书,讲怎么用社会选择理论来做RLHF。所以我主要希望那些对数学感兴趣的人能参与进来。
129:35
I was I went to a workshop that published a white paper on like how can you think about using
有个好玩的事,我一直在整理一个技术报告清单,比如推理模型那种。所以在第14章,也就是RLVR的简短总结里,有一张巨大的表格,我直接——
129:39
social choice theory for RLHF so I mostly would want people that get excited about the math to come
到了这个阶段,它基本上就是我喜欢的那种,因为语言模型在数学上太强了。比如那篇著名的论文《直接偏好优化》,它用比RL简单得多的方式解决了问题,推导过程和跳过的数学步骤都很清晰,就是这样。
129:44
and have things or they can stumble into and learn this kind of broader context I think there's a
而且有些东西他们可能会偶然发现并学到这种更广泛的上下文。我觉得有个有趣的事——我一直在整理一份技术报告清单,比如推理模型。所以在第14章,也就是RLVR的简短总结那一章,里面有一个巨大的表格,我把所有我喜欢的推理模型都列了出来。所以我觉得,很多教育内容现在需要变成“我喜欢什么”这种形式,因为语言模型在数学方面已经非常强了。比如那篇著名的论文Direct Preference Optimization,它用比RL简单得多的方式解决了问题,但推导过程和跳过的数学步骤让人头疼。我写这本书的时候重新做了推导,然后心想:这个log trick到底是什么鬼?
129:49
fun thing I just keep a list of all the tech reports like a reasoning model so in the in chapter 14
有意思的是,我一直在整理一份技术报告清单,比如推理模型之类的。所以在第14章里,有一个类似RLVR的简短总结,里面有一张巨大的表格,到了这个地步,我觉得还挺好的,因为语言模型在数学方面表现太强了。比如那篇著名的论文《直接偏好优化》,它比RL解决这个问题的方式简单得多,推导过程和跳过的数学步骤都很清晰。我现在开始做一些面向教育的模型,这些模型的设计初衷是——其实我还没用过,但我猜它们不会一次性给出所有信息,而是让人像玩《塞尔达》和《银河战士》那样去探索。最近有个新游戏,我卡住了,真的卡了很久。
129:55
which is a kind of like a short summary of RLVR there's just like a gigantic table where I just
这有点像RLVR的简短总结,就是一张巨大的表格,里面全是数学。比如那篇著名的论文《直接偏好优化》,它比Zelda和Metroid简单多了。还有一款新游戏,我卡住了,真的卡住了,但别告诉我完整解法,就说说我能尝试什么,比如那种稍微试探一下的方式。但问题在于,我觉得这需要自律,而且很多人学数学是为了——我是说,确实有很多人喜欢数学,但也有很多人是为了做作业才学的,然后就会走捷径。是啊,我们可以这样,而且所有考试都可以数字化,但在此之前,每个人都得用纸质方式完成所有考试。
129:59
like list every single reasoning model that I like so there's just like I think an education a lot of
比如列出每一个我喜欢的推理模型,我觉得现在很多教育方面需要这样,因为语言模型在数学上已经非常强了,像那篇著名的论文 Direct Preference Optimization,它用比 RL 更简单的方式解决了问题,但推导过程和跳过的数学步骤,我试着为这本书重新做了一遍推导,然后就想,这个 log 技巧到底是什么鬼,我不确定我是否喜欢这种数学被过度商品化的感觉。我觉得在阅读附录和跟随数学推导时遇到一些困难,对学习是有好处的。是的,所以实际上这又回到了教育这个话题上,你们两位都……
130:04
it needs to be like at this point it's like what I like because the language models are so good at the
到了这个阶段,情况就变成了这样——我喜欢的是,因为语言模型在数学方面已经非常强了,比如那篇著名的论文Direct Preference Optimization,它比Zelda和Metroid要简单得多。还有这个新游戏,我卡住了,真的卡住了,但别直接给我完整解法,而是告诉我有什么可以尝试的方法,你懂的,就是那种你小心翼翼地试探它的方式。但问题在于,我觉得这需要自律,而且很多人做数学是为了——我是说,有很多人喜欢数学,但也有很多人是为了完成作业才不得不做,然后就会想走捷径。是啊,我们可以这样,而且所有考试都可以数字化,但在此之前,每个人都得在纸上完成所有考试。
130:10
math where it's like famous paper direct preference optimization which is like a much simpler way of
数学方面,有一篇著名的论文叫Direct Preference Optimization,这是一种更简单的方法
130:15
solving the problem than RL the derivations and the impending skip steps of math and it's like I
解决这个问题比RL推导和跳过数学步骤更有效,感觉就像我
130:21
tried for this book like I redid the derivations and I'm like what the heck is this log trick that
为了写这本书,我重新推导了一遍公式,然后心想:这到底是个什么对数技巧啊?
130:26
they use to change the map but doing it with language models they're like this is the log trick and
他们以前用来改变地图,但用语言模型来做的时候,他们就说“这是对数技巧”,然后我说,我不太确定我喜不喜欢这样——数学变得这么商品化。我觉得,读附录、跟着数学推导走,这种挣扎的过程对学习是有好处的。是的,其实我经常回到这个话题,就是关于教育。你们俩都反复提到“挣扎”这个词。如果你在这个过程中没有挣扎,那可能就没有完全遵循正确的学习流程。我猜有些提供商已经开始开发教育模型了,这些模型的设计初衷是——其实我没用过,但我猜——它们不会一次性给出所有信息,而是让人……
130:30
I'm like I don't know if I like this that the math is so commoditized I think like some of the
我有点不确定自己是否喜欢这种把数学搞得这么商品化的做法。我觉得,读这个附录时遇到一些困难、跟着数学推导走,其实对学习是有好处的。
130:36
struggle and reading this appendix and following the math I think is good for learning and I
是的,所以我其实经常回到这个话题——关于教育。你们俩都有这个过程,但你们并没有完全遵循正确的学习流程。
130:43
yes so actually it returns to this often just on the topic of education you both both have
我猜有些教育服务提供商已经开始开发针对教育的模型了,这些模型的设计初衷并不是——其实我没用过它们,但我猜它们的设计是为了不一次性给出所有信息,而是让人自己去思考。
130:49
brought up the word struggle quite a bit so there's value if you're not struggling as part of this
你反复提到“挣扎”这个词,所以如果你在这个过程中没有挣扎,那说明你可能没有完全遵循正确的学习路径。我猜有些教育类模型已经开始设计成不会一次性给出所有信息,而是让人自己思考——虽然我没实际用过,但应该是这个思路。我自己也做过类似的事,比如前几天打游戏的时候。我平时消遣喜欢玩解谜类游戏,比如《塞尔达》和《银河战士》。最近有个新游戏,我卡住了,真的卡了两天,心想“算了,我不想硬撑两天”,于是就用了一个LLM,但结果你猜怎么着——
130:55
process you're not fully following the proper process for learning I suppose some of the providers
这说得通。我前几天就做过类似的事情,比如在电子游戏里。
131:03
are starting to work on models for education which are designed to not give actually I haven't used
开始在做教育模型,这些模型的设计初衷是——其实我没用过它们,但我猜它们不会一次性给出所有信息,而是让人像玩《塞尔达》和《密特罗德》那样去探索。最近有个新游戏,我卡住了,真的卡住了,它不给我完整解法,而是说“嗯,有什么你可以试试的?”——就是那种你小心翼翼地试探它的感觉。但问题在于,我觉得这需要自律,而且很多人学数学是为了……我是说,有很多人喜欢数学,但也有很多人只是为了做作业才学,然后就会走捷径,对吧,我们确实可以这样。
131:07
them but I would guess they're designed to not give all the information at once and make people
但它们的设计大概就是不会一次性给出所有信息,而是让人像玩《塞尔达》和《密特罗德》那样——比如有个新游戏我卡住了,真的卡住了,它不会直接给我完整解法,而是说“你可以试试这个方向”,就像那种你小心翼翼地试探的感觉。但问题在于,我觉得这需要自律,而且很多人学数学……我是说,确实有很多人喜欢数学,但也有很多人是为了做作业才不得不学,这时候就会想走捷径。是啊,我们可以……而且现在所有考试都可以数字化了,但在此之前,大家都得用蓝皮书手写答题,因为没别的办法。现在有了AI,所有人都得回到蓝皮书时代了。
131:12
work to do this so I think you could train models to do this and it would be a wonderful contribution
要做这个工作,所以我觉得你可以训练模型来做这件事,那会是一个很棒的贡献。
131:16
we're like all of this stuff in the book you have to re-evaluate every decision for it which is
书里所有这些内容,你都得重新评估每一个决策,这真是个好例子。我觉得你有可能在AI2上做点什么,我当时就想,哦,这说得通。我前几天也做过类似的事,比如在电子游戏里。
131:20
such a great example I think there's there's a chance you work on in the AI2 which I was like oh I
我平时消遣会玩电子游戏,比如我喜欢解谜类的游戏,像《塞尔达》和《银河战士》。最近有个新游戏,我卡住了,真的卡了很久。我就想,好吧,我不想硬撑两三天,于是我用了一个LLM。但我会说,嘿,别剧透,就告诉我我现在在哪儿、接下来该做什么。
131:25
think this makes sense I do something like that did that the other day for video games for example
我觉得这说得通,我前几天就这么干过,比如打游戏的时候。像《塞尔达》和《密特罗德》,还有一款新游戏,我卡住了,真的卡了很久。我就想,好吧,我不想花两天时间硬扛,于是就用了一个LLM。但你不能直接给我完整答案,而是说“你可以试试这个”,就像那种你小心翼翼地试探它的感觉。但问题在于,我觉得这需要自律。很多人学数学,比如——确实有不少人喜欢数学,但也有很多人只是为了做作业才学,这时候LLM就成了捷径。没错,我们可以开发一个教育专用的LLM,但另一个LLM还在那儿,它始终是个诱惑。
131:31
I sometimes for my pastime play video games like I like video games with puzzles so you know
我平时消遣会打打游戏,比如我喜欢那种带解谜元素的游戏,你懂的,像《塞尔达》和《密特罗德》。最近有个新游戏我卡住了,真的卡了很久,我就想,算了,不想硬耗一两天,于是用了LLM。但你不能直接给我完整答案,而是说“你可以试试这个”,就是那种小心翼翼地试探着问。但问题在于,我觉得这需要自律。很多人做数学题,比如——确实有不少人喜欢数学,但也有很多人是为了完成作业才不得不做,这时候就会想走捷径。没错,我们可以开发一个教育专用的LLM,但另一个LLM还在那儿,它始终是个诱惑。
131:36
like Zelda and Metroid and there's this new game where I got stuck and I really got stuck and
像《塞尔达》和《密特罗德》这种游戏,还有那个新出的游戏,我卡住了,真的卡住了。别直接告诉我完整解法,但能不能给我点可以试试的思路?就是那种你小心试探的感觉。但问题在于,我觉得这需要自律,而且很多人做数学——我是说,确实有很多人喜欢数学,但也有很多人是为了做作业才不得不学,然后就想着走捷径。是啊,我们可以这样。而且所有考试都可以数字化,但在此之前,每个人都得在纸上完成所有考试。这可能是史蒂夫·乔布斯的现实扭曲力场,因为你只需要说服别人。伯恩霍伯特写了一本书,把泡沫分类,但其中一种是金融泡沫。
131:41
was okay I you know I don't want to struggle like two two days and so I use an LLM but then you
行吧,我懂,我不想花两三天硬磕,所以就用了个LLM,但它也没给我完整的解决方案,只是说“你可以试试这个”,就像那种你得小心翼翼地试探它。但问题在于,我觉得这需要自律,而且很多人学数学——我是说,确实有很多人喜欢数学,但也有很多人只是为了做作业才学,然后就想着走捷径。是啊,我们可以开发一个教育专用的LLM,但其他LLM还在那儿,用它们还是很有诱惑力。有时候你对自己职业生涯里什么真正有用缺乏长远眼光,但你必须培养那种判断力。对,我之前跟人聊过,也这么觉得。
131:46
say hey please don't add any spoilers just you know I'm here and there what do I have to do next and
嘿,拜托别剧透,你就说“我在,然后呢,我下一步该做什么”就行,别直接给完整答案,但可以提示一下我能尝试什么,比如那种稍微引导一下的方式。但问题在于,我觉得这需要自律,而且很多人学数学吧——我是说,确实有很多人喜欢数学,但也有很多人是为了做作业才不得不学,然后就想着走捷径。没错,我们可以开发一个教育型的LLM,但另一个LLM还在那儿,用它作弊的诱惑也还在。我觉得很多人,尤其是大学生,他们其实明白自己真正热爱什么,对自己有清醒的认识,也知道这事儿不该太容易。
131:51
the same thing you can do I guess for math where you say okay I'm here at this point I'm getting stuck
数学上也可以做类似的事情,比如你说“好,我卡在这个点了”,不要直接给我完整答案,而是告诉我“有什么可以尝试的方向?”——就是那种小心试探的感觉。但问题在于,这需要自律,而很多人学数学……我是说,确实有很多人喜欢数学,但也有很多人是为了完成作业才学的,这时候捷径就很有诱惑力。我们可以开发一个教育用的LLM,但另一个LLM还在那里,而且用它作弊的诱惑依然存在。我觉得很多人,尤其是大学生,他们其实明白自己真正热爱的东西,对自己有清醒的认识,也知道学习不该太轻松。
131:56
don't give me the full solution but well what is something I could try you know like where
不要给我完整的解决方案,但有什么我可以尝试的?就像你小心地试探它。
132:00
you kind of carefully probe it but the problem here is I think it requires discipline and a lot
但问题在于我觉得这需要自律,而且很多人学数学——我是说有很多人喜欢数学,但也有很多人是为了做作业,然后就想着走捷径。
132:05
of people do math for like I mean there are a lot of people who enjoy math but there are also a lot of
是的,我们可以。所有的考试都能数字化,但在那之前,每个人都必须在超高效的环境下完成所有考试。
132:10
people who need to do it for their homework and then it's like the shortcut and yeah we can
这可能是Steve Jobs的Reality Distortion Field,因为你只是说服了即将发生的事情。
132:14
develop an educational LLM but the other LLM is still there and it's still a temptation to use the
开发一个教育用的LLM,但另一个LLM还在那里,而且用它还是很有诱惑力。
132:19
other LLM I think a lot of people especially in college they they understand the stuff they're
其他LLM我觉得很多人,尤其是大学生,他们其实懂自己热爱的东西,对自己有清晰的认知,也明白这事儿不该太容易。我觉得有时候你对自己职业生涯里什么真正有用,并没有长远的眼光,但你必须得培养这种品味。我跟我和朋友聊过这个,就是说大概有十年这么个窗口期,所有作业和考试都能用数字方式完成。但在这之前,大家都得用蓝皮书手写考试,因为没别的办法。现在AI来了之后,所有人又得回到蓝皮书和口试,因为作弊太容易了。这就像是短暂的一代人。
132:23
passionate about they're self-aware about it and they understand it shouldn't be easy like I think
他们对此有清晰的自我认知,也明白这本来就不该是件容易的事。我觉得有时候你并不清楚长期来看什么对你的职业真正有用,但你必须培养这种判断力。我和朋友聊过这个——大概有十年窗口期,所有作业和考试都能数字化完成;但在此之前,所有人都得用蓝皮书手写考试,因为没有其他选择。而现在AI出现后,每个人又得回归蓝皮书和口试,因为作弊太容易了。这就像短暂的一代人,恰好赶上了非常适合评估的模型时代——而你想成为最顶尖的那个。
132:28
we just have to develop a good taste because our research tastes like school taste about stuff that
我们得培养出好的品味,因为我们的研究品味就像学校里的品味一样,关于哪些事情你应该去努力攻克,哪些事情你不该纠结——这其实很难判断,因为有时候你并没有长远的眼光,看不清什么对你的职业生涯真正有用,但你必须得培养这种品味。嗯,我和我的朋友聊过这个,就像这样:有那么一个短暂的十年窗口期,所有的作业和考试都可以数字化;但在此之前,大家都得用蓝皮书来考试,因为没有别的办法。而现在有了AI之后,每个人又都得回到蓝皮书和口试,因为作弊太容易了。这就像是那一代人的短暂过渡期。
132:35
you should be struggling on and stuff you shouldn't be struggling on which is tricky to know because
你应该在某些事情上挣扎,而在另一些事情上不该挣扎——这其实很难判断,因为有时候你并没有足够的长远眼光,看不清什么对你的职业发展真正有用,但你必须培养这种判断力。嗯,我和我的朋友聊过这个,就像有那么一个短暂的十年窗口期,所有的作业和考试都可以数字化完成;但在此之前,每个人都得用蓝皮书手写考试,因为没有别的办法。而现在有了AI之后,大家又得回到蓝皮书和口试,因为作弊太容易了。就好像只有这一代人能作弊,现在又得退回去,这真的挺搞笑的。你刚才提到角色训练——
132:40
sometimes you don't have good long term vision about what will be actually useful to you in your
有时候你并没有很好的长期视野,去判断什么对你的职业生涯真正有用,但你必须培养这种品味。嗯,我之前和me还有found say聊过。
132:47
career but you have to you have to develop that taste yeah I was talking to me and I found say
而且所有考试本来都可以数字化,但在此之前,每个人都得用蓝皮书来考,因为没有别的办法。现在有了AI,每个人又都得用蓝皮书和口试了,因为作弊太容易了。这就像是一代短暂的模型,非常适合评估——你想成为评估方面最厉害的人。所以不是说每个项目都得这么做,但如果你从一个小规模开始……
132:53
our friends about this and it's like there's this brief 10-year window where all of the homework
我们跟朋友聊过这个,感觉就像有那么一个短暂的十年窗口期,所有作业和考试都能数字化。但在此之前,大家都得用蓝皮书手写考试,因为没有别的办法。现在AI来了,所有人都得回到蓝皮书和口试,因为作弊太容易了。这就像是模型特别适合评估的那一代,而你想成为评估最厉害的人。所以你不必让每个项目都这么做,但如果你从一所没有算力的小型大学起步,找到了Claude搞不定的问题,那确实很难。但如果你想用最少的算力实现最大的影响力,就得这么干。
132:59
and there all the exams could be digital but before that everybody had to do all the exams in
Bernhobert写了一本关于泡沫分类的书,但其中一种是思想空间的金融泡沫,你正在制造Reality Distortion Field,这意味着你在偏离。
133:03
blue book because there was another way and now after AI everybody's gonna need to be in blue
blue book 是因为还有另一条路,现在AI之后每个人都得进blue book了
133:07
books in oral exams because everybody could cheat so easily it's like this brief generation that
口试的时候翻书,因为作弊太容易了,就像那一代模型一样,其实特别适合做评估——如果你想把评估做到最好。所以不是说每个项目都得这么搞,但如果你从一个小安全网起步,他们就会发现可以长期运作,而他们真正想做的是……很多人会说:“我受不了这种找 funding 的折腾,grant 莫名其妙就被政府砍了,或者根本不知道接下来会发生什么。”所以我觉得不确定性很大。说实话,我觉得变化其实没那么大。我做过学术,现在不在学术圈了,但与此同时,我也不想错过在学术界的时光。不过我当时想要的是……
133:11
had a different education system that like everything could be digital and but you still couldn't
她接受过一种不同的教育体系,所有东西都可以数字化,但你仍然没法作弊,现在她能回到过去,这真的很好笑。你提到角色训练,我们稍微放大到更宏观的话题:那项研究需要多少算力?总的来说,作为研究者要做出贡献,有没有哪些领域不需要太多算力,个人研究者也能真正参与?关于角色训练这件事,我认为这项研究是基于对大约70亿参数的模型进行微调,用的是LoRA——本质上你只微调了模型权重的一小部分。我不确定具体需要多少GPU小时,但这是可行的——不过并非每个学术机构都能做到。
133:17
cheat and now she can go back that's just very funny you mentioned character training just
作弊然后她就能回去了,这真的很好笑。你提到角色训练,
133:22
zooming out on a more general topic for that topic how much compute was required and in general to
往大了说一个更宏观的话题,做这类研究需要多少算力?以及作为一个独立研究者,有没有哪些方向不需要太多算力也能做出贡献?关于角色训练这件事,我觉得这项研究是基于对约7B参数的模型做fine tuning,用的是LoRA——本质上你只微调了模型权重中的一小部分。我不确定具体需要多少GPU hours,但确实可行——不过对每个学术机构来说不一定都可行。所以现状就是,无论closed models还是open models,你都能拿到它们的completions,然后去观察、理解这些模型,这非常适合做evaluation——而你想成为这方面最顶尖的人。
133:29
contribute as a researcher are there places where not too much compute is required where you can
作为研究员,有没有哪些地方不需要太多算力,你个人也能做出贡献?
133:36
actually contribute as an individual researcher for on the character training thing I think this
关于角色训练这件事,我觉得这项研究是基于用LoRA微调大约70亿参数的模型,
133:41
research is built on fine tuning about 7 billion parameter models with Laura which is like a
本质上你只微调了模型权重的一小部分。我不确定具体需要多少GPU小时,
133:47
essentially you're only fine tuned a small subset of the weights of the model I don't know exactly
但这是可行的——不过不是每个学术机构都能做到。
133:51
how many GPU hours that would take but it's doable not doable for every academic so the situation
现在的情况是,无论是闭源模型还是开源模型,你都能从它们那里拿到输出结果,
133:58
for some academics is like so dire that the only work you can do is doing inference where you have
对某些学术界的人来说,情况严峻到你能做的唯一工作就是做推理——无论是用闭源模型还是开源模型,你从它们那里拿到输出结果,然后观察并理解这些模型。这非常适合做评估,而评估的目标就是成为最擅长设计代表性问题的人,这些问题要么让模型失败,要么展示出模型的某些能力。我觉得通过这种方式你可以取得突破。所以我认为,如果你想让研究有职业发展势头,最终极的目标就是做评估,让前沿实验室采纳你的评估方法。也就是说,你不需要每个项目都这么做,但如果你来自一个没有算力的小型大学,然后你发现了一个Claude搞不定的问题,那接下来——
134:02
closed models or open models and you get completions from them and you can look at them and understand
然后你可以观察并理解这些模型,这非常适合做评估——而评估正是你想做到最好的领域。
134:07
the models and that's very well suited to evaluation which you become you want to be the best at
这些模型非常适合做评估,如果你想成为评估领域最顶尖的人
134:12
creating representative problems that the models fail on or show certain abilities which I think
构建一些具有代表性的问题,让模型答不出来,或者暴露出某些能力——我觉得你可以通过这种方式取得突破。所以我认为,如果你想让研究有职业发展势头,终极目标就是做评估,让前沿实验室采用你的评估方法。也就是说,不一定每个项目都要这样,但如果你在没算力的小大学里,发现了一个Claude搞不定的东西,那虽然很难,但如果你想用最少的算力实现最大的影响力,就得走这种路线:把范围缩得很窄,同时要了解模型的发展方向。所以你需要造一个工具,专门测试Claude 4.5会在哪些地方翻车。
134:18
that you can break through with this so I've like I think that the top end goal for research
所以你能在这方面取得突破。我觉得,如果你想让研究有职业发展势头,终极目标就是让前沿实验室采纳你的评估方法。也就是说,不一定每个项目都要做到这一点,但如果你从一所没有算力的小型大学出发,找到了Claude都难以解决的问题,然后——这确实很难——但如果你想用最少的算力实现最大的影响力,大概就是这样:把范围缩得非常窄,同时需要了解模型未来的发展方向。所以你需要构建一个工具,测试的不是Claude 4.5会在哪里失败,而是八个月后的模型会在哪些地方遇到困难。但如果是开发全新的想法呢?
134:24
are working on evaluation if you want to have career momentum is the frontier labs pick up your
在做评估工作的话,如果你想保持职业势头,前沿实验室认可你的评估成果是关键。所以不是说每个项目都得这样,但如果你是从一个没有算力的小型大学起步,然后你发现了一些Claude搞不定的东西——这确实很难——但如果你想用最少的算力实现最大的影响力,大概就是这种思路:把范围收得非常窄,同时需要学习模型的发展方向。所以你得构建一个工具,去测试的不是Claude 4.5会失败的地方,而是八个月后的模型会卡在哪些地方。但另一方面,开发完全新颖的想法呢?在这些AI公司工作给人们带来的生活,那种开放的程度……
134:29
evaluation so it's like you don't need to have every project do this but if you go from a small
所以不是说每个项目都得这么做,但如果你从一个小的安全网起步
134:34
university with no compute and you figure out something that Claude struggles with and then the
没有算力的大学里,你发现了一些Claude搞不定的东西,然后——
134:38
next Claude model has it in the blog post like there's there's your career rocket ship I think
下一个Claude模型在博客文章里提到了,就像“这是你的职业火箭船”一样。我觉得这很难,但如果你想用最少的算力实现最大的影响力,大概就是那种思路——把范围收得非常窄,并且需要学习模型的发展方向。所以你需要构建一个工具,测试Claude 4.5会在哪里失败。如果你要做研究,如果我要启动一个研究项目,我需要思考八个月后模型会在哪些地方遇到困难。但开发完全新颖的想法呢?这是一个权衡。我觉得如果你在读PhD,你也可以说“在语言模型上工作风险太大了”,然后选择更长期的路径,比如“什么才是真正重要的事情”。
134:43
that that's hard but it's like if you want to scope the maximum possible impact with minimum compute
这确实很难,但如果你想用最少的算力实现最大的影响力,
134:48
it's something like that which is just get very narrow and it takes learning of where the models
大概就是那样,变得非常狭窄,而且需要了解模型的发展方向,所以你得造一个工具来测试 Claude 4.5 会在哪里失败。八个月后的模型也会遇到困难,但真正的问题在于如何提出全新的想法。在这些 AI 公司工作所赋予的生活,那种自由度,去做研究贡献的机会,所以选择无非就是学术界——读个 PhD,然后花五年发论文——或者去搞 open-weight 模型,在那里工作;再或者就是闭源前沿研究实验室,比如 OpenAI。但另一方面,你得到的认可会更少。所以从建立个人成果集的角度来看,作为学者你做了什么非常清楚,而你……
134:53
are going so you need to like build a tool that tests where not Claude 4.5 will fail
你就得造一个工具,去测试Claude 4.5会在哪些地方失败。
134:59
if you're going to do a research if I'm going to start a research project I need to think where the
如果你要做研究,或者我要启动一个研究项目,我得想想八个月后模型会在哪些方面遇到困难。但要是开发全新的想法呢?这其实是个权衡。我觉得如果你在读PhD,你可能会觉得搞语言模型风险太大,不如做更长远的事——比如思考真正本质的问题。不过也有人很务实,就像我读PhD的时候,进了Berkeley,最差也能拿个硕士,然后去科技公司工作。我对此非常实际。现在这些AI公司给员工的生活条件,真是让人大开眼界——普通员工的平均年薪加股票超过一百万美元,任何普通人都能拿到。
135:03
models in eight months are going to be struggling but what about developing totally novel ideas
八个月后的模型也会遇到瓶颈,但关键在于能不能提出全新的想法。
135:08
this is a trade-off I think that if you're doing a PhD you could also be like it's too risky
这是一个权衡,我觉得如果你在读博,你可能会觉得做语言模型风险太大,我更倾向于长期方向,比如什么是真正值得做的事。
135:14
to work in language models I'm going way longer term which is like what is what is the thing
我这个人挺实际的,我读博的时候就想,进了伯克利,最差也能拿个硕士,然后去科技行业工作,所以我对此很务实。
135:20
that's going to define language model development in 10 years which I think that I end up being a
这将定义未来十年语言模型的发展方向。我觉得自己是个相当务实的人——读博时我就想,最坏情况拿个硕士去科技公司上班,我对这事看得很实际。在AI公司工作能带给人的生活质量,那种眼界开阔的程度……普通员工年均股票收入超过一百万美元,在美国任何一个普通人能进入这样的AI实验室,人生都会发生翻天覆地的变化。我挺实际的,觉得如果你专注的话,语言模型领域仍然有很多上升空间,但得从研究视角来看,这种变革性的……
135:24
person that's pretty practical I mean I went to my PhD where it's like I got into Berkeley
这些AI公司给人们提供的生活条件,那种让人大开眼界的程度——普通员工平均年薪加股票超过一百万美元,只要做出研究贡献就行。
135:28
worst case I get a master's and I go work in tech it's like I'm very practical about it so I'm like
所以选择就是:学术界——拿个博士,然后花五年发论文、做开源权重模型,在那里工作;或者闭门前沿实验室、研究实验室,比如去OpenAI。
135:34
the life afforded to people to work at these AI companies the amount of like opening
在这些AI公司工作,人们能获得的那种自由度,以及
135:39
eyes average compensation is over a million dollars in stock a year for employee any normal person
普通员工平均每年能拿到超过一百万美元的股票补偿,这对普通人来说已经很高了。要做研究贡献的话,选项就是学术界——先读个博士,再花五年发论文。要么去搞开源权重模型的地方工作,要么去前沿实验室的研究部门,比如OpenAI。但问题是,你在那边能拿到的署名会少很多。从建立个人成果集的角度看,学术界很清楚你做了什么、完成了什么;而如果你选择去当一颗螺丝钉,虽然也可能挺有意思,但职业发展路径就完全不同了。我觉得这两种职业的安全感差别很大,而且他们意识到自己可以长期运作,这正是他们想做的。
135:45
in the U.S. to get into this AI lab is transformative for your life some pretty practical I'm like
在美国,能进入这种AI实验室,对你的人生来说是颠覆性的。有些很实际的问题,比如——
135:50
there's still a lot of upward humility working in language models if you're focused
语言模型领域仍然有很多向上的谦逊空间,只要你专注。
135:54
and that comes as like look at these jobs but from a research perspective the transformative
这就像,看看这些工作机会吧。但从研究角度来看,这种颠覆性——
135:59
impact and these academic awards that's like be the next Yom Likun is from not working I'm not
影响力以及那些学术奖项,比如成为下一个Yom Likun,这其实不是靠混日子就能做到的。我对语言模型开发本身没那么在意,但在这个领域,这确实是个巨大的经济牺牲。所以我带了一些很棒的学生,他们会问我:“我该去AI实验室工作吗?”我的回答是——你在顶尖学校读博,却要退学去实验室?我不确定。如果你去顶级实验室,我不怪你;但别去那种随时可能倒闭的随机创业公司。可如果你要去OpenAI,我觉得这值得你放弃博士学位。咱们更严谨地想想这个问题:你会建议人们在哪里做研究贡献?选项一是学术界——先拿个PhD,然后花五年发论文。
136:04
caring about language model development very much it's a big financial sacrifice in that case
对语言模型开发的关注,其实代价很大,经济上要做出很大牺牲。
136:09
so I get to work with some awesome students and they're like should I go work at an AI lab and I'm
所以我带了一些很棒的学生,他们问我:“我该去AI实验室工作吗?”
136:14
like like you're getting a PhD at a top school or you're going to leave to go to a lab I'm like I
我说,你正在顶尖学校读博,或者你要退学去实验室?
136:19
don't know like if you go work at a top lab I don't blame you don't go work at some random startup
我不知道。如果你去顶尖实验室,我不怪你。别去那种可能归零的随机创业公司。
136:23
that might go to zero but if you're going to open AI I'm like it could be worth leaving a PhD
但如果你要去OpenAI,我觉得值得放弃博士学位。
136:28
for let's more rigorously think through this where would you give a recommendation for people
那我们来更严谨地推演一下这个问题:你会建议人们去哪里做研究贡献?选项包括学术界——比如读个博士,然后花五年时间发表论文、做开源权重模型;或者去封闭的前沿实验室,比如OpenAI这类。实际上,这两个方向的区别在于:越封闭,通常收入越高,但你能获得的认可也越少。从建立个人成果集的角度看,作为学者,你做了什么、完成了什么,都非常清晰。而如果你选择去当一颗“机器里的齿轮”——虽然这也可以很有趣——那职业路径就完全不同了。所以我认为这是两种截然不同的职业生涯。
136:35
to do a research contribution so the options are academia so get get a PhD then five years publishing
做研究贡献的机会,所以选项无非是学术界——读个PhD,然后花五年发论文,
136:43
compute resources that can strain there's uh there's research labs that are more focused on
计算资源可能会很紧张,有些研究实验室更专注于开放权重模型,所以在那里工作,或者封闭前沿实验室,比如OpenAI,然后实际上,嗯,这两个梯度是:越封闭,你往往能拿到更多钱,但也会得到更少的认可。所以在建立你已完成工作的履历时,作为学者,你很清楚自己做了什么,你完成了这个那个;而如果你选择去当个机器里的齿轮——虽然也可能很有趣——那这就是一个相当合理的职业转换。所以我认为这是非常不同的职业路径,但做研究者的机会成本非常高,因为博士生们……
136:50
open-weight models and so working there or closed frontier labs research labs they go open AI
或者去开源模型公司工作,再或者去闭源前沿实验室,比如OpenAI,
137:02
and drop it actually I so on um the two gradients are the more closed the more money you tend to get
实际上,嗯,这两个梯度是——越封闭,你往往能拿到更多钱,但另一方面,你获得的认可也会更少。所以从建立个人成果组合的角度来看,作为学者,你做过什么非常清楚,比如你完成了这个、那个;而如果你选择去当个“大机器里的小齿轮”——虽然也可能很有趣——那这就是一个相当合理的职业递进。所以我认为这是完全不同的职业安全网。他们意识到自己可以长期运作,因为他们想做非常有意思的工作、得到非常有趣的职位。所以这其实是一个相当有优势的位置:先读完博士,之后再想办法,因为我想做这个,而且我觉得——
137:07
and but also the will that you get less credit so in terms of building a like a portfolio of
但问题是,你得到的认可会更少。所以从建立个人作品集的角度来看——
137:16
things that you've done like it's very clear of what you have done as an academic and you have
你做的那些事,作为学者来说成果非常清晰,而且你有安全网,他们意识到自己可以长期运作——这正是他们想做的。有很多人会说:“我受不了这种找 funding 的煎熬,政府莫名其妙就把我的 grant 砍了,或者我根本不知道接下来会发生什么。”所以我觉得这里面有很多不确定性。说实话,我觉得变化没那么大。我做过学术,现在不做了,但同时我也不想错过那段学术时光。不过在我讲到那部分之前,我想说,其实变化真的不大。我当时做的工作——就像 Nathan 刚才说的,教授跟实验室比起来,他们拥有的(资源或自由度)甚至可能更少。
137:20
done this and versus if you are gonna go be like trade this fairly reasonable progression for
做了这个,和另一种选择——如果你打算去当一个“机器里的齿轮”,虽然那也可能很有趣,但这是两种完全不同的职业安全网。他们意识到自己可以长期运作,这正是他们想做的。有很多人会说:“我受不了这种找 funding 的折腾,我的 grant 莫名其妙就被政府砍了,或者我根本不知道接下来会发生什么。”所以我觉得这里面有很多不确定性。
137:27
being a cog in the machine which could also be very fun so I think it's a very different career
说实话,我觉得变化没那么大。我过去在学术界,现在不在了,但同时我也不想错过在学术界的时光。但在我讲到那部分之前,我想说,变化真的没那么大。我当时做的工作,就像是在用……
137:31
paths but the like the opportunity cost for being a researcher is very high because PhD students are
路径上,但像研究人员的这种机会成本其实非常高,因为博士生有安全网,他们意识到自己可以长期运作——也就是说,他们想做非常有意思的工作,然后拿到一份非常有意思的工作。所以这其实是一个挺有优势的位置,可以说“我要先把博士读完,之后的事再说,因为我想做这个”。同时,学术生态也在被资金削减之类的事情冲击,所以这里面有太多不同的权衡取舍。我理解很多人会说,“我受不了这种到处找经费的日子,我的拨款莫名其妙被政府砍了,或者我根本不知道接下来会发生什么”,所以我觉得这里面充满了不确定性。
137:37
paid essentially nothing so I think it ends up rewarding people that have a fairly stable
基本上没付什么钱,所以我觉得这最终奖励的是那些有稳定安全网的人,他们意识到自己可以长期运作,想做非常有趣的工作、拿到非常有趣的职位。所以这其实是个挺有特权的位置——比如“我要读完博士,之后的事再说,因为我就想做这个”。同时我觉得,很多学术界的人,现在学术生态正被经费削减之类的事情冲击得焦头烂额,所以这里面有太多不同的权衡取舍。我理解很多人会说:“我受不了这种到处找经费的日子了,我的 grant 莫名其妙被政府砍了,或者我根本不知道接下来会发生什么。”所以我觉得这里面充满了不确定性。
137:42
safety net and they realize that they can operate in the long term which is they want to do very
他们意识到自己可以长期运作,而他们确实想长期做下去
137:47
interesting work and get a very interesting job so it is a fairly like it's a privileged position
有意思的工作,还能拿到一份非常有趣的职位,所以这其实算是个挺有优势的位置——就是那种“我先读完博士,之后再说”的状态,因为我想做这个,而且我觉得很多人其实是“我受不了这种找经费的折腾了,我的 grant 莫名其妙被政府砍了,或者我也不知道接下来会怎样”,所以我觉得这里面有很多不确定性。
137:52
to be like I'm gonna see out my PhD and figure it out after because I want to do this and I think a
老实说,我觉得变化其实不大。我过去在学术界,现在不在学术界了,但同时我也不想错过在学术界的时光。不过在我讲到那部分之前,我想说的是,变化真的不大。我当时做的工作,用的是 close step——这是其中一个区别,当然还有薪酬上的差异,但一直以来都是这样。
137:57
lot of academic like at the same time the academic ecosystem is getting bombarded by funding
学术界这边呢,其实同时也在被资金削减之类的事情搞得焦头烂额,所以这里面有太多不同的权衡取舍了。我理解很多人会说,我受不了这种到处找 funding 的日子了,grant 莫名其妙就被政府砍了,或者根本不知道接下来会发生什么。所以我觉得现在不确定性很大。
138:02
getting cut and stuff so there's just like so many different trade-offs where I understand
说实话,我觉得变化其实没那么大。我自己待过学术界,现在不在学术界了,但同时我也不想错过在学术界的时光。不过在我讲到那部分之前,我想说的是,变化真的没那么大。我当时用的就是 close step——当然 compensation 是一个区别,但这一点从来都是这样。
138:06
plenty of people that are like I can't deal with this funding search I grant got cut for no reason
很多人会说,我受不了这种找资金的折腾了,我的grant莫名其妙被政府砍了
138:13
by the government or I don't know what's gonna happen so I think there's a lot of uncertainty
或者我不知道接下来会发生什么,所以我觉得不确定性很大
138:18
and trade-offs that in my opinion favored just like take the take the well paying job with meaningful
以及一些权衡,在我看来,更倾向于接受那份高薪又有意义影响的工作。所以这不只是说你在OpenAI拿钱混日子,你是在构建前沿的东西,正在改变数百万人与科技的关系。但在发表成果方面,会越来越保密,所以你发表的越来越少、越来越少、越来越少。因此你确实在大规模地产生积极影响,但你只是机器中的一个齿轮。
138:24
impact so it's like not also like you're getting paid to sit around it open AI you're building
我觉得这其实挺重要的,说实话,情况并没有太大变化。我曾经在学术界,现在不在学术界了,但同时我也不想错过在学术界的时光。但在我谈到那部分之前,我想说的是,情况并没有太大变化。我当时的工作是在使用……
138:28
cutting edge of things that are changing millions of people's relationship to tech but publication
正在改变数百万人与技术关系的前沿领域,但从发表角度来看,越来越保密,越来越如此,所以你发表的越来越少越来越少越来越少,所以你在规模上产生了积极影响,但你只是机器中的一个齿轮。
138:35
wise there be more secretive increasingly so so you're publishing less and less and less and less
我觉得其实变化不大,真的。我曾经在学术界,现在不在学术界了,但同时我也不想错过在学术界的时光。但在我讲到那部分之前,我想说,其实变化不大。我当时在做类似的工作,用的是close step——这是一个区别,当然还有薪酬,但一直以来都是这样。
138:40
and so you're you are having a positive impact at scale but it's you're a cog of the machine
就像,是啊,你有多喜欢这个团队,以及做专有项目,还是更看重别的?
138:47
I think it's big honestly it hasn't changed that much so I have been academia I'm not in
我觉得这其实挺严重的,说实话变化并没有那么大,所以我以前在学术界
138:53
academia anymore at the same time I wouldn't want to miss my time in academia but what I wanted to
现在我不在学术界了,但同时我也不想错过在学术界的时光,但我当时想要的是——
138:58
say before I get to that part I think it hasn't changed that much I was working in like I was using
在说到那部分之前,我觉得其实变化没那么大。我之前做的工作,比如我用过……
139:04
AI or machine learning methods for applications and computational biology with collaborators and
AI或机器学习方法在应用和计算生物学领域与合作伙伴一起使用,
139:10
a lot of people went from academia directly to Google and I think it's the same thing back then
很多人直接从学术界去了Google,我觉得这和当年一样,
139:17
professors were like you know sad that their students went into industry because they couldn't carry
教授们当时因为学生去了工业界而难过,因为他们无法延续自己的学术传承,
139:23
on their legacy in that sense and I think it's the same thing I mean it's like it hasn't changed
我觉得现在也一样,其实没什么变化,
139:29
I think that much the only thing that has changed is the scale but you know cool stuff was always
唯一变的是规模,但酷的东西一直都是在工业界内部开发的,只是不能公开讨论,
139:34
developed in industry that was close you couldn't couldn't talk about it and I think the difference now
我觉得现在的区别在于,你更喜欢公开讨论你的工作并发表论文,还是更倾向于保密,
139:39
is well your preference do you like to talk about your work publish or you know you are more in a
这是一个区别,当然还有薪酬,但一直以来都是这样。
139:46
close step the that's one difference the compensation of course but it's always been like that I
接近了,但这是其中一个区别。薪酬当然不同,但一直以来都是这样。
139:52
think so it really depends on you know where you feel comfortable and it's also nothing is forever
我觉得这真的取决于你觉得自己适合哪里,而且没有什么是永远不变的。
139:58
the only thing right now is there's a third option which is starting a startup that's a lot of
目前唯一的新选择是创业,很多人都在创业,风险很大,但属于高风险高回报的类型。
140:04
people doing startups very risky move but can be high is a high risk high reward type of situation
加入工业界实验室我觉得挺稳妥的,职业发展空间也不错。说实话,一旦你在工业界实验室待过,以后找工作会更容易。
140:12
joining an industry lab I think is pretty safe you know also upward mobility honestly I think if
但话说回来,你有多喜欢团队合作和做闭源项目,又有多喜欢做发表论文的工作呢?
140:17
once you have been at a industry lab it will be easier to find future jobs but then again you know
发表论文压力很大,会议录用率有时候很随意,可能让人很沮丧,但如果你能发出来,回报也很高。
140:23
it's like yeah how much do you enjoy the team and working on proprietary things versus how do you
就是那种感觉,你有多享受团队合作和做专有项目,跟你怎么看待……
140:31
like the publishing work I mean publishing is stressful it is you know like acceptance rate
像学术发表工作,我是说发表论文压力很大,你知道的,比如录用率,会议评审有时很随意,可能让人非常沮丧,但回报也很高。说实话,我觉得我那些当教授的朋友,平均来看比我那些在前沿实验室工作的朋友更快乐,因为教授的工作更接地气。而前沿实验室确实在搞996,这基本上就是中文里“一直工作”的意思。你能解释一下996这种文化吗?我相信可以说这是在中国兴起的,后来被硅谷采纳了。什么是996?就是早上9点到晚上9点,一周六天。一周六天?那不就是72小时吗?所以这基本上成了硅谷AI公司的标准?这种拼命工作的心态越来越普遍了。嗯,也不完全是。
140:38
that conferences can be arbitrary can be very frustrating but also high reward if you have a
会议有时候会很随意,可能让人很沮丧,但如果你运气好,回报也很高。
140:43
paper published you feel good because your name is on there you have a higher accomplishment and you
论文发表了你会感觉很好,因为上面有你的名字,成就感更强。而且说实话,我那些当教授的朋友,平均来看似乎比在前沿实验室工作的朋友更快乐,因为那种生活更接地气。前沿实验室确实在搞这种996,本质上就是“永远在工作”。你能解释一下什么是996吗?这是一种文化,我觉得可以说是起源于中国,后来被硅谷采纳了。996就是早上9点到晚上9点,一周六天。一周六天?那不就是72小时?所以这基本上成了硅谷AI公司的标准?越来越多人有这种“拼命干”的心态。嗯,也不一定完全一模一样,但我认为确实有这种趋势,而且挺有意思的。
140:47
know feel like my friends who are professors seem on average happier than my friends who work at a
你知道吗,我觉得我那些当教授的朋友,平均来看比我在前沿实验室工作的朋友更快乐,说实话,因为那种工作更接地气,而前沿实验室确实在搞这种996。
140:52
frontier lab to be totally honest because that's just grounding and the frontier labs definitely do
这基本上就是“随时都在工作”的代名词。你能解释一下什么是996吗?这是一种文化,我相信可以说是在中国兴起的,然后被硅谷采纳了。什么是996?就是早上9点到晚上9点,一周六天。
140:59
this 996 which essentially is forehand for work all the time can you describe 996 is culture that's
一周六天?那是72小时对吧?所以这基本上成了硅谷AI公司的标准?越来越多人有这种拼命工作的心态。是啊,我的意思是,不完全是……
141:05
I believe you could say invented in China and adopted in Silicon Valley what's what's 996 it's 9am
我觉得可以说这是中国发明、硅谷采纳的模式——996,就是早上9点到晚上9点,一周六天。一周六天,那是72小时对吧?所以这基本上成了硅谷AI公司的常态,越来越多人有这种拼命工作的心态。没错,而且这还不只是一份全职工作,如果你想成功的话。我感觉现在,就像Nathan刚才说的,教授跟实验室比起来,他们的压力或者工作量可能还更小一些,比不上前沿实验室,因为那边的人工作强度真的很大。但跟学生一起工作,有持续的指导任务,而且使命更偏向于人,我觉得在一个变化极快、非常混乱的时代里,这反而是一种不同的状态。
141:12
to 9pm six days a week six days a week what is that 72 hours okay so what is this basically the
从早上9点到晚上9点,一周六天,一周六天——那就是72小时,对吧?所以这基本上就是……
141:19
standard in AI companies in Silicon Valley more and more this kind of grind mindset yeah I mean not
在硅谷的AI公司里,这种拼命工作的心态越来越普遍了。是啊,我的意思是,这不仅仅是全职工作,如果你想成功,就得这样。而且我觉得现在,就像Nathan刚才说的,教授跟实验室相比,压力和工作量可能还没那么大,甚至比前沿实验室还小,因为他们虽然工作很多,但……
141:27
maybe not exactly like that but I think there is a trend towards it and it's interesting I think it
可能不完全是这样,但我觉得确实有这种趋势,挺有意思的。我觉得写grant、教学、做研究,这三件事加在一起就像三份工作,而且如果你想做出成绩,这比一份全职工作还要累。我感觉现在就像Nathan刚才说的,教授跟实验室比起来,压力或者工作量可能还更小一些,因为前沿实验室的人工作强度也很大。但跟学生一起工作、持续提供指导、还有那种以人为本的使命感,我觉得在AGI这个变化很快、很混乱的领域里,反而让人很有成就感。对,而且我觉得在startup里,压力也很大,就像——
141:31
almost flipped because when I was in academia I felt like that because as a professor you had to
差点就翻车了,因为我在学术界的时候就有这种感觉——当教授你得写基金申请、得教学、还得做研究,这根本就是三份工作合在一起。要想成功,这工作量远超全职。现在我觉得,就像Nathan刚才说的,跟实验室比起来,教授的压力或者工作量可能反而更小一些,因为他们确实也很拼,但那种跟学生一起工作、持续带人、以及以人为核心的使命感,在技术发展极快、环境又很混乱的时代,反而让人很有成就感。对,而且我觉得在创业公司,压力也很大。
141:37
write grants you had to do you had to teach and you had to do your research it's like three jobs
写基金申请、教学、做研究,这三件事合在一起,简直就像三份工作。如果你想成功,这比全职工作还要累。我觉得现在,就像Nathan刚才说的,教授跟实验室比起来,压力或者工作量可能还更小一些,因为他们确实也很忙,但只是忙而已。不过,跟学生一起工作,持续地指导他们,并且有一个非常以人为本的使命——在技术飞速发展、一切都很混乱的时代,这其实让人很有成就感。是啊,我觉得在创业公司,压力是有的,但也是段好时光,只是我不知道自己能不能一直干下去。那种节奏很有意思,而且正是如此。
141:42
in one and it is more than a full-time job if you want to be successful and I feel like now like
但跟学生一起工作,有持续的指导任务,而且使命更偏向于人。我觉得在一个变化极快、非常混乱的领域里,情况就是这样。
141:49
Nathan just said the professors in comparison to a lab I think they have less like even maybe
Nathan刚才提到教授和实验室相比,我觉得他们可能资源更少,甚至……
141:55
pressure or workload than at a frontier lab because they work a lot they're just so
比起前沿实验室,他们的压力或工作量其实更大,因为这些人干得特别狠。但跟学生一起工作、有持续的指导任务、再加上一个非常以人为本的使命——我觉得在这样一个节奏飞快、局势混乱、时刻要跟竞争对手抢下一步的领域里,这简直太残酷了。我认为现在这种“你追我赶”的局面,加上多个玩家并存,其实是语言模型进步过程中一个被低估的推动力。竞争已经深深植根于人心,而这些公司也刻意打造了极强的文化,比如Anthropic就是如此。Anthropic的每个人看起来都非常一致,就像身处一种超级——
141:59
but like working with students and having a constant runway of mentorship and like a mission that
但和学生一起工作,有持续的指导通道,以及一个非常以人为本的使命——
142:04
is very people oriented I think in an arrow when things are moving very fast and a very chaotic
在一个变化极快、极其混乱的时期,大家不断试图迈出下一步,和竞争对手比拼,这真的太残酷了。
142:09
it's very rewarding to people yeah and I think at a startup I think it's a pressure it's like
这对人们来说非常有成就感。我觉得在初创公司,压力确实很大,但也是段好时光。不过我不确定自己能否永远做下去——这种节奏很有趣,但始终要不断追赶竞争对手,简直残酷无情。我认为目前这种“跳跃式发展”的格局加上多个玩家并存,实际上是被低估的语言模型进程驱动力。竞争已经深深植根于人们心中,这些公司也有意打造了极其强烈的文化,比如Anthropic就是如此。每个Anthropic的员工似乎都高度一致,身处一种拼命工作、创造更优成果的文化氛围中。但我觉得,这种状态是以牺牲为代价的。
142:15
you have to make it and it's like it is really important that people put in the time but
你必须投入时间去做,而且这一点非常重要,但说实话这真的很难,因为你得持续不断地交付成果。我在一家初创公司待过,时机还不错,但我不确定自己能永远这样干下去。这种节奏很有意思,就像我们一开始聊到的,这些模型正在互相超越,它们不断试图在竞争对手面前迈出下一步,这简直太残酷了。我觉得现在这种互相超越的特性,加上多个玩家参与,实际上是语言模型进步过程中一个被低估的驱动力。竞争已经深深植根于人们心中,而这些公司也刻意营造了非常强烈的文化,比如Anthropic就是如此。
142:19
well it is really hard because you have to deliver constantly and I've been at a startup I at a
这真的很难,因为你必须持续不断地交付成果。我在一家初创公司待过,时机不错,但我不确定自己能不能一直干下去。那种节奏很有意思,就像我们一开始聊到的,这些模型在互相超越,它们不断试图在竞争对手面前迈出下一步,竞争非常残酷。我觉得现在这种互相超越的特性,加上多个玩家参与,实际上是被低估的语言模型进步驱动力——竞争已经深深植根于人们心中。这些公司刻意打造了非常强的文化,比如Anthropic就是如此,那里的每个人都高度一致,就像身处一种超级凝聚的文化中。
142:25
good time but I don't know if I could do it forever it's like an interesting pace and it's exactly
好时光,但我不确定自己能不能一直干下去。这种节奏很有意思,但为了跟竞争对手抢下一步,简直太残酷了。我觉得现在这种多家玩家互相超越的局面,其实是被低估的语言模型进步驱动力——竞争已经深深植根于人心,而这些公司也刻意打造了极强的文化,比如Anthropic就是如此,每个Anthropic的人看起来都非常一致,就像身处一种拼命工作、创造更好产品的文化里。所以我认为,但这也带来了代价——比如试图当个全职管理训练的人,干这活简直疯了。苹果在中国出的那本书。
142:31
like we talked about in the beginning these models are leapfrogging each other and they are just
就像我们一开始聊到的,这些模型正在互相超越,它们不断试图在竞争对手面前迈出下一步,这简直太残酷了。我觉得现在这种多玩家互相赶超的局面,其实是语言模型进步过程中一个被低估的驱动力——竞争已经深深植根于每个人的意识里。这些公司刻意营造了非常强烈的文化,比如Anthropic就是如此,每个Anthropic的人看起来都高度一致,仿佛身处一种拼命工作、创造更优产品的文化中。但我觉得,这一切的代价是人力资本——你只能这样撑一段时间,人们确实在 burnout。
142:36
constantly like trying to take the next step compared to the competitors it's just ruthless I
我觉得现在这种“跳跃式”的竞争格局,加上多个玩家参与,实际上是被低估的语言模型进步驱动力——
142:41
think right now I think this leapfrogging nature and having multiple players is actually an
竞争已经深深植根于人们心中,而这些公司也刻意打造了非常强的文化,比如Anthropic就是如此。
142:45
underrated driver of language modeling process where competition is so deeply ingrained
语言建模过程中一个被低估的驱动因素,就是竞争已经深深植根于人们的意识中,而这些公司有意打造了非常强烈的文化,比如Anthropic就极其高效,这有点像Steve Jobs的“现实扭曲力场”,因为你只需要说服别人相信它即将到来。Bernhobert写过一本关于分类泡沫的书,但本质上其中一种是金融泡沫,也就是投机,这是不好的;另一种是——我不知道具体术语——但就是思想领域的泡沫,你在制造一个现实扭曲力场,这意味着你偏离了人类体验中一些根本性的方面。在硅谷,这是一个常见的问题,硅谷的问题在于它是一个非常特定的地理区域,你可能并不理解这一点。
142:52
to people and these companies have intentionally created very strong culture like Anthropic is
对于这些人以及这些公司来说,他们有意营造了非常强烈的文化氛围,比如Anthropic就极其高效,这有点像Steve Jobs的“现实扭曲力场”,因为你几乎能说服自己相信一切即将发生。Bernhobert写过一本关于泡沫分类的书,但本质上其中一种是金融泡沫,也就是投机行为,这是不好的;另一种呢,我不知道具体术语,但可以理解为思想领域的泡沫,你制造了一个现实扭曲力场,这意味着你偏离了人类体验中一些根本性的方面。在硅谷,这是一个普遍问题——硅谷是一个非常特定的地理区域,你可能无法理解那些跨越数百万分钟、数十亿次交互的千万个家庭,在那里你几乎是被允许失败的。
142:57
known to be so culturally like deeply committed and organized I mean like we hear so little from
众所周知,他们的文化非常投入且组织严密,我们几乎听不到他们的消息。而Anthropic看起来非常对齐,就像身处一个高度紧密的文化中,再加上这种竞争动态——这简直是逼着你拼命工作、做出更好的东西。所以我认为,这种模式确实有效,但代价是人力资本,你只能撑这么久,人们肯定在 burnout。我写过一篇关于 burnout 的文章,我自己也反复经历过,尤其是试图同时做管理者和 full mode training,这工作简直疯了。Patrick McGee 那本《Apple in China》里提到,苹果工程师为了搭建供应链有多拼命。
143:05
them and everybody's Anthropic seems very aligned and it's like being at a culture that is super
他们和所有人,Anthropic 看起来非常一致,就像身处一种超级高效的文化里,可能是那种 Steve Jobs 式的现实扭曲力场,因为你只需要说服别人相信它即将到来。Bernhobert 写了一本书给各种泡沫分类,但本质上其中一种是金融泡沫,也就是投机,这是不好的;另一种是——我不知道术语怎么说——但就是思想空间的泡沫,你在制造一个现实扭曲力场,这意味着你偏离了人类体验的一些基本方面。在硅谷,这是一个常见问题,硅谷的问题在于它是一个非常特定的地理区域,你可能不了解全球的情况,而且你们之间用一种特定的方式交流,互相说服对方相信某种东西。
143:12
tight and having this competitive dynamic is like talk about a thing that's going to make you
紧张且充满竞争的氛围,确实会逼着你拼命工作、做出更好的东西,我觉得这一点没错。但代价是人力资本的消耗——你只能这样撑一段时间,人们显然正在 burnout。我自己也写过关于 burnout 的文章,而且我本人也反复经历过这种状态,尤其是既要当管理者又要全职做训练的时候,这工作简直疯了。Patrick McGee 那本《苹果在中国》的书里提到,苹果工程师为了搭建供应链有多拼命,甚至有人因为这种工作强度去世了。所以我觉得,这完全就是一个靠透支人来推动进步的环境。这种情况会很多,而且已经很多了。
143:17
work hard and create things that are better so I think that this but that comes at the cost of
努力工作,创造出更好的东西,但代价是——
143:22
human capital which is like you can only do this for so long and people are definitely burning out
人力资本这东西,你只能撑这么久,大家确实都在 burnout。既要当管理者,又要全职做训练,这活儿简直疯了。Patrick McGee 那本《苹果在中国》里讲过,苹果工程师为了搭建供应链有多拼,有人甚至因为这种工作强度去世了。所以我觉得,这简直就是个靠消耗人来推动进步的环境。我自己也经历过——腰出问题、脖子出问题,因为我没按该有的节奏休息。但这不是别人逼我的,是我自己想干,因为硅谷那种狂热正在升温,尤其是跟 scaling laws 的理念绑在一起的时候。
143:27
I think I've I wrote a post on burnout as I think I've tried in and out of this myself especially
我觉得我写过一篇关于倦怠的文章,因为我自己也反复经历过这种状态,尤其是尝试全职做管理、训练模型的时候——这工作简直疯了。Patrick McGee写的《苹果在中国》那本书里提到,苹果工程师为了搭建供应链有多拼命,甚至有人因为这种工作强度去世了。所以我觉得这简直就是个以人类代价换取进步的完美环境。我自己也经历过很多——你知道,我背出过问题,脖子也出过问题,因为我没怎么休息,本来应该休息的。但这并不是有人逼我,而是我想工作,因为硅谷那种狂热正在升温,尤其是跟scaling laws的理念结合在一起。
143:33
trying to like be a manager full mode training it's a crazy job doing this the book apple in China by
试图完全进入管理者模式,训练这件事本身就是个疯狂的工作。苹果在中国的这本书,
143:39
Patrick McGee he talked about the how hard the apple engineers work to set up the supply chains in
Patrick McGee 聊到苹果工程师为了搭建供应链有多拼,有人甚至因为这种工作强度去世了,所以我觉得这简直就是个以人类代价换取进步的完美环境。而且说实话,我自己的腰和脖子都出过问题,因为我没怎么休息——其实也不是有人逼我,是我自己想干,因为那种狂热在硅谷越来越盛,跟 scaling laws 的理念正好合拍。全世界都在这样,看我们人类怎么形成这些模式真的很有意思。我觉得可以说硅谷就是个回音室,某种意义上的孤岛和泡沫——对,泡沫。
143:44
China and he was like they had saving marriage programs and he told them a podcast he was like
中国那边,他说他们有那种挽救婚姻的项目,他告诉他们在播客里说,有人因为这种工作强度累死了,所以我觉得这简直就是个以牺牲人为代价来推动进步的理想环境。而且,这种人的代价就是我们一开始提到的996,就是人们真的拼命干。还有这本书,我记得有句话,如果有人要回家陪家人、挽救婚姻,这听起来很疯狂,然后同事们居然说,好吧,这种情况确实得警惕,这周末得让那个人回家。但与此同时,我不觉得他们是被迫工作的,他们其实是太投入了。
143:50
people died from this level of working hard so I think this is just like it's a perfect environment
有人因为这种工作强度去世了。所以我觉得这简直就是一个完美的环境,
143:56
for creating progress based on human expense and I it's there's going to be a lot there's a lot
以人的消耗为代价来推动进步。而且,你知道,我有很多——
144:02
of the human expense is the 996 that we started this with which is like people do really grind
人类成本中很大一部分就是我们开头提到的996,大家真的在拼命工作。
144:08
also right this book I think that a quote word for if someone had to go home to spend time with a
还有这本书里有一句话,说如果某人必须回家陪家人、挽救婚姻,这居然会被认为很疯狂,然后同事们还会说“好吧,这种情况确实特殊,这周末得让他回家”。
144:13
family to save the marriage and it's crazy and then colleagues honestly okay this is like
但同时,我不认为他们是被迫工作的,他们其实是太投入了。
144:18
right alert for this situation we have to let that person go home this weekend and
作为学者,也作为一个独立的人,我自己有时也会过度工作,这很不健康。
144:23
but at the same time I don't think they were forced to work it's really they were so passionate
我出现过背部问题、颈部问题,因为我没有及时休息,也许我本该休息的。
144:27
about the product I guess that it is you get into that mindset and I had that sometimes as an
关于这个产品,我想说的是,你会进入那种状态——我有时也会有这种感觉,作为学者也好,作为独立个体也好,我有时候会过度工作,这很不健康。你知道,我出现过背部问题、颈部问题,因为我没有休息,也许我本该休息的。但这并不是因为有人强迫我,而是因为我想工作,因为这就是为什么我没有放弃,而他们也是真心想做这件事。但与此同时,还有一种情绪、一种狂热正在积聚,尤其是在硅谷,与scaling laws的理念紧密相连——那种炒作氛围让人觉得世界将在几周内被彻底改变,而你想站在这一切的中心。然后,你知道,我非常幸运能与这些人交流。
144:32
academic but also as an independent person I have that sometimes I overwork and it's unhealthy I had
但这并不是有人逼我,而是因为我自己想工作。
144:37
you know I had back issues I had neck issues because I did not take the breaks that I maybe
我腰出过问题,脖子也出过问题,因为我没有休息,也许我本该休息的。
144:41
should have taken but it's not because no one forced me to it's because I wanted to work because
但这并不是有人逼我,而是我自己想工作,因为——
144:45
that's why I didn't throw up and they're like they want to do this work yeah but there's also there's
所以我当时没吐出来,他们就说想做这个工作,没错,但还有一种正在酝酿的热情,尤其在硅谷,跟那个 scaling laws 的理念绑在一起。就是那种炒作,说世界会在几周尺度内被颠覆,你想站在中心。然后呢,我有幸跟世界各地的人聊过,看我们人类怎么形成这些想法,挺有意思的。我觉得可以这么说,硅谷某种程度上就是个回音室,一种孤岛和 bubble。其实 bubble 挺有用、挺高效的,不一定是坏事,因为它可以超级有生产力,就像 Steve Jobs 的 reality distortion field,因为你只要说服自己就行。
144:50
also a feeling a fervor that's building especially in Silicon Valley aligned with the scaling laws idea
还有一种狂热正在积聚,尤其是在硅谷,与 scaling laws 的理念相呼应,
144:56
where there's this hype where the world will be transformed in a scale of weeks and you want to
现在有种炒作,说世界会在几周内天翻地覆,而你想站在风暴中心。然后呢,我很幸运能和世界各地的人交流,观察人类如何形成这些想法真的很有意思。我觉得可以说,硅谷某种程度上就是个回音室,一个孤岛和泡泡。但泡泡其实很有用、很高效,不一定是坏事——它可能带来超高的生产力,就像Steve Jobs的“现实扭曲力场”,因为你只需要说服自己。Imminent Bernhobert写过一本书给泡泡分类,其中一种是金融泡沫,也就是投机,那是不好的;另一种嘛,我不太确定术语叫什么。
145:01
be at the center of it and then you know I have this great fortune of having conversations with
身处这一切的中心,然后你知道,我有幸能与世界各地的人交流,观察我们人类如何形成这些圈子,这非常有趣。我认为可以公平地说,硅谷是一种回音室,一种孤岛和泡沫。我觉得泡沫其实非常有用且高效,这不一定是个负面的事情,因为它可以极其高效,就像Steve Jobs的现实扭曲力场,因为你只是说服自己。Bernhobert写过一本书对泡沫进行分类,但基本上其中一种是金融泡沫,也就是投机,这是不好的;另一种是——我不知道术语怎么说——但就是思想空间里的那种泡沫,你在制造一个现实扭曲力场,这意味着你在偏离常规。
145:09
wide variety of human beings and from there I get to see all these bubbles and echo chambers
我接触到各种各样的人,从而得以看到世界各地这些信息茧房和回音室,观察人类如何形成它们真的很有意思。我觉得可以说,硅谷本身就是一个回音室,某种意义上的孤岛和茧房。但我认为茧房其实非常有用且高效,这不一定是坏事——因为它可能极具生产力,就像史蒂夫·乔布斯的现实扭曲力场:你们互相说服对方,说突破即将到来,而正是通过互相说服,你们真的让突破变成了现实。Bernhobert写过一本书对茧房进行分类,但本质上其中一种是金融泡沫,也就是投机行为,这是不好的;另一种嘛,我不太确定术语叫什么。
145:16
across the world and it's fascinating to see how we humans form them and I think it's fair to say
遍布全世界。看到我们人类如何形成这些观念,真的很有意思。
145:21
that Silicon Valley is a kind of echo chamber a kind of uh silo and bubble I think bubbles are
硅谷某种程度上就是一个回音室,一个孤岛和泡沫。我觉得泡沫其实可以非常高效,就像史蒂夫·乔布斯的现实扭曲力场,因为你只需要说服自己相信就行。Bernhobert写过一本书给泡沫分类,但本质上其中一种是金融泡沫,也就是投机行为,那是不好的;另一种呢,我不知道具体术语怎么说,但就是那种思想上的泡沫,你在里面制造一个现实扭曲力场,这意味着你会偏离甚至忽略人类体验中一些根本性的东西。在硅谷,这其实是个常见问题——硅谷是一个非常特定的地理区域,你可能并不了解全球其他地方的情况,而且你们之间用一种特定的方式交流,互相说服对方相信某种特定的东西。
145:28
actually really useful and effective it's not necessarily a negative thing because it could be
实际上非常有用且有效,这不一定是坏事,因为它可能带来超高效率,就像史蒂夫·乔布斯的现实扭曲力场,因为你只是说服了别人。Imminent Bernhobert写过一本书对泡沫进行分类,但本质上其中一种是金融泡沫,也就是投机行为,那是不好的;另一种是——我不太确定术语——思想空间的泡沫,你在制造一个现实扭曲力场,这意味着你偏离了人类体验的一些基本方面。在硅谷,这是一个常见问题,硅谷的问题在于它是一个非常特定的地理区域,你可能不了解全球的情况,你们用一种特定的方式互相交流,互相说服某种观点。
145:33
ultra productive it could be the the Steve Jobs reality distortion field because you just convince
超高效——它可能就像那个Steve Jobs的现实扭曲场(reality distortion field),因为你只是说服大家事情即将发生。Bernhobert写了一本关于泡沫分类的书,但本质上其中一种是金融思想空间里的泡沫,你在搞现实扭曲场,也就是说你偏离了实物商品和事件的价值,还给Slop施加更大压力,所以它会一直骗你,而且它会出现在那些提供验证或建立信任方式的平台上,这样你就会相信。
145:40
each other the breakthroughs are imminent and by convincing each other of that you make the breakthroughs
彼此都说突破即将到来,通过互相说服这一点,你们真的让突破变得触手可及。Bernhobert写过一本关于泡沫分类的书,但本质上其中一种是金融泡沫,就像投机行为,那是不好的;另一种是——我不知道术语怎么说——但我担心它会演变成金融泡沫,嗯,确实如此。不过,在思想领域里,这种泡沫其实是在制造一个现实扭曲场,意味着你在偏离现实。如果你离现实太远,同时又996地工作,你可能会错过人类体验中一些根本性的东西。包括在硅谷,这也是一个常见问题——硅谷是一个非常特定的地理区域,你可能并不了解全局。
145:47
imminent. Bernhobert wrote a book classifying bubbles but essentially one of them is financial
即将到来。Bernhobert写了一本关于分类bubble的书,但本质上其中一种是financial space of ideas,这种bubble让你制造reality distortion field,意味着你在偏离实体商品和事件的价值,而且给Slop带来更大压力,所以他们会一直愚弄你,这会在那些提供验证或建立信任方式的平台上发生,这样你就会信任。
145:52
bubbles which is like speculation which is bad and the other one is like I don't know the term but
泡沫,就是那种投机行为,是不好的;另一种情况是,我不知道怎么准确形容,但就是那种想法空间里的泡沫,你在制造一个现实扭曲场,意味着你偏离了人类体验中一些根本性的东西。在硅谷,这是个常见问题——硅谷是一个非常特定的地理区域,你可能不理解,在数百万分钟、数十亿次交互中,你几乎被允许失败。而那个SC超级代码,我认为其假设是,人类参与的数量趋近于零。当人类数量与网络、HTML之类的东西结合时,那个世界会是什么样子?它对那种垃圾内容非常有韧性,是的,确实如此。
145:56
effectively for buildouts because it pushes people to build these things and I do think AI is in this
对于构建来说其实挺有效的,因为它推动人们去搭建这些东西,而且我确实认为AI正处于这个阶段。但我担心它会演变成金融泡沫,这确实是个问题。不过在思想层面,这种泡沫其实是在制造一个现实扭曲场,意味着你在偏离现实。如果你一边996地工作,一边离现实越来越远,你可能会错过人类体验中一些根本性的东西。包括在硅谷,这也是个常见问题——硅谷是一个非常特定的地理区域,你可能不理解美国中西部人的视角,也不理解美国乃至全世界其他不同人类的完整体验。你们用一种特定的方式互相交流,互相说服对方相信某种观点。
146:01
but I worry about it transitioning to a financial bubble which is like it's yeah but also in the
但我担心它会演变成金融泡沫,就是那种,嗯,在思想领域里,这个泡沫会制造一个现实扭曲场,意味着你在偏离现实。如果你离现实太远,同时又996地工作,你可能会错过人类体验中一些根本性的东西。包括在硅谷,这也是个常见问题——硅谷是一个非常特定的地理区域,你可能并不理解全球的情况。你们用一种特定的方式互相交流,互相说服某种技术是可行的,或者它正走在某个轨道上,但这样很容易让自己陷入麻烦。所以你必须考虑到所有这些。而你现在是个年轻人,正试图决定你的人生要做什么。
146:06
space of ideas that bubble you are doing a reality distortion field and that means you are deviating
space of ideas that bubble you are doing a reality distortion field and that means you are deviating
146:14
from reality and if you go too far from reality while also working you know 996 and you might
脱离现实,如果你在996的同时又离现实太远,你可能会错过人类体验的一些基本方面,包括在硅谷,这也是一个常见问题。硅谷的问题在于它是一个非常特定的地理区域,你可能无法理解全球的情况,而且你们之间用一种特定的方式交流,互相说服某种技术是可行的,或者它并不在某个发展轨迹上,这样你就会陷入麻烦。所以你必须考虑所有这些因素。在这里,你是一个年轻人,试图决定你的人生要做什么。其中一个是“永久底层阶级”的概念,指的是2025年的最后六个月是唯一能在AI初创公司或模型中建立持久价值的时机,否则所有价值都会……
146:22
miss some fundamental aspects of the human experience including in Silicon Valley this is a common
缺失了人类体验的一些基本方面,包括在Silicon Valley,这是个常见问题——Silicon Valley就像是一个非常特定的地理区域
146:27
problem in Silicon Valley is like it's a very specific geographic area you might not understand the
你可能不太理解那些跨越数百万分钟、数十亿次交互的家
146:33
Midwest perspective of the full experience of all the other different humans in the United States
从中西部视角来看,你体验着美国乃至全世界其他不同人类的全貌,彼此用某种方式交流,说服对方相信某项技术——但如果你走错了方向,就可能陷入麻烦。所以你必须考虑所有这些因素。现在你是个年轻人,试图决定自己的人生方向。问题是,我甚至不太理解这个,但旧金山AI圈的那些梗已经发展到这种程度了——其中一个是“永久底层阶级”,意思是2025年最后六个月是唯一能在AI初创公司或模型上建立持久价值的时间窗口,否则所有价值都会被现有公司瓜分,你因此会变得贫穷。这,就是个例子。
146:39
and across the world and you speak a certain way to each other you convince each other of a certain
在世界各地,你们用一种特定的方式交流,互相说服对方接受某种观点。
146:44
thing and that that gets you into real trouble whether AI is a big success it becomes a powerful
不管怎样,这都会让你陷入真正的麻烦——无论AI是大获成功,成为一项强大的技术,还是它没能做到,这两种轨迹都可能让你陷入困境,所以你必须全面考虑这些。现在你是个年轻人,正试图决定这辈子想做什么,问题是,我甚至不太理解这个,但旧金山AI圈的那些梗已经发展到这种程度了——其中一个是“永久底层阶级”的概念,意思是2025年的最后六个月是唯一能在AI初创公司或模型上建立持久价值的时间窗口,否则所有价值都会被现有公司瓜分,你因此就会变穷。这就像旧金山那种走极端的例子,但我仍然认为,对年轻人来说,能够抓住这个机会才是关键。
146:50
technology or it's not in either trajectory you can get yourself into trouble so you have to consider
技术或者它不在任何一个轨迹上,你可能会陷入麻烦,所以你必须考虑所有这些。作为一个年轻人,你想决定这辈子要做什么,其中一种可能性是“永久底层阶级”——这个想法认为2025年的最后六个月是唯一能在AI初创公司或模型中建立持久价值的窗口,否则所有价值都会流失。还有一本关于旧金山历史的书《Season of the Witch》,涵盖了1960到1985年,包括嬉皮士革命、同性恋群体逐渐接管城市以及那种文化的兴起。我推荐这本书给我那些搬离旧金山的朋友,他们又推荐给了我。背景很近,感觉就像刚发生一样。好吧,我们聊了很多事情。
146:57
all of that here you are a young person trying to say what you want to do with your life the
所有这些,当你是个年轻人,试图决定这辈子想做什么的时候——
147:02
thing that is I don't even really understand this but the SF AI memes have gotten to the point
说实话这个我都不太懂,但旧金山AI圈的那些meme已经发展到这种程度了——比如“永久底层阶级”这个说法,意思是2025年最后六个月是唯一能在一家AI初创公司或模型上建立持久价值的时间窗口,否则所有价值都会被现有公司抢走,然后你就会变穷。这算是一个例子,说明最有可能让你去做这件事的地方,但也是有代价的。我觉得旧金山是个很棒的地方,但确实有点泡沫,如果你进入那个泡沫——虽然它非常有价值——也记得要跳出来。多读历史书,多读文学作品,多去世界各地看看。Twitter不是全世界,Substack也不是全世界。我想说,这是我其中一个建议。
147:08
where permanent underclass was one of them which was the idea that the last six months of 2025
其中一个是“永久底层阶级”的概念,意思是2025年的最后六个月
147:14
was the only time to build the durable value in AI startup or model otherwise all the value will
是唯一能在AI初创公司或模型中建立持久价值的窗口,否则所有价值都会流失——
147:20
be captured by existing companies and you will therefore be poor which like that's an example of
会被现有公司捕获,因此你会变穷——这算是一个例子。
147:25
the SF thing that goes so far I still think for young people that going to be able to tap into it
SF那个地方,虽然我觉得对年轻人来说,能融入其中仍然是最有可能实现突破的地方,但也是有代价的。我认为SF是个很棒的地方,但那里有点像个泡泡,如果你进入那个泡泡——这本身非常有价值——也一定要走出来。多读历史书,读文学作品,去世界各地看看。Twitter不是全世界,Substack也不是全世界。我想说,我认识的一个同事正在搬去SF,我得给他弄一本《Season of the Witch》,这本书讲的是SF从1960到1985年的历史,涵盖了嬉皮革命、同性恋群体逐渐主导这座城市,以及那种文化的兴起。
147:32
if you are really passionate about wanting to have an impact in AI like being physically an SF
如果你真的对在AI领域产生影响充满热情,那么物理上待在旧金山(SF)是最有可能实现这一目标的地方,但这也有代价。我认为旧金山是个很棒的地方,但这里有点像个泡泡,如果你进入这个泡泡——这本身非常有价值——也一定要走出来。多读历史书,读文学作品,去世界各地看看。Twitter和Substack并不是整个世界。我想说,我认识的一个人正要搬到旧金山,我得给他弄一本《The Season of the Witch》,这本书讲的是旧金山从1960年到1985年的历史,涵盖了嬉皮士革命、同性恋群体逐渐主导这座城市以及那种文化的兴起。
147:36
is the most likely place for you going to do this but it has trade offs. I think SF is an incredible
最有可能让你做成这件事的地方是旧金山,但它也有代价。我觉得旧金山是个很棒的地方,但那里有点泡沫化。如果你进入那个泡沫——虽然它非常有价值——也一定要走出来。
147:43
place but there is a bit of a bubble and if you go into that bubble which is extremely valuable
还要读历史书,读文学作品,去世界各地看看。
147:50
just get out also read history books read literature visit out the places in the world
推特不是全世界,Substack也不是全世界。我想说,我推荐一本叫《Season of the Witch》的书,它讲的是旧金山从1960到1985年的历史,涵盖了嬉皮士革命、同性恋群体逐渐占领这座城市以及那种文化的兴起。
147:57
twitter is not and substack is not the entire world I think I would say one of my
这本书我推荐给不少在旧金山的朋友,他们确实会走出去,也是他们推荐给我的。
148:02
one people I worked with is moving to SF and it's like I need to get them a copy of the season
我有个同事要搬去旧金山了,我就觉得得送他一本《Season of the Witch》,这本书讲的是旧金山从1960年到1985年的历史,涵盖了嬉皮士运动、同性恋群体逐渐主导城市、以及那种文化兴起的过程。这本书我推荐给不少在旧金山的朋友,他们读了之后又反过来推荐给我。我觉得就像住在那里一样——我自己住过旧金山,但当时并没有真正理解这些背景,而这段历史其实离现在并不远。好了,我们聊了很多话题,当然也包括去年那些让人兴奋的事情。但今年你们提到的一个亮点是text-to-video模型的规模化,这完全是一种全新的探索方向。
148:06
of the witch which is a history of SF from like 1960 to 1985 which goes through like the hippie
还有《女巫的季节》,这是一本关于旧金山从1960年到1985年的历史书,涵盖了嬉皮士革命、同性恋群体逐渐接管这座城市以及那种文化的兴起。
148:13
revolution like they all the gays kind of taking over the city and that culture emerging
《女巫的季节》这本书,我推荐给不少在旧金山的朋友,他们读了之后又推荐给了我。
148:20
and then the HIV AIDS crisis and other things and it's just like that is so recent and so much turmoil
然后就是艾滋危机那些事,感觉这一切都离我们这么近,却经历了那么多动荡和伤痛,但同时也充满了爱和科幻。好像没人知道这段历史,真的是一本很棒的书——《季节的女巫》,我推荐给我那些偶尔出门的科幻朋友,他们又推荐给了我。我觉得就像住在那里一样——我自己也住过,但当时没意识到这些背景,而且这一切真的离现在这么近。是啊,好了,我们聊了很多事情,当然包括去年让人兴奋的那些事。但今年你们提到的一个亮点是文本到融合模型的规模化,这是一种完全不同的文本到融合探索。能讲讲这是什么,以及它可能带来哪些不同的可能性吗?
148:25
and hurt but also like love and SF and it's like no one knows about this it's a great
但同时也夹杂着爱和科幻,而且好像没人知道这本书——《女巫的季节》。我推荐给了一些喜欢科幻的朋友,他们读完后也推荐给了我。我觉得就像住在那里一样——我确实在那里住过,但当时并没有真正体会到这种背景。而且这一切都发生得那么近。是啊,好吧,我们聊了很多事情,当然包括去年让人兴奋的那些事。但今年你们提到的一个兴奋点是文本到融合模型的规模化,这是一种对文本到融合的全新探索。你能讲讲那是什么,以及它可能带来哪些不同的可能性吗?还有自回归Transformer架构,特别是像GPT这样的,但这并不意味着没人能做到。
148:30
book season of the witch I recommend a bunch of my SF friends who do get out recommended it to me
背景就是这样,而且时间上真的很近。好,我们聊了很多话题,
148:36
and I think that's just like living there like I lived there and I didn't appreciate this
而且我觉得,就像住在那里一样——我住过那儿,当时却没意识到这一点。这个背景其实很近,对吧?好,我们聊了很多事情,当然包括去年让人兴奋的那些。但今年,你们提到的一个兴奋点是文本到融合模型的扩展,这完全是另一种探索方向。因为我觉得,不去做几乎就是傻,对吧?目前transformer架构确实是主流,效果最好,而且眼下也没有别的替代方案。但你知道,永远不要把鸡蛋都放在一个篮子里,所以人们也在开发其他东西,作为自回归transformer的替代方案,其中之一就是……
148:41
context and it's just like so recent yeah okay let's we talked a lot about a lot of things
其中让我兴奋的是文本到融合模型的规模化,这完全是一种不同的探索方向。
148:52
certainly about the things that we're exciting last year but this year one of these you guys
当然,去年我们聊的那些东西确实让人兴奋,但今年你们提到的一个亮点是文本到融合模型的规模化,这完全是另一种探索方向。因为我觉得,不这么做几乎等于犯傻——没错,现在transformer架构确实最管用,效果最好,市面上也没别的能比,但你知道,把所有鸡蛋放在一个篮子里总归不是好主意。所以人们也在开发其他东西,作为自回归transformer的替代方案。其中一个就是GAN,生成对抗网络;另外还有扩散过程,可以并行填充内容。而像GPT这样的模型,是自回归的,一次只生成一个token,你得等它逐个完成。
148:58
mentioned is exciting is the scaling of text-to-fusion models and it's just a different exploration
提到的令人兴奋的一点是文本到融合模型的扩展,这完全是一种不同的探索方向。
149:03
of text-to-fusion can you talk about what that is and what the possibility holds sort of different
关于文本到融合模型,你能聊聊它是什么以及它可能带来哪些不同的可能性吗?
149:09
kinds of approaches than the current albums yeah so we talked a lot about the transformer architecture
跟现在主流的方法不太一样。我们聊了很多关于transformer架构,特别是像GPT这种自回归transformer架构,但这不代表没人做别的东西。大家其实一直在留意下一个大突破,因为我觉得不去找的话几乎等于犯傻。毕竟现在transformer架构确实是最主流、效果最好的,目前也没有别的能比得上。但你知道,把所有鸡蛋放在一个篮子里总归不是好主意,所以很多人也在开发其他东西,作为自回归transformer的替代方案。其中一个例子就是text-to-fusion模型,听众可能对diffusion模型更熟悉,因为它在图像生成领域很常见。
149:15
and the auto-regressive transformer architecture specifically like GPT and it doesn't mean no one
具体来说,就是像GPT那样的自回归transformer架构,但这并不意味着只有这一种选择,因为我觉得如果不探索其他方向,那几乎等于犯傻。毕竟现在transformer架构确实是最主流、效果最好的,而且目前也没有其他东西能替代它。但你知道,把所有鸡蛋放在一个篮子里总不是个好主意,所以人们也在开发其他东西,作为自回归transformer的替代方案。其中一个例子就是文本到融合模型。听众可能知道扩散模型来自图像生成领域——以前用的是GANs,也就是生成对抗网络,后来出现了这种扩散过程。
149:21
else is working on anything else so people are always on the let's say look out for the next big
大家都在忙别的事,所以人们总是——怎么说呢——在留意下一个大事件,因为我觉得如果不这样,那几乎就是傻。毕竟现在,transformer架构确实是主流,效果也最好,目前还没有其他东西能替代它。但你知道,不把所有鸡蛋放在一个篮子里总是个好主意。所以人们也在开发其他东西,作为自回归transformer的替代方案。其中一个例子就是text-to-fusion模型。听众可能知道扩散模型来自图像生成领域,之前用的是GANs,也就是生成对抗网络。后来出现了这个扩散过程,你通过迭代去噪来生成图像,最终随着时间的推移,得到了质量非常高的图像。
149:26
thing because I think it would be almost like yeah stupid not to because sure right now the
因为我觉得,不这么做几乎等于犯傻——毕竟现在Transformer架构确实是主流,效果也最好,目前还没有其他东西能替代它。但你知道,把所有鸡蛋放在一个篮子里总归不是明智之举。所以人们也在开发其他东西,作为自回归Transformer的替代方案。其中一个方向是GANs,也就是生成对抗网络;另外还有扩散过程,可以并行地填充内容。而GPT模型是自回归的,一次只生成一个token,但扩散模型可以同时处理多个token——要么补全缺失的部分,要么通过多次迭代逐步优化。这里最酷的地方在于,它能同时处理多个token,所以某种程度上就像……
149:32
transformer architecture is the thing and it works best and there's right now nothing else out there
Transformer架构就是那个核心,它效果最好,目前还没有其他东西能替代它。
149:37
but you know it's always a good idea to not put all your eggs into one basket so people are
但你知道,把所有鸡蛋放在一个篮子里总不是个好主意,所以人们也在开发其他东西,作为自回归Transformer的替代方案。
149:41
developing other things alternatives to the auto-regressive transformer one of them would be for
其中之一就是使用GANs,也就是生成对抗网络,然后还有这种扩散过程,它采用并行填充的方式。
149:47
example text-to-fusion models and listeners may know diffusion models from the image generation
比如文本到融合模型,听众可能从图像生成中了解过扩散模型。之前用的是GANs,也就是生成对抗网络,后来出现了这种扩散过程。而并行填充的方式则不同,GPD模型是自回归的,一次生成一个token,你逐个token完成句子。而在bird模型中,你有一段文本,比如一个句子,需要填充缺失的部分,或者通过多次迭代逐步优化。这里很酷的一点是,它可以同时处理多个token,所以某种程度上,质量可能更高,速度也可能更快。然后现在又有了去噪这个维度,你做的步骤越多,生成的文本就越好。而且,你知道,人们可以用不同的方式去扩展规模。
149:52
like stable diffusion popularized it there was like a paper on generating images back then people
像stable diffusion把它带火了,以前有篇论文讲的是用GANs(生成对抗网络)来生成图像,后来出现了这个扩散过程,就是一步步对图像去噪,结果随着时间的推移,图像质量变得特别好。Stable Diffusion本身是一家公司,其他公司也构建了自己的扩散模型,然后现在大家就在想,能不能也把这个方法用在文本上?虽然直觉上还不太说得通,因为文本不像图像那样是连续的、可以求导的东西,它是离散的,那怎么实现那个去噪过程呢?但这其实有点像Google的bird模型,追溯到最初的transformer,所以当时就有……
149:58
used GANs a generative adversarial networks and then there was this diffusion process where
而GPD模型则是自回归的,一次只生成一个token,你逐步补全缺失的部分,或者通过多次迭代反复优化。
150:02
you iteratively denoise an image and that resulted in really good quality images over time stable
你通过迭代去噪一张图像,最终随着时间的推移得到了质量非常好的图像,稳定了。
150:08
diffusion was a company other companies build their own diffusion models and then people are now like
diffusion 是一家公司,其他公司会基于它构建自己的 diffusion 模型,然后现在大家就在想,好吧,我们能不能也把这个方法用在文本上呢?目前直觉上还不太说得通,因为感觉文本不像图片那样是连续的、可以求导的东西,它是离散的。那要怎么实现那个去噪过程呢?但这其实有点像 Google 的 bird 模型,如果你回头看最初的 transformer 的话。所以当时有 encoder,它更像是一种并行的技术,你可以同时填充多个 token。而 GPD 模型是自回归的,一次只生成一个 token,你一个 token 一个 token 地补全句子。但在 bird 模型里,你有一段文本,比如一个句子,它是有……
150:13
okay can we try this also for text doesn't you know make intuitive sense yet because it feels like
好,那我们能不能也试试这个方法用在文本上呢?虽然直觉上还不太说得通,因为感觉——
150:18
okay it's not something continuous like a picture that we can differentiate it's like a discrete
对,文本不像图像那样是连续的、可以求导的东西,它是离散的。
150:22
text so how do we implement that denoising process but it's kind of like similar to the
那怎么实现这个去噪过程呢?但这其实有点像Google的BIRD模型,当你回到最初的Transformer时,它更像是一种并行的技术,你可以同时填充多个token。
150:29
bird models by Google like when you go back to the original transformer and so there were like
而GPT模型是自回归的,一次只生成一个token,你一个词一个词地补全句子。
150:34
the encoder and the decoder the decoder is what we are using right now in GPD and so forth the
encoder 和 decoder,我们现在用的 GPT 这些模型,其实用的是 decoder。encoder 更像是一种并行技术,你可以同时填充多个 token。GPT 模型是自回归的,一次只生成一个 token,你一句一句地补全。而像 BERT 这类模型,你有一段文本,比如一个句子,里面有一些空缺,你把它们遮住,然后一次迭代就把这些空缺填上。text diffusion 有点像这样,你从一段随机文本开始,然后逐步填充缺失的部分,或者通过多次迭代不断优化。这里很酷的一点是,它可以同时处理多个 token,所以有点像……
150:39
encoder it's more like a parallel let's say technique where you have multiple tokens that you
在BIRD模型里,你有一段文本,比如一个句子,它是有——
150:45
fill in in parallel instead so GPD models they do auto-regressive one token at a time you complete
这里很酷的一点是,这种方法可以同时处理多个token,所以它有点像——
150:51
the sentence one token at a time and in bird models you have a text that say sentence that has
逐 token 地处理句子,在 bird 模型里,你有一段文本,它说的是一个句子,需要填补缺失的部分,或者你在多次迭代中逐步优化它。这里很酷的一点是,它可以同时处理多个 token,所以有点像——质量上可能更快,然后现在你有了这个去噪过程的维度,你做的步骤越多,文本就变得越好。而且,你知道,人们可以用不同的方式扩展,用更少的算力达到同样的质量。现在我觉得,你知道,有些论文表明,好吧,把你在 auto-regressive 模型上花的同样算力用在这里——另一个缺点是,嗯,这个东西会发展起来,会有一些应用,但我实际上觉得这不一样。
150:56
gaps you like mask them out and then one iteration is filling in these gaps and text diffusion
像那种遮掉空缺,然后一次迭代就是填补这些空缺,文本扩散就有点像这样——你从一段随机文本开始,然后逐步填补缺失的部分,或者通过多次迭代不断优化。这里很酷的一点是,它可以同时处理多个token,所以从质量上看可能会更快。然后你还有这个去噪过程的维度,迭代次数越多,生成的文本质量就越好。而且,大家也知道,你可以用不同的方式去扩展,他们想看看这是否能成为auto-regressive模型的一个可行替代方案,用更少的计算量达到同样的质量。目前我觉得,确实有一些论文表明,嗯,这个方向是可行的。
151:03
is kind of like that where you are starting with let's say some random text and then you are
有点像这样:你从一段随机文本开始,然后逐步填充缺失的部分,或者通过多次迭代不断优化它。这里很酷的一点是,它可以同时处理多个token,所以从质量上看可能会更快。然后你现在有了这个去噪过程的维度——你做的步骤越多,生成的文本就越好。而且,你知道,人们可以用不同的方式去扩展,他们想看看这是否能成为auto-regressive模型的一个有效替代方案,在更少算力的情况下达到同样的质量。目前我觉得,有些论文表明,如果你把同样的算力花在auto-regressive模型上,另一个缺点就是……
151:08
filling in the missing parts or you are refining them iteratively in your multiple iterations and
填补缺失的部分,或者在多次迭代中逐步完善它们。
151:13
the cool thing here is that this can do multiple tokens at the same time so it's kind of like
这里很酷的一点是,它可以同时处理多个token,所以这有点像——
151:19
the promise of having it more efficient now the tradeoff is of course well how good is the
现在效率更高了,但代价当然是质量如何。它可能更快,而且现在你有了这个去噪过程的维度——步骤越多,文本质量越好。人们,你知道,我是说你可以用不同的方式扩展,他们想看看这是否可能成为自回归模型的一个有效替代方案,用更少的算力达到同样的质量。目前我认为,你知道,有些论文表明,如果你想达到同样的质量,就得增加去噪步骤,结果最终消耗的算力和自回归模型差不多。另一个缺点是,它虽然是并行的,听起来很吸引人,但有些任务并不是并行的,比如推理。
151:24
quality it might be faster and then now you have this dimension of the denoising process the more
质量上可能会更快,然后现在你有了这个去噪过程的维度——步骤越多,文本质量就越好。而且你知道,人们可以通过不同方式扩展规模:用更少的计算量达到同样的质量。现在我觉得,有些论文表明,如果把同样的计算量花在自回归模型上,另一个缺点就是……它确实会发展并有一些应用,但我其实觉得,不同的网络搜索——比如我问1988年世界杯谁赢了——它仍然需要找到正确的网站并获取准确信息,所以你还是可能访问到错误的网站,给我错误的信息。因此我不认为它能完全解决这个问题,但它确实在这方面有所改进。
151:29
steps you do the better the text becomes and people you know I mean you can scale in different ways
步骤做得越多,文本效果就越好,而且你知道,其实可以从不同维度去扩展规模
151:36
they try to see if that is maybe a valid alternative to the auto-regressive model in terms of giving you
他们想看看这是否能成为自回归模型的一个可行替代方案,在计算量更少的情况下提供相同的质量。目前我觉得,他们的论文表明,如果把同样的算力花在自回归模型上,另一个缺点就是——这东西虽然会发展并有一些应用,但我其实觉得它不太一样。第二个问题是,互联网并不总是正确的。你可以做一次网络搜索,但假设我问1988年世界杯谁赢了,它仍然需要找到正确的网站并获取准确的信息。所以你还是可能访问到错误的网站,给我错误的信息。我不认为这能完全解决这个问题,但它确实在改善这一点。
151:44
the same quality for less compute right now I think it's you know their papers that suggest okay
用更少的算力达到同样的质量,现在我觉得,你看他们的论文也在暗示,好吧
151:49
if you want to get the same quality you have to crank up the denoising steps and then you end up
如果你想获得同样的质量,就得把去噪步数调高,结果最后消耗的计算量跟自回归模型差不多。另一个缺点是,虽然并行听起来很吸引人,但有些任务并不适合并行,比如推理这类任务。它不会完全取代自回归算法,但可能会用于一些快速、廉价、大规模的简单任务。也许未来的免费版就会采用这种模式。我听说已经有几个实际应用的例子了。举个例子来说明为什么这个方案更好:比如当GPT-5需要30分钟才能回复时,它是一次生成一个token,而扩散模型的思想是,一次性生成所有那些补全的token。
151:55
spending the same compute you would spend on an auto-regressive model the other downside is well
把同样的算力花在自回归模型上,另一个缺点就是
152:00
it's parallel which sounds appealing but some tasks are not parallel like you know like reasoning
它虽然是并行的,听起来很吸引人,但有些任务并不是并行的,比如推理这种。
152:05
task tool use maybe where you have to ask and quote interpretive to give you an intermediate result
任务型工具使用,可能需要你提问并引用解释来获取中间结果
152:10
and that is kind of tricky with the fusion mode so there are some hybrids but the main idea is
这在融合模式下有点棘手,所以有一些混合方案,但核心思路是
152:15
can we parallelize it and so interesting avenue I think right now there are mostly research
我们能不能把它并行化?所以我觉得这是一个很有意思的方向
152:21
let's say models out there like Lada and some other ones I saw some I start up some
目前主要还是研究性质的模型,比如Lada,还有一些我看到的初创公司做的
152:26
the proit models there is no big diffusion model at scale yet like you know like Gemini
那些原型模型,还没有像Gemini、ChatGPT那样规模的大型扩散模型
152:32
Chatchee PD scale in that level but there was an announcement by Google like aside where they said
不过Google那边有个公告,他们说要推出Gemini diffusion
152:37
they are launching Gemini diffusion and they put it into context of their I think nano2 model
并且把它放在他们那个nano2模型的背景下
152:44
and then they said basically for the same quality on most benchmarks we can generate
然后他们表示,在大多数基准测试上,达到相同质量的情况下,我们可以生成
152:49
things much faster so you mentioned what's next I don't think the text diffusion model is going to
事情快得多,所以你提到下一步是什么,我不觉得文本扩散模型会取代自回归算法,但它可能会用于那些快速、廉价、大规模的任务。也许未来的免费层就会是这种东西。我觉得有几个例子,我听说它实际上已经开始被使用了。举个例子来说明为什么这好得多:比如当GPT-5需要30分钟才能响应时,它是一次生成一个token,而这个扩散模型的想法本质上是把所有的补全、所有的token一次性生成出来,这就是为什么它能快很多。我觉得它很适合那些我听说过的初创公司,比如代码相关的初创公司,你有一个代码库,然后有人在那里……
152:54
replace auto-regressive algorithms but it will be something maybe for quick cheap at scale tasks
会替代自回归算法,但可能只适用于那些快速、廉价、大规模的任务。
153:01
maybe the free tier in future will be something like that I think there's a couple examples where
也许未来的免费版就会是这种模式,我觉得已经有一些例子了。
153:05
it's I've heard that it's actually been started to be used I think to paint an example of why this
我听说它其实已经开始被使用了,举个例子来说明为什么这样好得多:
153:11
is so much better for example when GPT-5 is taking 30 minutes to respond is generating one token at
比如当GPT-5需要30分钟才能响应时,它是一次生成一个token,
153:17
a time and this diffusion idea is essentially generate all of those completion all of those tokens
而这种diffusion的思路,就是一次性生成所有那些补全、所有那些token。
153:21
in the completion in one batch which is why it could be way faster and I think it could be suited
在一个批次里完成,所以速度可以快很多,我觉得它挺适合的。
153:27
the startups in hearing are like codes startups where you have a code base and you have somebody that's
我听到的那些初创公司有点像代码初创公司,就是有一个代码库,然后有人来回复模型,但它不需要太多外部上下文,而且通过使用这些扩散模型,你可以很快得到结果。
153:32
effectively vibe coding and they say make this change and a code diff is essentially a huge
实际上就是 vibe coding,他们说“做这个改动”,然后代码 diff 本质上就是模型返回的一大段内容,但它不需要太多外部上下文,而且用这些 diffusion 模型可以非常快地生成。这就是我听说的一个例子:他们用这些 text diffusion 来生成很长的 diff,因为如果用 auto-regressive 模型来做,可能要花几分钟,而对面向用户的产品来说,这种延迟会导致大量用户流失——每多等一秒就会失去很多用户。所以我觉得它会发展起来,会有一些应用场景。但我原本以为,不同类型模型会更快地被用于不同任务,比现在实际发生的时间点要早得多。
153:38
reply from the model but it doesn't have to have that much external context and you can get it
我听说过的一个例子是,他们用这些文本扩散模型来生成非常长的代码差异,因为如果用自回归模型来做,可能要花几分钟,而那种时间对于面向用户的产品来说会导致大量用户流失——每多等一秒就会失去很多用户。
153:43
really fast by using these diffusion models so that's what I've heard of one example is that
所以我觉得它会发展起来,会有一些应用场景,但我其实觉得它不太一样。
153:47
they use these text diffusion to generate really long diffs because doing it with a
他们用这种text diffusion来生成非常长的diff,
153:51
auto-regressive model would take minutes and that time for like a user-facing product
因为如果用自回归模型来做,需要好几分钟,这对面向用户的产品来说太慢了。
153:56
causes a lot of churn so like every second you lose a lot of users so I think it's going to be this
导致大量用户流失,所以每秒钟都会失去很多用户。我觉得它会像这样发展,逐渐增长并有一些应用场景,但我其实觉得它和工具核心不太一样。第二点是,互联网并不总是正确的——你可以做网页搜索,但比如我问1988年世界杯谁赢了,它还是需要找到正确的网站并获取准确信息,所以它仍然可能访问到错误的网站,给我错误的信息。因此我不认为它能完全解决这个问题,但在某种程度上确实有所改进。另外,今年早些时候还有一篇很酷的论文,我记得大概是12月31日发布的,严格来说不算2026年,但也差不多了——就是那个递归语言模型,这个想法挺有意思的。
154:01
thing where it's going to grow and have some applications but I actually thought that different
它确实会发展并有一些应用,但我其实觉得不同的
154:05
types of models were going to be used for different things more sooner sooner than they have been
不同类型的模型会更快地被用于不同的事情,比以往更快。
154:09
so I kind of trade off I think that the tool use point is the one that's stopping them from
所以我覺得這是一種取捨,我認為工具使用這點正是阻礙它們成為真正通用型AI的原因,因為像Cloud Code和這個HGPTA研究,自回歸鏈會被外部工具打斷,而我不知道在diffusion架構下要怎麼做到這一點。那麼今年和未來幾年,工具使用的發展方向是什麼?你覺得這方面會有很多進展嗎?它會如何整合到整個技術棧中?我確實認為,目前這主要還是在專有LLM這邊,但我覺得我們會看到更多開源工具鏈上的發展。而且我認為,這會是一個巨大的突破,因為這樣你就可以真正把某些任務從單純的記憶外包出去,轉而變成實際的——你知道,與其只是記住,不如直接去執行。
154:14
being like most general purpose because like cloud code and this HGPTA research like the
大多数通用模型就像云代码和这个HGPTA研究一样,
154:22
the auto-regressive chain is interrupted with some external tool and I don't know how to do that
自回归链条会被一些外部工具打断,而我不知道在扩散模型设置下该怎么做。
154:26
with the diffusion setup so what's the future of tool use this year and in the coming years
那么,工具使用的未来在今年和未来几年会怎样?
154:32
do you think there's going to be a lot of developments there how that's integrated to the entire
你认为这方面会有很多进展吗?它如何整合到整个技术栈中?
154:36
stack I do think right now I mean it's mostly on the proprietary L&M site but I think we will see
我确实认为,目前这主要还是在专有的L&M领域,但我认为我们会看到
154:42
more of that in the open source tooling and I think I mean it is a huge unlock because then you
更多这样的工具出现在开源工具中。而且我认为,这确实是一个巨大的突破,因为这样
154:48
can really outsource certain tasks from just memorization to actual you know like instead of
你就可以真正把某些任务从单纯的记忆外包出去,变成实际的——你知道,就像——
154:55
having the L&M memorize what is 23 plus 5 just use a calculator so you think that can help solve
让L&M记住23加5等于多少,直接用计算器就行,所以你觉得这能帮助解决幻觉问题?不能完全解决,但能减少。所以L&M需要知道什么时候该调用工具。第二个问题是,互联网也不总是对的。你可以做网页搜索,但比如我问1988年世界杯谁赢了,它还是得找到正确的网站并获取准确信息。所以它可能跑到错误的网站,给我错误的信息。我不认为这能彻底解决幻觉,但在那个方向上确实有改进。今年早些时候还有一篇很酷的论文,我记得大概是12月31号发表的,严格来说不算2026年,但也差不多了。就是那个递归语言模型,这个想法挺有意思的。
155:00
hallucination not solve it but reduce it so so the L&M needs to know what like when to ask for
幻觉问题没法彻底解决,但可以减轻。所以L&M需要知道什么时候该调用工具。第二点是,互联网也不总是对的。你可以做网页搜索,但比如我问1988年世界杯谁赢了,它还是得找到正确的网站、拿到正确的信息。所以它仍然可能跑到错误的网站上,给我错误的信息。我不认为这能完全解决这个问题,但在那个方向上确实有改进。今年早些时候还有一篇很酷的论文,我记得大概是12月31号,所以严格来说不算2026年,但也差不多了。就是那个递归语言模型,这个想法挺有意思的,在学术界做这种研究很酷,因为计算预算有限。如果我没记错的话,他们当时用了……
155:08
a tool core and the second one is well it doesn't mean the internet is always correct you can do a
一个工具核心,第二个是——好吧,这并不意味着互联网总是对的。你可以做网页搜索,但假设我问1988年世界杯谁赢了,它还是得找到正确的网站并获取正确的信息,所以你仍然可能访问到错误的网站,给我错误的信息。所以我不认为这能完全解决这个问题,但它确实在改进,虽然不是技术上2026年,但也差不多了。所以像递归语言模型,这个想法挺酷的,用来处理上下文任务——与其让L&M一次性解决所有问题,甚至用链式方式,不如把它分解成子任务,让L&M决定什么是好的子任务,然后递归调用另一个L&M来解决它。我觉得类似这样的方法,再加上工具。
155:13
web search but let's say I asked who won the World Cup in let's say 1988 it still needs to find the
网络搜索,但假设我问“谁赢了1988年的世界杯”,它还是得找到
155:19
right website and get the right information so you can still go to the incorrect website and give
正确的网站并获取准确信息,所以你仍然可能访问到错误的网站,给我错误的信息
155:24
me incorrect information so I don't think it will fully solve that but it is improving it in that
所以我不认为它能完全解决这个问题,但它确实在改善这一点
155:29
sense and so another cool paper earlier this year I think was generally December 31st so it's
嗯,今年早些时候还有一篇挺有意思的论文,我记得大概是12月31号发的,严格来说不算2026年,但也差不多了。就是那个recursive language model,这个想法挺酷的。它把context task拆开,不让L&M一次性解决所有问题,甚至也不走chain那种方式,而是把它分解成子任务,让L&M自己判断什么时候该拆、拆成什么样的子任务,然后递归地调用另一个L&M去解决。我觉得类似这种思路,再加上工具调用,比如你有一个很大的Q&A任务,每个子任务都去网上抓信息,最后再汇总拼接起来。这样其实不一定要提升L&M本身,而是改进了L&M的使用方式,以及L&M能做什么。
155:36
not technically 2026 but close so like the recursive language model that that's a cool idea to kind
严格来说不算2026年,但差不多,比如递归语言模型这个想法挺酷的。
155:45
of take this even a bit further so just to explain so Nathan you also mentioned earlier it's harder
把这个再延伸一点,Nathan你之前也提到,现在在学术界做酷的研究更难了,因为算力预算有限。如果我没记错的话,他们当时全程用的是GPT-5,连本地模型都没碰。但思路是这样的:比如一个长上下文任务,不让L&M一次性解决,甚至也不走chain的方式,而是把它拆成多个子任务,让L&M自己判断什么时候该拆、拆成什么样的子任务合适,然后递归地调用另一个L&M去解决。我觉得类似的做法再加上工具调用,比如你有一个超大的Q&A任务,每个子任务都去网上搜集信息,最后再汇总到一起,拼接回来。
155:51
to do cool research in academia because of the compute budget if I recall correctly they did
在学术界做酷研究,主要受限于计算预算。如果我没记错的话,他们用的是上下文任务分解,而不是让语言模型一次性解决所有问题,甚至不是用链式推理。你把任务拆成子任务,让语言模型自己判断哪些是合适的子任务,然后递归调用另一个语言模型去解决它。我记得类似的方法还会加上工具调用。比如你有一个庞大的问答任务,每个子任务都让模型去网上搜集信息,最后再把所有结果汇总拼接起来。这样你并不一定改进了语言模型本身,而是改进了语言模型的使用方式,以及语言模型能调用什么工具。目前工具使用的一个缺点是,你必须给语言模型授权才能使用工具。
155:56
everything with GPT-5 so they didn't even use local models but the idea is let's say if a long
全部基于GPT-5,所以他们甚至没用本地模型,但思路是这样的——比如一个长上下文任务,不让L&M一次性解决所有问题,甚至不用链式推理,而是把它拆成子任务,让L&M自己判断什么时候该拆出合适的子任务,然后递归调用另一个L&M去解决。我觉得类似这样,再加上工具调用,比如你有一个超大的问答任务,每个子任务都去网上搜集信息,最后再汇总拼接起来。这样不一定提升了L&M本身,而是改进了L&M的使用方式,以及L&M能调用什么工具。目前工具调用的一个缺点是,你得先授权L&M使用工具。
156:01
context task instead of having the L&M solve all of it in like one shot or even like in a chain
把上下文任务拆开,不让L&M一次性解决所有问题,甚至不靠一条链式推理。
156:06
you break it down into subtasks you have the L&M decide when like what is a good let's say subtask
你把它分解成子任务,让L&M自己判断什么时候该拆、拆成什么样的子任务合适。
156:13
and then recursively call an L&M to solve that and I think something like that also then adding tools
然后递归地调用另一个L&M去解决那个子任务,我觉得类似这样的思路,再加上工具。
156:20
and you know each one maybe you have like a huge Q&A task each one goes to the web and
而且你知道,每个任务可能都像是一个巨大的问答任务,每个任务都会去网上收集信息,最后你再把它们整合到一起、拼接起来。你并不一定是在改进L&M本身,而是在改进L&M的使用方式,以及L&M目前能做什么。我认为语言模型可以解决很多任务,但关键在于——如果你雇一个编辑,编辑会出错,但你会告诉他;如果你雇一个好编辑,他们就不会再犯同样的错。但语言模型没有这种快速修改自身并学习的能力。所以,关键在于,如果我们真的想要实现一种真正通用、可适应的智能,能够进入任何远程工作场景,并且需要具备学习能力的话……
156:25
gathers information and then you pull it at the end together and stitch it back together
收集信息,最后把所有结果拼到一起,缝合起来。
156:29
like where I think there's going to be a lot of unlock using things like that where
我觉得未来会有很多突破,比如通过类似的方式,你不一定非要改进L&M本身,而是改进L&M的使用方式,以及L&M能调用什么工具。现在工具使用的一个缺点是,你必须给L&M使用工具的权限,这需要一定的信任,尤其是如果你想实现让L&M帮你回复邮件、或者只是帮你分类、筛选邮件之类的功能。说实话,我今天可能还不敢让L&M访问我的邮件,风险太大了。关于工具使用,我还有一个有意思的点想提一下,你之前也暗示过这一点,我们各自都有不同的理解,那就是开源模型和闭源模型在使用工具方面的差异。
156:35
you're not necessarily improve the L&M itself you improve how the L&M is used and what the L&M can
你不一定是在改进L&M本身,而是在改进L&M的使用方式,以及L&M能做什么。
156:40
use one downside right now with tool use is you have to give the L&M permission to use tools
目前使用工具的一个缺点是,你必须给L&M使用工具的权限。
156:46
and that will take some trust especially if you want unlock things like having an L&M answer emails
这需要一定的信任,尤其是如果你想解锁像让L&M帮你回复邮件这样的功能——不是完全替你回复,而是帮你分类、筛选或者做类似的事情。说实话,我今天可能还不太敢让L&M访问我的邮箱,这风险太大了。关于工具使用,我觉得还有一个很酷的点,你之前也暗示过,而且我们各自都有体会:那就是开源模型和闭源模型在使用工具时的区别。用户可能会想“我该用什么工具”,比如Exa是我偏好的搜索引擎,但别人可能更喜欢另一家搜索初创公司。当你发布一个模型时,它需要能适配多种工具、多种使用场景,这其实非常难。
156:53
for you a lot in answer but just sort them for you or select them for you or something like that
帮你回答很多问题,但只是帮你整理一下,或者帮你筛选一下,或者类似这样的事。
156:57
I don't know if I would today give an L&M access to my emails right I mean it's like a huge risk
我不知道今天我会不会让L&M访问我的邮件,对吧,这风险太大了。
157:03
I think there's a cool one last point on the tool use thing I think that you hinted at this
我觉得关于工具使用还有一个很酷的点,你之前也暗示过这个。
157:08
and we both come at this in our own ways is that the open versus closed models use tools in
我们俩各自都有体会,就是开源模型和闭源模型在使用工具上的区别。
157:13
very different ways where open models people go to hugging face and you download the model and
开源模型和闭源模型的使用方式非常不同。开源模型的话,人们会去Hugging Face下载模型,然后就会想“我该用什么工具呢?”比如我个人偏好Exa作为搜索工具,但别人可能更关注其他搜索初创公司。当你发布一个模型时,它需要适配多种工具和多种使用场景,这其实很难,因为你本质上是在打造一个通用推理引擎模型——这正是GPT OSS擅长的。但在闭源模型这边,你会把特定工具深度整合到使用体验中。我认为开源模型很难复制我用闭源模型做的一些事情,比如你可以同时引用公开信息和私有信息。
157:17
then the person's going to be like oh what tool do I want and I don't know exa is my search
然后用户就会想:“哦,我想要用什么工具?” 比如Exa是我偏好的搜索引擎,但别人可能更喜欢另一个不同的搜索初创公司。
157:21
preferred search provider but somebody else might care for a different search startup where you release
当你发布一个模型时,它需要能适配多种工具、多种使用场景,这其实非常难,因为
157:26
a model it needs to be useful for multiple tools for multiple use cases which is really hard because
我觉得不可避免的是,这些前沿实验室投入了那么多研究和那么多资源。
157:30
you're making like a general reasoning engine model which is actually what GPT OSS is good for
你是在做一个通用的推理引擎模型,这其实正是 GPT OSS 擅长的地方。
157:36
but on the closed models you're deeply integrating the specific tool into your experience and I think
但在闭源模型上,你会把特定工具深度整合进自己的使用体验里,我觉得
157:43
open models will struggle to replicate some of the things that I like to do with closed models
开源模型很难复现我在闭源模型上喜欢做的某些事情。
157:47
which will be like I don't know you can reference a mix of public and private information and
比如,我也不知道,你可以同时引用公开和私有的信息,
157:53
something that I keep trying every three to six months I try like codex on the web which is
我每隔三到六个月就会试一次,比如用Codex on the web,就是让模型直接给我的GitHub仓库做个更新。那种感觉就像——它说的那种云端环境真的太方便了,把任务丢过去让它做完,再回来找我。这些大概会帮助定义一些本地、开放和封闭的细分领域。但我觉得一开始,因为大家急着让这些工具能用起来,开源模型确实有点落后。不过这也几乎是必然的,那些前沿实验室有那么多研究和资源。等开源模型解决这个问题的时候会很有趣,因为那会逼着大家再往前迈一步。
157:58
just prompting a model to make an update to some GitHub repository that I have and it's just like
然后直接让模型去更新我某个 GitHub 仓库,这种感觉就像——
158:02
like that said it's a cure cloud environment is just so nice for just like
就像在那种云端环境里,直接丢过去让它干活,然后回来找我,这种感觉太方便了。
158:08
send it off and do this thing and then come back to me and these will probably help
这些可能会帮助定义本地、开源和闭源模型各自的 niche,
158:13
define some of the local open and closed niches but I think initially because there was such a
但我认为一开始,因为差距实在太大了……
158:20
rush to get these tool use working that the open models were on the back foot but just kind of
急于让这些工具调用跑起来,导致开源模型一度处于劣势,但这几乎是不可避免的。我认为前沿实验室有那么多研究、那么多资源,但等开源模型解决这个问题时会很有趣,因为这会迫使模型更像一个编排者,以及一个工具调用模型。所以希望这种必要性会催生一些有趣的创新。至于持续学习,这是一个长期存在的重要问题。我认为随着模型训练成本上升,它的重要性也在增加。所以如果你能解释一下什么是持续学习,以及今年和未来几年它对取得进展有多重要——这很大程度上与旧金山那种“什么是AGI”、“什么是人工”的思潮有关。
158:24
inevitable I think there's so much research that so many resources of these frontier labs but
我觉得这是不可避免的,前沿实验室投入了那么多研究资源和算力。
158:29
will be fun when the open models solve this because it's going to necessitate like a bit more
等开源模型解决这个问题时会很有趣,因为这需要模型更像一个编排者,同时具备工具使用能力,希望这种需求能推动一些有趣的创新。所以持续学习是一个长期存在的重要问题,我认为随着模型训练成本上升,它的重要性也在增加。如果你能解释一下什么是持续学习,以及它在今年和未来几年对取得进展有多重要——这很大程度上与当前关于AGI(通用人工智能)的思潮有关,也就是我们今天拥有的人工智能到底能做什么。我认为语言模型可以解决很多任务,但关键在于处理信息、解决数字任务并执行它们,而持续学习所凸显的局限性也正在于此。
158:33
flexible and potentially interesting model that might work with this recursive idea to like
一个灵活且可能很有趣的模型,可以配合这种递归的想法,比如作为一个编排器和工具调用模型,所以希望这种需求能推动一些有趣的创新。继续学习是一个长期存在的重要问题,我认为随着模型训练成本的上升,它的重要性也在增加。所以如果你能解释一下什么是继续学习,以及它在今年和未来几年对取得进展有多重要,这其实和当下那种关于AGI(通用人工智能)是什么、ASI(超级人工智能)是什么、以及我们今天拥有的语言模型能做什么的思潮有很大关系。我认为语言模型能解决很多任务,但关键在于
158:38
be an orchestrator and to tool use model so hopefully the necessity drives some interesting
成为一个协调者,以及一个能使用工具的模型,希望这种需求能推动一些有趣的创新。
158:43
innovation there so continue learning this is a longstanding topic important problem I think
所以持续学习是一个长期存在的重要问题,我认为它的重要性会随着模型训练成本的上升而增加。
158:52
that increases and importance is the cost of training of the models goes up so if you can explain
如果你能解释一下什么是持续学习,以及今年和未来几年它对取得进展有多重要。
158:57
what continue learning is how important it might be this year in the coming years to make progress
这很大程度上与硅谷当下的思潮有关,也就是什么是AGI,什么是我们今天拥有的人工智能能够做到的。
159:03
this relates a lot to this kind of SF get zeitgeist of what is a GI what is which is artificial
我认为语言模型可以解决很多任务,但关键在于——
159:08
general intelligence and what is ASI artificial super intelligence and what are the language models
通用智能是什么,以及ASI人工超级智能又是什么,还有我们现在的语言模型能做什么。我认为语言模型可以解决很多任务,但关键在于处理信息、解决数字任务并执行它们。人们指出的一个限制是,语言模型无法像员工那样从反馈中学习。比如你雇一个编辑,他会犯错,但你告诉他之后,如果是个好编辑,他就不会再犯同样的错误。但语言模型没有这种自我调整和快速学习的能力。所以关键在于,如果我们想要真正实现一种通用的、可适应的智能,能够胜任任何远程工作场景,并且需要具备学习能力的话……
159:13
that we have today capable of doing I think the language models can solve a lot of tasks but of key
我们现在已有的L&M其实能解决很多任务,但关键在于——
159:19
milestone among the AI community is essentially when AI could replace any remote worker taking in
AI社区的一个重要里程碑,本质上是当AI能够取代任何远程工作者——接收信息、解决数字任务并执行它们。而人们指出的一个限制是,语言模型无法像员工那样从反馈中学习。比如你雇一个编辑,他会犯错,但你指出来;如果雇的是好编辑,他们就不会再犯。但语言模型没有这种快速自我调整和学习的能力。所以关键在于,如果我们想要真正实现一种通用的、可适应的智能,能够胜任任何远程工作场景,并且需要能够从反馈和在职学习中快速学习——我个人对语言模型更乐观一些。
159:26
information and solving digital tasks and doing them and the limitation that's highlighted by
信息和解决数字任务以及执行这些任务的能力,以及由此凸显的局限性——如果你雇一个编辑,编辑会犯错,但你会指出来,而如果你雇一个好编辑,他们就不会再犯同样的错误。但语言模型没有这种自我修正和快速学习的能力。所以关键在于,如果我们真的想要实现一种真正通用、可适应的智能,能够胜任任何远程工作场景,并且需要具备学习能力——而智能体模型才刚刚起步——这就成了一个权衡问题:我们是否需要通过持续学习来更新模型权重,让它们学得更快?或者相反的观点是,我们只需要给它们提供更多的上下文和信息,它们自然就能做到。
159:31
people is that a language model will not learn from feedback the same way that an employee is so
人们的问题是,语言模型不会像员工那样从反馈中学习。比如你雇了一个编辑,他会犯错,你告诉他之后,如果是个好编辑,他就不会再犯。但语言模型没有这种自我修改和快速学习的能力。所以关键在于,如果我们想要真正实现一种通用的、可适应的智能,能够进入任何远程工作场景,并且需要具备学习能力——而agentic模型才刚刚起步——这就涉及一个权衡:我们是否需要通过continual learning来更新模型的weights,让它们学得更快?或者相反的观点是,我们只需要给它们提供更多的context和信息,它们自然就能做到。
159:37
if you hire an editor the editor will mess up but you will tell them and if you hire a good editor
如果你雇一个编辑,编辑会出错,但你会告诉他;如果你雇一个好编辑的话……
159:41
they don't do it again but language models don't have this ability to modify themselves and learn
但它们不会重复犯错,而语言模型并不具备自我修改和快速学习的能力。所以关键在于,如果我们想要真正实现一种通用的、可适应的智能体,能够胜任任何远程工作场景,就需要通过持续学习机制让模型快速调整权重;而反对观点则认为,我们只需要给模型提供更多上下文和信息就够了——这通常被称为上下文学习。你每次向系统输入提示时,都可以不断加载额外信息,而巨大的上下文窗口正好支持这一点。我认为这两种方式本质上都可以被视为学习,只是学习发生的环节不同。
159:47
very quickly so the idea is if we're going to actually get to something that is a truly general
而且速度很快,所以关键在于,如果我们真的想实现一个真正通用的东西
159:52
adaptable intelligence that can go into any remote work scenario and needs to be able to learn
适应性智能可以进入任何远程工作场景,并且需要能够学习
159:56
quickly from feedback and on job learning I'm personally more bullish on language models by
从反馈和工作中快速学习,我个人更看好语言模型。
160:02
being able to just provide them with very good context you said maybe offline said that like you can
能够直接给它们提供非常好的上下文,你刚才提到,比如离线状态下,你可以给模型写很长的文档,说“我这里有所有信息,这是所有写过的博客文章,我喜欢这种写作风格,我的声音基于这个”。但很多人并没有给模型提供这些,而且之前的模型也不是设计来接受这么多上下文的。像agentic模型才刚刚开始,所以这里有一个权衡:我们是否需要通过持续学习来更新模型的权重,让它们学得更快?反过来说,我们只需要给它们提供更多的上下文和信息,它们通过拥有大量上下文并且非常聪明,就能表现出学得很快的样子。
160:08
write extensive documents to models where you say I have all this information here is all the blog
你可以给模型写大量文档,说“我这里有所有信息,这是所有写过的博客文章,我喜欢这种写作风格,我的声音基于此”,但很多人并没有给模型提供这些,而且模型之前也不是设计来处理这么大上下文的。
160:13
posted ever written I like this type of writing my voice is based on this but a lot of people don't
像agentic模型才刚刚起步,所以这里有个权衡:我们是否需要通过持续学习来更新模型权重,让它们学得更快?
160:19
provide this to models and the models weren't designed to like take this amount of context previously
或者反过来说,我们只需要给它们提供更多上下文和信息,它们通过拥有大量上下文并变得非常聪明,就能表现出快速学习的效果。
160:24
like the agentic models are just starting so it's this kind of tradeoff of do we need to update
Agentic模型才刚刚起步,所以这里存在一种权衡:我们是否需要通过这种持续学习(continual learning)来更新模型的权重,让它们学得更快?反方观点则是,我们只需要给它们提供更多的上下文和信息,它们自然就能学会——这通常被称为上下文学习(in-context learning)。当你学习新东西时,如果有一个巨大的上下文窗口,你每次给系统输入提示时,都可以不断往里面加载额外信息。我认为这两种方式其实都可以被看作是学习,只是学习发生的位置不同罢了。老实说,持续学习(continual learning)这种更新权重的方式,我们已经有了不同的变体。我的意思是,如果你仔细想想,这里的区别就在于:你是在哪里进行学习。
160:30
the weights of this model with this continual learning thing to make them learn fast or the
这个模型的权重通过这种持续学习机制来让它们快速学习,或者
160:34
counter argument is we just need to provide them with more context and information and they will have
相反的观点是,我们只需要给它们提供更多的上下文和信息,它们就能学会
160:38
the appearance of learning fast by just having a lot of context and being very smart so it was
通过拥有大量上下文和非常高的智能,看起来像是快速学习,所以它很迅速、频繁,等等。然后你提到的另一面,通常我们称之为上下文学习(in-context learning),当你学习时,有一个巨大的上下文窗口,每次提示系统时,你都可以不断加载额外信息。我认为这两者都可以合理地被视为学习,只是学习发生的地方不同。老实说,我认为持续学习(continual learning)——即权重的更新——我们已经以不同形式存在了。我的意思是,如果你想想看,从GPT 5到5.1再到5.2的过渡,我们其实已经有了这种能力,只是可能不是即时发生的。
160:43
you mentioned the terminology here so continual learning refers to changing the weights continuously
你刚才提到了这些术语,continual learning 指的是持续调整权重,让模型根据新输入的信息不断适应和调整,而且这个过程是持续、快速、频繁的。而另一边你提到的那个,我们通常叫 in context learning,就是学习的时候有一个巨大的 context window,每次你给系统输入提示时,都可以不断往里面塞额外信息。我觉得这两种其实都可以看作是学习,只是学习发生的地方不同。老实说,continual learning 这种更新权重的方式,我们已经有了不同形式的实现。我的意思是,如果你仔细想想,这里的区别在于——你是选择
160:52
so that the model adapts adjusts based on the new incoming information does so continuing and
这样模型就能根据新输入的信息不断调整适应,持续且快速频繁地更新。而你提到的另一面,通常我们称之为上下文学习——当你学习新东西时,有一个巨大的上下文窗口,每次你给系统输入提示时,都可以不断往里面加载额外信息。我认为这两种方式其实都可以被看作学习,只是学习发生的环节不同。老实说,持续学习(即更新权重)我们已经以不同形式存在了。比如想想看,从GPT-5升级到5.1再到5.2,这个过程虽然可能不是实时的,但本质上就是持续学习。
160:57
rapidly and frequently and so on and then the thing you mentioned on the other side of it
快速且频繁地,等等等等,然后你提到的另一面,就是我们通常说的 in-context learning。当你学习东西时,有一个巨大的 context window,你每次给系统输入 prompt 时,都可以不断往里面加载额外信息。我觉得这两种方式都可以合理地被视为学习,只是学习发生的位置不同。老实说,我认为 continual learning(持续学习)——也就是更新权重——我们已经以不同形式实现了。我的意思是,想想看,从 GPT 5 到 5.1 再到 5.2 的演进,虽然可能不是即时更新,但某种程度上也算是那种学习的一种变体。另一个更细粒度的好例子是……
161:04
is generally we refer to as in context learning as you learn stuff there's a huge context window
这通常被称为上下文学习,当你学习时,有一个巨大的上下文窗口
161:11
you can just keep loading it with extra information every time you prompt the system which I think
你可以在每次提示系统时不断加载额外信息,我认为
161:16
both are legitimately can be seen as learning it's just a different place where you're doing the
这两种方式都可以被合理地视为学习,只是学习发生的位置不同
161:23
learning I think to be honest with you continual learning the updating of weights we already have
说实话,我觉得持续学习——也就是更新已有的权重——这件事,其实已经有不同形式了。我的意思是,如果你仔细想想,这里的区别在于:你是做那种……甚至更细分的版本?一个很好的例子就是,为每个人更新权重成本太高,我觉得这才是问题所在。除非你……哪怕到了OpenAI那种规模,建数据中心都太贵了。就像Apple尝试用Apple Foundation Models做的那样,把它们放到手机上,然后让它们从使用中学习。但这其实是个相关的话题——随着系统不断扩展,这种记忆机制,尤其是个性化记忆,就变得特别重要。
161:29
that in different flavors I mean if you think about how so I think the distinction here is do you do
有不同的形式,我的意思是,如果你想想如何区分,我认为这里的区别在于你是否进行
161:35
that on a personalized custom model for each person or do you on a global model scale and I think
是针对每个人做个性化定制模型,还是在一个全局模型上做扩展?我觉得我们已经有了这种思路,从GPT 5到5.1再到5.2,虽然不是立竿见影,但就像一种精心策划的更新、快速迭代的更新——根据它做不到的事情收集反馈,根据社区反馈调整权重,然后推出下一个模型,以此类推。所以这其实有点像那种思路的变体,甚至还有更细粒度的好例子,比如rlvr,你可以运行更新。但问题在于,你不能为每个人都这么做,因为为每个人更新权重成本太高了,我觉得这就是问题所在。除非你——就算以OpenAI的规模去建数据中心,也还是太贵了,我觉得。
161:42
we have that already with going from GPT 5 to 5.1 and 5.2 it's maybe not immediate but it is
从GPT 5到5.1再到5.2,我们已经有了这种能力,可能不是立竿见影的,但确实有点像那种味道。另一个更细粒度的好例子是,为每个人更新weights成本太高,我觉得这就是问题所在。除非你——我的意思是,就算到了OpenAI那种规模,建data centers也太贵了。就像Apple尝试用Apple foundation models把它们放到手机上,然后从实际体验中学习。但这是一个相关的话题,这种系统的memory随着规模扩大而增强,所以个性化的memory,尤其是回忆功能。但话说回来,我觉得这还是很贵,因为你得——我的意思是,你可以……
161:49
like a curated update a quick created update where there was feedback by the things it couldn't
像是那种精选更新,快速生成的更新,其中包含了基于它做不到的事情的反馈,来自社区的反馈,他们更新了权重,下一个模型,以此类推。所以这有点像那种味道,甚至更精细的例子,一个更精细的例子就是像RLVR,你运行更新。问题是你不能为每个人都这么做,因为为每个人更新权重太贵了,我觉得这就是问题所在。除非你达到——我的意思是,即使在OpenAI的规模下,建设数据中心也太贵了,我觉得。就像苹果试图用Apple Foundation Models做的那样,把它们放在手机上,然后它们从体验中学习,但这有点相关的话题,不过这种……
161:54
do feedback by the community they updated the weights next model and so forth so it is I mean
社区反馈后,他们更新了下一版模型的权重,以此类推。所以这其实算是那种思路的一个变体。另一个更细粒度的好例子是 RLVR,你运行它然后更新。问题在于你不能为每个人都这么做,因为为每个人更新权重成本太高了,我觉得这就是问题所在。除非你——就算以 OpenAI 的规模去建数据中心,也还是太贵了。就像 Apple 尝试用 Apple Foundation Models 把模型放到手机上,然后从用户交互中学习。虽然这个话题有点相关,但核心是随着系统规模扩大,这种记忆机制——尤其是个性化记忆——会变得很重要。
161:59
kind of like a flavor of that other even finer great example a finer great example is like
有点像另一种更精细的变体,一个很好的例子是
162:06
rlvr you run updates the problem is you can't just do that for each person because it would be too
rlvr 你运行更新,问题在于你不能为每个人都这么做,因为为每个人更新权重成本太高了,我觉得这就是问题所在。除非你——我的意思是,就算达到OpenAI那种规模去建数据中心,也还是太贵了。就像苹果试图用Apple Foundation Models做的那样,把它们放到手机上,然后从实际体验中学习。但这其实是个相关的话题——随着系统不断扩展,这种记忆机制,尤其是个性化记忆,特别是回忆功能——但话说回来,我觉得这成本很高,因为你得……我是说你可以做缓存,但依然要消耗token,而且第二点是,你能做的其实有限。
162:13
expensive to update the weights for each person and I think that's the problem so unless you get
为每个人更新权重的成本太高了,我觉得这就是问题所在。除非你——
162:18
I mean even at open-eye scale building the data centers it would be too expensive I think
我的意思是,就算达到OpenAI那种规模去建数据中心,也还是太贵了。
162:23
that is only feasible once you have something on the device where the cost is on the consumer
只有当设备本身具备条件,且成本由消费者承担时,这才可行——就像苹果尝试把Apple Foundation Models直接放到手机上那样。他们从那次经历中学到了东西。不过,这算是个相关话题。说到这个,可能有点拟人化的说法——"记忆"。随着系统不断扩展,关于如何给这些系统添加记忆,有哪些不同的机制思路?尤其是个性化记忆。目前主要还是靠上下文,基本上就是把信息塞进上下文里,然后直接调用。但我觉得,这成本很高——虽然可以缓存,但还是要消耗token;而且,能塞进去的内容也有限。
162:28
like what Apple tried to do with the Apple foundation models putting them on the phone
就像苹果尝试把Apple Foundation Models直接放到手机上那样,
162:31
and then they learned from the experience but a bit of a related topic but this kind of
然后他们从实践中吸取了经验。不过有个相关的话题是,
162:38
maybe anthropomorphized term but memory what are the different ideas of the mechanism how to add
可能有点拟人化的说法,但关于记忆——给这些系统增加记忆的机制有哪些不同的思路?尤其是随着规模扩大,个性化记忆这块。目前主要还是靠上下文,基本上就是把东西塞进上下文里,然后直接召回。但我觉得,这成本很高,因为你得——我是说你可以做缓存,但还是要消耗token。而且能塞的东西也有限。另一个思路是LoRA适配器,它不是更新整个权重矩阵,而是用两个更小的权重矩阵,并行叠加在上面,有点像增量调整。嗯,这在一定程度上可行,但说到底还是经济账。这方面也有相关论文。
162:44
memory to these systems as you're increasing things so so personalized memory especially
随着系统规模扩大,这种记忆机制——尤其是个性化记忆——
162:49
so right now it's mostly like context basically stuffing things into the context and then
现在主要还是靠上下文,就是把东西硬塞进上下文里然后直接调取。但话说回来,这成本挺高的,因为你得——我是说你可以做缓存,但依然要消耗token。第二个问题是,能做的事情有限。我觉得还有LoRA适配器,这玩意儿本质上不是更新整个权重矩阵,而是用两个更小的权重矩阵并行叠加,就像增量一样。嗯,某种程度上你可以这么搞,但最终还是经济账。之前也有论文提到过“遗忘更多”的问题,你得找到那个“金发姑娘区”才行。虽然没明说,但这场讨论里隐含了一点:上下文长度这个领域,创新其实还挺多的。
162:55
just recalling that but again I think well it's expensive because you have to like I mean you can
只是回忆一下,但我觉得,嗯,这很贵,因为你得——我是说,你可以在你的transformer里加一个state space model,那些会更适合,因为你得——
163:03
cache it but still you spend tokens on that and the second one is you can only do so much I think
缓存它,但你仍然要为此消耗 tokens,第二点是你能做的其实有限,我觉得。
163:09
it's more like a preference or style I mean a lot of people do that when they solve math problems
这更像是一种偏好或风格。其实很多人解数学题的时候也会这样。
163:14
you say it's basically you can add previous knowledge and stuff but it also give it certain
你说它基本上可以加入已有知识之类的东西,但也会带来某些偏好问题——比如“按我上次喜欢的来”之类的。但它并不会解锁新的能力。
163:19
preference problems do what I preferred last time whatever like something like that but it does it
所以对于人们常做的那个事情,还有LoRA、LoRA适配器。这些基本上不是更新整个权重矩阵,而是用两个更小的权重矩阵,以并行的方式叠加在上面,就像是一个增量。
163:24
doesn't unlock new capabilities so for that one thing people do you still
嗯,某种程度上你可以这么做,但说到底这还是经济学问题。所以也有论文提到,比如LoRA学得少但忘得也少。就像你知道的,天下没有免费的午餐,如果你想……
163:30
is Laura Laura adapters these are basically instead of updating the whole weight matrix they are
Laura adapters 嘛,基本上就是不用更新整个权重矩阵,而是用两个更小的权重矩阵并行叠加上去,有点像那个delta。对,某种程度上可以这么做,但说到底还是经济学问题。所以也有论文说你会忘掉更多,你得找到那个刚刚好的区间。他们没怎么明说,但讨论里隐含了这一点。这个上下文长度方面也有很多创新,有时候是一些小的架构改动,比如注意力机制的变体。我们之前聊过那种混合注意力模型,本质上就是在你的transformer里加入一个看起来像状态空间模型的东西,这种模型更合适,因为你必须……
163:35
two smaller weight matrices that you kind of have in parallel overlay it's like the delta but
两个较小的权重矩阵,你以并行叠加的方式放进去,有点像 delta 那种。
163:41
yeah you can do that to some extent but then again it is economics so there were also papers for
嗯,某种程度上你可以这么做,但说到底这还是经济学问题,所以也有论文讨论过。
163:49
example Laura learns less but forget less it's like you know it's no free lunch if you want to
Laura学得少但忘得也少,你知道,这就像没有免费的午餐——如果你想忘得更多,就得找到那个Goldilocks区间。虽然他们没明说,但讨论中隐含的意思是,这个context length方面其实也有很多创新空间。我认为目前普遍接受的观点是,这本质上是个compute和data的问题,有时候也会涉及一些小的架构调整,比如attention的变体。所以我们之前聊过的hybrid attention模型,本质上就是在你的transformer里加入一个类似state space model的结构,这类模型更适合处理长序列,因为你只需要花更少的compute就能建模最远的那个token。不过我觉得,这些也不是免费的。
163:55
learn more you need to use more weights but it gets more expensive and then again if you learn more
你需要学习更多,就得用更多权重,但成本会越来越高,而且学得越多,忘得也越多,基本上就得找到那个Goldilocks区间。虽然他们没怎么明说,但这次讨论里隐含的一点是,context length这方面也有大量创新空间。我觉得普遍接受的观点是,这本质上是个compute和data的问题,有时候也会涉及一些小架构调整,比如attention的变体。所以我们之前聊过的hybrid attention模型,本质上就是在你的transformer里加入一个类似state space model的结构,这类模型更占优势,因为建模最远端的token时需要的compute更少。不过我觉得,这些也不是免费的午餐。
164:00
you forget more and it's like you have to find that Goldilocks zone basically whatever they
你会遗忘更多,基本上你得找到那个 Goldilocks 区间。不管他们提了多少次,
164:05
mention it much but implied in this discussion this context length also is there a lot of innovations
但在这次讨论中隐含的意思是,这个上下文长度方面也有很多创新。
164:11
as possible there I think but colloquially accepted thing is that it's a compute and data problem where
我觉得这基本上是个算力和数据的问题,不过大家普遍接受的说法是,有时候也会涉及一些小的架构调整,比如注意力机制的变体。所以我们之前聊过混合注意力模型,本质上就是在你的transformer里加入一个类似状态空间模型的结构,这种模型更适合,因为建模最远那个token需要的算力更少。但我觉得这些改进也不是免费的,把它们规模化其实挺贵的。所以我们很快就做到了大约一百万token的输入上下文长度,而且我预计这个数字还会继续增长,今年可能会达到两百万或五百万。但我不觉得它会涨到一亿,那不太可能。
164:18
you can and sometimes like small architecture things which are like attention variance so if you
有时候是一些小的架构调整,比如 attention 的变体。所以如果你
164:23
have we talked about like hybrid attention models which is essentially if you have what looks like
——我们之前聊过混合 attention 模型,本质上就是如果你有一个看起来像状态空间模型的东西放在你的 transformer 里,那些会更适合,因为你必须
164:29
a state space model within your transformer and like those are better suited because you have to
我觉得问题在于,对于pre-training本身,我们没有那么多长上下文文档,所以很难研究LLM在那层面上的行为之类的。
164:33
spend less compute to model the furthest along token and I think that but those aren't free
花更少的算力去建模最靠后的那个token,但我觉得——这些都不是免费的。
164:41
because they have to be accompanied by a lot of compute or the right data so how many sequences
因为它们需要搭配大量算力或合适的数据,所以世界上有多少条10万token的序列,这些序列又从哪里来?我觉得最终扩展它们的成本会非常高。我们很快就把输入上下文长度做到了100万token,我预计这个数字还会继续增长,今年可能达到200万或500万。但我不认为它会涨到1亿——那将是一个真正的突破。我认为这类突破是有可能的,比如持续学习这个研究方向,可能会有一个突破让transformer在这方面表现好得多,而且成本很低。这些事情随时可能发生。
164:48
of 100,000 tokens do you have in the world and where do you get these and I think it just
世界上有10万个token,你从哪搞到这些?我觉得这玩意儿扩起来成本挺高的。所以我们很快就搞到了100万个token的输入上下文长度,我估计今年还会继续涨到200万或500万,但我不觉得会到1亿——那得是真正的突破才行。我觉得这种突破是有可能的,比如持续学习这事儿,它本来就是个研究问题,说不定哪天就有人搞出个突破,让transformer在这方面表现好得多,而且成本还低。这些事儿都有可能发生。把一切压缩成一个状态,另一边则是transformer。
164:53
ends up being pretty expensive to scale them so we've like gotten to pretty quickly to like a million
最终把它们规模化其实相当昂贵,所以我们很快就达到了大约一百万token的输入上下文长度,而且我预计这个数字还会继续增长,今年可能会到两百万或五百万。但我不认为它会涨到一亿,那将是一个研究问题——有可能出现一个突破,让transformer在这方面表现更好,而且成本很低,这种事情是有可能发生的。
164:58
tokens of input context length and I would expect it to keep increasing and like get to like two
意思是把一切压缩成一个状态,而在另一端,你有transformer,一次性处理所有内容。我的意思是,这是一个新范式,我们拭目以待,你知道,可能还会有其他变种。
165:03
million or five million this year but I don't expect it to go to like a hundred million that would be
今年可能是一百万或五百万,但我不觉得会涨到一亿,那太夸张了。
165:08
like a true breakthrough and I think those breakthroughs are possible like the continual learning
像是一个真正的突破,而且我觉得这些突破是可能的,比如持续学习这件事。我认为这是一个研究问题,有可能出现一个突破,让transformer在这方面表现好得多,而且成本很低——这类事情是有可能发生的。把一切压缩成一个状态,另一端则是transformer,一次性处理所有信息。我的意思是,这是一种新范式,我们拭目以待,可能还会有其他变体。所以我认为,我们仍然会在长上下文方面取得进展,但就像Nathan说的,我认为问题在于预训练本身,我们没有那么多长上下文文档可供使用,所以研究起来更困难,基本上也很难了解LLM在那种层面上的行为表现。
165:12
thing I think it was a research problem where you could there could be a breakthrough that just makes
我觉得这本来是个研究问题,说不定哪天就会有个突破,让transformer在这方面表现好得多,而且成本很低——这种事情完全有可能发生。
165:17
transformers work way better at this and it's cheap like these things could happen with so much
意思是把所有东西压缩成一个状态,另一边则是transformer,一次性处理——这算是一种新范式吧,谁知道呢,可能还会有其他变种。
165:21
scientific attention but turning the crank it'll be consistent increases over time.
科学界的关注点在于,只要持续推动,效果会随时间稳步提升。
165:27
I think I was looking at the extremes I think there's again no free lunch so the one extreme
我觉得我之前看的是极端情况——毕竟天下没有免费的午餐。一个极端是
165:32
to make it cheap you have a let's say an RNN that has a single state a state where you save everything
为了降低成本,比如用RNN,它只有一个状态,把所有之前的信息都塞进这个固定大小的状态里,
165:37
from the previous stuff it's like a specific fixed size things we never really
内存永远不会真正增长,因为你是把所有东西压缩进一个状态。但这样一来,
165:43
grow the memory because it's you are stuffing everything into one state but then
上下文越长,遗忘的信息就越多,因为你不可能把所有东西都完美压缩进一个状态。
165:47
the longer the context gets the more information you forget because you can't you can't
另一个极端则是transformer,它试图记住每一个token,这在某些情况下很棒,比如你想查找特定信息时。
165:51
mean compress everything into one state then on the other end you have the transformers which
我认为问题在于pre-training本身,我们没有那么多长上下文文档,所以研究起来更困难,也很难搞清楚LLM在那层面上的行为模式。
165:56
try to remember every token which is great sometimes if you want to look up specific information
尽量记住每个token,这在你想查找特定信息时有时很有用
166:00
but very expensive because you have the kvcache that grows the dot product that grows but then
但成本非常高,因为你的kvcache会不断增长,点积计算也会随之膨胀,然后
166:06
yeah like you said the mamba layers I mean they kind of have the same problem I would say like an RNN
对,就像你说的,mamba层其实也有类似的问题,我觉得就像RNN一样
166:11
you try to compress everything into one state you're a bit more selective there but then I think it's
你试图把所有信息压缩到一个状态里,这样确实更有选择性,但我觉得这又回到了
166:15
like this Goldilocks zone again with Unimotron 3 they found like a good ratio of how many
那个Goldilocks区间——就像Unimotron 3里,他们找到了一个很好的比例
166:21
attention layers do you need for the global information where everything is accessible
需要多少attention层来处理全局信息,让所有内容都可访问
166:25
compared to having these compressed states and I think that's how I think we will scale more
相比之下,这些压缩状态又是另一种方式,而我认为未来扩展的方向
166:31
by finding better let's say ratios in Goldilocks zone like between like compute making it
就是找到更好的比例,落在Goldilocks区间里——在计算成本足够低
166:39
cheap enough to run but then also making it powerful enough to be useful and one more plaque here
和模型足够强大、足够有用之间取得平衡,还有一个问题
166:45
the recursive language model paper that is one of the papers that tries to kind of address the
那篇关于递归语言模型的论文,就是试图解决长上下文问题的那一类研究。他们发现,与其把所有内容塞进一个长上下文里,不如把它拆分成多个较小的子任务——通过使用多个较小的编码器来节省内存,这样反而能比让LLM一次性处理所有内容获得更高的准确率。这算是一种新范式,我们拭目以待吧,可能还会有其他变体。所以我认为,我们仍然会在长上下文方面取得进展,但就像Nathan说的,问题在于预训练本身——我们没有那么多长上下文文档可供使用,因此研究起来更困难,也很难深入了解LLM在那层面上的行为表现。
166:50
long context thing so what they found is essentially instead of stuffing everything into this long
关于长上下文的问题,他们发现的关键是:与其把所有内容塞进这个长上下文里,不如把它拆分成多个更小的子任务。这样通过使用多个更小的code来节省内存,实际上能获得比让LLM一次性处理所有内容更高的准确率。
166:55
context if you break it up into the smaller multiple smaller tasks so you save memory by having
我的意思是,这是一种新范式,我们拭目以待,可能还会有其他变体。
167:02
multiple smaller codes you can get actually better accuracy than having the LLM try everything
所以我认为,我们仍然会在长上下文方面取得改进,但就像Nathan说的,我认为问题在于pre-training本身——我们没有那么多长上下文文档,所以更难研究LLM在那个层面的行为模式之类的东西。
167:07
all at once I mean it's a new paradigm we'll see you know there might be other flavors of that
然后通常你可以把上下文长度再扩展2到4倍,所以我觉得很多工作最终都落在这上面了。
167:13
so I think with that we will still make improvement on long context but then also like Nathan said
所以我觉得,在这方面我们还是会继续改进长上下文,但就像 Nathan 说的,问题在于预训练本身,我们没有那么多长上下文文档,所以很难去研究 LLM 在那层面上的行为表现之类的。然后通常你可以再把上下文长度扩展 2 到 4 倍,所以我觉得很大程度上,预训练阶段还是受限于算力,这正好就是我们一直在聊的,大家都在说今年顶级实验室的算力大幅增长,这应该也会体现在更长的上下文窗口上。不过我觉得在 post-training 这边,有一些更有意思的事情,就是随着我们有了 agent,这些 agent 会自己管理上下文,现在我们终于到了人们……
167:18
I think the problem is for pre-training itself we don't have as many long context documents as
然后你通常可以把上下文长度再扩展2到4倍,所以我觉得今年顶级实验室的很大一部分投入最终都会是计算量的大幅增加,这应该会体现在更长的上下文窗口上。
167:24
documents so it's harder to study and basically how LLM's behave and stuff like that on that level
但我认为在post-training这边,有一些更有趣的事情,那就是当我们有了agent,这些agent会自己管理上下文,我们现在已经到了人们——
167:31
like there are some rules of thumb where essentially you pre-training a language model like although we
有一些经验法则,比如你在预训练语言模型时,虽然我们预训练了8k的上下文长度,然后通过训练扩展到32k,还有一些经验法则,比如基本上把训练上下文长度翻倍需要2倍的计算量,然后通常可以再扩展到2到4倍的上下文长度。所以我觉得很多问题最终都受限于预训练时的计算资源,这和我们之前聊过的一样,大家都在讨论今年顶级实验室计算量的大幅增长,这应该会体现在更长的上下文窗口上。但在后训练方面,我觉得有一些更有趣的事情,那就是当我们有了agent,这些agent会自己管理上下文,现在我们正处于人们...
167:35
pre-trained like 8k context length and then extended the 32k with training and there's some rules
预训练时上下文长度是8k,然后通过训练扩展到32k,这里有一些经验法则——基本上把训练上下文长度翻倍需要2倍的计算量,然后通常还能再扩展2到4倍。所以我觉得很大程度上,预训练阶段最终受限于算力,这和我们之前聊过的一样,大家都在讨论今年顶级实验室算力的大幅增长,这应该会体现在更长的上下文窗口上。但在后训练阶段,我觉得有一些更有趣的事情:随着智能体的出现,它们会自己管理上下文。现在人们还在手动把内容压缩成要点列表,但下一代模型会怎么做,我对此感到新奇。
167:40
of thumb where you just like essentially doubling the training context length takes like 2x compute
一个经验法则是,基本上把训练上下文长度翻倍大约需要2倍的计算量,然后你通常还能再把上下文长度提升2到4倍。所以我觉得很大程度上,这最终在预训练阶段是受计算资源限制的——这正好是我们聊过的,也是大家都在讨论的,今年顶级实验室在计算量上的大幅增长,这应该会体现在更长的上下文窗口上。但在后训练方面,我觉得有一些更有趣的事情:随着我们拥有智能体,这些智能体会自己管理上下文。现在人们还在手动把内容压缩成要点列表,但下一代模型会怎么做,这还挺新颖的。具体来说,你可以训练你的强化学习算法,把压缩作为一个动作来处理。
167:45
and then you can normally like 2 to 4x the context length again so I think a lot of it ends up being
通常能让上下文长度再提升2到4倍。所以我认为,
167:52
compute bound at pre-training which is seamlessly we talked about this everyone talks about this
预训练阶段受限于算力,这个我们聊过,大家都在聊。今年顶级实验室的算力投入大幅增长,这应该会体现在更长的上下文窗口上。但我觉得后训练阶段有些更有意思的事——随着智能体的出现,它们会自己管理上下文。现在人们开始用稀疏注意力机制,本质上就是搞一个非常高效轻量的小模型,直接屏蔽掉某些部分,甚至干脆不做计算。还有滑动窗口注意力,重点放在我们讨论的LLM上。不过如果能引入一些可能有用的东西就好了,比如世界模型。这方面越来越让人兴奋,你觉得呢?
167:57
big increase in compute for the top labs this year and that should reflect in some longer
今年顶级实验室在算力上的大幅投入,应该会体现在更长的上下文窗口上。
168:01
context windows but I think on the post-training side there's some more interesting things which
但在后训练方面,我觉得有一些更有意思的东西。
168:04
is as we have agents the agents are going to manage this context on their own we're now at people
随着我们拥有智能体,这些智能体将自行管理上下文,我们现在处于一个阶段——人工成本很高,但这就像让事情变得更复杂,比如建模,比如研究生水平。有一个叫CASP的比赛,我记得是用来预测蛋白质结构的。关于运动控制和操作的问题,运动控制已经解决得比较好了,尤其是在学习领域。可能大家几乎没怎么讨论过的一个重要性问题是安全。我们聊到的所有有趣的复杂性、各种有趣的学习方式,在LLM领域、机器人领域,这些都像是游戏一样。但在人们家中,经过数百万分钟、数十亿次交互,你几乎是不被允许失败的。
168:09
that use code a lot dread the compaction which is when cloud takes its entire full 100,000 tokens
那些大量使用代码的人非常讨厌压缩功能——也就是云服务把整整10万token的工作内容压缩成一条要点列表。但接下来的模型能做到的(我敢肯定已经有人在研究这个了)是让模型自己控制何时压缩以及如何压缩。这样一来,你就能训练你的RL算法,把压缩本身当作一个动作,它会缩短历史记录。而问题的设定就变成了:我希望在模型把历史记录压缩到最短的同时,保留我获得过的最高评估分数——因为这样你只需要最少的token数量,就能完成这种复合自回归预测。所以实际上,这里面有一些相当不错的问题设定。
168:15
of work and compacts it into bulleted list but what the next models will do I'm just about a novel
把工作内容压缩成要点列表,但下一代模型要做的,我觉得还挺新颖的。
168:21
I'm sure people are already working on this is essentially the model can control when it compacts
肯定已经有人在研究这个了,本质上就是让模型自己决定什么时候压缩、怎么压缩。这样你就可以训练一个RL算法,把压缩当成一个动作,用来缩短历史记录。然后问题的设定就是:我希望在模型把历史记录压缩到最短的同时,保留我获得过的最高评估分数,因为这样你需要的token数量最少,才能做这种复合自回归预测。所以其实这个问题设定还挺有意思的,往前推进的话,一个最近有趣的例子就是DeepSeek的3.2版本,他们用了那种稀疏注意力机制,本质上是一个非常高效、轻量的小模型。
168:25
and how so you can essentially like train your RL algorithm where compaction is an action
具体怎么做呢?你可以把“压缩”本身当作一个动作来训练你的RL算法。
168:30
where it shortens the history and then the problem formulation will be I want to keep
它会把历史记录压缩,然后问题设定就变成了:我想在模型把历史记录压缩到最短的同时,保留我获得过的最高评估分数,因为这样你就能用最少的token来完成这种复合自回归预测。所以这里面其实有挺不错的数学问题框架。顺着这个思路,一个有趣的近期例子是Deep Seek 3.2版本,他们用了稀疏注意力机制,本质上就是一个非常高效、轻量的小模型——好吧,我们干脆把它遮掉,或者干脆不做这个,甚至用滑动窗口注意力,那也是类似的想法,你有一个滚动窗口,保持它固定不变。
168:36
the maximum evaluation scores that I have gotten while the model compacts its history to the
我得到的最高评估分数,是在模型把历史记录压缩到最短长度时出现的,因为这样你只需要最少的token数量,就能进行这种复合自回归预测。
168:41
minimum length because then you have the minimum amount of tokens that you need to do this kind of
所以这里面其实有一些挺不错的数学问题设定。
168:46
compounding auto regressive prediction so there's actually pretty nice problem setups in this
往前看,一个有趣的近期例子是DeepSeek 3.2版本,他们用了那种稀疏注意力机制,本质上就是一个非常高效、轻量的小模型。
168:50
where the like these agentic models learn to use their context in a different way than just
这些智能体模型学习以不同的方式利用上下文,而不是一味地向前推进。最近一个有趣的例子是Deep Seek 3.2版本,它采用了稀疏注意力机制,本质上是一个极其高效、轻量级的小型索引器,不再关注所有token,而是选择实际需要的token。这几乎回到了注意力的原始概念——你是有选择性的,但注意力机制中你可能会给某些token分配零权重,却仍然会处理它们。而它们更进一步,直接说“我们把它屏蔽掉吧”,甚至根本不处理。还有滑动窗口注意力,也类似这种思路,你有一个固定的滚动窗口。
168:56
plow forward one interesting also recent example would be deep seek version 3.2 where they had like
好,咱们干脆把那部分遮掉,或者干脆不做,甚至用滑动窗口注意力也行。
169:01
the sparse attention mechanism where they have essentially like a very efficient small lightweight
稀疏注意力机制,就是那种非常高效、轻量级的小型结构
169:07
indexer and instead of attending to all the tokens it selects okay what tokens were actually need it's
indexer 的做法是,不去关注所有 token,而是先筛选出真正需要的那些。
169:12
I mean it almost comes back to the original idea of attention where you are selective but attention
我的意思是,这几乎回到了注意力机制的原始理念——要有选择性。但注意力机制本身,虽然可能对某些 token 权重为零,却依然会处理所有 token。而它们更进一步,直接说“咱们把这个遮掉吧”,或者干脆连计算都不做。就连 sliding window attention 也类似这种思路,用一个固定大小的滚动窗口。
169:18
is always on you have maybe zero weight on some of them but you use them all but they are even more like
这样确实浪费,但目前来看,我觉得如果你把所有信息都用上,那是最稳妥的做法,性价比也最高,因为你永远不会遗漏信息。而且我觉得今年,也会像你说的那样,是大家更深入研究如何更聪明地处理这个问题的一年。
169:22
okay let's just mask that out or like not even do that and even with sliding window attention
“行,咱们直接把它遮掉,或者干脆不做”——哪怕是用滑动窗口注意力
169:29
all more that is also kind of like that idea you have that rolling window where you keep it fixed
而且更多也是那种想法,就是你那个滚动窗口,保持它固定不变。
169:32
because you don't need everything all the time you occasionally suddenly as you might but it's
因为你不需要每次都动用全部资源,偶尔突然需要一下,但那样很浪费。不过现在我觉得,如果你用上全部资源,确实更稳妥,性价比也最高,因为你不会错过任何信息。而且我觉得今年也会是像你说的那样,大家会更聪明地处理这个问题。现在人们想要的是下一个最先进的技术,而最先进的技术恰好就是那种烧钱又费力的东西。等有了这个之后,就像你说的,保持同样的准确度,但看看怎么用更便宜的方式实现,比如一些技巧。你知道的,所有这些 scaling 的事情,我们之所以先拿到 quad 4.5 sonnet 模型,是因为你可以更快地训练它,而且你——
169:37
wasteful but right now I think yeah if you use everything you're on the safe side it gives you
浪费但现阶段,我觉得如果你用上所有资源,确实更稳妥,性价比也最高,因为你不会错过任何信息。而且我认为今年也会是像你说的那样,更聪明地处理这个问题的一年。先靠蛮力砸钱搞出结果,然后像你说的,保持那个准确度,再看看怎么用更便宜的方式实现——比如各种技巧。你知道的,所有这些scaling的事情,我们之所以先拿到quad 4.5 sonnet模型,是因为它训练更快,推理也更快,尽管更大的模型其实效果更好。我觉得得说清楚,在AI领域现在有很多令人兴奋的事情,我最近心思其实都放在机器人上了。
169:42
the best bang for the buck because you never miss information and right now I think this year
性价比最高,因为你永远不会错过信息,而且我觉得今年
169:45
will be more also the year figuring out like you said how to be more smart about that I think
也会是更聪明地处理这个问题的年份,就像你说的那样。我觉得
169:51
right now people want to have the next state of the art and the state of the art is happens to be
现在大家都想要下一个最先进的技术,而最先进的技术恰好就是那种烧钱又费力的暴力方法。然后一旦你有了这个,就像你说的,保持那个准确率,但看看我们怎么才能更便宜地做到,比如各种技巧,你懂的。对,所有这些scaling的事情,我们之所以先得到quad 4.5 sonnet模型,是因为你可以更快地训练它,而且速度更快,尽管更大的模型实际上更好。我觉得我们应该说,在AI领域有很多令人兴奋的事情在发生。我最近的心思其实一直集中在robotics上,所以我们今天几乎完全没聊robotics。在image generation和video generation方面也有很多东西。我觉得可以这么说,最激动人心的研究工作在……
169:56
the brute force expensive thing and then once you have that like you said keep that accuracy but
那种暴力但昂贵的方法,然后一旦你有了那个,就像你说的,保持那个准确度,但
170:03
let's see how we can do that cheaper now like tricks you know yeah all this scaling thing like
看看我们怎么才能做得更便宜,比如一些技巧,你懂的。对,所有这些 scaling 的事情,
170:08
the reason we get the quad 4.5 sonnet model first is because you can train it faster and you're
我们之所以先拿到 quad 4.5 sonnet 模型,是因为你可以更快地训练它,而且你
170:14
not hitting these compute walls as soon and they can just try a lot more things and get the model
不会那么快撞上算力墙,他们就能尝试更多东西,更快地把模型做出来——尽管更大的模型其实效果更好。我觉得我们得说清楚,在AI领域有很多令人兴奋的事情正在发生。我最近的心思其实一直放在机器人上,但我们今天几乎完全没聊机器人。图像生成、视频生成方面也有很多进展。公平地说,目前从研究工作的数量和密度来看,最激动人心的并不在LLM领域——这也是为什么我觉得我们专注于讨论LLM是有道理的——但能引入一些可能有用的东西也不错,比如世界模型。大家对这方面的兴趣越来越高了,你觉得呢?
170:18
faster even though the bigger model is actually better I think we should say that there's a lot of
更快,尽管更大的模型实际上更好。我觉得我们应该说,在 AI 领域有很多
170:23
exciting stuff going on in the ice space my mind is recently been really focused on robotics
令人兴奋的事情在发生。我最近的心思其实一直集中在机器人技术上。
170:29
so we have today really almost entirely didn't talk about robotics there's a lot of stuff on image
今天我们几乎完全没聊机器人,图像生成和视频生成方面倒是有很多内容。可以说,最激动人心的研究工作还是集中在咱们讨论的LLM上,但能引入一些可能有用的东西也不错,比如世界模型——这方面越来越让人兴奋了。你觉得这会有回报吗?不过话说回来,世界模型确实挺有意思,基本上就是让模型在某种意义上模拟世界,像真实世界的一个小玩具版本,这又能解锁一些LLM本身不具备的能力,它能模拟事物,而我认为这比单纯做下一个token预测要更高级一些。
170:36
gen video generation I think it's fair to say that the most exciting research work in terms of the
关于视频生成,我觉得可以公平地说,目前最激动人心的研究工作还是集中在咱们讨论的LLM上,但能引入一些其他东西也挺好的,比如world models,这方面越来越让人兴奋。你觉得这会有回报吗?不过话说回来,world models确实很有意思,它本质上就是让模型在某种程度上运行一个世界模拟,有点像真实世界的一个小玩具版本,这能解锁一些LLM本身不具备的能力——它能模拟事物。而且我觉得,虽然我们做的是next token prediction,但我们可以做得更复杂一些,不只是简单的next token prediction,再加上verifiable rewards来检查答案的正确性,这样也行。
170:44
amount and density further isn't the LLM space which is why I think it's justified for us to really
数量和密度进一步增加,这其实已经不是LLM的范畴了,所以我觉得我们专注于讨论的LLM是合理的。不过如果能引入一些有用的东西也挺好,比如world models,这方面现在越来越让人兴奋。你觉得它会有回报吗?但话说回来,world models确实很有意思,基本上就是让模型在某种意义上模拟世界,像是一个真实世界的迷你玩具版,这又能解锁一些LLM本身并不具备的能力——它能模拟事物。我觉得在做next token prediction的时候,我们其实可以做得更复杂一些。所以我的意思是,我记得好像有一篇Meta的论文叫“Code of World”。
170:51
focus on the LLM that we're discussing but it'd be nice to bring in some certain things that
还是聚焦在我们讨论的LLM上,但能引入一些有用的东西也不错
170:56
might be useful for example world models there's growing excitement on that do you think there
比如世界模型,这方面越来越让人兴奋了,你觉得呢
171:01
will be any use in this coming year for world models in the LLM space yes I do think as well
未来一年里,world models 在 LLM 领域会有用吗?我觉得会的。
171:09
also with LLM what's the interesting thing here is I think if we unlock more LLM capabilities it
另外关于 LLM,有意思的一点是,我认为如果我们解锁更多 LLM 的能力,它也会自动推动其他领域的发展——或者说不是“解锁”,而是让进展更快,因为你知道很多研究人员和工程师都在用 LLM,比如我们之前说的 coding。
171:14
also automatically unlocks all the other fields because or not unlocks but like makes progress
所以即使他们做的是 robotics,如果你优化这些帮你写代码的 LLM,那也是值得的。
171:20
faster because you know a lot of researchers and engineers use LLM so like we said for coding so
但话说回来,world models 确实很有意思,它本质上就是让模型在某种程度上模拟世界,就像一个真实世界的迷你玩具版。
171:25
even if they work on robotics if you optimize these LLMs that help you with coding you know it's like
这又能解锁一些 LLM 本身不具备的能力——它能模拟事物,我觉得是这样。
171:29
it pays off but then yes the world models are interesting it's basically where you have
这确实有回报,但世界模型确实很有意思。基本上就是让模型在某种意义上模拟世界,就像真实事物的一个小型玩具版本,这可以解锁一些LLM本身并不具备的能力——它能模拟事物。我觉得虽然我们做的是下一个token预测,但我们可以做得更复杂一些,不只是简单的下一个token预测和可验证奖励来检查答案正确性。它们本质上也是一个代码环境,我认为这很有道理,只是成本很高。但这就像让事情变得更复杂,比如像研究生那样建模。对了,有一个叫CASP的比赛,我记得是用来预测蛋白质结构的。
171:36
the model run simulation of the world in a sense like a little toy thing of the real thing which
模型在某种意义上运行世界的模拟,就像真实事物的一个小玩具版本
171:42
can again unlock capabilities that are the LLM is not aware of is can simulate things and I think
这又能解锁一些LLM本身意识不到的能力——它能模拟事物,我觉得
171:50
see this is like something I think LLM they just happen to work well by pre-training and then
你看,我觉得LLM这东西,就是通过pre-training然后做next token prediction,效果就意外地好。但我们其实可以做得更复杂一点,你懂吧。我的意思是,有一篇Meta的论文,叫《Code of World Models》,他们就是把world models的概念重新应用到LLM上。也就是说,不只是做next token prediction和用verifiable rewards来检查答案对不对,他们还会确保中间变量也是正确的。这有点像模型在学习一个code environment,我觉得这挺有道理的。就是做起来成本很高,但这确实让事情变得更复杂了,像是在建模一样。
171:57
doing the next token prediction but we could do this even a bit you know like sophisticated in a
虽然是在做下一个token预测,但我们其实可以做得更复杂一点
172:03
sense so what I'm saying is like with there's like I think it was by meta a paper code of world
所以我的意思是,像Meta有一篇论文叫Code of World,就是只做next token prediction加上verifiable rewards来检查答案正确性,同时还要确保中间变量也是对的。你知道,这有点像模型在某种意义上学习一个代码环境。我觉得这很有道理,只是做起来成本很高。但这让事情变得更复杂了,比如像模拟研究生水平的工作。还有一个叫CASP的比赛,我记得是用来做蛋白质结构预测的,就是预测当时还没解出来的蛋白质结构。所以从某种意义上说,这其实很棒,我觉得LLM也需要类似的东西。
172:08
models so where they basically apply the concept of world models to LLMs again where they so instead
有些模型把世界模型的概念用到了LLM上,就是说它们不只是做next token prediction和用可验证的奖励来检查答案是否正确,还会确保中间变量也是对的。你知道,这有点像模型在学习一个代码环境,我觉得这挺有道理的,只是做起来成本很高。但这让事情变得更复杂了,就像在模拟一个研究生一样。有个叫CASP的比赛,我记得是用来做蛋白质结构预测的,就是预测当时还没解出来的蛋白质结构。所以从某种意义上说,这其实很棒,我觉得LLM也需要类似的东西。
172:15
of just having next token prediction and verifiable rewards checking the answer correctness they also
不只是下一个token预测,再加上可验证的奖励机制来检查答案的正确性,他们也是这样做的
172:21
make sure the intermediate variables are correct you know like it's kind of like a the model is learning
确保中间变量是正确的,你知道,这有点像模型在学习,基本上就是一个代码环境。我觉得这很有道理,只是做起来成本很高,但这让事情变得更复杂了,比如建模就像研究生一样。有一个叫CASP的比赛,我记得是用来做蛋白质结构预测的,就是预测当时还没被解析的蛋白质结构。所以从某种意义上说,这其实很棒,我觉得LLM也需要类似的东西。那个基准测试,虽然也有多次迭代,但我记得第一次——我不是那个子领域的专家——第一次是明确建模了物理相互作用的。
172:26
basically a code environment in a sense and I think this makes a lot of sense it's just like
基本上就是一个代码环境,我觉得这挺有道理的,只是做起来成本很高。但这其实是在让事情变得更复杂,比如建模之类的。有个叫CASP的比赛,我记得是用来预测蛋白质结构的。关于运动控制和操作的问题,运动控制这块已经解决得比较好了,尤其是在学习领域。可能大家几乎没怎么讨论过的一个重要性问题是安全。我们聊的所有那些有趣的复杂性、各种学习方式,在LLM领域、机器人领域,这些都像是游戏一样。但在人们家里,面对数百万分钟、数十亿次的交互,你几乎是不允许失败的。
172:31
expensive to do but this is like making things more sophisticated like modeling like
虽然成本很高,但这让事情变得更复杂,比如建模,就像——
172:40
modeling the whole thing not just the result in so it can add more value I remember when I was a
对整个过程进行建模,而不仅仅是结果,这样能带来更多价值。我记得我读研的时候,有个叫CASP的比赛,就是做蛋白质结构预测,预测那些当时还没解出来的蛋白质结构。从某种意义上说,这其实很棒,我觉得LLM领域也需要类似的东西——你提交结果做基准测试,但没人知道正确答案,之后才有人揭晓。不过AlphaFold出来的时候,直接碾压了那个基准测试。当然它也有多个迭代版本,但我记得第一个版本——我不是那个子领域的专家——第一个版本明确建模了物理相互作用。
172:47
grad student there is a so there's a competition called CASP I think where they doom protein
研究生。有一个叫CASP的比赛,我记得他们是在预测蛋白质结构。
172:55
structure prediction like they predict the structure of protein that is not solved yet at that point
像蛋白质结构预测那样,去预测当时尚未解析的蛋白质结构
173:02
so in a sense this is actually great and I think we need something like that for LLMs also where
所以从某种意义上说,这其实很棒,我觉得LLMs也需要类似的东西
173:08
you do the benchmark but no one does so you hand in the results but no one knows the solution and
你做了benchmark,但没人做,你提交了结果,但没人知道解法。然后事后有人揭露了,但AlphaFold刚出来的时候,它直接碾压了benchmark。我的意思是,当时也有多个迭代版本,但我不是那个子领域的专家,不过第一个版本明确建模了物理相互作用。后来他们好像去掉了这个,纯粹靠暴力scaling把它放大。我觉得对于LLM,我们现在就处于这种暴力scaling的阶段,因为它就是管用。但我也认为,到了某个时候,把这种机制重新引入可能是有意义的。而且我觉得对于world models,那可能会非常酷。嗯,是的,当然对机器人领域也是如此。
173:12
then after the fact someone revealed that but alpha fold when it came out it crushed you know
事后有人透露,但AlphaFold刚出来的时候,直接碾压了那些基准测试。我的意思是,虽然也有多个迭代版本,但我记得第一个版本——我不是那个子领域的专家——第一个版本明确建模了物理相互作用。后来的版本好像去掉了这个,纯粹靠暴力扩展规模。我觉得LLM目前就处于这种暴力扩展阶段,因为它就是管用。但我也认为,到了某个节点,把这种物理建模重新引入可能是有意义的。而世界模型,我觉得那可能会非常酷。当然,对于机器人技术来说,运动控制和操作的问题——运动控制已经解决得比较好了,尤其是在学习领域。
173:19
the benchmark I mean there were also multiple iterations but I remember the first one I'm not an
至于基准测试,虽然有过多次迭代,但我记得第一个——我不是那个子领域的专家——第一个是明确建模了物理相互作用的
173:26
expert in that subfield by the first one explicitly modeled the physical interactions of the
我们目前处于这种暴力scaling阶段,因为它恰好有效,但我确实认为
173:33
you know the physics of the molecule also like the angles impossible angles and then in the next
你知道,分子的物理特性,比如那些不可能的角度,然后在下一个版本中,我觉得他们去掉了这个,只是靠暴力扩展规模硬推上去。我觉得对于LLMs,我们现在就处于这种暴力扩展的阶段,因为它恰好有效,但我也认为,在某个时间点,把这种东西带回来可能是有意义的。而对于世界模型,我觉得那可能会非常酷。嗯,是的,当然还有机器人领域,这跟LLMs完全无关。对对,机器人领域非常明确,存在运动控制和操作控制的问题,运动控制在学习领域已经解决得比较好了,但就像最初的蛋白质折叠系统一样,引入这些方法仍然有很大的价值。
173:37
version I think they got rid of this so and just with brute force scaling it up and I think with
我觉得他们后来去掉了这个版本,纯粹靠暴力扩展规模来硬推。我认为目前LLM就处于这种暴力扩展的阶段,因为这样确实有效。但我也觉得,到了某个节点,重新引入这个机制可能是有意义的。而说到世界模型,我认为那才是真正酷的地方。当然,对于机器人领域也是如此——运动控制和操作控制的问题中,运动控制已经解决得比较好了,尤其是在学习领域。你可以直接端到端地学习操作问题,或者全身局部操作问题,这是理想状态。但当你看到人类手掌的精妙之处,以及现实世界的复杂性时,你就会意识到,要完全端到端地学会这一切,真的非常困难。
173:41
LLMs we are currently in this brute force scaling because it just happens to work but I do think
在某个时间点,重新引入这种思路是有意义的,而且结合world models,我觉得
173:46
also at some point it might make sense to bring back this thing and I think with world models I think
那可能会非常酷。当然,对于机器人领域也是如此
173:53
that is where I think that might be actually quite cool I mean yeah and of course also for robotics
运动控制和操作控制的问题——运动控制已经解决得比较好了,尤其是在学习领域
173:59
that is a completely unrelated from LLMs yeah yeah robotics is very explicitly so there's
这跟大语言模型完全不是一回事,对,机器人技术确实很明确。比如运动控制和操作控制的问题,运动控制已经解决得比较好了,尤其是在学习领域。但就像最初的蛋白质折叠系统一样,它的价值在于你可以直接端到端地学习操作控制,或者全身局部操作控制的问题——这是理想状态。但当你看到人类手的神奇之处,以及现实世界的复杂性时,你就会意识到,像AlphaFold 2那样从头到尾学透这件事真的很难。我对机器人学习领域很兴奋,我觉得它正在被集体加速,就像语言模型领域那种兴奋感和投资热潮一样。
174:06
the problem of locomotion manipulation locomotion is much more solved especially in learning domain
关于运动控制与操作的问题,运动控制这个领域解决得更好,尤其是在学习领域。
174:11
but there's a lot of value just like with the initial protein folding systems bringing in
但就像最初的蛋白质折叠系统一样,这里面有很大的价值——你可以直接端到端地学习操控问题,或者整个身体的局部操控问题,这是理想状态。但当你看到人类手的神奇之处和现实世界的复杂性时,你会意识到,要像AlphaFold 2那样从头到尾学会这一切,真的很难。我对机器人学习领域很兴奋,我觉得它正在集体获得超级加速,就像语言模型领域那种竞争和投资热潮一样。类似我们之前聊过的Hugging Face和transformers,但我在Hugging Face的时候,就试图推动这件事,只是当时太早了,这些开源……
174:15
the traditional model based methods so you don't it's it's unlikely
传统基于模型的方法,嗯……其实不太可能直接从头到尾学会操控,或者整个身体局部的操控问题。端到端学习是理想,但当你看到人类手的精妙和真实世界的复杂性时,就会发现这条路真的很难走通,不像AlphaFold 2那样。我对机器人学习领域很兴奋,感觉整个行业正在被超级加速——语言模型带来的兴奋和投资,让训练transformer的基础设施,这种通用的建模工具,正在变成世界级的工业级工具,无论用在哪儿。
174:21
that you can just learn the manipulation or the whole body local manipulation problem
你可以直接学习操控问题,或者整个身体局部操控问题,
174:26
end to end that's the dream but then you realize when you look at the magic of the human hand
端到端地解决——这是理想状态。但当你看到人类手掌的神奇之处,
174:33
and the complexity of the real world you realize it's really hard to learn this all the way through
以及现实世界的复杂性时,你就会意识到,要完全学会这一切真的很难。
174:37
the way I guess alpha fold 2 did I'm excited about the robotic learning space so I think it's
我觉得AlphaFold 2的做法挺有意思的,我对机器人学习领域很兴奋,感觉它正在被集体加速,就像语言模型领域那种热潮和投资一样。我们之前聊过Hugging Face的transformers,但我在Hugging Face的时候就想推动这件事,可惜太早了。不过,你提到机器人领域有很多兴奋点和投资冒出来,但往往没有真正可用的产品,然后就会出现一波热潮的冷却,这挺让人紧张的。希望到时候会有别的东西接上,让这些想法能持续发展下去。
174:43
collectively getting like supercharged battle the excitement and investment in language models
语言模型领域集体获得了超强助力,充满了兴奋感和投资热潮,
174:48
generally where they're getting like the infrastructure for training transformers which is
一般来说,他们获取训练transformer的基础设施——也就是那种通用建模的东西——正在变成世界级的工业工具,无论在哪里都是。
174:52
like a general modeling thing is becoming like world class industrial tooling wherever that was
他们把这些语言模型当作核心单元,用来在已经能用的东西上做有趣的探索性工作。
175:00
a limitation for robotics it's like way better there's where we're compute and then on top of like
机器人技术的一个局限是,在计算方面会好很多,然后在此基础上,他们把这些语言模型当作核心单元,用来做一些有趣的探索性工作,围绕那些已经能跑通的东西。然后我看到它正在逐渐成形,就像我们之前聊到的Hugging Face和transformers那样。但我觉得,当我在Hugging Face的时候,我试图推动这件事发生,但那时太早了——比如在Hugging Face上开放机器人模型,让人们能够贡献数据并对它们进行fine-tuning。我认为现在离这个目标更近了,因为对机器人技术的投资,以及我认为自动驾驶汽车也与此相关并推动了这一点——一旦你到了能够拥有这种能力的阶段。
175:05
they take these language models and use them as kind of central units where you can do interesting
然后我看到它正在演变成,就像我们之前聊过的hugging face transformers和hugging face那样,但我觉得我在hugging face的时候,曾经想推动这件事发生,但那时太早了——就是那种在hugging face上开放机器人模型,让人们能贡献数据并进行fine tune。
175:09
explorative work around something that kind of already works and then I see it emerging as like
我觉得现在离这个目标近多了,因为机器人和自动驾驶汽车领域的投资已经上来了。
175:16
kind of like we talked about hanging face transformers and hugging face but I think when I was
就像我们之前聊到的Hugging Face和transformers一样。但我觉得,当我在
175:19
a hugging face I was trying to get this to happen but it was too early as like these open
Hugging Face的时候,我试图推动这件事发生,但时机太早了,就像这些开源项目一样。
175:24
robotic models on hugging face and be having people be able to contribute data and fine tune them
在Hugging Face上托管机器人模型,让大家能贡献数据并对它们进行fine tune
175:29
I think we're much closer now that the investment in robotics and I think self-driving cars is
我觉得现在离这个目标更近了,因为机器人和自动驾驶领域的投资都在增加
175:34
related and enables this where it's like once you get to the point where you can have this sort
相关的,并且能够实现这样的场景:一旦你到了能够进行这种共享的阶段,或者在全球范围内共享数据集,这方面已经有一些工作,比如RTX,我记得是几年前有人尝试过。但我认为一旦有了这个生态系统,情况会变得非常不同。而ChatGPT之后的这波热潮,正在把更多资源投入其中,我觉得这是一个非常好的研究领域。这也促使人们构建更好、更精确、更逼真的模拟器,从而缩小机器人领域与现实之间的差距。不过,你提到了机器人领域有很多兴奋点和大量投资,但随之而来的负面影响——这在炒作周期中经常发生——我个人认为,大多数做机器人的人……
175:38
of ecosystem where somebody can download a robotics model and maybe fine tune it to their robot
一个生态系统,让用户可以下载一个机器人模型,然后针对自己的机器人做 fine tune,或者在全球范围内共享数据集。这方面已经有一些工作,比如几年前的 RTX,大家就在尝试做这件事。但我认为一旦这个生态系统建立起来,情况会非常不同。而 ChatGPT 之后的这波热潮,正在把更多资源投入其中,我觉得这是一个非常好的研究方向。这也推动了更逼真、更精确的模拟器的构建,缩小了机器人领域里 sim-to-real 的差距。不过,你提到机器人领域有很多兴奋点和大量投资,但 hype cycle 也有不好的一面——我个人认为,大多数做机器人的人……
175:43
or share data sets across the world and there's some data there's some work in this area like RTX
或者说在全球范围内共享数据集,这方面已经有一些工作,比如RTX
175:49
I think is a few years ago where people are trying to do that but I think once they have this ecosystem
大概是几年前,有人就在尝试做这件事,但我认为一旦有了这个生态系统
175:53
it'll look very different and then this whole post-chat GBT boom is putting more resources into that
情况会变得非常不同,而且这波ChatGPT之后的爆发,正在把更多资源投入进去
176:00
which I think is a very good area for doing research this is also resulting in much better
我觉得这是一个非常好的研究领域,这也催生了更优质、更精准、更逼真的simulator被开发出来,缩小了机器人领域里sim-to-real的差距
176:05
more accurate more realistic simulators being built closing this into real gap in the robotic space
不过你也提到了,机器人领域现在确实有很多兴奋点和大量投资
176:11
but you know you mentioned a lot of excitement in the robotics space and a lot of investment
不过,你提到了机器人领域有很多兴奋点和大量投资,
176:16
the downside of that which happens in hype cycles I personally believe most robotics people
在炒作周期里,这种情况的坏处是——我个人觉得,大多数搞机器人的人冒出来,但拿不出能用的产品,然后就会有一波兴奋感的崩塌,这挺让人揪心的。希望会有别的东西接上,不断补位,这样这些想法才能继续发展下去。这也跟持续学习的问题有关,本质上现实世界太复杂了。LLM 的话,你其实不需要让系统为用户去学习,因为有很多事情是每个人都得做的,比如每个人都可能想改改邮件里的语法。但我觉得每个人的家都不一样,你知道,差别太大了,而这正是关键所在。
176:22
believe that the it's not robotics is not going to be solved at the time scale as being kind of
我认为机器人技术不会在人们明示或暗示承诺的时间尺度内得到解决。那么当大量机器人公司涌现,却拿不出能用的产品时,就会发生一波兴奋感的崩溃,这让人很紧张。希望届时会有别的东西接棒,持续推动这些想法的发展。这也与持续学习的问题本质相关——现实世界太复杂了。而有了LLM,你其实不需要让系统为用户学习,因为有很多事情是每个人都必须做的,比如每个人都可能想修正自己邮件里的语法错误。
176:30
implicitly or explicitly promised and so what happens when there's all these robotics companies
无论是明示还是暗示的承诺,所以当出现一大堆机器人公司,它们的产品却无法正常运作时,就会引发一波兴奋感的崩塌,这让人很紧张。希望会有别的东西及时出现,持续接棒,让这些想法中的一部分能继续发展下去。这也跟持续学习的问题有关——现实世界实在太复杂了。对于LLM来说,你其实不需要让系统为用户学习,因为有很多事情是每个人都必须做的,比如每个人都可能想修正邮件里的语法。但我觉得每个人的家都不一样,你知道的,差异太大了,而这正是关键所在。
176:36
that spring up and then they don't have a product that works and there's going to be this kind of
但很多项目冒出来之后,并没有做出能用的产品,而且接下来还会出现这种
176:43
crash of excitement which is nerve-racking there's hopefully something else will come in and
那种兴奋到崩溃的感觉确实让人紧张,但希望总会有别的东西冒出来,持续接棒,让这些想法的后续发展能继续推进下去。
176:48
keep swooping in so that the the the the continued development of some of these ideas keeps going.
可能很少有人意识到——无论是做机器人的人还是其他人——几乎没人真正讨论安全性的重要性。我们聊的那些关于学习的有趣复杂性,在LLM领域、机器人领域、在人们家里,跨越数百万分钟、数十亿次交互中,这些都像游戏一样好玩。但当你真正面对一个被设计和优化来重复执行人类能做的任务的东西时,你几乎是被允许失败的——去解决那些你从未想过要解决的、数不清的问题。
176:53
It's also related to the continual learning issue essentially where the real world is so complex
这也跟持续学习的问题本质相关,现实世界实在太复杂了。
177:00
with LLMs yeah you don't need to really have something learn for the user because there are a lot
对于LLMs来说,其实不需要让系统为每个用户单独学习,因为有很多事情是每个人都必须做的——比如每个人都可能想修正邮件里的语法。
177:06
of things everyone has to do everyone maybe wants to fix their grammar in their email or
但我觉得每个人的家都不一样,对吧?差别太大了。而我认为,这正是那个几乎没人讨论的东西的重要性所在——无论是机器人领域还是其他领域,都没人怎么提过——那就是安全。
177:13
code or something like that it's it's more constrained so you can kind of prepare the model for that
代码或者类似的东西,它更受约束,所以你可以为模型做一定的准备。
177:17
but preparing the robot for the real world that's harder I mean you have the foundation models the
但让机器人为真实世界做准备就更难了,我的意思是,你有基础模型、机器人基础模型,你可以学习某些东西比如抓取物体,但话说回来,我觉得每个人的家都不一样,你知道,差别太大了。而这正是我认为世界本质上需要在实际工作中学习的地方。我觉得这大概就是现在的瓶颈——如何实时进行定制化。
177:22
robotic foundation models but you can learn certain things like grasping things but then again
我确实觉得,我可能无法完全理解那个几乎没人讨论的事情的重要性——无论是机器人领域的人还是其他人——那就是安全性。所有那些我们讨论的有趣复杂性,比如学习……
177:26
I think everyone's house is different you know like it's so different and that is I think where
我们聊到的所有那些有趣的复杂性、各种花式学习方法,在LLMs领域、在机器人领域、在人们家里,跨越数百万分钟、数十亿次交互的过程中,这些确实都很好玩。但在真实场景里,你几乎是不被允许失败的。
177:32
the world would have to learn on the job essentially and I think that I guess is the the bottleneck
世界基本上得在工作中边干边学,我觉得这大概就是目前的瓶颈——比如如何实时地定制它。我确实不认为我能完全理解那个几乎没人讨论过的事情的重要性,无论是机器人领域的人还是其他人,那就是安全。我们聊到的所有那些有趣的学习复杂性、各种新奇的学习方式,在LLM领域、机器人领域里都是好玩的东西。但在人们家中,经过数百万分钟、数十亿次交互,你几乎是不被允许失败的。当你有具身系统被部署到现实世界中时,你必须解决无数你之前只靠想象时从未想过要解决的问题。
177:38
right now like how to you know customizing it on the fly essentially I do I don't think I can
现在的问题就是,如何实时地定制它。我觉得我可能根本无法理解那个几乎没人讨论过的重要性——无论是机器人领域的人还是其他人,那就是安全。我们聊到的所有那些有趣的复杂性,比如各种学习方式,在LLM领域、机器人领域,以及人们家中数百万分钟、数十亿次交互的场景里,这些确实都很有趣。但当你真正把具身系统放到现实世界中时,你几乎不允许失败。你不得不解决无数你从未想过要解决的问题——当你只是思考一个被设计和优化来执行人类可重复任务的系统时,这些问题根本不会出现。
177:44
possibly understand the importance of the thing that doesn't get talked about almost at all
可能理解一个几乎没人讨论的事情的重要性——
177:50
by robotics folks or anyone is safety all the interesting complexities we talk about learning all
无论是机器人领域的人还是其他人——那就是安全性。所有我们讨论的那些有趣的复杂性,比如学习,全部——
177:56
the failure modes and failure cases everything will be talked about LLMs sometimes it fails
失败模式和失败案例都会被讨论到,LLMs 有时候会以有趣的方式出错,这在 LLMs 领域算是小打小闹。但在机器人领域,当它们进入人们家中,经历数百万分钟、数十亿次交互时,你几乎完全不允许失败。当实体系统被部署到现实世界中时,你必须解决无数你原本在思考通用机器人学习问题时从未想过要解决的问题。因此,我对面向消费者购买的家用学习型机器人持悲观态度,但我非常看好自动驾驶汽车,也非常看好机器人自动化,比如亚马逊的物流配送——亚马逊已经建造了全新的、专为机器人设计的配送中心。
178:00
in interesting ways all of that is fun and games in the LLMs space in the robotic space in people's
在LLM领域里,这些有趣的东西都像是游戏和娱乐,但在机器人领域,在人们家中,跨越数百万分钟、数十亿次交互时,你几乎真的被允许失败。在软件编写中,人类参与的比例相对于所写的代码量只会越来越少,对吧?而那个SC超人类代码,我认为其中的假设是,人类参与的数量会降到零。当人类参与的数量降到零时,那个世界会是什么样子?你知道,对于网页、HTML这类东西,它非常能容忍“垃圾内容”。没错,它展示垃圾内容的能力和展示好东西一样强。我更愿意想想那些安全关键系统,比如汽车这类东西。所以,端到端地为你生成内容,我认为这是一个更中间的状态。
178:07
homes across millions of minutes billions of interactions you really are almost allowed to fail
你几乎被允许失败、写得正确,然后那个SC superhuman code
178:17
never when you have embodied systems that are put out there in the real world you just have
一旦你把具身系统放到现实世界中,你就不得不解决很多你之前只考虑设计优化重复性任务时根本没想到过的问题,而且这些任务人类能做得更久,可能比人们预测的还要久。我觉得从AI singularity到我们现在能因为拥有巨大的AI优势而在美国大规模扩展制造业,这个跳跃跟AGI或ASI的具体时间线有关。那么,作为起点,说没有人——我最近一直受到反驳,很多人都在说类似的话——即一个能完成大多数数字经济工作的东西,比如远程工作者那种,这样讲公平吗?
178:24
to solve so many problems you never thought you'd have to solve when you're just thinking about
解决这么多你从未想过要解决的问题,当你只是在思考那种被设计和优化用来执行重复性任务的东西时,人类本来也能做。
178:30
the general robot learning problem and so bearish on in-home learned robots for consumer purchase
通用机器人学习问题,所以我对消费者购买家用学习型机器人持看空态度。
178:38
I'm very bullish on self-driving cars and I'm very bullish for robotic automation EG like Amazon
我非常看好自动驾驶汽车,也非常看好机器人自动化,比如亚马逊的仓储系统——亚马逊已经建造了全新的、专为机器人设计的配送中心,用于大规模制造。
178:43
distribution where Amazon has built whole new distribution centers designed for robots for
我确实认为,机器人实现这一目标的路径更合理:它是一个被设计和优化来执行重复性任务的设备,这些任务人类理论上能做但不想做。
178:48
Australian humans there's a lot of excitement in AI circles about AI enabling a automation and
澳大利亚的朋友们,AI圈子里现在对AI推动自动化和大规模制造这件事特别兴奋。我觉得机器人走这条路更合理——就是设计并优化一个东西,专门做那些人类能做但不想做的重复性任务。不过,这肯定比大家预测的要慢得多。从AI奇点直接跳到“因为AI优势巨大,我们就能在美国大规模扩产”,这个想法其实被很多政治和其他棘手问题拖住了。咱们具体聊聊时间线吧——特别是AGI或ASI的时间线。这么说公平吗:作为起点,没人能真正确定?
178:54
like mass scale manufacturing and I do think that the path to robots doing that is more reasonable
但这也需要比人们可能预测的更长的时间。我认为,从AI奇点到“我们现在能因为巨大的AI优势在美国大规模扩产制造”这一跳跃,是……
179:00
where it's like a thing that is designed and optimized to do a repetitive task that a human could
在美国大规模制造,因为我们拥有巨大的AI优势,这是一个特别指向AGI或ASI时间线的问题。公平地说,作为起点,是否可以说没有人——
179:05
conceivably do but doesn't want to and then I'm but but so but it's also going to take a lot
理论上能做到但不想做,而且……但……但……所以这也会比人们预测的要花更长时间。我认为从AI singularity到“因为我们在AI上有巨大优势,所以能大规模提升美国制造业”这个跳跃,具体来说就是通往AGI或ASI的时间线。那么,作为起点,这样说是否公平:我最近一直收到反驳,很多人都在说类似的话——比如“一个能替代大部分数字经济工作的东西”,远程工作者就是个挺合理的例子。我觉得OpenAI的定义也与此相关,就是“一个能完成大量具有经济价值任务的AI”。
179:11
longer than people probably predict I think the the leap from AI singularity to we can now scale
比大多数人预测的还要长。我认为,从AI奇点到我们能够在美国大规模扩展制造业——因为我们拥有巨大的AI优势——这个跨越,具体来说是与AGI或ASI的时间线相关的。那么,作为起点,这样说是否公平:我最近一直受到一些反驳,很多人都在说类似的话,比如“一个能完成大部分数字经济工作的东西”,就像远程工作者那样,一个能完成一定数量经济价值任务的AI——我指的不是AI研究员——然后是完全的ASI(人工超级智能)。但一旦你开发出超级人类编码员,其他一切都会迅速跟上。这里的任务是拥有一个完全自主的……
179:19
up mass manufacturing in the US because we have a massive AI advantage is one that is
我最近一直受到反驳,很多人都在说同样的话,那就是:
179:25
troubled by a lot of political and other challenging problems let's talk about timelines
受困于一大堆政治和其他棘手问题,我们来聊聊时间线吧。具体来说,就是通往AGI或ASI的时间线。作为起点,说“没人知道”算公平吗?我最近一直被反驳,很多人都在说类似的话,比如:一个能替代大部分数字经济工作的东西——远程工作者就是个挺合理的例子。我觉得OpenAI的定义跟这个有点沾边,就是那种能做大量经济上有价值任务的AI。我个人不太喜欢这个定义,但我觉得它可以作为一个基准点,因为现在的语言模型虽然极其强大,但还做不到直接替代远程工作者,而且你也能想到一些例子。
179:32
specifically timelines to AGI or ASI is it fair like as a starting point to say that nobody
一个能够复制大多数数字经济活动的东西,比如远程工作者,基本上就是——
179:42
really agrees on the definitions of AGI and ASI I kind of think there's a lot of disagreement but
关于AGI和ASI的定义,其实大家并没有真正达成一致,我觉得分歧还挺大的。不过,我最近收到了一些反驳意见,很多人其实都在说类似的话,比如:一个能完成大部分数字化经济工作的东西——远程工作者就是个挺合理的例子。我觉得OpenAI的定义跟这个有点关系,就是说一个AI能做很多有一定经济价值的任务。我个人不太喜欢这个定义,但我觉得它可以作为一个讨论的起点,因为现在的语言模型虽然非常强大,但还远不能直接替代远程工作者。而且,有些你想象中AI能做的事,其实比它实际能做的要难得多,比如解决某个问题。
179:48
among I've been getting pushed back where a lot of people kind of say the same thing which is like
一个能完成大量特定经济价值任务的AI,而我不——
179:53
a thing that could reproduce most digital economic work so like the remote remote workers are fairly
AI研究员,然后是完整的ASI(人工超级智能),但在你开发出它之后——
180:00
reasonable example and I think open AI's definition is somewhat related to that which is like
一个很合理的例子,我觉得OpenAI的定义跟这个有点关系,就是说一个AI能做很多有一定经济价值的任务。我不太确定。AI研究员,然后是完整的ASI,也就是人工超级智能,但一旦你开发出超人类程序员,其他一切都会很快跟上。他们的目标是实现完全自主的自动化编程,也就是说,为了进行研究所需的任何编程工作都完全自动化。从那里开始,人类会跟这个系统一起做AI研究,然后很快就能开发出一个真正能替你完成研究的系统,这就是他们的想法。然后还有一些关于这个过程会如何展开的假设和动态,但我觉得他们做得不错。
180:06
an AI that can do a lot of like a certain number economically valuable tasks which I don't
一个能完成大量、特定数量经济价值任务的AI,我不太确定具体数字。
180:11
really love as a definition but I think it could be a grounding point because language models today
“爱”这个定义确实很妙,但我觉得它可以作为一个锚点。因为现在的语言模型虽然无比强大,但并不是那种能直接替代远程员工的工具——有些事你得想清楚。
180:17
what immensely powerful are not this remote worker drop in and there are things that you can think
有几个里程碑式的系统:超人级的程序员、超人级的AI研究员,然后是超级智能的AI研究员,最后就是完全的ASI(人工超级智能)。但一旦你开发出超人级的程序员,其他一切都会迅速跟上。这个任务就是实现完全自主的自动化编程——也就是说,任何为了做研究而需要的编程工作都能完全自动化。
180:23
of that are could be done by an AI that are way harder than or won't work which are like solving a
有些事AI能做,但难度大得多,或者根本行不通,比如解决一个
180:29
finding and unexpected scientific discovery that you couldn't even posit which would be an
一个你甚至无法设想的、意想不到的科学发现,比如有人说的那种超级人工智能问题,或者像AI读取所有医疗记录,发现某些疾病之间人们未知的关联,或者找出某种常见药物能治疗某种小众癌症——他们会说这属于超级智能的范畴。所以这些其实都是很自然的延伸,但问题在于,它和AI的意义追寻以及其中的宗教层面深深纠缠在一起。因此,你可以选择不同的路径,我甚至不确定“远程工作”是否是个好定义,因为那到底是什么?它更像是一个完美的使用场景。
180:33
example of something that somebody says it's like an artificial super intelligence problem or like
别人口中所谓的“超级人工智能”问题,或者
180:39
saw taking in all medical records and finding linkages across certain illnesses that people
把所有的医疗记录整合起来,找出某些疾病之间人们未曾发现的关联,
180:46
didn't know or figuring out that some common drug can treat some niche cancer like they would say
又或者发现某种常见药物能治疗某种罕见癌症——他们会说
180:50
that that is like a super intelligence thing so these are kind of natural tears by problem with it is
这属于超级智能的范畴。所以这些其实都是很自然的难题,但问题在于
180:56
that it becomes deeply entwined with like the quest for meaning of AI and this religious
它和AI的意义追寻以及宗教层面的东西深深纠缠在一起。
181:01
aspects to it so there's kind of different there's different paths you can take it and I don't
所以其实有几种不同的路径可以选择,我甚至
181:06
even know if the remote work is a good definition because what exactly is that it's like perfect to use
不确定“远程工作”是不是个好定义,因为那到底是什么呢?它简直太适合拿来用了。
181:13
I actually I mean I like I don't know if you like the originally titled AI 27 report they focus
其实吧,我挺喜欢那个最初叫AI 27的报告,它更侧重于代码和研究能力。它的目标是打造一个超级人类级别的程序员,所以有几个里程碑系统:超级人类程序员、超级人类AI研究员、超级智能AI研究员,最后是完整的ASI(人工超级智能)。但一旦你开发出超级人类程序员,其他一切都会很快跟上。任务就是实现完全自主的自动化编码——也就是说,任何为了进行研究所需的编码工作都能完全自动化。从那里开始,人类会与这个系统一起进行AI研究,并且很快就能开发出一个真正能替你完成研究的系统。这就是他们的想法。
181:20
more on code and research tastes so the the target there is the super human coder so they have
继续聊代码和研究偏好,他们的目标是打造超级人类程序员。他们有几个里程碑式的系统:超级人类程序员、超级人类AI研究员、然后是超级智能AI研究员,最后是完整的ASI(人工超级智能)。但一旦你开发出超级人类程序员,其他一切都会很快实现。他们的任务是实现完全自主的代码自动化——也就是说,任何为了进行研究所需的编码工作都能完全自动化。从那时起,人类将和这个系统一起进行AI研究,并且很快就能开发出一个真正能替你完成研究的系统。这就是他们的想法。然后到2031年,平均预测——可能我的预测是2031年,但至少你能达到。
181:26
several several milestone systems super human coder super human AI researcher then super intelligent
从那里开始,人类会与那个系统一起做AI研究,并且很快就能开发出一个真正能替你完成研究的系统——这就是那个构想。
181:33
AI researcher and then the full ASI artificial super intelligence but the after you develop the
AI研究员,然后是完整的ASI,即人工超级智能,但在你开发出它之后。
181:40
super human coder everything else falls quickly there the task is to have a fully autonomous like
超级人类级别的程序员出现后,其他一切都会迅速跟上。任务就是实现一种完全自主的协作——人类在帮助模型完成它做不到的事情,而最好的AI也在发挥作用。我觉得像Cloud Code这种工具,用来搭建网站的话,你几个小时就能搞出一个漂亮的站点,或者顺便学点新代码技能,过程中自然就会掌握。这跟之前提到的观点有关——我认为研究是混乱的、社交性的,很大程度上依赖于数据,而这些是AI模型无法处理的。但我们今天拥有的东西确实非常强大,这些科技公司都领先十年以上——在软件方面我可能会说短一些,但在研究这类事情上,我觉得会更久。不如我们纯粹为了好玩,想象一个所有软件都...
181:49
automate coding so any kind of coding need to do in order to perform research is fully automated
自动化编码,让任何为了进行研究所需的编码工作完全自动化
181:58
and from there humans would be doing AI research together with that system and they will quickly be
然后人类会与那个系统一起进行AI研究,并且很快就能
182:03
able to develop a system that's actually can do the research for you that's the idea and then
开发出一个真正能替你完成研究的系统——这就是他们的想法,以及
182:10
initially their prediction was 20 27 28 and now they've pushed it back by three to four years to
最初他们的预测是2027、2028年,现在又往后推了三到四年,到了2031年。平均预测大概是2031年,我的预测可能也是2031年,但至少你能有个具体的方式来思考完全自动化编程到底有多难。我不同意他们的一些假设和关于事情会如何发展的动态分析,但我觉得他们在设定里程碑场景方面做得不错——这些里程碑很具体,能讲出一个有用的故事。这也是为什么《AI 2027》这份文档的影响力远远超出了硅谷,因为他们讲了一个好故事,并且为此做了大量严谨的工作。我觉得我属于那种认为AI是所谓“锯齿状”的阵营——它在某些事情上会非常出色,但在另一些事情上又非常糟糕。
182:17
to 2031 mean prediction probably my prediction is you would be on 2031 but at least you can get
到2031年的预测,我的预测大概是你会到2031年,但至少你能了解一些他们关于事情会如何发展的假设和动态。不过我觉得他们做得不错,在定义里程碑的场景设定上做得很好,很具体,而且能讲出一个有用的故事。这就是为什么AI 2027这份文档的影响力远远超出了硅谷,因为他们讲了一个好故事,并且为此做了大量严谨的工作。我觉得我属于的那个阵营是,AI是所谓的“锯齿状”的,在某些事情上会非常出色,而在另一些事情上则非常糟糕。擅长的是传统ML系统在前端模型上表现很好,但分布式ML模型实际上做得相当差,因为这方面的训练数据太少了。
182:25
concrete way think about how difficult it is to fully automate programming yeah I disagree with
一个很具体的思考方式,就是看完全自动化编程到底有多难。嗯,我不同意他们的一些假设和关于事情会如何发展的动态判断,但我觉得他们在设定里程碑场景方面做得不错——这些里程碑很具体,能讲出一个有用的故事。这也是为什么《AI 2027》这份文档的影响力远远超出了硅谷,就是因为他们讲了一个好故事,而且为此做了大量严谨的工作。我觉得我属于的那个阵营,认为AI是所谓的“锯齿状”——它在某些事情上会非常出色,但在另一些事情上又真的很差。擅长的是传统ML系统在前端方面,模型表现很好;但分布式ML方面,模型其实相当糟糕,因为这方面的训练数据太少了。
182:32
some of their presumptions and dynamics on how it would play out but I think they did a good
他们关于这个过程会如何展开的一些假设和动态,但我觉得他们做得不错
182:38
they did good work in the scenario defining milestones they were concrete and to tell a useful story
他们在定义里程碑的场景方面做得不错,这些里程碑很具体,也能讲出一个有用的故事。
182:43
which is why the reach for this AI 2027 document well transcended Silicon Valley is because they
这就是为什么这份AI 2027文档的影响力远远超出了硅谷——因为他们讲了一个好故事,并且为此做了大量严谨的工作。
182:49
told a good story and they did a lot of rigorous work to do this I think the camp that I'd fall into
我觉得我倾向于的观点是,AI是所谓的“锯齿状”的——它在某些事情上会非常出色,但在另一些事情上却非常糟糕。
182:55
is that like AI is like so-called jagged which will be excellent at some things and really bad at
传统ML系统在前端表现很好,模型在这方面很擅长;但分布式ML模型实际上做得非常差,因为关于“AI研究是如何运作的”这类问题的训练数据太少了。
183:00
something so I think that when they're close to this automated software engineer what it will be
所以我觉得,当它们接近这个自动化软件工程师的水平时,它真正擅长的会是传统ML系统在前端方面的东西——模型在这方面表现很好,但分布式ML模型实际上做得非常差,因为关于大规模分布式学习这类任务的训练数据太少了。这其实是我们已经能看到的现象,而且我觉得这种情况只会被放大,然后这些权衡取舍会变得更混乱。接着还有像AI研究到底怎么运作这类问题。所以你基本上认为超人级别的程序员几乎是无法实现的?我的意思是,因为这种能力分布本身就不平滑,你总是会存在能力上的缺口。我觉得这就像是在给模型赋予某种“完备性”,而模型本身并不具备这种属性。
183:06
good at is that traditional ML systems in front end the model is excellent at but the distributed ML
所以,基本上,超级人类程序员几乎是无法实现的——因为这种锯齿状的本质,你总是会碰到短板。
183:12
the models are actually really quite bad at because they're so little training data on doing
这些模型其实真的很不擅长,因为用于训练的数据太少,比如
183:15
large scale distributed learning and things and this is something that we already see and I think
大规模分布式学习之类的,这其实我们已经看到了,而且我觉得这只会被进一步放大,然后这些权衡取舍会变得更复杂。接着还有像“AI研究到底怎么运作”这类问题。所以你觉得,基本上超人类程序员几乎是无法实现的?意思是,因为这东西本身具有不规则的特性,你总是会存在能力上的缺口。我认为这是把“完备性”强加给了某个东西,而模型本身是有创造力的,所以它们会利用这些惊人的能力来填补模型的弱点,并且行动非常迅速。长期以来我一直觉得,这始终会是一种人类在弥补模型做不到的事情,而最好的AI……
183:19
this is just get amplified and then it's kind of messier in these trade-offs and then there's
这只会被放大,然后在这些权衡中变得更混乱,接着就是像“你觉得AI研究是怎么运作的”这类问题。所以你基本上认为“超人类程序员”几乎无法实现,意思是,因为这东西的锯齿状特性,你总是会有能力上的缺口。我觉得这是把“完备性”强加给某个东西,而模型是有创造力的,所以它们会利用这些不可思议的能力来填补模型的弱点,并且行动非常迅速。长期以来我一直收到这种反馈:人类和模型之间始终存在这种舞蹈——人类在促成模型做不到的事情。而最好的AI,比如Claude Code,用来建网站的话,你几个小时就能搭出一个漂亮的网站。
183:24
like how do you think AI research works and so on so you think basically superhuman coder is
“你觉得AI研究是怎么运作的”这类问题,所以你认为基本上超人级的编码能力
183:30
almost unachievable meaning like because of the jagged nature of the thing you're just always
几乎是无法实现的,意思是,因为这件事本身具有不规则的特性,你总是需要
183:35
going to have gaps in capabilities I think it's assigning completeness to something where the models
能力上会有缺口,我觉得这是在给模型赋予一种“完备性”,但实际上它们并不完备。人类会利用这些不可思议的能力来填补模型的弱点,并且行动非常迅速。长期以来我一直感受到这种互动:人类在完成模型做不到的事情,而最好的AI——比如用Cloud Code搭建网站,你可以在几小时内建出一个漂亮的网站,或者顺便学到一些新的编程技能——这又联系到另一个观点:我认为研究是混乱的、社会性的,很大程度上依赖于数据,而这些是AI模型无法处理的。但我们今天拥有的技术确实非常强大,这些科技公司都在全力投入。
183:41
are kind of superhuman at some types of code and I think that will continue and people are
在某些类型的代码上已经超越了人类,我认为这种趋势会持续下去,而人类很有创造力,会利用这些不可思议的能力来弥补模型的短板,并且行动非常迅速。长期以来我一直看到这种互动:人类在做模型做不到的事情,而最优秀的AI研究者则能赋予模型这种超能力。我认为这和我们已有的观察是一致的——比如用Claude Code建网站,你几个小时就能搭出一个漂亮的网站,或者做数据分析。而且我认为它在这些方面会不断进步,还会沿途掌握一些新的编程技能,这正好呼应了刚才提到的观点。
183:46
creative so they'll utilize this like incredible abilities and like to fill in the weaknesses of
创造力,所以他们会利用这种不可思议的能力来弥补弱点
183:51
the models and move really fast they'll always kind of be this I've received for a long time this
模型迭代速度极快,我一直觉得,人类与模型之间这种“人类在补足模型做不到的事”的共舞,会长期存在。最好的AI,比如用Cloud Code建网站,你几小时就能搭出一个漂亮的站点,顺便还能学到一些新的代码技巧。这又联系到另一个问题:我认为研究本身是混乱的、社会化的,很大程度上依赖于数据,而这些是AI模型目前无法处理的。但我们今天拥有的技术确实非常强大,这些科技公司——在软件层面,我认为用不了十年,可能更短;但在研究这类事情上,我觉得需要更长时间。不如我们纯粹为了好玩,想象一个所有软件都……的世界。
183:56
dance between the humans are enabling this thing that the model can't do and the best the best AI
人类与模型之间的互动,是在促成模型无法完成的事情,而最好的AI……
184:01
researchers once I can enable this superpower and I think this aligns like to what we already see
研究人员一旦能赋予这种超能力,我觉得这跟我们目前看到的趋势是一致的。比如像 Cloud Code 这种工具,你搭个漂亮网站几小时就能搞定,或者做数据分析。而且我认为它不会止步于此,它会不断进步,还会在这个过程中学会一些新的编程技能。这又联系到另一个问题——我觉得研究本身是混乱的、社交性的,很大程度上依赖于数据,而这些是 AI 模型无法处理的。但我们今天拥有的东西确实很强大,这些科技公司都在集体投入,动辄几百亿美元的投资。所以我们肯定会看到一个比 ChatGPT 更广泛的版本,一个比 Cloud Code 好得多的版本。
184:06
I think like cloud code for building a website you can stand up a beautiful website in a few hours or
我觉得像Cloud Code这种建站工具,你花几小时就能搭出一个漂亮的网站。
184:11
do data analysis and I don't think it's going to keep getting better at these things and it'll pick
做数据分析,我不觉得它会在这些方面持续变强,它可能会顺带学会一些新的代码技能之类的,这跟我想说的有关——我认为研究是混乱的、社会性的,而且在很大程度上依赖于数据,这些是AI模型无法处理的。但我们今天拥有的东西确实很强大,这些科技公司都在集体投入,砸了几百亿美元,所以我们肯定会得到一个比ChatGPT更广泛的版本,一个比Cloud Code好得多的版本。正是这种未来的清晰图景,让世界上一些最有权势的人投入这么多钱。我觉得这跟我们之间的分歧其实很小。
184:14
up some new code skills and stuff that it'll get along the way and kind of linking to what's
顺便学点新代码技能,过程中自然就会了,这跟之前提到的有点关联。
184:21
happening in in big tech is like this AI 2027 report is like it leans into the singularity idea
现在大科技公司里发生的事,就像那份AI 2027报告说的,它倾向于奇点理论。但我觉得研究本身是混乱的、社会性的,而且很大程度上依赖于数据,这些是AI模型无法处理的。不过,我们今天拥有的东西确实很强大,这些科技公司都在集体投入,砸了几百亿美元。所以,我们肯定会得到一个比现在更广泛的ChatGPT版本,一个比现有Cloud Code好得多的版本。我只是觉得,很难预测这到底会走向哪里,但那种未来清晰的光明前景,正是为什么世界上一些最有权势的人愿意投入这么多钱。而我认为,我们和那个未来之间,其实只是些微小的差距。
184:28
where I think research is messy and social and largely in the data in ways that AI models can't
我认为研究是混乱的、社交性的,很大程度上依赖于数据,而这些是AI模型无法处理的。
184:34
process but like what we do have today is really powerful and these tech companies are all
但我们今天拥有的东西确实很强大,这些科技公司都……
184:39
collectively buying into this with tens of billions of dollars of investment so like we are
集体投入数千亿美元的投资,所以我们将会得到一个更广泛版本的ChatGPT,一个比Claude Code好得多的版本。
184:44
going to get some much broader version of chat GPT a much better version of cloud code than we
对那个未来的清晰认知,正是世界上一些最有权势的人投入如此多资金的原因。
184:49
already have I think that it's just like hard to predict where that is going but the like
我觉得吧,这事儿真的很难预测会走向哪里,但正是那种未来的清晰图景,才让世界上一些最有权势的人往里面砸这么多钱。我觉得这其实只是些微小的差别——比如我们不会说,至少在这个时间框架内,big tech 会花一千亿美元,速度比我们得到一个能实现 AI research singularity 的自动化 AI researcher 快得多。所以你觉得你的预测会是什么?如果这算是个有用的里程碑的话,十年以上吧。软件方面我会说更短,但在像 research 这类事情上,我觉得会更长。咱们就随便想想,试着想象一个所有软件都……的世界吧。
184:55
bright clarity of that future is why some of the most powerful people in the world are putting
而我认为,我们之间的分歧其实很小,无非是我们更快地花掉数十亿美元,还是更快地得到一个能实现AI研究奇点的自动化AI研究员。
184:59
so much money into this and I think it's just kind of small differences between like we don't
所以你觉得你的预测会是什么?比如,如果这算是一个有用的里程碑,
185:05
actually know what a better version of chat GPT is but also like can it automate AI research I
其实你知道ChatGPT的更好版本是什么,但它能不能自动化AI研究呢?我觉得可能不行,至少在这个时间框架内不行。像大科技公司会更快地投入一千亿美元,而不是我们得到一个能实现AI研究奇点的自动化AI研究员。所以你觉得你的预测是什么?如果这算是一个有用的里程碑的话,十年以上?我觉得软件方面会少于十年,但在研究这类事情上会更长。不如我们随便想象一下,一个所有软件编写都完全自动化的世界。你能想象吗?到今年年底,被自动化的软件数量会非常高,但那些事情就像——你懂的。
185:10
would say probably not at least in this time frame like big tech is going to spend a hundred
大概不会,至少在这个时间框架内不会。大型科技公司花一千亿美元的速度,会比我们搞出一个能实现AI研究奇点的自动化AI研究员快得多。所以你觉得你的预测是什么?如果这算是个有用的里程碑的话,软件方面我觉得不到10年,但研究这类事情我觉得会更久。不如我们随便想象一下,一个所有软件都被自动化的世界会是什么样——那会非常厉害,但像人与人之间的那些事还是会很难。不过我觉得会容易很多。一个思考这个问题的角度就是,编程的完全自动化,可以想象成是写出的有用代码的行数。
185:16
billion dollars much faster than we get a automated AI researcher that enables AI research singularity.
超过十年的话,我会说软件方面更短,但在研究这类事情上我认为会更长。
185:22
So you think your prediction would be what like if this is even a useful milestone
那就纯粹为了好玩,试着想象一个所有软件都……的世界吧。
185:28
more than 10 years out I would say less than that on the software side but I think longer than that
在软件方面,我觉得不到十年,但在其他方面,我认为会更久。
185:34
on the things like research let's just like for fun try to imagine a world where all software
在研究这类事情时,比如纯粹为了好玩,试着想象一个世界:所有软件里,人类参与写代码的环节会越来越少,相对于代码总量而言。而那种超人类代码,我觉得默认假设是,人类参与的数量会降到零。那这个世界会是什么样?当人类参与的数量降到零,你知道,网页、HTML 这类东西,对“垃圾内容”其实挺有抵抗力的。没错,它会把垃圾内容展示得很好。我更愿意想想安全关键系统,比如汽车这类东西,端到端地直接生成给你。我觉得更中间态的情况是,比如我想加一个功能,把标签页从顶部移到左侧。
185:42
writing is fully automated like can you imagine that world by the end of this year the amount of
写作完全自动化了,你能想象那个世界吗?到今年年底,被自动化的软件数量会高得惊人,但像那种人与人之间的互动还是会很难,不过我觉得会容易很多。思考这个问题的一个方式是:编程的完全自动化,就是想想写出的有用代码行数,与参与其中的人类数量之比。所以很可能在很长一段时间里,软件编写中仍然会有人的参与,只是相对于写出的代码量,人会越来越少,对吧?而那种超人类代码,我认为其中的假设是,参与的人类数量会趋近于零。当人类数量变成零时,那个世界会是什么样子?
185:48
software that will be automated will be so high but it's like it'll be the things of like you're
会被自动化的软件数量会非常高,但就像那种人与人之间的互动,依然会很难。不过我觉得会容易很多。一种思考方式是:编程的完全自动化,可以想象成有用代码的行数。在软件编写过程中,人类参与的环节会越来越少,相对于被写出的代码总量而言。而那种超人类代码,我认为其中的假设是,人类参与的数量会趋近于零。那么当人类参与的数量变成零时,那个世界会是什么样子?像网页、HTML这类东西,对“垃圾内容”的抵抗力很强。没错,它确实很擅长展示垃圾内容。我更愿意考虑像安全关键系统这样的领域。
185:52
trying to train a model with RL and you need to have multiple bunches of GPUs communicating
用RL训练模型时,需要多组GPU互相通信,这仍然很难,但我觉得会容易很多。一种思考方式是:把编程完全自动化想象成“每行有用代码”与“参与其中的人类数量”的比值。未来很长一段时间里,软件编写过程中仍然会有人类参与,但相对于代码总量,人类参与的比例会越来越低。而所谓的超人类代码,我猜它的前提是——人类参与的数量趋近于零。当参与的人类数量从几十万降到几百时,那个世界会是什么样子?我觉得软件工程将会……
185:58
with each other that'll still be hard but I think it'll be much easier one of the ways to think
彼此之间仍然会很困难,但我认为会容易得多。一种思考方式是,编程的完全自动化可以想象成有用的代码行数,而软件编写中的人类参与相对于总代码量会越来越少。对吧,而那种超人类代码——我认为这里的假设是,人类参与的数量会趋近于零。当人类参与数量归零时,那个世界会是什么样子?对于网页、HTML这类东西,它非常能容忍“垃圾输入”。是的,它会向你展示“垃圾输入”有多擅长展示垃圾。我更愿意考虑像安全关键系统,比如汽车这类东西。所以端到端地为你生成内容。我认为更中间的状态是……
186:02
about this so the full automation of programming is just think of like lines of useful code written
关于这个,编程的完全自动化,其实就是想想那些有用的代码行数。在软件编写过程中,人类参与的比例会越来越少,相对于代码总量来说。而那个超级人类代码,我觉得它的假设是,人类参与的数量会降到零。当人类参与数量降到零时,那个世界会是什么样子?当人类还在用网页、HTML这些东西时,它对那种“垃圾输出”其实挺有抵抗力的。没错,它确实擅长展示垃圾。我更愿意想想那些安全关键系统,比如汽车之类的。所以端到端地生成东西给你。我觉得更中间的状态是,加一个功能,比如我想要标签页,不是放在顶部,而是放在左侧。
186:11
the fraction of that to the number of humans in the loop so presumably there'll be for a long time
其中一部分与人类参与者的数量有关,所以可以预见在很长一段时间内,软件编写中的人类参与者相对于代码总量会越来越少,对吧。而那个“超人类代码”的假设,我认为它趋向于零,也就是人类参与者数量归零。当人类参与者数量归零时,那个世界会是什么样子?对于网页、HTML这类东西,它们对“垃圾内容”的容忍度很高,对吧。垃圾内容在展示垃圾内容方面确实很在行。我更愿意考虑像安全关键系统这类场景,比如让AI端到端地生成管理物流、管理汽车和车队之类的东西。所以是端到端地为你生成内容。我认为这更像是一个中间阶段。
186:17
humans in the loop of software writing is just be fewer and fewer relative to the amount of code
人类在软件编写过程中的参与度,相对于代码总量来说,只会越来越少。而那个“超人类代码”的假设,我认为是认为人类参与度会降到零。那么当人类参与度降到零的世界会是什么样?你知道,像HTML这类网页技术,对“垃圾内容”其实很有抵抗力。是的,它会展示垃圾内容,就像展示垃圾内容一样好。我更愿意考虑像安全关键系统,比如汽车这类东西。所以端到端地为你生成内容。我认为更中间的状态是——这是我试图在2025年推出的东西,因为我觉得AI的力量仍然没有以那种积极的方式整合进来:我是一个人,我拥有一个小型……
186:22
written right and that the the SC superhuman code I think the the presumption there's it goes to
我觉得预设就是人类参与者的数量会归零
186:28
zero the number of humans in the loop what does that world look like when the number of humans
那个世界看起来会是什么样子,当人类参与的数量与网络(你知道HTML之类的东西)一起时
186:34
in the loop is in the hundreds not in the hundreds of thousands I think software engineering will
in the loop 是几百,不是几十万。我觉得软件工程会
186:40
be driven more to system design and goals of outcomes where I do think software is largely going to
更多地转向系统设计和结果目标,我认为软件在很大程度上会——
186:46
be I think this has been happening over the last few weeks where people have gone from a month
我觉得过去几周一直在发生这种情况,一个月前人们还在说“哦,agents 有点垃圾”,这是 Carpety 的名言,
186:52
ago like oh yeah agents are kind of slop which is a famous carpety quote to like the what is
到现在变成了一种有点 meme 化的说法,比如软件的工业化——当任何人都能随手创建软件时,
186:59
a little bit of a meme of like the industrialization of software when anyone can just create software
我确实认为我们更接近那个方向了,而这需要方向感和对系统如何运作的理解,才能从语言模型中提取出最好的东西。
187:03
at their fingerprints like I do think we are closer to that side of things and it takes direction
我觉得很难接受软件开发将发生多大变化、以及有多少人可以在完全不看代码的情况下做事的这个现实。
187:09
and like understanding how the systems work to extract that best from the language models and
我认为有趣的是,
187:14
I think it's hard to like accept the gravity of how much is going to change with software development
我觉得很难真正接受软件开发将发生多大变化
187:19
and how many more people can do things without ever looking I think what's interesting is to
以及有多少人可以在完全不看代码的情况下完成事情。我觉得有意思的是
187:23
think about whether these systems will be independent like completely independent in the sense that
想想这些系统会不会变得完全独立,就是那种意义上的完全独立。
187:28
well I've no doubt that a lot of times will kind of at some point solve coding in a sense like
嗯,我毫不怀疑,很多时候我们最终会在某种程度上解决编程问题,就像计算器解决了计算问题一样。对吧,人类开发出某种工具,你根本不需要再找人来算那个数字,直接输入进去,算法就搞定了。从这个意义上说,我觉得编程大概也会一样。但问题是——
187:33
calculators solve calculating right so at some point humans develop the tool that you know you
所以我觉得会发生的是:你只要说“建那个网站”,它就会做出一个非常好的网站,然后你可能再稍微调整一下。但它会不会完全独立地做事呢?也就是说,是否仍然需要人类去让AI做点什么?比如,还会不会有个人说“建那个网站”?
187:38
never need a human to calculate that number you just type it in and it's on algorithm you you
永远不需要人类去计算那个数字,你直接输入,它就是一个算法,你可以
187:44
can do it in a in that sense and I think that's the same probably for coding but the question is
在那种意义上做到这一点,而且我觉得这对编程来说可能也一样,但问题是
187:50
so I think what will happen is yeah you will just say build that website it will make a very good
所以我认为会发生的是,是的,你只需要说“建那个网站”,它就会做出一个非常好的网站
187:54
website and then you maybe refine it but will it do things independently where so will you be still
然后你可能会去优化它,但它会独立完成事情吗?也就是说,是否仍然
188:01
having humans asking the eye to do something like will there be a person say build that website
需要人类让 AI 去做某件事?比如还会有人会说“建那个网站”吗?
188:08
or will there be either just build the website or something or whatever I think using talking about
或者干脆就建个网站什么的,我觉得用建网站来举例太简单了,就像网站本身的问题和网络的问题,你知道HTML那类东西,它对那种粗糙生成的内容非常包容——没错,它展示粗糙内容的效果和展示好内容一样好。我更愿意考虑像安全关键系统这样的例子,比如让AI端到端地生成管理物流、管理汽车和车队之类的东西。所以端到端地为你生成内容。我觉得一个更中等的例子是像Slack或Microsoft Word这样的东西,我认为如果组织允许,AI可以非常容易地端到端地实现功能,并且在类似的事情上做得相当不错。
188:14
building websites is the too simple it's just like there's the the problem with websites and the problem
建网站这事儿太简单了,问题就在于网站本身和整个网络生态,你知道的,HTML那类东西,它对那种“糊弄式”的内容容忍度很高——它能把垃圾内容展示得跟优质内容一样好。我更想聊聊安全关键系统,比如让AI端到端生成管理物流、管理汽车和车队这类东西的系统。所以是端到端地为你生成内容。我觉得一个更中级的例子是像Slacker或者Microsoft Word这类软件。如果组织允许AI介入,它其实能非常轻松地端到端实现功能,而且做得相当不错。对于你能做到的事情,它确实能做得很好。这其实是个很好的例子——我们离那个目标还有多远?
188:19
with the web you know HTML and all that kind of stuff it's very resilient to just slop yeah it will
它对垃圾内容非常具有弹性,是的,它会
188:26
show you slop is good as showing slop I would rather like think of like safety critical systems like
展示垃圾和展示垃圾没什么区别,我更愿意想想那些安全关键系统,比如汽车之类的东西。所以端到端地为你生成内容,我觉得更中间一点。
188:33
uh asking AI to end to end generate something that manages logistics or manages cars and fleet of
嗯,让AI端到端生成一些东西,比如管理物流、管理汽车和车队之类的,就是完全帮你生成出来。我觉得一个中等水平的开发者,其实很容易就能端到端实现一些功能,而且做得还不错,像那种你能做得挺好的事情。其实有个很好的例子,我们离那一步还有多远?但我觉得,大概在几年之内,很多人会被迫变得更像设计师和产品经理,你会有多个这样的agent,它们可以帮你尝试各种事情,可能花一两天时间实现一个功能,或者尝试修复一个bug。然后你会有这些dashboard,我觉得Slack其实就是一个不错的dashboard。
188:42
cars all that kind of stuff so end to end yeah generate stuff for you I think a more intermediate
我觉得这就是我试图在2025年推出的事情,因为我认为AI的力量还没有完全整合到那种积极的视角里,比如“我是一个人,我有自己的小圈子”。
188:47
example is take something like slacker Microsoft Word I think if the organization to allow it AI
举个例子,像Slacker Microsoft Word这种东西,如果组织允许它接入AI,其实可以很轻松地实现端到端的功能,而且做得相当不错。像这类事情,你很快就能做到。实际上,这正好是一个很好的例子,说明我们离那个目标还有多远。但我觉得,大概在几年之内,很多人会被迫变得更像设计师和产品经理——你手上有多个agent,它们可以帮你尝试各种事情,可能花一两天就能实现一个功能,或者尝试修复一个bug。你会有像dashboard这样的工具,我觉得Slack其实就是一个很好的dashboard,你的agent会跟你沟通,你给它们反馈。但像“我做个网站”这种事情……
188:53
could very easily implement features end to end and do a fairly good job for like things that you
可以非常轻松地端到端地实现功能,并且对于很多事情都能做得相当不错,比如那些你
188:59
want to try you want to add a new like tab and slack that you want to use and I think AI
你想试试,比如在Slack里加个新标签页,然后直接用起来。我觉得AI其实能做得不错,这确实是个很好的例子。那离实现这个还有多远呢?比如今年?呃,我不太清楚,我真的不知道生产环境的代码库到底有多乱。但我估计,大概再过个一两年,很多人会被迫变得更像设计师和产品经理——你手上有好几个这样的agent,它们可以帮你尝试各种事情,可能花一两天就能实现一个功能,或者试着修一个bug。然后你会有一些dashboard,我觉得Slack其实就是一个很好的dashboard,你的agent会跟你沟通,你给它们反馈。但像“我做个网站”这种事……
189:04
will be able to do that pretty well actually has a really great example how far away are we from that
其实能做得挺好的事情。有一个很好的例子,我们离那个目标还有多远?
189:08
like this year see I don't I don't know I don't know I don't know how bad production code
像今年这样,我也不清楚,真的不清楚,生产环境的代码库到底有多糟糕。但我估计,大概就在未来一两年内,很多人会被迫转型成更像设计师和产品经理的角色——你手上有多个agent,它们能帮你尝试各种事情,可能花一两天时间实现一个功能或者尝试修复一个bug。然后你会有一些dashboard,我觉得Slack其实就是一个很好的dashboard,你的agent会跟你沟通,你再给它们反馈。但像那种“我做个网站”之类的事情……我经常跟程序员混在一起,他们有些人整体上偏怀疑态度,就那种感觉,他们觉得事情没那么简单。
189:16
bases are but I think that within like on the order of low years a lot of people are going to be
基础是有的,但我认为在几年之内,很多人会被迫变得更像设计师和产品经理,你会有多个这样的
189:22
pushed to be more of like a designer and product manager where you have multiple of these agents
agent 可以帮你尝试各种事情,它们可能需要一到两天来实现一个功能或者尝试
189:26
that can try things for you and they might take one to two days to implement a feature or attempt
修复一个 bug,然后你会有这些 dashboard,我觉得 Slack 其实就是一个很好的 dashboard,
189:31
to fix a bug and you have these dashboards which I think slack is actually a good dashboard for
从整体氛围上来说就是这样。我只是觉得添加一个功能有很多复杂性,
189:36
your agents will talk to you and you'll then give feedback but things like like I make a website
你的智能体会跟你对话,然后你给出反馈,但像那种“我做个网站”之类的事,整体上从感觉来说,他们就是那样。我只是觉得,要加个功能会非常复杂——比如我想用标签页,但不要放在顶部,而是放在左侧界面。我觉得这还不是明年能实现的事。今年Claude的一次发布中,他们的一个测试是:给Claude一个软件,让它在一个沙盒里从头开始运行,重现这个软件的参数。我其实更喜欢这种思路。所以可能是那些更小、更新的公司有优势,他们不需要背负那些历史包袱和复杂性,因此这个功能就能存在。我觉得这正好说明了关键点。
189:42
it's like you want to make a logo that's passable like I think these like cohesive design things and
就像你想做一个还过得去的logo,我觉得这些设计元素要协调统一,而这种风格对模型来说会非常困难,而且还要决定下一步该加什么。
189:47
this style is going to be very hard for models and deciding on what to add at the next time I just
好吧,我经常跟很多程序员混在一起,其中有些人整体上有点持怀疑态度,就那种气场,他们就是那样。我只是觉得,给复杂系统加功能涉及很多复杂性,比如你看浏览器Chrome,如果我想加个功能,比如不想让标签页在顶部,而是想放在左侧界面,对吧?我觉得这不是明年就能实现的事。今年Claude的一次发布中,他们的一个测试是:我们给它一个软件,然后让Claude运行并尝试复现它。
189:54
okay so I hang out with a lot of programmers and some of them are a little bit on the skeptical
嗯,我经常跟程序员混在一起,有些人天生就带点怀疑态度,整体气质上就是那样。我就觉得,加个功能特别复杂,比如我想要标签页,不是放在顶部,而是放在左边界面。我觉得吧,这不会是明年就能实现的事。今年Claude的一次发布里,有个测试是:我们给它一个软件,让Claude在沙盒里从头运行,去复现这个软件的参数。我其实更喜欢这种从头开始的方式。所以可能那些小一点、新一点的公司反而有优势,他们不需要背负那么多历史包袱和复杂性,因此这个功能就能实现。我觉得这正好说到点子上了。
190:00
side in general that's just vibe wise they're like that I just think there's a lot of complexity
比如如果我想把标签页从顶部移到左侧。
190:07
involved in adding features to complex systems like if you look at the browser chrome if I wanted
参与给复杂系统添加功能时,比如你看Chrome浏览器,如果我想加个功能,比如把标签页从顶部移到左侧界面,我觉得这不会是明年就能实现的事。今年他们的一次发布中,有个测试是:给Claude一段软件代码,让它自己运行并重新创建软件的参数,放在沙盒里从头开始。我其实更喜欢这个思路。所以可能那些更小、更新的公司有优势,他们不需要背负那些历史包袱和复杂性,因此这个功能就能存在。我觉得这正好说到你提的那个点——你聊过的一些人对此持怀疑态度,我认为这并非因为技术本身。
190:14
to add a feature if I wanted to have tabs as opposed to up top I want them on the left side
如果要加一个功能,我希望有标签页,但不是放在顶部,而是放在左侧。
190:21
interface right you I think we're not is not a next year thing one of the clawed releases
对,我觉得这不会是明年才发生的事。今年Claude发布的一个测试就是,我们给它一个软件,让Claude在沙盒里从头开始运行,重现这个软件的参数。我其实更喜欢后面这部分。所以可能那些规模更小、更新的公司反而有优势,他们不需要背负那些臃肿和复杂性,因此这个功能就存在了。我觉得这其实指向了一个问题,可能是个specification不足的问题。编程的时候,你好像就是在假设它能读懂你的心思。我认为spec-driven design真的很重要,你只需要用自然语言去描述你想要什么。我觉得,如果你去跟那些做这个的人聊聊……
190:27
this year one of their tests was we give it a piece of software and leave clawed to run to recreate
今年他们的一项测试是:给模型一个软件,让它自己运行并重新创建软件的参数,放在沙盒里从头开始。我几乎更喜欢后面这部分。所以可能规模较小、较新的公司反而有优势,他们不需要背负那些臃肿和复杂性,因此这个特性就存在了。我觉得这触及了一个关键点——可能是个欠规范的问题。编程就像你默认它应该能读懂你的心思。我认为规范驱动设计非常重要,你只需要用自然语言指定你想要什么。我觉得如果你和Code的人聊,他们都在大量使用这些工具,而Dario也提到Claude的代码中有多少是这么生成的。
190:32
it entirely and it can all already almost rebuild scrap like slack from scratch just given the
它完全可以做到,甚至已经能几乎从零重建像Slack这样的东西——只要给出软件的参数,放在沙盒里就行。我更喜欢“从零开始”这部分。所以可能规模更小、更新的公司反而有优势,它们会说:“我们不需要背负那些历史包袱和复杂性,因此这个功能就能实现。”我觉得这正好说到你提的那个点:你采访的一些人对此持怀疑态度。我认为这不是因为LM做不到XYZ,而是因为人们不希望它用这种方式来做。其中一部分可能是人类这边的技能问题——不幸的是,我们必须对自己诚实——另一部分可能是规格不明确的问题。编程就像……你只是假设事情是这样的。
190:37
parameters of the software and left in a sandbox from the scratch part I like almost better so
软件的参数被放在沙盒里,从零开始的部分我其实更喜欢,所以
190:44
it might be that the smaller newer companies are advantage and they're like we don't have to have
可能是那些比较小的新公司更有优势,它们会觉得我们不需要那些
190:49
the blood and complexity and therefore this feature exists and I think this gets to the point
复杂的血泪史,因此这个功能就存在了,而且我觉得这触及了一个关键点
190:54
that you mentioned that some people up you talk to us skeptical and I think that's not because the
你提到你接触的一些人对此持怀疑态度,我觉得这倒不是人类这边能力不够——说实话我们得对自己诚实——部分原因可能是规格定义不清晰。编程的时候你就像在默认它应该能读懂你的心思。我觉得规范驱动设计真的很重要,你直接用自然语言说明你想要什么就行。我跟实验室的人聊过,他们在训练和生产代码里都在用这些工具,比如Claude的代码就是用Claude自己写的,他们都在大量使用。Dario也提到过Claude的代码有多少是这么生成的——这些人在能力上确实稍微领先一点。
190:59
LM can't do XYZ it's because people don't want it to do it this way some of that could be a
LM 不能做 XYZ,是因为人们不希望它用这种方式去做。其中一部分可能是人类这边的技能问题——不幸的是,我们得对自己诚实;另一部分可能是规格不明确的问题。编程的时候,你就像是在假设它应该能读懂你的心思。我觉得基于规格驱动的设计真的很重要,你只需要用自然语言明确说明你想要什么。我想,如果你跟那些实验室里的人聊,他们在训练和生产代码中都在用这些工具——比如 Claude 的代码就是用 Claude 自己写的,而且他们都在大量使用这些东西。Dario 也提到过,Claude 的代码有多少是这些人凭借他们稍微领先的能力写出来的。
191:05
skill issue on the human side unfortunately we have to be honest with ourselves and some of that
人类这边存在技能问题,不幸的是我们得对自己诚实,其中一部分可能是规格不明确的问题。编程时你就像在假设这东西能读懂你的心思。我认为值得强调的是,spec-driven design(规格驱动设计)真的很重要,你只需要用自然语言明确你想要什么。我觉得如果你跟实验室的人聊,他们在训练和生产代码中都会用到这些工具——比如Claude的代码就是用Claude自己写的,他们广泛使用这些工具。Dario也提到过Claude的代码中有多少是这类工具生成的。这些人在能力上稍微领先一点,而且这些工具确实有用。关于时间线,有没有什么具体、有趣且深刻的实质性内容可以说?
191:10
could be an underspecification issue so programming like you're like you're just assuming this is
这可能是一个规格不明确的问题,编程的时候你就像是在假设它能
191:19
like in relationships and friendships communication type issue you're assuming the LM somehow
就像在人际关系和友谊中那种沟通问题一样,你假设语言模型 somehow 能读懂你的心思。我觉得 spec-driven design 真的很重要,你只需要用自然语言明确说出你想要什么。我猜如果你跟那些实验室的人聊,他们在训练和生产代码里都在用这些方法——比如 Claude 的代码就是用 Claude 自己写的,他们到处都在用这些东西。Dario 还提到 Claude 的代码有多少是……这些人在能力上稍微领先一点,他们在推理上花的钱可能是我们的 10 到 100 倍甚至更多,而我们只是用着每月一两百美元的低级套餐。他们是真的放开手脚去干,我觉得就是这样。
191:24
supposed to read your mind I think it's worth spec driven design is really important like you just
读懂你的心思,我觉得基于规格的设计真的很重要,你只需要
191:29
using natural language specify like what you want I think I was like if you talk to people at
用自然语言描述你想要什么。我想如果你跟code的人聊
191:34
the labs they use these in their training and production code like clawed code is built with clawed
这些实验室在训练和生产代码中都在使用这些技术,比如Claude的代码就是用Claude构建的,他们广泛使用这些东西。Dario谈到Claude的代码中有多少是——这些人能力上稍微领先一点,而且很有用。有没有什么具体、有趣且深刻的观点可以讨论时间线?在真实的科学领域,有些初创公司拥有数亿美元的融资,还有湿实验室,他们让语言模型提出假设,并在现实世界中进行验证。我得说,我认为这还非常早期。他们之所以成功,是因为他们率先进入,或者可能早了八年,但你真的说不准。
191:39
code and they all use these things extensively and Dario talks about how much of clods code
他们都会大量使用这些东西,Dario也提到过claude的代码
191:45
is like these people are slightly ahead in terms of the capabilities they have and they
这些人就能力而言稍微领先一点,他们
191:50
probably spend on inference they could spend 10 to 100 plus X as much as we're spending like we're
他们在推理上的投入,可能是我们目前花费的10倍到100倍以上——我们还在用每月一两百美元的低价套餐,而他们是真的放手去干。而且我觉得,当时Claude Code还没出来,我们也没有真正的推理模型,这就像今天坐在这里,和我们现在能用这些模型做的事情之间的差距。感觉还有很多低垂的果实可以改进,那些失败模式其实挺蠢的——比如Claude试了14次用我没安装的CLI命令,然后我发给你正确的命令去运行它。从建模的角度看,这类问题其实相当容易修复。所以我同意你的看法,我最近也越来越乐观,基本就是你刚才说的那个方向。
191:56
on a lowly a hundred or two hundred dollar a month plan like they truly let it rip and I think that
在那种一个月一两百美元的低价套餐上,他们真的就放手去干了,我觉得那
192:02
that like with the pace of progress that we have it seems like like we're a year ago we didn't have
按照我们现在的进步速度,感觉一年前我们还没有Claude Code,也没有推理模型,而今天坐在这里能做的事情跟那时相比差别巨大。而且这些模型还有很多低 hanging fruit 可以改进,它们的失败模式其实挺蠢的——比如Claude试了14次一个我没装的CLI命令,然后我发给你正确的命令去运行,从建模角度来看这个问题其实挺容易修复的。所以我同意你的看法,我最近也越来越乐观,基本上你说的这些我都认同。我觉得这其实是个人类技能的问题,所以Anthropic在这方面走在前列,或者说其他公司也是。
192:09
a clawed code and we didn't really have reasoning models and it's like the difference between
就是Claude写的代码,而且我们当时还没有推理模型,这就像
192:12
sitting here today and what we can do with these models and it seems like there's a lot of
今天坐在这里,和我们能用这些模型做的事情之间的差距,而且感觉还有很多
192:17
what like there's a lot of low hanging fruit to improve them the failure modes are pretty dumb it's
那种低垂的果实可以去改进它们,失败模式也挺蠢的,比如
192:23
like clawed you tried to use the CLI command I don't have installed 14 times and then I sent you
Claude你试了14次那个我没装的CLI命令,然后我发给你
192:28
the command to run it's like that thing from a modeling perspective is pretty fixable so I agree
要运行的命令,从建模角度来看,这个问题其实挺容易修复的,所以我同意
192:34
with you I've been becoming more and more bullish in general speaking to what you're articulating
你的看法,我最近也越来越乐观,基本上你说的那些
192:41
I think it is a human skill issue so anthropic is leading the way in or other companies in
我觉得这其实是个人类技能的问题,所以Anthropic在这方面走在前列,其他公司也是。如果最终结果是一个能正常运行的软件系统,那这些投入就值得了。不过话说回来,挺有意思的是,我们从AGI时间线的讨论,竟然转向了更实际、更有用的东西。关于时间线赌注,有没有什么具体、有趣又深刻的内容可以说呢?现在有很多人在尝试用可验证奖励来做强化学习,但在真实的科学领域里,有些初创公司拿着数亿美元的融资,还有湿实验室,让语言模型提出假设,然后在现实世界中进行测试。我得说,这些尝试还处于非常早期的阶段。
192:49
understanding how to best use the models for programming therefore they're effectively using them
因此他们实际上是在有效使用这些模型,来理解如何最好地利用它们进行编程。
192:55
I think there's a lot of programmers on the outskirts they're like they don't I mean there's not
我觉得有很多边缘的程序员,他们其实并不——我是说,目前并没有一个真正好的指南教人怎么用这些模型,大家都在摸索具体怎么操作。
193:01
a really good guide and how to use them people trying to figure it out exactly it might be very
这可能非常昂贵,比如入门门槛可能高达每月两千美元,只有科技公司和有钱人才用得起——确实有可能这样,但也许这笔钱花得值。
193:05
expensive like it might be that the entry point for that is two thousand dollars a month which is
我的意思是,如果最终能搞出一个能用的软件系统,那当然值得。不过话说回来,有趣的是我们从时间线的讨论,聊到AGI,又转向了更实际、更有用的话题。
193:09
only tech companies and rich people just like like that could be it but it might be worth it I mean
关于时间线,有没有什么具体、有趣且深刻的观点可以说呢?
193:15
if if the final result is a working software system will they be worth it but by the way it's
如果最终结果是一个能用的软件系统,那它们就值了,但顺便说一句,这
193:19
funny how we converge from the discussion of time line to AGI to a something more pragmatic and
有意思的是,我们从时间线的讨论聊到AGI,然后又落到更实际、更有用的东西上。关于时间线赌注,有没有什么具体、有趣又深刻的说法?现在有很多人在尝试用可验证奖励做强化学习,但在真实的科学领域里,有些初创公司烧钱烧得像有几亿美元融资一样,他们还有湿实验室,让语言模型提出假设,然后在现实世界里测试。我觉得吧,这些都还非常早期——他们能成可能是因为抢占了先机,也可能只是早了八年,谁也说不准。所以我认为,这种把势头延伸到其他科学领域的登月式尝试,还是挺有意思的。
193:24
useful is there anything concrete an interesting and useful and profound to be said about time line
有没有什么具体、有趣又深刻的东西能说清楚时间线
193:31
to AGI and ASI or these discussions a bit to detach from the day to day there's interesting
聊到AGI和ASI,或者稍微脱离日常去讨论这些话题时,其实有一些很有意思的赌注。现在有很多人在尝试用可验证奖励来做强化学习,但真正用在科学领域里——有些初创公司拿着几亿美元的融资,还有湿实验室,让语言模型提出假设,然后在现实世界里做实验验证。我觉得吧,它们现在还非常早期,或者说处于早期阶段,但按照这个进步速度,可能也就早了六个月,然后因为抢占了先机就成功了;也可能早了八年,谁也说不准。所以我认为,这种把势头延伸到其他科学领域的登月式尝试,还是挺值得关注的。
193:39
bets so there's a lot of people trying to do reinforcement learning with verifiable rewards but
所以呢,现在有很多人在尝试用可验证奖励来做强化学习,但在真实的科学领域里,有些初创公司已经投入了数亿美元的融资,他们还有湿实验室,让语言模型提出假设,然后在现实世界中进行测试。我觉得吧,这些项目还非常早期,他们之所以能做成,可能是因为抢占了先机,或者可能早了八年,谁也说不准。所以我认为,这种把势头扩展到其他科学领域的登月式尝试,比如Harmonic,他们全力押注语言模型加Lean来做数学——我记得你最近在另一期播客里聊过这个——其实我们并不确切知道最终会怎样。
193:44
in real scientific domains where there's startups that are spending like they have hundreds of
在真正的科学领域里,有些初创公司花着几亿美金,还有湿实验室,让语言模型
193:47
millions of dollars of funding and they have wet labs where they're having language models
提出假设,然后在现实世界里测试。我得说,我觉得它们还非常早期
193:51
proposed hypotheses that are tested in the real world and I would say that I think they're very early
它们能成是因为抢占了先机,或者可能早了八年,你其实
193:56
or they're early but with the pace of progress it's like maybe they're early by six months and
或者他们起步早,但按照现在的进展速度,可能也就早六个月,然后因为抢占了先机就做成了;也可能早八年,这谁也说不准。所以我觉得,那种把这种势头延伸到其他科学领域的moonshot项目——比如通过一家创业公司来解决——确实存在。我认为有些创业公司,比如harmonic,就是全力押注语言模型加lean来做数学。我记得你最近在另一期播客里聊过这个,我们也不清楚在那个模型上砸一亿美元到底会有什么结果。大多数都会失败,但其中少数几个可能会带来重大突破,跟ChatGPT或者Cloud Code那种完全不一样。
194:02
they make it because they were there first or maybe they're early by eight years you don't really
没办法绕过使用它们的一些私有数据,去做实验,甚至可能专门定制
194:06
know so I think that that type of moonshot to branch this momentum into other other sciences
所以我觉得,那种把这种势头延伸到其他科学领域的登月计划,
194:15
is like okay like that would be very transformative if like alpha-fold moments happened in all
就像是,如果AlphaFold那样的突破在所有其他科学领域都发生了,那会是极具变革性的,比如由一家创业公司来解决这个问题。我觉得确实有创业公司在这么做,也许Harmonic就是其中之一,他们全力投入语言模型加Lean来做数学。我记得你最近在另一期播客里也聊过这个,就是——我们并不确切知道花一亿美元在那个模型上会得到什么结果,大多数都会失败,但其中几个可能会带来巨大的突破,跟ChatGPT或Claude Code那种软件体验完全不同。比如一个工具只对数学博士有用,但能让他们效率提升一百倍。对,我同意,我认为这会在很多领域发生,尤其是……
194:20
sorts of other scientific domains by like a startup solving this I think there are startups I think
各类其他科学领域,比如有家创业公司在解决这个问题——我觉得确实有这类公司,可能Harmonic就是其中之一,他们全力押注语言模型加数学推理。我记得你另一期播客里我们聊过这个,就像我们根本不知道花一亿美元在那个模型上会有什么结果,大多数都会失败,但其中几个可能会带来重大突破,跟ChatGPT或Cloud Code那种完全不同,效果提升一百倍。我同意,我觉得这会在很多领域发生,尤其是某个时候,比如“嘿,美国银行,花一亿美元,我们给你做定制模型”之类的。我认为那会带来巨大的经济价值,但另一方面呢……
194:26
maybe harmonic is one where they're going all in on language models plus lean for math I think
也许 Harmonic 就是其中之一,他们全力押注语言模型加 Lean 做数学,我觉得。
194:31
you had another podcast we talked about this recently and it's like we don't know exactly what's
你之前另一个播客我们聊过这个,就是其实我们也不确定到底会怎样,
194:36
going to fall out of spending a hundred million dollars on that model and most of them will fail but
花一亿美元搞那个模型,大部分都会失败,但其中少数几个可能会带来重大突破,跟ChatGPT或Cloud Code那种完全不同,效率能提升一百倍。对,我同意,这种情况会在很多领域出现,尤其是到了某个节点,比如美国银行说花一亿美元让你做个定制模型之类的。我觉得那会带来巨大的经济价值。但另一方面,如果所有人都用ChatGPT,那大家又都做同样的事了。我是说,虽然大家都在齐步走,但通常公司都想要有竞争优势。我认为,要想做到这一点,就绕不开使用自己的私有数据,去尝试、去专门化。
194:42
a couple of them might be big breakthroughs that are very different than chat gpt or cloud code type
其中几个可能会是巨大的突破,跟 ChatGPT 或 Cloud Code 这类完全不同,
194:49
software experiences like a tool that's only good for a PhD mathematician but makes them
软件体验就像一种工具,只对数学博士有用,但能让他们效率提升一百倍。好吧,我同意,这在很多领域都会发生,尤其是某个时候,比如“嘿,美国银行,花一亿美元,我们给你做定制模型”之类的。我认为这会产生巨大的经济价值。但另一方面,对于公司来说——现在真正的差异化因素是什么?如果每个人都用同一个LLM,如果每个人都用ChatGPT,那他们又会做同样的事情。也就是说,大家都在齐步走,但通常公司想要的是竞争优势。我认为,要获得这种优势,就绕不开使用自己的私有数据、进行实验,或许还要做专业化。
194:55
a hundred X effective like okay I agree I think this will happen in a lot of domains especially also
效率提升一百倍,对,我同意,这会在很多领域发生,尤其是
195:02
like domains that have a lot of you know resources like finance and legal and pharmaceutical companies
像金融、法律、制药这些资源丰富的领域
195:10
but then again is it really agi again because we are now specializing it again and then again
但话说回来,这真的算AGI吗?因为我们又在把它专门化
195:15
is it really that much different from big in the day how we had specialized algorithms is I think
这跟以前我们搞的那些专门算法,真的有本质区别吗?我觉得
195:19
it's just the same thing more way more sophisticated but I don't know is that threshold when we
其实是一回事,只是现在更复杂得多,但我不确定那个阈值在哪里
195:26
call it agi I guess I think the the real cool thing is here that we have like the foundation models
什么时候我们才叫它AGI?我觉得真正酷的地方在于,我们现在有了基础模型
195:31
that we can specialize I think that that's like the breakthrough at some point right now I think
可以去做专门化,我认为这某种程度上是个突破
195:34
we are not there yet because well first it's too expensive but also you know like chat gpt doesn't
但目前还没到那一步,首先是因为太贵了,而且你看ChatGPT
195:41
just give away that chat gpt to customize it I think the ones that's going to be true in a
也不会随便让你拿去定制。我觉得真正能实现这一点的
195:46
somewhere and I think I can imagine this as a business model that chat gpt opened me I says at
某个时候,我觉得我能想象出一种商业模式,ChatGPT 给我打开了思路,比如到了某个节点,像美国银行花一亿美元,我们给他们做定制模型之类的,我觉得那会是巨大的经济价值。但另一方面呢,公司们——我是说现在,差异化因素到底是什么?如果大家都在用同一个 LLM,如果大家都在用 ChatGPT,那他们又会做同样的事情,对吧?我是说,那就等于所有人都在齐步走。但通常来说,公司都想要有竞争优势,我觉得那就绕不开要用一些自己的私有数据,去实验、去专门化。这会很有意思。是啊,看着进步的速度,感觉事情就是——
195:51
some point like hey you know bank of america for a hundred million we will do your custom model or
到了某个节点,比如“嘿,美国银行,我们花一亿美元给你做定制模型”
195:55
something like that and I think that will be the huge economic value at the other thing though is
类似这样,我觉得那会是巨大的经济价值。但另一件事是,
196:01
also companies I mean right now what is the differentiating factor I mean if everyone uses the same
而且啊,现在公司之间到底靠什么拉开差距?如果大家都在用同一个LLM,比如都用ChatGPT,那结果不又一样了吗?所有人都在齐步走。但公司通常想要竞争优势,我觉得绕不开的一点就是利用自己的私有数据去尝试、去实验,可能还要在经济效益上做专精。因为目前来看,LLM模型在经济影响上还没有出现明显的飞跃。抛开AGI、ASI这些概念不谈,真正的问题是:我们什么时候才能看到GDP那种级别的增长?是啊,GDP里很大一部分是金融服务构成的,所以……我也不太清楚,这真的不好说。
196:08
LLM if everyone uses chat gpt they will all do the same thing again I mean then well it's everyone
LLM 如果每个人都用 ChatGPT,那大家又会做同样的事,我是说,那就人人都一样了。
196:14
is moving in rockstep but usually companies they want to have a competitive advantage and I think
是在稳步推进,但通常公司都想要竞争优势,我觉得没办法避免使用一些私有数据、做实验,可能还要对模型进行specialization。比如说,除了AGI或ASI那些东西之外,还有一个很现实的问题:我们什么时候能看到GDP式的跃升?是啊,GDP本身是由什么构成的?很大一部分是金融服务之类的。所以我不太清楚这到底是什么,只是换了一种方式——当你不再需要看代码的时候。所以当它像云一样进入世界时,那就不只是企业市场的问题了,而是很棘手的问题。我不知道怎么让人们去尝试做这件事。我想如果ChatGPT能做到,那人们已经在试ChatGPT了。
196:19
there's the no way around using some of their private data and experimenting and maybe specializing
模型。比如说,这跟AGI、ASI或者那些东西无关,而是
196:24
it's gonna be interesting yeah sitting in the pace of progress it does just feel like things are
这确实会很有意思。身处进步的速度之中,感觉事情就是一直在变。
196:29
coming I don't think the agi and asi thresholds are particularly useful I think I guess the real
我觉得AGI和ASI的阈值其实没什么用,真正的问题——这又回到远程工作那个话题了——是:什么时候我们才能看到经济影响上一个明显的大飞跃?因为目前来看,LLM模型在经济上并没有带来那种明显的飞跃。这跟AGI、ASI那些东西无关,真正的问题是,我们什么时候能看到GDP那种级别的跳跃?是啊,GDP到底是由什么构成的?很大一部分是金融服务之类的,所以我真不知道这个GDP增长点会是什么。对我来说,很难想象GDP会突然跳升。但我觉得,当你再也不用盯着代码看的时候,软件开发的价值就会变得完全不同。也就是说,当它变得像云服务那样的时候。
196:37
question this takes us to the remote worker thing is when I will go into see a big obvious leap
这个问题把我们带到了远程办公的话题上:我什么时候才能看到经济影响上一个明显的巨大飞跃?因为目前来看,LLM模型在经济影响上还没有出现那种明显的飞跃。而且你知道,先不谈AGI或者ASI那些东西,真正的问题是:我们什么时候才能看到GDP那种级别的跃升?是啊,GDP到底是由什么构成的?很大一部分是金融服务之类的。所以我不太清楚这到底是怎么回事,对我来说,很难想象GDP会突然飙升。但我想说的是,当你不再需要盯着代码看的时候,软件开发的价值就会变得完全不同。所以当它变得像云服务那样的时候——
196:45
in economic impact because currently there's not been an obvious leap in economic impact of LLM
从经济影响来看,目前LLM模型还没有带来明显的经济飞跃,比如,你知道,除了AGI或ASI这类概念之外,真正的问题是:我们什么时候能看到GDP式的跃升?是啊,GDP到底是由什么构成的?很多都是金融服务,所以我不太确定这到底是什么。只是换一种方式,当你不再需要看代码的时候——就像云技术进入世界那样,这不仅仅是企业市场的问题,而是很难让人去尝试这么做。我猜如果ChatGPT能做到,人们就会去试ChatGPT。这归根结底是一个科学问题:工具用来解决问题的难度有多大?有很多因素。
196:53
models for example and that's you know aside from agi or asi or all that kind of stuff there's a
模型用了多少,当然这跟AGI或ASI那些东西无关,但确实有
197:00
real question of like when are we going to see a gdp like jump yeah it's like what is the gdp made
真正的问题是,我们什么时候能看到像GDP那样的跃升?是啊,问题在于GDP是由什么构成的——比如很多是金融服务,所以我不太清楚这到底意味着什么。只是换了一种方式,当你不再需要盯着代码看的时候。所以当它像云一样融入世界时,这不仅仅是企业市场的问题,而是很难——我不知道怎么让人们去尝试做那件事。我猜如果ChatGPT能做到,人们就会去试ChatGPT。我认为你有一个LM(语言模型)在外面运行,这个代理系统(agentic system)在现实世界里做事情,而且只有1%的概率出错。计算机使用(computer use)就是一个很好的例子,说明实验室关心什么。而且我们要做的是——它们不是在你的MacBook上运行,而是各自独立地与Google交互。
197:07
up of like a lot of his like financial services so like I don't I don't know what this is it's just
他做的很多都是金融服务类的东西,所以我不太清楚这到底是什么。
197:14
hard for me to think about the gdp bump but like I'd say that software development becomes valuable
很难去想象GDP的增长,但我觉得软件开发会以另一种方式变得有价值——当你不再需要看代码的时候。所以当它像云一样融入世界时,这就不只是企业市场的问题了,而是很难——我不知道怎么让人们去尝试做这件事。我猜如果ChatGPT能做到,那人们就会去试。归根结底,这其实是一个科学问题:工具使用到底有多难?你买的东西里有很多是跟工具使用相关的,就像计算机使用一样——比如你有一个LM,它作为一个agentic系统去执行任务,在现实世界里做事情,只有1%的概率出错。计算机使用就是一个很好的例子,说明实验室真正关心的是什么。
197:21
in a different way when you no longer have to look at the code anymore so when when it is like cloud
换一种方式来说,当你不再需要看代码的时候,当它像云一样融入世界时,这就不只是企业市场的问题了,但说实话我不知道怎么让人们去尝试做这件事。
197:27
will make you a small business which is a centrally cloud can set up your website your bank account
能让你开个小公司,核心就是云端服务,帮你搭网站、银行账户、邮箱,还有别的乱七八糟的东西。你只需要表达清楚你想往这个世界里放什么——这不只是企业市场的事,但确实挺难的。我不知道怎么让人愿意去试这个。我猜如果ChatGPT能做到的话,那人们已经在试ChatGPT了。我觉得归根结底是个科学问题:工具使用到底有多难解决?你要买的东西里有很多是更偏向工作场景的,工具使用就是其中之一。就像计算机使用一样——你有一个LM,它跑出去,作为一个agentic系统,在现实世界里做点事,而且只有1%的概率搞砸。计算机使用就是个很好的例子,说明实验室真正关心的是什么。
197:32
your email and your whatever else and like you just have to express like what you're trying to put
你的邮箱啊,还有别的什么,反正你就得表达清楚你想往这个世界里放什么。这不只是企业市场的问题,但确实挺难的——我不知道怎么让人愿意去试这个。我猜如果ChatGPT能做到,那人们就会去试ChatGPT。我觉得归根结底是个科学问题:工具使用到底有多难解决?你买的东西里有很多是跟工作相关的,工具使用就是其中一部分。就像计算机使用一样——你有一个LLM,它作为一个agentic系统出去在现实世界里做点事,只有1%的概率搞砸。计算机使用就是个好例子,说明各个实验室在乎什么。我们这边在开放计算机使用,我见过Kua,它们都挺烂的。对,所以它们也在往里砸钱。
197:38
into the world like that's not just a enterprise market but it is a hard like I don't know how you
我猜如果ChatGPT能做到,那人们就会去试ChatGPT。
197:44
get people to try doing that I guess if chat gpt can do it like people are trying chat gpt I think
你有一个LM在外面运行,这个agentic系统在现实世界里做事情,只有1%的概率出错,computer use就是一个很好的例子,说明实验室关心什么。
197:49
boils down to the the scientific question of how hard is tool used to solve there's a lot of
归根结底,这其实是一个科学问题:工具到底有多难用?有很多情况是,你有一个LM,它作为这个agentic系统去外界执行任务,但只有1%的概率会搞砸。Computer use就是一个很好的例子,说明实验室真正关心的是什么。而且,它们并不是在你的MacBook上运行,而是各自独立地与Google、Amazon和Slack交互,它们处理这些事情的方式和人类非常不同。所以,其中一些可能是结构上的障碍。从specification的角度来看,我认为问题还在于:环境是什么?你怎么去定义它?你可以设定最终目标,但如果它无法通过LM达成这个目标——比如你让它生成文本,你总是可以进一步澄清。
197:55
stuff you're buying there are more work stuff is tool use it's like how computer use like how
你买的东西里,更多是工作相关的工具使用,比如计算机使用,就像你有一个LM,它作为这个智能系统去外部世界执行任务,只有1%的概率出错。计算机使用就是实验室关心的一个典型例子。而且他们工作的方式,并不是在你的MacBook上操作,而是分别与Google、Amazon、Slack交互,处理这些事务的方式和人类非常不同。所以其中一些可能是结构性的障碍。另外从规格上来说,我认为问题还在于:环境是什么?你怎么去定义?你可以说最终目标是什么,但如果它无法用LM达成这个最终目标——比如你让它生成文本,你总是可以进一步澄清。
198:02
you have an lm that goes out there this agentic system and does something in the world and only
而且它们不是在你的MacBook上运行,而是各自独立地与Google交互。
198:09
screws up one percent of the time computer use is a good example of what labs care about and we
这其中可能也有结构性的障碍,比如从规范的角度来看,我觉得问题也在于……
198:14
haven't seen a lot of progress on it's on multiple demos and 2025 of like cloud can use your
在多个演示和2025年的展示中,我没看到太多进展,比如云端能操控你的电脑。我试过Kua,它们都很烂。对,他们也在往这上面投钱,我觉得这会是个好例子,说明接管整个屏幕实际上比在后端调用一个API要难得多。部分原因是你得为模型搭建一个不同的运行环境——它们不是在你的MacBook上工作,而是分别与Google、Amazon和Slack交互,处理这些事务的方式和人类截然不同。所以有些可能是结构性的障碍。另外从规范角度来看,我觉得问题也在于——
198:21
computer are opening I had Kua and they all suck yeah so like they're also investing money in
电脑正在打开,我用了Kua,它们都很烂。所以呢,他们也在投钱进去。
198:26
this and I think that will be a good example where it's actually something where it just seems
这一点我觉得是个很好的例子——实际上,有些东西看起来像是要占据整个屏幕,这比提供一个后端可调用的API要难得多。部分原因在于,你需要为模型搭建一个不同的运行环境,它们并不是在你的MacBook上工作,而是各自独立地与Google、Amazon和Slack交互,并且它们处理这些事情的方式和人类非常不同。所以这其中可能也有一些结构性的障碍。另外从规格说明的角度来看,我认为问题还在于:环境是什么?你如何定义它?你可以说出最终目标是什么,但如果它无法通过LLM来实现那个最终目标——比如你让它生成文本,你总是可以再进一步澄清。
198:32
pretty like taking over the whole screen seems a lot harder than having an API that they can call
基本上,接管整个屏幕看起来比在后端调用一个API要难得多。部分原因是,你得为模型搭建一个不同的运行环境——它们不是在你的MacBook上工作,而是各自独立地与Google、Amazon和Slack交互,而且它们处理这些事情的方式和人类非常不同。所以有些可能是结构上的障碍。
198:38
in the back end and some of that is you have to then set up a different environment for the model
另外,从规格说明的角度来看,我觉得问题也在于:环境是什么?你怎么去指定?你可以说最终目标是什么,但如果它用LLM解决不了那个最终目标——比如你让它生成文本,你总是可以再澄清一下。
198:42
to work in like they're not working on your MacBook they are individually interfacing with Google and
它们并不是在你的MacBook上运行,而是各自独立地与Google交互。
198:48
Amazon and Slack and they handle all these things in a very different way than humans do so some
Amazon 和 Slack,它们处理这些事情的方式和人类非常不同,所以其中一些可能是结构上的障碍。从规格角度来看,我认为问题也在于:环境是什么?你如何定义它?你可以说最终目标是什么,但如果它无法用语言模型(LM)解决那个最终目标——比如你让它生成文本,你总是可以澄清——需要对此保持微妙,比如“我不在乎”,但像那些正在涌现的东西,比如聊天,或者人们讨论语言模型会如何向你提问,这又回到了人类非常容易受影响的领域。那里有很多社会因素,也有很多太阳能资源,你可以解决散热问题,但确实有很多。
198:53
of this might be structural blockers also like specification wise I think the problem is also for
这可能也是结构上的障碍,从规格上来说,我觉得问题还在于:对于专用模型,比如多模态领域,视频生成完全是另一回事。
199:00
you know arbitrary tasks while you still have to specify what you want your lm to do and how do you
你知道,任意任务,但你还是得明确告诉你的语言模型你想让它做什么,那你怎么做呢?环境是什么?你怎么去指定?你可以说最终目标是什么,但如果它用语言模型解决不了最终目标,比如你让它生成文本,你总是可以澄清一下,分几步走。那你怎么把这些信息放进一个系统里,比如说帮你订旅行行程的系统?你可以说“你搞错了我的信用卡信息”,但即使要让它到那个地步,作为用户,你怎么在模型甚至还没尝试之前就引导它?我觉得这个界面真的很难。是啊,它需要了解很多关于你个人的信息,还要持续学习,持续学习整个过程中常见的错误,然后……
199:04
do that in a what is the environment how do you specify you can say what the end goal is but
在什么环境里做这个?你怎么去指定?你可以说最终目标是什么,但如果它用语言模型解决不了最终目标——比如你让它生成文本,你总可以再澄清一下。
199:11
if it can't solve the end goal with lm's if you ask it for text you can always you know clarify
得对这事委婉点,像“我不在乎”这种,但那些正在涌现的东西,比如聊天功能,值得聊聊。人们总说语言模型会反过来问你问题。
199:16
do some steps what is how do you put that information into a system that let's say books a travel
做一些步骤,比如你怎么把那些信息放进一个系统里,让它帮你订旅行行程?你可以说“你搞砸了我的信用卡信息”,但即使要让它做到那一步,作为用户,你怎么在模型甚至还没尝试之前就引导它?我觉得这个界面真的很难。是的,它需要学习很多关于你个人的信息,还要持续学习整个过程中常见的错误。然后我们聊到了记忆功能,它可以跨聊天保存信息,但它的第一次实现有点奇怪,比如它会在一段聊天里提到我狗的名字,我就想说“你没必要这么刻意,我其实不在乎”。但正在涌现出来的东西是聊天。
199:22
trip for you you can say well you screwed up my credit card information but even to get it to that
给你举个例子,你可以说“你搞砸了我的信用卡信息”,但就算要让模型走到那一步,作为用户,你该怎么引导它,在它甚至还没能尝试之前?我觉得这个界面真的很难用。是的,它需要大量学习关于你的具体信息,还要持续学习整个过程中常见的错误。然后我们聊到了memory,它能在不同对话之间保存信息,但它的第一个实现方式有点奇怪,比如它会在某个对话里提到我狗的名字,我就想说“你没必要这么隐晦,我根本不在乎”。但真正正在浮现出来的东西,是chat at或者类似的功能,人们也在讨论语言模型会开始主动向你提问。
199:26
point like how do you like as a user guide the model before like it can even attempt that I think
比如说,作为用户,你怎么在模型还没尝试之前就引导它?我觉得这个界面真的很难。它得先深入了解你这个人,而且这还涉及到——
199:34
the interface is really hard yeah it has to learn a lot about you specifically and about this goes
继续,继续学习那些普遍存在的错误,贯穿整个过程。
199:41
the continue continue learning about the general mistakes that are made throughout and then
然后我们聊到了记忆功能,它能跨对话保存信息。但它的初次实现有点奇怪,比如它会在聊天里突然提到我狗的名字,我就想说,你没必要这么刻意,我其实无所谓。但那些正在涌现的东西,比如聊天功能,值得讨论。
199:46
mistakes that are made through you all day I interfaces are getting set up to ask humans for input
全天候通过界面发生的错误,现在正在被设置成向人类请求输入。
199:52
I think cloud code we talked about a lot it asks we'd back on questions if it doesn't have enough
我觉得我们聊了很多关于 Cloud Code 的事情,如果它对你的计划或期望没有足够明确的说明,它就会反过来问问题,比如“你更希望怎样?”
199:56
specification on your plan or you're desired it starts to ask questions would you rather
我们还聊了记忆功能,它能跨聊天保存信息,但它的第一个实现方式有点奇怪,比如它会突然在聊天里提到我狗的名字,我就想“你没必要这么刻意吧,我其实无所谓”。但正在涌现出来的东西是,ChatGPT 有个“脉搏”功能,就是一段精选的、带链接的几段文字,供你阅读或讨论。而且人们也在讨论,语言模型将来会主动向你提问。
200:01
we talked about memory which saves across chats which it's first implementation is kind of
人们也在讨论语言模型会反过来问你问题,这又回到了那个领域:人类很容易受这个影响,而且这里面有很多社交因素。
200:08
odd where be like it'll mention my dog's name or something like in a chat I'm like you didn't
挺奇怪的,比如它会在聊天里突然提到我狗的名字,我就想“你没必要这么刻意吧,我其实无所谓”。但真正有意思的是那些正在浮现的东西——比如人们开始讨论语言模型会反过来问你问题,这就进入了人类很容易被影响的领域。这里面有大量的社交能量,也有大量的太阳能,你还能解决散热问题。但悲剧在于,一亿用户可能从中得不到太多好处,它真正服务的是那些专用模型。比如在多模态领域,视频生成完全是另一回事。说那个梦想正在消亡是个很大的论断,因为我不确定它是不是真的在消亡。
200:13
need to be subtle about this like I don't care but the like things that are emerging are chat
这又回到了人类很容易受影响的领域,而且这里面有很多社会因素。
200:16
GPT has the pulse feature which is like a curated couple paragraphs with links to something to look
GPT 有个叫 Pulse 的功能,它会生成几段精选内容,附带链接,让你看看或者聊聊。大家也在讨论语言模型以后会不会主动问你问题,比如“你感觉怎么样”,就像医生预约那样。这又回到了一个话题:人类很容易受这种互动影响,而且未来会有很多社会变化。同时,他们也在尝试让模型主动跟人互动。有些人真的很喜欢这个 Pulse 功能,它会处理你的聊天记录,自动搜索相关信息,然后直接放到 ChatGPT 应用里。所以接下来会有很多新东西。我之前用过这个功能,每次都觉得有点不好意思,因为它每天都会推送,但我真的会点进去看看。
200:24
at or to talk about and people talk about how the language models are going to ask you questions
那里太阳能资源很丰富,你可以解决散热问题,但确实有很多。
200:28
which I think is a very it's probably going to work the language model is like it knows you had
我觉得这很可能会奏效,语言模型就像知道你去看了医生或者别的什么事,然后它会问“你今天感觉怎么样?”这又回到了人类很容易受影响的领域,未来会有很多社会变革。但同时,他们也在尝试让模型与用户互动。有些人真的很喜欢这个“Pulse”功能,它会处理你的聊天记录,自动搜索相关信息,然后放进ChatGPT应用里。所以接下来会有很多新东西。我之前用过这个功能,但每次都觉得有点愧疚,因为它每天都运行,而我其实很少去看。想想看,有多少算力被浪费在我根本不会去看的东西上,你知道吗?
200:35
doctor appointment or something it's like hey how are you feeling out of that which is like
看医生或者别的什么事,它就会问“你感觉怎么样”,这又回到了那个领域——人类很容易受这个影响,而且未来会有很多社会变化。不过他们也在尝试让模型跟人互动,有些人特别喜欢这个“pulse”功能,它会处理你的聊天记录,自动搜索信息,然后放到ChatGPT应用里。所以接下来会有很多东西出来。我之前用过那个功能,每次都觉得有点不好意思,因为它每天都这么做,而我其实很少真的去看。大概就是这种性质,很难预测。但我觉得,就算没有这个,我们也走不了太远。如果你把视野拉远一点,未来30年里还是会有很多我们现在想象不到的点子。
200:39
again goes into the territory of humans are very susceptible to this and there's a lot of social
专门化的模型,比如多模态是真实的,视频生成完全是另一回事。
200:43
change to come but also like they're experimenting with having the models engage some people
变化即将到来,但他们也在尝试让模型与用户进行互动。
200:48
really like this pulse feature which is it processes your chats and automatically searches for
我真的很喜欢这个“脉冲”功能,它能处理你的聊天记录,自动搜索信息,然后整合到ChatGPT应用里。所以接下来会有很多新东西。我之前用过这个功能,每次都觉得有点不好意思,因为它每天都在运行,而我其实只是随便看看。
200:53
information and puts it in the chat GPT app so there's a lot of things coming I use that feature
这种事情本质上很难预测,但我觉得,就算没有它,我们也走不了太远。
201:00
before and I always feel bad because it does that every day and I really check it out it's like
如果你把视野拉远一点,未来30年里仍然会有很多新想法涌现。
201:05
how much money like mean computer is burned on something I don't even look at you know where it's
一台计算机烧了多少钱在某个我甚至看都不看的东西上,你根本不知道它花在哪了。
201:10
like there's also a lot of idle computer in the world so I don't feel too bad okay do you think
世界上其实也有大量闲置的算力,所以我倒不太担心。你觉得呢——会不会需要全新的思路?有没有可能,通往AGI的路——不管我们怎么定义它,比如Dario对AGI的定义,或者Parflé A那种,让计算机更通用地解决生物学、化学和物理问题——是不是完全需要新的想法?非LLM、非RL的想法?它们可能长什么样?这有点要进入哲学领域了。如果非要有个奇点式的突破,我觉得答案是肯定的。新想法可能来自架构或训练算法,也就是深度学习底层的东西,但这类东西本来就很难预测。不过我觉得,就算没有这些,我们也走不了多远。
201:18
new ideas might be needed is it possible that the path to AGI whatever that is however we define
可能需要新的想法——通往AGI的路,不管它是什么、我们怎么定义它,
201:24
that the solve computer use more generally to solve biology and chemistry and physics sort of the
让计算机更广泛地用于解决生物学、化学和物理学问题,也就是Dario对AGI的定义,或者Parflé A的定义——你觉得有可能吗?
201:33
Dario definition of AGI or Parflé A do you think is possible the totally new ideas are needed
全新的想法是必要的吗?不是LLM、不是RL的想法,它们可能长什么样?
201:39
non LLM non RL ideas what might they look like this is we're not going into philosophy land a
这有点要进入哲学领域了。
201:49
little bit for something like a singular need to happen I would say yes and the new ideas could
对于某种“奇点”需要发生,我会说“是的”,而新想法可能是架构或训练算法,这些属于深度学习的基础层面,
201:55
be architectures or training algorithms which is like fundamental deep learning things but there's
但本质上很难预测,而且我觉得,即使没有这些,我们也走不了多远。
202:01
that in that nature pretty hard to predict and I but I think we won't get very far even without
那里有大量的太阳能,你也能解决散热问题,但确实存在很多挑战。
202:07
those advances like we might get this software solution but it might stop at software and not do
那些进展,比如我们可能得到这个软件解决方案,但它可能止步于软件层面,无法实现计算机操作,除非有更多创新。所以我觉得会有很多进步,但如果你把视角拉远,未来30年里仍然会出现一些想法,它们会被视为重大的科学创新,开启下一个篇章——我不知道这会在一年后还是15年后到来。是啊,我好奇“苦涩的教训”在未来100年是否依然成立,那会是什么样子。如果scaling laws是深度学习的根本,我认为“苦涩的教训”永远适用:算力会变得越来越充裕,但即使在算力充裕的情况下,那些拥有更陡峭的scaling law斜率或更好偏移量的方法——这就像是一个二维问题。
202:13
computer use without more innovation so I think that it's like a lot of progress would be coming but
计算机使用如果没有更多创新,我觉得很多进展还是会来的,但如果你把视野拉远,未来30年里总会出现一些想法,让人感叹“那才是开启下一篇章的重大科学创新”,我不知道这会在一年后还是15年后到来。是啊,我好奇“苦涩的教训”在未来100年是否依然成立,如果scaling laws在deep learning中是根本性的,那我认为“苦涩的教训”永远适用——compute会变得越来越充裕,但即便在compute充裕的情况下,那些拥有更陡峭的scaling law斜率或更好偏移量的方法,比如能从中获得100倍提升的,就会胜出。可能最终就是像literal compute clusters orbiting earth这样的东西。
202:18
in if you're going to zoom out like there's still ideas in the next 30 years that are going to look
悲剧的是,1亿用户可能不会从中获得太多好处,但它确实会服务于某些人。
202:23
like that was a major scientific innovation that enabled the next chapter of this and I don't know
那是一项重大的科学创新,开启了下一篇章,我不知道
202:30
if it comes in one year or in 15 years yeah well I wonder if the bitter lesson holds true for the
它会在一年后还是十五年后到来。是啊,我在想“苦涩的教训”在未来一百年是否依然成立,
202:35
next 100 years what that looks like if scaling laws are fundamental in deep learning I think the
如果缩放定律在深度学习中是最根本的,我认为“苦涩的教训”会一直适用——算力会变得越来越充裕,
202:41
bitter lesson will always apply which is compute will become more abundant but even within abundant
但即使在充裕的算力中,那些拥有更陡峭缩放斜率或更好偏移量的方法,就像这是一个二维问题,
202:47
compute the ones that have a steeper scaling law slope or a better offset like this is a 2D
能从中获得100倍收益的就会胜出。可能最终会变成像环绕地球或太阳的算力集群,
202:54
plot of performance and compute and like even if there's more compute available the ones that
性能与计算量的关系图显示,即便有更多算力可用,那些能从中榨出100倍效率的玩家会胜出。这可能听起来像科幻——比如在地球轨道上部署计算集群,靠太阳能板供电。但问题在于散热:你接收了太阳的所有辐射,却没有空气来散热。不过太空里确实有大量空间来放置集群,也有充足的太阳能,而且散热问题或许能通过工程手段解决。毕竟能量足够多,工程意志力也可能攻克散热难题。所以这到底可不可能?我们得说,绝对可能。关键在于“如何实现”——这其实是我们今年即将触及天花板的问题,但说的不是系统能力的天花板。
202:58
get 100x out of it will win it might be something like literally compute clusters orbiting earth
没有空气来散热,但那里有大量空间来放置集群,
203:07
with solar panels the problem with that is heat dissipation so you get all the radiation from
用太阳能板的话,问题是散热——你会接收到太阳的所有辐射,但周围没有空气来散热。不过太空里有很多地方可以放集群,太阳能也很充足,散热问题也许能通过工程手段解决。能量是够的,很可能会有工程上的决心去攻克散热难题。所以这是否可行?我们得说,绝对可行。关键在于“怎么做”——这其实是我们今年会遇到的瓶颈,不是说系统能力上的瓶颈,而是“能不能做到”以及“怎么做”的问题。你看这些模型,有太多显而易见的改进空间,但训练这些模型、做这些精细调整都需要很长时间,所以这本身就是一个挑战。
203:12
the sun and you don't have any air to dissipate heat but there is a lot of space to put clusters
也有大量太阳能可用,你可以解决散热问题,但空间确实很充裕。
203:17
there's a lot of solar energy there and you could figure out the heat dissipation but there is a lot
“那个梦快死了”是个大论断,因为我不确定它是不是真的在消亡。
203:21
of energy and there probably could be engineering will to solve the heat problem so there could be
能源方面,工程上应该能解决散热问题,所以是有可能的。
203:27
is it possible and we should say that it definitely is possible how like this is the question
我们得说这绝对有可能,关键是怎么实现——这才是问题所在。
203:33
that we're basically going to be plateauing this year not in terms of the system capabilities but
今年我们基本上会在系统能力上遇到平台期,但不是说模型本身没有提升空间。
203:40
what the system capabilities actually mean for human civilization so on the coding front
系统能力对人类文明到底意味着什么,在编程方面呢
203:46
really nice websites will be built very nice autocomplete very nice way to understand code
会建出很漂亮的网站,很棒的自动补全,很厉害的方式去理解代码库
203:57
bases and maybe help the bug but really just a very nice helper I'm not coding front
也许还能帮忙修bug,但真的就是个很棒的助手,我自己不写前端代码
204:03
it can help research mathematicians do some math it can help you with shopping it can help
它能帮研究数学家做点数学,能帮你购物,能帮你
204:10
it could help it's a nice helper it's clipy on steroids what else it may be a good education tool
它能帮——它就是个很棒的助手,是强化版的Clippy,还有什么呢,可能是个好用的教育工具
204:18
and all that kind of stuff but computer use turns out extremely difficult to solve so I'm trying
诸如此类的东西,但计算机使用这个任务被证明极其难解决,所以我试着
204:25
to be I'm trying to frame the cynical case in all these domains where it kind of there's not a
我试着在这些领域里描绘一个悲观的情况,就是它其实没有
204:31
really huge economic impact realize how costly is the training systems at every level both the
带来特别巨大的经济影响,要意识到训练系统在每个层面有多昂贵,包括
204:37
pre-training on the inference how costly the inference is the reasoning all of that like is that
预训练和推理的成本有多高,推理过程中的推理能力,所有这些,比如是否可行,以及当你观察这些模型时,有那么多显而易见可以改进的地方,但训练这些模型需要很长时间,要完成这种艺术也需要很长时间,而且根据我们现有的想法,可能需要好几年才能真正在某个基准或我们追求的性能上达到饱和。它可能只服务于非常狭窄的领域,比如普通的Tragedy BT一亿用户可能不会从中获得太多好处,但它会通过在不同方面变得更好来服务于不同的人群。但我认为现在每个人都在追逐的是一个对所有人都通用的系统。所以,好吧,如果那不是目标的话。
204:45
possible and how like there's that doing when you look at the models there's so much obvious
当你观察这些模型时,会发现有太多明显的改进点,但训练这些模型、打磨这些技术需要很长时间。
204:50
things to improve and it takes a long time to train these models and to do this art and that it'll
至于基准测试或性能,我们寻找的可能是非常狭窄的应用场景——比如普通的一亿用户可能不会从中获得太多好处,但它确实能通过在不同领域做得更好来服务不同的人群。
204:56
take us with the ideas that we have multiple years to actually saturate in terms of whatever
先说说我们的想法:我们其实有好几年的时间来慢慢消化这些成果,不管是在某个benchmark上,还是我们追求的性能上。它可能只服务于非常狭窄的领域,比如一个普通的、拥有1亿用户的悲剧性产品,可能并不会从中获得太多好处。但它会通过在不同方面变得更好,来服务于不同的人群。不过我觉得,现在大家真正在追逐的,是一个对所有人都通用的通用系统。所以,好吧,如果那不是专门化的模型——比如在多模态领域,视频生成完全是另一回事——那么那个梦想其实正在消亡。这是一个很大的论断,因为我不确定它是不是真的在消亡。我不确定是不是每个人——如果你去问真正的粉丝,你会听到人们说,我的意思是,他们确实……
205:02
benchmark or performance we are searching for it might serve very narrow niches like the average
不过,我明白大家真正关心的是什么。
205:08
tragedy BT 100 million user might not get a lot of benefit out of this but it is going to serve
tragedy BT 那1亿用户可能不会从中获得太多好处,但它会服务于 specialized models,比如在 multimodal 领域,像视频生成完全是另一回事。那个梦想正在消亡是个很大的说法,因为我不确定它是否真的在消亡。会比之前的好很多——"好很多"这个词用得对,但会比上一个更好。而且我不觉得他们会放慢脚步,我只是觉得这些进步更多会通过 scaling 模型来实现,但同时也需要 fine-tune。所以我觉得有很多技术,比如,同时也要改进周围的一切,就像你懂的,LLMs 的工程本身就像一个循环,它们也让人们变得更高效。
205:14
different populations by getting better at different things but I get I think what everybody's
不同人群通过在不同领域变得更擅长而有所区别,但我理解大家说的那种专门化模型——比如多模态领域里,视频生成完全是另一回事。那个梦想正在消亡的说法是个大论断,因为我不确定它是否真的在消亡。我不确定是否每个人——如果你去问真正的粉丝,会有人觉得……它们会比之前的好很多,“很多”这个词用得对,但会比上一代更好。而且我看不出它们会放缓脚步,我只是觉得进步会更多地体现在——不仅是模型本身的scaling,还有现在的fine-tuning。所以我觉得有很多技术,比如……同时也要改进周围的一切,比如工程层面的东西。
205:19
chasing now is the is a general system that's useful to everybody so okay so if that's not that
现在大家追逐的是一个对所有人都通用的系统。所以,如果那不是专门化的模型,比如多模态那种,视频生成完全是另一回事,那个梦想其实正在消亡——这是个很重的说法,因为我不确定它是不是真的在消亡。我不确定是不是每个人——如果你去问真正的粉丝,会有人说,它们会比之前的好很多,“很多”这个词用得对,但确实会比之前的好。而且我看不出它们会放慢脚步,我只是觉得进步更多会来自于——不只是 scaling 模型,还有 fine-tuning。所以我感觉有很多技术,比如,同时也在改进周围的一切,像是工程层面的东西。
205:26
can plateau right I think that dream is actually kind of dying as you talked about with the
可能会遇到瓶颈。我觉得那个梦想其实正在慢慢消亡,就像你之前聊到的那些专门化模型一样——多模态其实很真实,视频生成完全是另一回事。说那个梦想正在消亡是个很大的论断,因为我不确定它是否真的在消亡。我不确定每个人……如果你去问真正的粉丝,会有人……他们其实还在追逐这个梦想,对吧?我确实觉得他们仍然在急着推出下一个模型,那个模型会比之前的好很多——虽然“很多”这个词用得不一定准确,但确实会比之前的好。我看不出他们会放慢脚步。我只是觉得,进步更多会来自于——不仅仅是scaling模型,还有fine-tuning。所以我感觉有很多技术,比如……
205:31
specialized models where it's like in multimodal is authentic like video generation is a totally
“那个梦想正在消亡”是个很重的说法,因为我不确定它是否真的在消亡。
205:37
different thing that dream is kind of dying is a big statement because I don't know if it's dying
在那个语境下,广告和不在广告里的内容——那是我几年前提到过的事情。
205:43
I don't know if every I don't if you ask the actual fans you'll have people they I mean they're
我不知道,如果你去问真正的粉丝,会有人说——我是说,他们肯定比上一版好很多,“好很多”这个词可能不太准确,但确实会更好。而且我看不出他们会放慢脚步,我只是觉得进步会更多体现在——不只是靠scaling模型,现在还有fine-tuning。我感觉有很多技术,比如同时改进周围的一切,像工程方面,更多人参与LLM,就像个循环,它们也让这些人更高效。这有点像一种范式转变,我不觉得那是对的,但一切都会被放大、放大、再放大,而且我看这种情况会持续很长时间。嗯,我猜我的意思是——
205:47
still chasing it right I do think they are still like rushing to get the next model out which will
还在追这个目标,我觉得他们确实还在赶着推出下一个模型,这个模型会比上一个好很多——虽然“好很多”这个词用得不一定准,但确实会比上一个强。而且我看不出他们会放慢脚步,我只是觉得未来的进步不仅来自模型本身的规模扩展,还会来自很多其他方面的优化。比如,我觉得现在有很多技术,是在同时改进模型周围的一切,像是上下文工程、推理扩展这些。大实验室会继续做这些事,现在小实验室也会跟上,因为他们正在招更多人,会有更多人研究LLM。这就像一个循环,他们也在让这些模型变得更高效。
205:52
be much better than the much is the right of term but will be better than the previous one
比之前那个好很多,虽然“好很多”这个说法没错,但确实会比上一个版本更强。
205:57
and I I can't see them slowing down I just think the gains will be made or felt more through
我,我看不出他们会放慢脚步,我只是觉得未来的进步更多会体现在——
206:04
not only scaling the model but now fine so I feel like there's a lot of tech that is like well
不只是靠 scaling 模型,现在还有 fine-tuning,所以我觉得有很多技术,像是——
206:10
let's just put the better model in there and better model better model and now people okay let's
咱们就把更好的模型放进去,更好的模型,更好的模型,现在大家说好吧,那同时也要把周围的东西都改进,比如上下文工程和推理缩放这些。大实验室还会继续做这个,现在小实验室也会跟上,因为他们正在招更多人,会有更多人搞LLM。这就像个循环,他们也让人更高效,这就像放大器。我觉得我们能期待的是放大,但不是那种范式转变,我不认为那会发生。但一切都会被放大、放大、再放大,而且我看这会持续很长时间。是啊,我猜我的意思是——
206:16
also at the same time improve everything around it to like you know like the engineering of the
同时也在改进周围的一切,比如工程层面,
206:21
context and inference scaling and I the big labs will still keep doing that and now also the
context和inference scaling,大实验室会继续做这件事,现在小实验室也会跟上,因为情况就是他们正在招更多人,会有更多人参与LLM。这就像个循环,他们也让这些模型变得更高效,有点像范式转变。我不觉得真是这样,但一切只会被放大、放大、再放大,而且我看这种情况还会持续很久。是啊,我觉得我的cloud code是个能做很多事的通用模型,但它不一定非得依赖集成和其他东西。我打赌cloud code在处理你的邮件方面能做得相当不错,最难的部分其实是搞清楚怎么把信息喂给它。
206:27
smaller labs will catch up with that because now it's just like they are hiring more there will be
小型实验室会很快追上,因为现在他们只是在招更多人,会有更多人投入LLM。这有点像,你知道,一个循环——他们也会让这些人变得更高效。这算是一种范式转变,我不觉得真是这样,但一切只会被放大、放大、再放大,而且我看这种情况还会持续很久。是啊,我猜Claude Code是一个能做很多事的通用模型,但它不一定非得依赖集成和其他东西。比如我打赌Claude Code在处理你的邮件方面能做得相当不错,而最难的部分其实是弄清楚怎么把信息喂给它——理解我自己的生活、规划职业路径、找到解决问题的方法。
206:31
more people LLMs it's kind of like you know like a circle they also make them more productive and it
更多人参与 LLM 的优化,这就像一个循环,他们也让彼此更高效,
206:36
it's just it's like amplify I think what we can expect is amplification but not like a change
我觉得更像是放大,我认为我们能期待的是一种放大,而不是那种范式转变。我不觉得会那样,但一切都会被放大、再放大、再放大,而且我看这种情况会持续很长时间。是啊,我猜我的Cloud Code是一个能做很多事的通用模型,但它不一定非得依赖集成和其他东西。我打赌Cloud Code在处理你的邮件方面能做得相当不错,最难的部分其实是弄清楚怎么把信息给它,以及怎么让它能帮你发邮件之类的。但这其实又回到了那种“一个模型统治一切”的理念,就是这样。
206:43
of like a paradigm change I don't think that is true but the everything will be just amplified
这更像是一种范式转变,我不这么认为,但一切只会被放大、放大、再放大,而且我看这种情况还会持续很久。是啊,我觉得这很大程度上取决于集成和其他因素,比如我猜 cloud code 在处理你的邮件方面能做得相当不错,而最难的部分其实是弄清楚如何把信息喂给它。理解我自己的生活,规划职业路径,找到解决问题的方法——想想看,这不只是美国的事,而是全世界的事。全世界的孩子都能学习这些理念,这种影响跨越时间,可能才是真正值得讨论的。说到 GDP,它不会是一个飞跃,而是——我们就是这样才能登上火星的。
206:47
and amplified and amplified and I can see that continuing for a long time yeah I guess my
然后不断放大、再放大,我看这种情况还能持续很久。是啊,我觉得这
206:53
saving with the dream is dying depends on exactly what you think it's going to be doing like
“用梦想来拯救这个说法正在消亡,这完全取决于你想象它具体要做什么。比如,Cloud Code 是一个通用模型,能做很多事情,但也不一定——它很大程度上依赖于集成和其他因素。我打赌 Cloud Code 在帮你处理邮件方面能做得相当不错,而最难的部分其实是弄清楚如何把信息喂给它,以及如何让它能真正帮你发送邮件之类的。但这其实又回到了那个‘一个模型统治一切’的理念——就是云端有个东西,能处理你整个数字生活,比所有人都聪明得多。所以,从这一点出发,确实是一个有趣的信仰之跃。”
206:57
cloud code is a general model that can do a lot of things but it's not like necessarily like
cloud code 是一个通用模型,能做很多事情,但也不一定非得这样——它很大程度上依赖于集成和其他东西。我敢打赌 cloud code 在处理你的邮件方面能做得相当不错,而最困难的部分是弄清楚如何把信息喂给它。理解我自己的生活、规划职业轨迹、找到解决问题的方法——想想看,这不只是美国的事,而是全世界的事。全世界的孩子都能学到这些理念,这种跨越时间的影响力,可能才是真正重要的。说到 GDP,它不会是一个跳跃式的增长,而是——这就是我们如何登上火星、如何建造这些东西、如何催生一百万个新的 OpenAI,以及所有这类创新的方式。
207:05
depends a lot on integrations and other things like I bet cloud code could do a fairly good job
很大程度上取决于集成和其他因素,比如我猜 Cloud Code 在处理你的邮件方面能做得相当不错,
207:09
with doing your email and the hardest part is figuring out how to give the information to it
最难的部分其实是搞清楚怎么把信息喂给它。
207:13
and how to get it to be able to send your emails and stuff like this but that's just kind of like
以及如何让它能帮你发邮件之类的,但这其实有点像
207:18
I think it goes back to like what is the one model to rule everything ethos which is just like
我觉得这又回到了“一个模型统治一切”的理念,就像
207:24
a thing in the cloud that handles your entire digital life and is way smarter than
云端有个东西能打理你整个数字生活,而且比所有人都聪明得多,感觉它就像在另一个维度运作。所以这其实是个挺有意思的信仰之跃。我觉得行业里那些话术有点不一样。作为普通用户,我们接下来马上能感受到的Adams相关变化,可能跟一些特别琐碎的事情有关,比如画图表。现在Adams画图表简直一塌糊涂。是不是因为我们用到的都是廉价模型,背后分配的inference compute特别少?也许已经有某些偏门方法能画出更好的图表了,但如果你现在让它画个xyz流程图,大部分时候结果都很糟糕。这其实有点像——
207:30
everybody it's like it's operating in a so it's an interesting leap of faith to go from
每个人都在这个框架里运作,所以这其实是一个有趣的信仰之跃,从
207:36
cloud code becomes that which is like in some ways is there's some avenues for that but I do
云代码在某些方面确实有实现的途径,但我觉得行业的宣传口径有点不一样。作为一个普通用户,接下来我们最直观能感受到的变化,可能还是跟一些琐事有关——比如画图表。现在AI画图表的能力简直糟透了,这是不是因为我们后台用的是廉价模型,推理算力分配得很少?其实有些取巧的方法已经能画出更好的图表了,但如果你今天让它画个xyz流程图,大部分时候结果都很糟糕。这对人类来说明明是很简单的任务,有时候我觉得手绘反而比写代码更容易。
207:44
think that like the rhetoric of the industry is a little bit different I think the immediate also
我觉得行业的宣传口径有点不同,而且我认为接下来
207:50
thing we will feel next as a normal person using addams is will probably be related to something
作为一个普通用户使用Adams时,我们马上会感受到的,可能跟
207:56
like also trivial like making figures right now addams are terrible at making figures is it because
一些琐碎的事情有关,比如制作图表。现在Adams在制作图表方面表现很差,这是不是因为我们
208:02
we are getting served the cheap models with very less like less inference compute than behind
被分配到了廉价模型,背后使用的推理算力很少?
208:07
the scenes maybe some like there are some cranks we can already get better figures but if you ask
也许有些“高手”已经能做出更好的图表了,但如果你去问
208:12
today I don't draw a flow chart of xyz it's most of the time terrible and it is kind of like a
今天我也不会画什么xyz的流程图,大部分时候都画得很烂,这更像是理解我自己的生活、规划职业路径、解决身边的各种问题,以及通过人类历史去学习任何东西。我觉得好像没人真正思考过——这不只是美国,而是全世界,全世界的孩子都能学到这些想法。这种影响跨越时间,可能才是真正重要的。要说GDP的话,它不会是一个飞跃,而是我们怎么去火星、怎么造出这些东西、怎么涌现出一百万个新的OpenAI,以及由此产生的所有创新。而这只是一股安静的力量,渗透到一切事物中,对吧?人类。
208:19
very simple task for human I think it's almost easier sometimes to draw something then to write
对人类来说很简单的任务,我觉得有时候画出来比写出来更容易。
208:24
something yeah the multimodal understanding that's feeling something that is odd that it's not
对,多模态理解这块确实有点奇怪,感觉还没被很好地解决。我觉得我们其实没在说一个很明显的事——我们没真正意识到,有一件巨大且难以衡量的事正在发生:那就是让全人类的知识对全世界每个人触手可及。你看,我觉得有个很难说清楚的点,但Google搜索和LLM之间真的存在巨大差异。我感觉现在基本上什么都能问,而且能得到答案,幻觉也越来越少、越来越少。这意味着我能理解自己的生活,规划职业路径,解决身边的各种问题,了解人类历史上的任何知识——我觉得好像还没人真正意识到这一点。
208:29
better solved I think we're not saying one actually obvious thing that we're not actually realizing
更好的解法是,我觉得我们没在说一个其实很明显、但自己都没意识到的事。
208:35
that's a gigantic thing that's hard to measure which is making all of human knowledge accessible
那是一件巨大且难以衡量的事——让全人类的知识对全世界开放。
208:40
to the entire world like we I one of the things that I think it's hard to articulate but there's
比如,我觉得很难说清楚,但Google搜索和LLM之间真的有很大区别。
208:48
just a huge difference between Google search and an llm like I feel like I can basically ask an
我感觉我基本上可以问任何问题,然后得到答案,而且幻觉越来越少、越来越少。
208:56
anything and get an answer and less is doing less and less and less hallucination and that means
这意味着,理解我自己的生活、规划职业路径、解决身边的各种问题、了解人类历史上的任何事——我觉得没人真正意识到这一点。
209:05
understanding my own life figuring out a career trajectory figuring how to solve the problems
理解自己的人生,规划职业道路,想办法解决问题。
209:11
all around me learn about anything through human history that like I feel like nobody's really
放眼整个人类历史,我觉得好像没人真正思考过——这不仅仅是美国的事,而是全世界的事。全世界的孩子都能学到这些知识,这种跨越时间的影响力,可能才是真正的关键。说到GDP,它不会是一个飞跃,而是我们如何登上火星、如何建造这些东西、如何诞生一百万个新的OpenAI,以及由此产生的所有创新。而这只是一股安静的力量,渗透到一切之中——人类提出问题,也给出答案。但如果你想从零开始学习一个主题,我觉得还是得有人把它线性地梳理出来,这就像是一种经过验证的学习策略。
209:20
talking about that because they just immediately take it for granted it's just this is awesome that's
说到这个,因为他们直接就理所当然地觉得这太棒了,这就是为什么大家都在用——因为你能得到各种问题的答案。而且这种影响会随着时间扩散开来,想想看,这不只是美国的事,全世界都一样。全世界的孩子都能学到这些知识,这种长期的影响,可能才是真正值得讨论的。要说GDP的话,它不会是一个跳跃式的增长,而是我们靠这个去火星、去造那些东西、去诞生一百万个新的OpenAI,所有那些创新都会从那里涌现出来。而这就像一种安静的力量,渗透到一切事物中,对吧?人类知识。我同意你的看法,从某种意义上说,它确实让知识变得更易获取了。
209:26
why everybody's using it is because you get answers for stuff and like the impact of that across time
大家之所以都在用,是因为你能直接得到各种问题的答案,而且这种影响会随着时间持续放大。想想看,这不只是美国的事,而是全世界的事——全世界的孩子都能学到这些知识。这种长期影响,才是真正值得讨论的。说到GDP,它不会是一个跳跃式的增长,而是我们怎么去火星、怎么造出这些东西、怎么诞生一百万个新的OpenAI,以及由此引发的所有创新。这股力量悄无声息地渗透到一切事物中,对吧?人类知识。我同意你的观点,从某种意义上说,它让知识变得更易获取,既能提问也能回答。但如果你想从零开始学一个领域,我觉得,再说一次,我们……
209:33
like think about this is not just the United States is all across the world like kids throughout the
想想看,这不只是美国的事,全世界都一样——全世界的孩子都能学到这些理念,这种影响跨越时间,可能才是真正重要的。要说GDP的话,这不会是一次飞跃,而是我们如何到达火星世界的方式。
209:39
world being able to learn these ideas like the impact that has across time is probably that's
“LLM能做的十大事情是什么”——现在问LLM比问互联网上任何东西都好得多。
209:47
where the real like to talk about gdp it won't be like a leap it'll be that's how we get to Mars
那是因为它们目前被大规模补贴着,未来会靠广告来买单。
209:53
that's how we build these things that's how we have a million new open AIs all the kind of innovation
这就是我们构建这些东西的方式,也是我们拥有上百万个新的OpenAI和各种创新的原因。
209:59
that happens from there and that's just this quiet force that permeates everything right human
从那里开始,这种安静的力量渗透到一切,对吧,人类。它会提问,也会回答,但如果你想从头学一个主题,我觉得还是像我们之前说的那样,有人把它线性地铺开,这算是学习这个主题的经过验证的策略。先吸收文本内容,然后用LLM生成无数练习题,比如你在某个领域有问题,或者有些东西不确定,或者你对某些事情感到不确定,你就让它生成例题,你解答它们,然后你又有问题,接着它不会给你任何课本之外的东西,那只是包装。举个例子,比如你不喜欢,假设你打算去迪士尼乐园,你想搞清楚怎么安排。
210:05
knowledge I do agree with you and in a sense you make it makes knowledge more accessible but
知识方面我同意你的观点,从某种意义上说它确实让知识更容易获取,也能回答问题,但如果你想从零开始学一个主题,我觉得还是像我们之前说的那样,需要有人把内容线性地铺开,这算是学习这个主题的成熟策略。从零开始逐步提升,吸收信息密集的文本是有道理的,然后你可以用LLM来生成无穷无尽的练习题——比如你在某个领域有问题,或者对某些事情不确定,你就让它生成例题,你解答,然后你有疑问,它不会给你课本之外的东西,只是重新包装而已。
210:12
it also I think depends on what the topic is for something like math in a sense you can ask
这也取决于具体话题。比如数学,你可以直接问它问题,它也能回答。但如果你想从零开始学一个领域,我觉得——就像我们之前聊过的——最理想的方式是:确实有很好的数学教材,作者已经把内容线性地编排好了,这可以说是经过验证的学习路径。从零开始,逐步提升,读一本信息密度高的书来吸收知识,这很合理。然后你再拿LLM来生成无穷无尽的练习题——比如针对某个特定领域的问题,或者你有不确定的地方,就让它生成例题,你来做,做完还有疑问,再继续问。
210:19
it questions it answers but if you want to learn a topic from scratch I think that again like we
它提出问题,也给出答案,但如果你想从头学习一个主题,我觉得还是那样,
210:26
talked about this earlier I think the sweet spot is I mean there are really good math textbooks
之前聊到过这个,我觉得最理想的方式是——确实有一些很好的数学教材,作者按线性逻辑编排内容,这算是学习某个主题的成熟策略。从零开始逐步进阶,啃一本信息密度高的书确实有效。但你可以用LLM来生成无穷无尽的练习题:比如针对某个薄弱环节,或者对某些概念不确定时,让它生成例题,你做完再提问。它不会给你教材之外的内容,只是换种方式重新组织知识点。不过有些地方我觉得它确实能带来额外价值。
210:31
where someone laid it out linearly and that is like let's say proven strategy to learn this topic
就像有人把它线性地铺开,这可以说是学习这个主题的成熟策略。
210:36
and it does make sense if you start from zero to ramp up to get like a like a information dense
从零开始逐步提升到信息密集型的文本,确实有道理,这样能快速吸收内容,然后你可以用LLM生成无限量的练习题——比如你在某个领域遇到问题,或者对某些事情不确定、有疑问,就让它生成例题,你解答,再提问。但话说回来,它不会给你任何课本里没有的东西,它只是重新包装。举个例子,假设你打算去迪士尼乐园,想搞清楚该买哪个园区的门票、什么时间去,这种问题课本里可没有,也没有信息密集型的资源,只有稀疏的互联网信息,这时候LLM就很有价值了。
210:42
text to soak it up but then you use the LLM to make infinite exercises like you you have problems
先通过文本吸收内容,然后你用LLM来生成无穷无尽的练习,比如你在某个领域有问题,
210:48
in a certain area and or have questions something's uncertain or like you are uncertain about certain
或者有不确定的地方,或者你对某些事情感到疑惑,
210:53
things you ask it to generate example problems you solve them and you have questions and then
你让它生成示例问题,你解决它们,然后你又有新的问题,
210:59
maybe you need more background knowledge and you ask it to to generate that and I think but
可能需要更多背景知识,你让它生成那些内容,但我觉得它不会给你任何教科书里没有的东西,只是换了个方式包装而已,这么说你能理解吧。但有些地方我觉得它确实能创造价值,而且是更实时的价值,除了让人现场临时处理之外没有更好的替代方案。比如,我不太喜欢这么说,但假设你计划去迪士尼乐园,想搞清楚该买哪个公园的哪种门票、什么时间去——这种事没有教科书可查,也没有信息密集的资源,只有零散的互联网信息。这时候LLM就很有价值了,你直接问它,你有这些限制条件:我这些天出行,我想去……
211:03
then it won't give you anything let's say that is not in the textbook it's just packaging
接着它不会给你任何超出课本范围的东西,只是重新包装。
211:11
it differently if that makes sense but then there are things I feel like where it also adds value
这么说可能有点不一样,但有些地方我觉得它确实能带来价值。比如,假设你要去迪士尼乐园玩,想搞清楚该买哪个园区的票、什么时间去,这种问题没有教科书可查,也没有信息密集的资源,只有零散的互联网信息。这时候LLM就很有价值了,你直接问它,它知道你的限制条件——我这些天旅行,想去哪个世界,有什么必做的十件事——LLM比互联网上任何东西都好用。不过目前这是因为它们被大规模补贴了,以后会靠广告来付费。广告和上下文无关,这点我几年前就提过。
211:16
in a more I mean timely sense where there is no good alternative besides human doing it on the fly
从更及时的角度来看,有些场景除了人类现场临时处理之外,根本没有好的替代方案。比如,假设你打算去迪士尼乐园,想搞清楚该买哪个园区的门票、什么时间去,这种问题没有教科书可查,也没有信息密集的资源,只有零散的互联网信息。这时候LLM就很有价值了——你直接问它,告诉它你的限制条件,比如“我这几天旅行,想去迪士尼世界,有什么必做的十大项目?”LLM比互联网上任何东西都好用。目前这是因为它们被大规模补贴,未来会靠广告来盈利。而广告和上下文无关的内容——这个观点我几年前就提过。
211:24
for example if you I don't like let's say you're planning to go to Disneyland and you try to figure out
举个例子,比如你计划去迪士尼乐园,然后你想搞清楚怎么安排。
211:29
which tickets to buy for which park when well there is no textbook on that there's no information
哪个公园该买哪种票,这个确实没有教科书可循,也没有现成的信息。网上资源很零散,但在LLM的世界里,问“十大必玩项目”这种问题,LLM比互联网上任何东西都好用。目前是因为它们被大幅补贴,未来会靠广告来买单。广告本身没什么问题,这是我几年前就提过的。但我觉得这正是大家担心的——那种微妙的、隐含的信息。这也引出了广告这个话题,我本来想在2025年推出这个功能,因为我觉得现在时机还没到。
211:35
dense resource and that there's only the sparse internet and then there is a lot of value in the LLM
密集的资源,而只有稀疏的互联网,然后在LLM的世界里有很多价值。现在问LLM比问互联网上的任何东西都好得多,排名前十的事情是什么?目前这是因为它们被大规模补贴,未来会通过广告来支付。广告,以及不在那个上下文里的东西——这是我几年前提到过的。要明确这一点,但我觉得这正是大家所担心的,像是那种微妙的、你懂的、隐含的信息之类的。但这也把我们带到了广告这个话题,我认为这是我希望在2025年尝试推出的东西,因为我觉得现在大家还是在互相砸钱抢用户,就像Instagram广告那样。
211:40
you just ask it it has you have the constraints I'm traveling these in these days I want to go
你直接问它就行,它有没有那些限制?我这几天在旅行,想去世界各地,问LLM“前十件必做的事”比上网搜好太多了。目前是因为它们被大规模补贴着,以后会靠广告来赚钱。广告和那些上下文无关的东西——我几年前就提过这个,得说清楚——但我觉得这正是大家担心的,就像那种隐晦的、你懂的,藏在里面的信息。不过这也引出了广告这个话题,我想这就是我2025年打算尝试推出的东西,因为我觉得它现在还没通过其他方式盈利,所以像在里面植入真正的广告位,然后……
211:45
there and there please figure out what I need when and from where what what it costs and stuff like that
你帮我搞清楚,我需要什么、什么时候要、从哪里拿、要花多少钱,还有诸如此类的事。
211:50
and it is very customized on the fly package and then this is like one of the thousand examples
而且它是那种实时高度定制化的方案,这只是上千个例子中的一个。
211:57
and exercise personalized personalization is essentially like pulling information from the sparse
个性化说白了,就是从稀疏的互联网里提取信息——那些信息密度低、没有现成更好版本的地方,根本不存在,你几乎得从零开始造。
212:03
internet the non-information dense thing where there is no better version that exists it just doesn't
就算存在,也全是那种迪士尼乐园式的废话,或者怎么说呢,广告堆砌,根本没法用。
212:10
exist you make it from scratch almost and if it does exist it's full of speaking a Disney world
比如,随便说个世界上的城市,问“前十件必做的事”,LLM 的回答比互联网上任何东西都好得多。
212:15
like full of what would you call it add slum like it's just as impossible here you go any city in the
目前是这样,因为它们被大规模补贴着,未来会靠广告来买单。
212:23
world what are the top 10 things to do LLM is just way better to ask than anything in the internet
广告,以及不在那个上下文里的东西——我确实说过,这是我几年前提到过的。
212:30
for now that's because they're massively subsidized and they're going to be paid for by ads
要说明白这一点,但我觉得这正是大家害怕的——那种微妙的、你懂的,微妙的。
212:37
coming no oh I hope they're I mean I'm hoping there's a very clear indication of what's
来了,哦不,我希望他们——我是说,我希望在那个场景里,能非常清楚地标明什么是广告、什么不是。这一点我几年前就提过,比如“你在找新跑鞋吗,妈妈?Nike刚好排在前面,这是巧合吗?也许吧,也许不是。”我觉得这方面是有明确法规的,你必须说清楚。但大家真正怕的是那种——你知道,那种很隐晦的暗示。不过这也引出了另一个话题,就是广告。我记得我本来想在2025年推出这个功能,因为目前它还没通过其他方式盈利,所以像在里面插入真正的广告位,然后——
212:44
an ad and what's not in that context I did I mean that's something I mentioned a few years
要说明白这一点,但我觉得这正是大家所担心的,就是那种微妙的、你懂的、微妙的……
212:48
ago is like I don't know if you are looking for a new running shoe mom is this a coincidence that
之前说到,我不知道你是不是在找新跑鞋,妈妈,这算巧合吗?Nike可能排在前面,也许吧,也许不是。但我觉得这方面有明确的法律规定,你必须说清楚。不过我认为这正是大家害怕的地方——那种微妙的、隐含的信息之类的。这也引出了广告这个话题,我觉得这正是我试图在2025年推出的东西,因为目前它还没通过其他方式盈利。所以就像是在里面放真正的广告位,然后引流到其他产品。而且这真的很疯狂,他们互相较劲,花那么多钱就为了抢用户。我觉得就像某些Instagram广告那样。
212:54
Nike maybe comes up first maybe maybe not and but I think there are clear laws around this you have
Nike 可能第一个冒出来,也可能不是,但我觉得这方面有明确的法律规定,你必须说清楚。不过我认为这正是大家害怕的地方——就是那种微妙的、你懂的,藏在里面的信息之类的。但这也把我们带到了广告这个话题上,我觉得这就是那个东西,希望我能在 2025 年推出,因为我觉得现在它还没用那种方式赚钱。所以就像在里面放真正的广告位,然后用户就涌向其他产品。而且这也挺疯狂的,他们互相较劲,花那么多钱就为了抢用户。我觉得有些 Instagram 广告确实跟你的产品很搭,这是 Instagram 广告最好的情况了。
213:01
to be clear about that but I think that's what everyone fears it's like the subtle you know subtle
我认为这就是我试图在2025年推出的原因,因为我觉得现在时机仍然不成熟。
213:07
message in there or something like that but it also brings us to the topic of I guess ads where
消息里大概有类似的内容,但这也把我们带到了广告这个话题上。我觉得这就是我打算在2025年尝试推出的东西,因为我认为现在大家还在互相砸钱抢用户,就像Instagram上的那些广告一样。AI的力量可以融入这种积极的视角——比如我是一个普通人,经营着一家小生意,我想做出全世界最好的牛排刀,然后卖得更好。这对世界来说其实是件好事,尤其是在数字基础设施方面,因为现代网络就是这样建起来的。但这并不是说,那些让人上瘾的信息流、好让你能展示更多内容给用户就是件好事。所以我觉得,这大概就是我想说的开场白了。
213:12
I think this was the thing hope me I try to launch in 2025 and just to because I think it's still not
人们太容易被那些推动前沿的头条新闻冲昏头脑了,我觉得这有点过头了。
213:19
making money in that other way right now so that like having really like ads spots in there and then
现在靠那种方式赚钱,比如在里头塞一堆广告位,然后互相砸钱抢用户。我觉得有些Instagram广告确实跟你的产品很搭,那是最理想的情况。但AI的力量可以结合这种正面场景——比如我是个普通人,开了个小生意,想做全世界最牛逼的牛排刀,想卖得更好。这对世界是好事,尤其是有了数字基础设施,毕竟现代互联网就是这么建起来的。但这不代表那些让人上瘾的信息流、为了给你推更多内容而设计的东西就是好的。所以我觉得,这大概就是我的开场白了。
213:25
the thing though is they couldn't because well there are alternatives without ads and people would
但问题是他们做不到,因为毕竟还有无广告的替代品,用户会直接涌向其他产品。而且这真的很疯狂,他们互相较劲,砸那么多钱就为了抢用户。我觉得像Instagram广告那样——虽然我不用Instagram,但我理解花钱在平台上找到真正会喜欢你产品的用户,这确实是广告最理想的情况。但也有大量案例表明,广告对激励机制非常有害。我认为,如果AI的能力能融入那种积极的视角——比如我是一个人,经营着小生意,我想做出全世界最好的牛排刀,我想卖出去——那会更好。
213:30
just flock to the other products and it also is it's just like crazy how yeah like they're one
大家都涌向其他产品,而且真的挺疯狂的,他们互相较劲,花那么多钱就为了抢用户。我觉得吧,有些Instagram广告确实让人真心喜欢你的产品,这是最理想的情况。但AI的力量可以结合这种正面视角——比如我是一个普通人,经营着小生意,想做全世界最好的——我也不知道——牛排刀,然后想卖得更好,这对世界是件好事,尤其是结合数字基础设施,因为现代网络就是这么建起来的。但这并不是说,那些让人上瘾的信息流、为了给你推送更多内容而设计的东西就是好事。所以我觉得,这甚至就是我开头想说的。
213:37
upping each other spending so much money to just get the users I think so like some Instagram ads
互相砸那么多钱就为了抢用户,我觉得就像Instagram广告那样。AI的力量可以和那种积极的观点结合,比如“我是一个人,我有个小生意,我想做出世界上最好的——我也不知道——顶级牛排刀,然后卖得更好”,这对世界很有好处,尤其是在数字基础设施方面,因为现代网络就是这么建起来的。但这并不是说,让人上瘾的信息流、好让你给用户展示更多内容就是好事。所以我觉得,这甚至可以说是它的溢价所在,你会通过股权和这些授权协议获得回报,这对员工更有利,但它本质上还是那种规避反垄断的做法。不过我认为,这种趋势是……
213:43
I don't use Instagram but I understand the appeal of paying a platform to find users who will
我不用Instagram,但我能理解付费给平台来找到真正喜欢你产品的用户这种吸引力,Instagram广告就是最好的例子。不过也有很多情况,广告对激励机制非常糟糕。我觉得,如果AI的能力能结合这种正面视角——比如我是一个人,经营一家小生意,我想做出全世界最好的、呃,该死的牛排刀,并且想卖得更好——这对世界是件好事,尤其是在数字基础设施方面,因为现代网络就是这样建起来的。但这并不是说,让人上瘾的信息流以便给用户展示更多内容就是好事。所以我觉得,这甚至是我会说的开场白。
213:51
genuinely like your product and that is the best case of things like Instagram ads but there are
真心喜欢你的产品,这是像Instagram广告这类东西最理想的情况。但AI的力量可以结合这种正向视角——比如我是一个人,经营着一家小生意,我想做出全世界最棒的牛排刀,并且想卖得更好。这对世界来说其实是件好事,尤其是有了digital infrastructure,因为现代web就是靠这个搭建起来的。但这并不是说,那些让人上瘾的信息流、为了给你推送更多内容而设计的东西就是好事。所以我觉得,这甚至可以说是你在每个用户身上投入成本的优势所在。但现在这个领域钱太多了,以至于它成了一种溢价,你会通过股权和这些licensing deals获得回报。
213:57
also plenty of cases where advertising is very awful for incentives and I think that a world where
还有很多情况是,广告对激励机制非常糟糕。我觉得在一个世界里,AI 的力量可以融入那种积极的视角——比如我是一个人,经营着一家小生意,我想做出世界上最好的、呃,该死的牛排刀,并且想卖得更好——这对世界是很有益的,尤其是在数字基础设施方面,因为现代网络就是这样建起来的。但这并不是说,让人上瘾的信息流、以便给用户展示更多内容就是好事。所以我觉得,这甚至就是 OpenAI 所说的“用户自主权”。我个人认为,Google 可能会更擅长解决这个问题,因为他们已经有广告供应了,而且他们知道如何利用这一点。
214:03
the power of AI can integrate with that positive view of like I am a person and I have a small
Alex,他们俩都很聪明,但我就是很难完全理解这一切。
214:08
business and I want to make the best I don't know damn steak knives in the world and I want to sell
做生意,我想做出世界上最好吃的牛排刀,然后卖出去。
214:14
them to somebody who needs them and if like if AI can make that sort of advertising thing work even
把广告推给需要的人,如果AI能让这种广告模式运作得更好,那对世界是件好事,尤其是在数字基础设施方面——毕竟现代互联网就是这么建起来的。但这不等于说,那种让人上瘾的推送、为了让你多看内容而设计的机制就是好东西。所以我觉得,OpenAI的态度大概是:他们想找到一种方式,既能通过广告获得收益,又能让用户保留自主权。我个人认为,谷歌更有可能解决这个问题,因为他们已经有现成的广告供应体系,也知道如何把Gemini应用里的用户需求转化成有用的广告。一旦他们能做到这一点,就能直接启动,而其他人自然会跟上。
214:20
better that's very good for the world especially with like digital infrastructure because that's how
这样对世界很好,尤其是数字基础设施,因为现代网络就是这么建起来的。
214:25
like the modern web has been built but that's not to say like addicting feeds so that you can
但这并不是说,让人上瘾的信息流、不断给人推更多内容就是好事。
214:32
show people more content is a good thing so I was like I think that's even what opening I would say
所以我觉得,这甚至是我会说的“溢价”部分,你会因为股权和这些授权协议获得回报。
214:37
is they want to find a way that can make the monetization upside of ads while still giving their
他们的想法是,找到一种既能从广告中获取收益,又能让用户保留自主权的方式。我个人觉得,Google 在这方面可能会做得更好,因为他们已经有现成的广告供应,而且如果能想办法把 Gemini 应用里的这些需求转化成有用的广告,那他们就能直接开启这个功能。中间可能会有人想出类似“推广一下”这样的机制。这对我以及很多其他人来说都是如此,而他们正在视频领域建立起如此主导的地位。所以我认为关键在于,广告能让你在每位用户上的支出保持持续优势,而目前这个领域里投入的资金量实在太大了。
214:43
users agency and I personally would think that Google is probably going to be better at figuring out
用户的自主权,我个人觉得谷歌可能会更擅长解决这个问题,因为他们已经有广告供应,并且知道如何把这个优势转化为每个用户的花费。但现在这个领域钱太多了,所以它是有溢价的,你会因为这些股权而获得回报,而这些授权协议本质上很多时候是在争夺顶尖人才。我觉得Grock和Nvidia的交易据传对员工更有利,但这仍然是为了规避反垄断。不过我认为这种整合趋势本该更早发生,但现在看来有些情况开始转变了。与此同时,你还会看到一些公司融到了离谱的巨额资金。
214:48
how to do this because they have they already have ad supply and they figure out how to turn this
怎么做呢,因为他们已经有广告供应了,而且他们知道怎么把这个优势转化成你在每个用户上的花费,但现在这里面钱太多了,所以它成了溢价,你会因为这种股权得到回报,而这些授权协议本质上是在争夺顶尖人才。很多时候,我觉得Grock跟Nvidia的传闻交易对员工来说更好,但它仍然是为了规避反垄断。不过我认为这种整合趋势本该更早发生,但现在看来有些东西开始转变了。但同时,有些公司通过拥有大量用户数据,正在筹集巨额资金来占据位置。是的,我们之前也聊过持续学习之类的东西,他们确实有。
214:55
demand in their Gemini app into useful ads then they can turn it on and somebody will figure
他们在Gemini应用里的需求可以转化成有用的广告,然后他们一开启这个功能,自然会有人想办法搞定中间环节。大概会像这样,系统会提示“推广一下”之类的。
215:02
I don't know if I think it's this year but there will be experiments with it.
我不确定是不是今年,但肯定会有相关的实验。
215:06
I do think what holds companies back right now is really just that the competition is not doing it
我觉得现在阻碍公司推进这件事的,其实就是竞争对手还没做。
215:11
it's more like more like a reputation thing it's just like I think people are just afraid right now
这更像是个声誉问题,我觉得大家现在就是害怕。
215:16
like ruining or like losing the reputation and losing users because it is it would make headlines
怕搞砸了,怕失去声誉和用户,因为一旦有人推出这种广告,肯定会成为头条新闻。
215:21
if someone launched these ads unless they were great but the first ads won't be great because
除非广告效果很好,但第一批广告肯定不会好,因为这是个很难解决的问题,我们根本不知道该怎么解决。
215:25
it's a hard problem that we don't know how to solve yeah I think also the first version of that
对,而且我觉得第一版很可能就像X平台上的时间线那样,中间偶尔会出现一条推广帖子。
215:29
will likely be something like on X like the timeline where you have like a promoted post sometimes
大概就是那种形式,上面会写着“推广”之类的字样。
215:34
in between it would be something like that where it will say like promote it or something like
靠我和其他很多人,他们正在视频领域建立起如此主导的地位。
215:38
small and then there will be an image or something I think right now the promise makes the first move
小一点,然后会有一张图片之类的。我觉得现在这个承诺是先发制人的。
215:42
if we go 10 years out the proposition for ads is that you will make so much money on ads by
如果往十年后看,广告的商业模式就是:你能通过海量用户从广告上赚到那么多钱,然后用这些钱去优化研发、做出更好的模型。
215:48
having so many users that you can use this to funnel better R&D and make better models
这就是为什么YouTube在视频领域占据主导地位,像Netflix都怕YouTube。
215:53
which is why like YouTube is dominating the market for any like Netflix is scared of YouTube like
他们——我每个月付28美元给YouTube Premium,他们从我身上至少赚28美元,还有无数其他人也一样——就这样在视频领域建立了绝对优势。
216:00
they have like they make I don't I pay $28 a month for premium they make at least $28 a month
所以我觉得这个逻辑就是:广告能让你在每位用户上的投入保持持续优势,而现在这个市场里的钱实在太多了。
216:06
off of me and many other people and they're just like creating such a dominant position in video
所以我认为核心逻辑是:广告能让你在每位用户上的投入成本保持持续优势,但现在这个领域钱太多了,以至于产生了溢价,你会通过股权获得回报,而这些授权协议本质上是在争夺顶尖人才。
216:12
so I think that's the proposition which is that ads can make you have a sustained
很多时候,我觉得Grock给Nvidia的协议据说对员工更有利,但这仍然是一种规避反垄断的做法。不过我认为这种趋势是——
216:17
advantage in what you're spending per user but there's so much money in it right now that it's
每个用户的花费上有优势,但现在这个领域钱太多了,所以它其实是一种溢价,你会通过这种股权和授权协议获得回报,这对员工更有利,但它本质上还是在规避反垄断。不过我觉得这种整合趋势本该更早发生,但现在有些迹象开始转变了。与此同时,有些公司为了占据市场地位,靠海量用户数据筹集了巨额资金。对,我们之前聊过持续学习之类的东西,他们有一个作曲家模型,是对中国某个大型混合专家模型进行微调后的版本,每90分钟根据用户实际使用反馈更新一次模型权重。
216:23
like like somebody's starting that flywheel is scary because it's a long term but
就像有人启动了那个飞轮,这很可怕,因为它是长期的,但
216:29
do you think there'll be some like crazy big moves this year business-wise like somebody like
你觉得今年会不会出现一些疯狂的商业大动作?比如
216:35
Google or Apple acquiring a thropic or something like this Dario will never sell but we are
Google 或 Apple 收购 Anthropic 之类的?Dario 肯定不会卖,但我们
216:42
starting to see some types of consolidation with like rock for $20 billion and scale AI for
已经开始看到某种形式的整合了,比如 Rock 以 200 亿美元、Scale AI 以
216:48
almost 30 billion and countless other deals like this that they're structured in a way that is
近 300 亿美元的估值成交,还有无数类似的交易。这些交易的结构
216:54
actually detrimental to the Silicon Valley ecosystem which is this sort of licensing deal where not
实际上对硅谷生态是有害的——它们是一种授权协议,
216:59
everybody gets brought along rather than a full acquisition that benefits the rank and file
并不是所有人都能跟着受益,而不是像全面收购那样,让普通员工
217:05
employee by getting their stock vested like that's a big issue for Silicon Valley culture to
通过股票归属获利。这对硅谷文化来说是个大问题。
217:09
address because the startup ecosystem is the lifeblood where if you get a if you join a startup
因为创业生态是命脉,如果你加入一家初创公司,即使它没那么成功,你的公司也很可能以较低的溢价被收购,你的股权就能变现。而这些授权交易很多时候本质上是在挖走顶尖人才。我听说Grock卖给Nvidia的交易对员工更有利,但这本质上还是为了规避反垄断。不过我认为这种整合趋势会持续下去。我和许多我尊敬的聪明人一直以为整合会更早发生,但现在看来有些苗头才开始显现。与此同时,有些公司还在融离谱数额的资金。
217:16
even if it's not that successful your startup very well might get acquired on a cheap
就算你的创业公司没那么成功,也很有可能被低价收购,拿到一笔溢价,你的股权就能变现。这些授权交易本质上是在抢顶尖人才。很多时候,我觉得Grock卖给Nvidia的交易,传闻中对员工更有利,但这仍然是为了规避反垄断。不过我认为这种整合趋势还会继续。我和很多我尊重的聪明人一直以为整合会更早发生,但现在看来有些事开始有变化了。与此同时,今年有些公司融了离谱的钱,但整合的压力也开始显现——这还挺让人意外的。
217:21
premium of it and you'll get paid out for this equity and these licensing deals are essentially
这些协议本质上对员工更有利,但它仍然是一种规避反垄断的手段。
217:26
taking the top talent a lot of the times I think the deal for Grock to Nvidia is rumored to be
很多时候,挖走顶尖人才,我觉得像Grock跳槽到Nvidia的传闻,据说给员工的待遇更好,但这本质上还是为了规避反垄断。不过我认为这种整合趋势本该更早发生,但现在看来有些苗头正在显现。与此同时,有些公司凭借海量用户数据,正在疯狂融资抢占位置。对,我们之前聊过持续学习之类的东西,他们有个composer模型,是对中国某个大型混合专家模型进行fine-tune的版本,每90分钟就会根据用户真实反馈更新一次模型权重。这有点像Anthropic更专注的方向,但当你跟业内人士交流时,感觉他们正在解决大量实际问题。
217:31
better to the employees but it is still this antitrust-avoiding thing but I think that this trend of
不过我认为,这个趋势是——
217:38
consolidation will continue I've been me and many smart people I respect have been expecting
整合还会继续,我和很多我尊重的聪明人一直以为整合会更早发生,但现在看来有些苗头才开始显现。不过与此同时,有些公司今年又融了离谱数额的钱,但整合压力确实开始出现了——说起来还有点意外,比如Q那边的整合。顺便一提,现在初创公司太多了,而且AI初创公司的估值溢价非常高,所以很可能会有大量十亿美元级别的收购案,这对一家可能才成立一年的初创公司来说,真是天价收购。比如Meta投资的这家新加坡公司Minus AI,成立才八个月。
217:43
consolidation to have happened sooner but it seems like some of these things are starting to turn
整合本应更早发生,但看起来其中一些事情开始出现转机。不过与此同时,有些公司正在通过拥有大量用户数据来筹集巨额资金,以占据有利位置。是的,我们之前讨论过continual learning之类的东西,他们有一个composer model,是对中国某个大型mixture of experts模型的fine tune版本,每90分钟根据用户使用的真实反馈更新一次模型权重,这听起来像是一个很夸张的故事。Llama则有点不同,Llama对他们来说是品牌最集中的体现,所以他们可能仍会在开放生态中参与一部分,或者将Llama品牌延续到不同的应用场景。你知道Llama是什么吗?你觉得会有这种可能性吗?
217:49
which but at the same time you have companies raising ridiculous amounts of money for
与此同时,有些公司为了占据位置,靠拥有大量用户数据,融了离谱的钱。
217:55
reasons that you don't like I'm like I don't know why you're taking that money so it's maybe like
你不喜欢的原因,我就像“我不知道你为什么要拿那笔钱”,所以今年可能有点复杂,但一些整合压力已经开始,有点出乎意料的整合。你觉得我们会看到吗?她说这个话题其实从未有过,我是说Grock是个大玩家,而且Grock是带Q的拼写。是的,有很多初创公司,而且AI初创公司的估值溢价非常高,所以可能会有很多交易,比如100亿美元级别的收购,这对一个可能才成立一年的初创公司来说是非常大的收购。比如这家总部在新加坡的公司,Meta创立的,才成立八个月,然后就有20亿美元的退出。我认为还会有其他一些大的收购。
218:00
mixed this year but some consolidation pressure is starting well kind of surprising consolidation
今年有些混杂,但整合压力开始显现,嗯,有点出乎意料地出现了整合压力。
218:06
do you think we'll see she's saying a topic is as a never I mean Grock is a big one and Grock
你觉得我们会不会看到——她说某个话题是“从未有过”的,比如Grock就是个大家伙,而且Grock是带Q的,顺便一提。对,现在有很多初创公司,AI初创公司的估值溢价非常高,所以可能有很多这类交易,比如百亿美元级别的收购,这对一个可能才成立一年的初创公司来说,是笔非常大的收购。我觉得,比如这家总部在新加坡的公司Minus AI,Meta投资创立的,才成立八个月,就实现了20亿美元的退出。而且我认为还会有其他类似的大动作,AI领域存在很大的流动性和压力,大公司有压力要拿出成果。我猜一笔大收购会给人们提供一种方式,去讲述那个故事的下一章。
218:11
with a Q by the way yeah there's just a lot of startups and there's a very high premium on AI
顺便提一下,确实有很多初创公司,而且AI初创公司的估值溢价非常高,所以可能会有很多交易,比如10亿美元级别的收购,这对一家可能才成立一年的初创公司来说,是一笔非常大的收购。
218:16
startups so there's a lot of like there could be a lot of stuff yeah 10 billion range acquisitions
我觉得这家公司是minus AI,总部在新加坡,Meta创立的,才成立八个月。
218:20
which is a really big acquisition for a startup that was maybe founded a year ago I think
通过拥有大量用户数据来占据优势,是的,我们之前聊过持续学习之类的东西。
218:26
minus AI from this company that's based in Singapore that meta founded was founded eight months ago
他们在博客里有两句话特别有意思,说的是他们新的composer模型,是对中国某个大型mixer of expert模型进行fine-tune得到的。
218:31
and then had a two billion dollar exit and I think that there will be some other big like many
然后有个两亿美元的退出,我觉得AI领域还会有其他类似的压力和流动性问题,大公司面临压力需要拿出成果,我猜一次大规模收购会让人有办法开启故事的下一个篇章。
218:37
billion dollar acquisitions like perfect yeah people rumored them to Apple I think there's a lot
像完美这种十亿美元级别的收购案,大家一直传苹果要买他们。我觉得AI行业现在压力很大,流动性也很强,大公司必须拿出成果来。我猜一笔大收购能让人们继续讲这个故事的下一个篇章。没错,说到Cursor,我们可以聊聊代码这块——有人需要Cursor,他们手握海量用户数据,位置太好了。而且我们之前聊过持续学习之类的东西,他们博客里有两句话特别有意思:他们的新Composer模型是对中国某个大型混合专家模型做了fine-tune。这事儿你问Gossip就能知道,因为那个模型有时候会显示中文字体。
218:43
of pressure and liquidity in AI there's pressure on big companies to have outcomes and I would
通过拥有大量用户数据来占据位置,没错,我们还聊到了持续学习之类的东西。他们有一篇博客文章里有两句话特别有意思,说的是他们推出了新的Composer模型,这是对中国那些大型混合专家模型之一进行微调得到的。
218:50
guess that a big acquisition gives people will be way to then tell the next chapter of that story
你可以通过问八卦或者因为模型有时会显示中文字体来知道这一点,模型权重每90分钟就会根据用户使用的真实反馈更新一次,这简直就像——
218:56
I mean yes I guess cursor we can talk about code somebody requires cursor they're in such a good
嗯,对,我觉得Cursor可以聊一聊。有人需要Cursor,他们因为拥有大量用户数据而处于非常有利的位置。对,我们之前也聊过continual learning这些。他们博客里有两句话特别有意思,就是说他们新出的composer模型,是对中国某个大型mixer of expert模型做了fine-tune。这个你问一下gossip就能知道,或者因为模型有时候会显示中文字体。这个模型每90分钟就会根据用户真实使用反馈更新一次权重,这几乎就是最接近真实世界RL在模型上运行的情况了。这些内容就在他们一篇博客里,超级酷。顺便说一句,我觉得用composer log就是它的好处之一。
219:02
position by having so much user data yeah and we talked about continual learning and stuff they had
对,我们还聊过持续学习之类的东西。
219:07
one of the most interesting like two sentences in a blog post which is that they had their new
一篇博客里最有趣的两句话是,他们那个新的composer模型,是对中国某个大型mixer of expert模型做了fine tune,然后每90分钟根据用户真实反馈更新一次模型权重。这听起来有点像Anthropic更专注的方向,但跟人聊下来感觉他们其实在解决很多相同的问题。所以我觉得,未来会有各种不同的产品出现,很多公司都在做,比如Google和xAI(跟X有关联),它们也做其他事情。所以AI很可能会——它们有个优势,就是用户量很大,我觉得它们会直接转型。嗯,如果它们发现这跟Anthropic类似,我觉得它们会转型。我不觉得它们一开始是这么打算的。
219:11
composer model which was a fine tune of one of these large mixer of expert models from China
composer model 是其中一个中国大模型的 fine tune,基于那种 mixture of experts 架构
219:17
you can know that by asking gossip or because the model sometimes are fonts in Chinese which
你可以通过打听八卦知道,或者因为模型有时候会显示中文字体——模型每90分钟根据用户使用的真实反馈更新一次权重,这有点像Anthropic更专注的方向,但当你跟人聊的时候,听起来他们其实在解决很多相同的问题。所以我觉得,会有各种产品分散开来,很多公司像Google和xAI(跟X有关联,但也做其他事情)都在做,所以很有可能如果AI因为——他们的优势是他们有大量用户,我觉得他们会转型,嗯。然后如果他们发现这有点像Anthropic,我觉得他们会转型,我不认为他们最初计划做代码,但碰巧发现,好吧,这是个不错的细分领域,现在我们就做这个了。
219:22
none of the American models do and they had a blog post where they're like we're updating the
美国模型没有一个能做到这一点,他们有一篇博客文章说,他们每90分钟就根据用户使用的真实反馈更新一次模型权重,这几乎就是真实世界中的RL(强化学习)在模型上发生的样子,就在他们的一篇博客文章里,这超级酷。顺便说一句,我提到我用Composer Log,它的一个好处就是速度快,我得试试,因为大家都这么说。而且未来可能会有一些IPO(首次公开募股)。你觉得Anthropic、OpenAI、xAI这些公司,它们都能这么轻松地融到那么多钱,所以只要融资容易,它们就不会去IPO,因为公开市场会施加压力。我觉得在中国情况有点不同,像MiniMax和
219:27
model weights every 90 minutes based on real world feedback from people using it which is like
模型权重每 90 分钟根据用户真实反馈更新一次,这有点像
219:31
the closest thing to real world RL happening on a model it's just like in one of their blog posts
这几乎是模型上最接近真实世界强化学习的东西了,就像他们某篇博客文章里写的那样。
219:36
that's super cool and by the way I just say I use composer log is one of the benefits it has
这太酷了,顺便说一句,我用Composer Log就是因为它有这个好处。
219:42
is this fast I need to try it because everybody says this and there'll be some IPOs potentially
这个快不快?我得试试,因为大家都这么说,而且可能会有一些IPO的机会。
219:47
you think anthropic open AI XAI they can all raise so much money so easily that they don't feel
你觉得Anthropic、OpenAI、xAI,它们都能这么轻松地融到这么多钱,所以它们根本不需要——
219:54
I need to like so long as fundraising is easy they're not going to IPO because public markets apply
只要融资容易,它们就不会去IPO,因为公开市场会施加压力。
219:59
pressure I think we're seeing in China that the ecosystems a little different with both minimax and
我觉得我们在中国看到的情况有点不一样,像Minimax和——
220:04
z.ai applying for filing IPO paperwork which will be interesting to see how the Chinese market reacts
z.ai 正在提交IPO申请文件,看看中国市场的反应会很有意思
220:11
I actually would guess that it's going to be like similarly hypey to the US so so long as all
我其实猜它会跟美国那边一样炒作得很厉害,只要这势头还在,而不是基于它们都在亏大钱这个现实
220:16
this is going and not based on the realities that they're both losing a ton of money I wish more
我真希望更多美国那些巨型AI初创公司能上市,因为看看它们怎么花钱、获得更多透明度会很有趣
220:21
of the American gigantic AI startups were public because it would be very interesting to see how
而且也能让普通人有机会投资这些公司,因为我觉得它们是最具代表性的——它们是这个时代的公司
220:26
they're spending their money and have more insight and also just to give people access to investing
但现在美国很多大初创公司都不上市,这成了惯例,就像我们还在等Stripe的IPO,但Databricks肯定没上市,它们融了那么多钱
220:32
in these because I think that there's some of the most like format like they're the companies of
因为我觉得有些公司特别典型,它们就是这个时代的公司,而现在的传统是,美国很多大型初创公司都不上市。
220:37
the era and the tradition is now for so many of the big startups in the US to not go public it's
就像我们还在等Stripe的IPO,但Databricks肯定没上,它们融了——
220:43
like we're still writing for stripe and the IPO but data bricks definitely didn't they raised like
我倒是希望看到这些公司上市,然后以那种方式进化,就像一家公司本该有的成长路径。
220:47
a series G or something and I just say like it's a kind of a weird equilibrium for the market where
G轮或者类似的东西,我就觉得这市场处于一种挺奇怪的平衡状态——我其实挺想看到这些公司上市,然后像正常公司那样发展。十年后,有些前沿模型公司可能还在,但像OpenAI这种巨头,我完全不觉得会是赢家通吃,除非其中一家真找到了什么算法秘密,比如那种飞轮效应。因为大家的开发路径都太像了,Google和OpenAI的产品线几乎一模一样,Anthropic虽然更专注,但跟人聊起来感觉他们也在解决很多相同的问题。所以我觉得,未来会有各种不同的产品分散开来,这个市场其实非常——
220:54
it's like I would like to see these companies go public and evolve in that way that a company can
我挺想看到这些公司上市,然后以一家公司应有的方式去发展。
221:01
using 10 years from now some of the frontier model companies are still around and
十年后,一些前沿模型公司可能还在,但纵观整个OpenAI,我完全不觉得这会是一个赢家通吃的局面,除非其中一家真的找到了某种算法上的秘密,比如某种飞轮效应——因为大家的开发路径实在太相似了。Google和OpenAI的产品几乎一模一样,而Anthropic虽然更专注,但跟业内人士聊起来,感觉他们解决的都是同一类问题。所以我认为,未来会有各种不同的服务分散开来,这个领域非常……但OpenAI和Anthropic主要还是LLM服务提供商,而其他公司比如Google和xAI(跟X有关联)还做别的事情。所以如果AI真的……那情况就非常多样了。
221:06
throughout big open AI I definitely don't see it to be a winner takes all unless there truly is
纵观整个OpenAI,我完全不觉得这会是一个赢家通吃的局面,除非其中一家真的找到了某种算法上的秘密,比如那种飞轮效应,因为大家的开发路径其实非常相似。
221:12
so algorithmic secret that one of them finds like let's just flywheel because the development
Google和OpenAI的产品线几乎一模一样,而Anthropic则更专注一些。但当你跟业内人士聊起来,会发现他们都在解决很多相同的问题。
221:17
path is so similar for all of them Google and open AI have like all the same products and then
所以我觉得,未来会有很多不同的产品和服务分散开来,这个领域非常广阔。
221:23
like anthropics more focused but when you talk to people it sounds like they're solving a lot of
Anthropics 更专注一些,但跟人聊起来感觉他们好像在解决很多内部问题。Llama 有点不一样,Llama 对他们来说是最能体现品牌专注度的产物,所以他们可能还会在开放生态里参与一部分,或者把 Llama 这个品牌延续到不同的应用场景上。你知道 Llama 是什么吧?你觉得会不会有——因为我觉得他们训练了一些针对偏好的特定模型,在基准测试上表现很好,有点像那种过拟合的做法,硬逼着它成为最好的,但然后又能跑这些大模型,感觉挺奇怪的。我觉得这其实就是因为大家太容易被头条新闻冲昏头脑了,老想着推前沿,我觉得有点过头了。
221:27
the same problem so I think and there's offerings that'll spread out there's a lot of it's a very
同样的问题,所以我觉得会有一些产品分散开来,有很多——这非常像。
221:32
big cake that's being made that people are going to take money out of I don't want to trivialize
这块大蛋糕正在被做出来,大家都会从中分一杯羹——我不想说得太轻描淡写。但OpenAI和Anthropic本质上就是LLM服务提供商,而其他一些公司,比如Google和xAI(LinkedIn/X也做其他业务),业务范围更广。所以很有可能,如果AI变得更商品化,那些只提供LLM的公司就会死掉。我觉得它们会死。它们的优势在于用户量很大,但我觉得它们会转型。嗯,比如Anthropic,如果它们发现情况不对,我觉得它们会转型。我不认为它们最初计划做code相关的东西,但后来发现这是个不错的niche,现在它们在这个niche里很舒服,就继续深耕。我觉得同样的事情可能也会发生在其他公司身上。
221:37
it but so open AI and andthropic are primarily LLM service providers and some of the other
但OpenAI和Anthropic主要是LLM服务提供商,而其他一些公司比如Google和xAI(跟X有关联)也做别的事情。所以很有可能,如果AI——因为它们有用户多的优势——我觉得它们会转型。嗯,如果它们发现像Anthropic那样的情况,我觉得会转型。我不认为它们最初计划做代码,但碰巧发现“好吧,这是个不错的细分领域,现在我们在这个领域很舒服,就继续深耕”。我同样能看到这种情况发生,一旦某个东西占据了通用聊天机器人的全部市场份额,也许OpenAI到时候就会专注于其他话题。它们用户太多了,在可预见的未来不会消失。
221:45
companies like Google and XAI link to X does other stuff too and so it's very possible if AI because
像Google和XAI这样的公司,也跟X有其他合作,所以如果AI发展起来,这是很有可能的。
221:54
more commodified that the companies that are just providing LLM will die I think they will the
那些只提供LLM的公司会更加商品化,我觉得它们会死掉。它们现在的优势是用户量很大,但我觉得它们会转型。嗯,比如像Anthropic,我觉得它们就转型了,原本可能没打算做代码方向,但后来发现这是个不错的细分领域,现在在这个领域做得很舒服,也在持续深耕。同样的事情也可能发生在别处——一旦某个通用聊天机器人占据了全部市场份额,也许OpenAI就会转向其他主题。它们用户太多了,在可预见的未来不会消失。我觉得Google随时准备说“AI热潮可能结束了”,但问题在于……
222:02
advantage they have they have a lot of users and I think they will just pivot I think um
他们的优势在于拥有大量用户,我觉得他们会直接转型,嗯。
222:07
then uh if they figure out it's a like anthropic I think pivot it I don't think they originally um
然后如果他们搞清楚了,比如像Anthropic那样,我觉得他们会转型,我不认为他们最初是这么打算的。
222:12
plan to work on code but it happened that they found okay this is like a nice niche and now we
原本计划是做代码相关的工作,但后来他们发现,嗯,这其实是个不错的细分领域,现在他们几乎拿下了通用聊天机器人的全部市场份额。也许OpenAI到时候会转向其他方向,比如——他们的用户太多了,在可预见的未来不会消失。在产品端和面向消费者的AI领域,现在下结论还为时过早。我觉得他们有一些人……故事翻了好几倍。Llama的情况有点不同,Llama是那个组织最聚焦的表达方式,我不认为Llama会得到那么大力度的持续支持。我觉得对他们来说,那是一个非常成功的品牌,所以他们可能仍然会在开放生态中参与一部分,或者把Llama这个品牌延续到不同的载体上——如果你知道Llama是什么的话。你觉得呢?
222:16
are comfortable in this niche and we push on this niche and I can see the same thing once maybe
在这个 niche 里他们很舒服,并且持续深耕这个 niche,我能看到同样的情况。一旦某个通用聊天机器人占据了全部市场份额,也许 OpenAI 就会转而专注于其他话题——毕竟他们的用户太多,在可预见的未来不会消失。在产品端和面向消费者的 AI 前端,现在下结论还为时过早,我觉得他们有一些人……故事翻了好几倍。Llama 有点不同,因为 Llama 是这家组织最聚焦的表达方式,而我不认为 Llama 会得到那么大力度的支持。我觉得对他们来说这是一个非常成功的品牌,所以他们可能仍然会在开放生态中参与一部分,或者把 Llama 这个品牌延续到不同的载体上——如果你知道 Llama 是什么的话。你觉得有吗?
222:21
let's say hypothetically speaking I'm not sure it will be true but let's say Google
假设说啊,我不确定会不会成真,但假设Google拿下了通用聊天机器人的全部市场份额,那OpenAI可能就会转向其他领域。它们用户太多了,短期内不可能消失。我觉得Google随时都准备好说“AI热潮可能结束了”。我认为问题在于这些公司能不能撑起它们的估值。我觉得AI公司某种程度上会被看作像AWS、Azure和GCP那样——都在同一个领域竞争,而且都是非常成功的业务。有可能API市场利润太薄,以至于它们会往产品端和硬件端上下延伸。它们钱多到可以自己造。
222:25
takes all the market share of the general chatbot maybe open AI will be then
如果通用聊天机器人占据了所有市场份额,也许OpenAI到时候会专注于其他话题,因为他们有太多用户,不会在可预见的未来消失。
222:29
focus on some other topic like the they have too many users to go away and foreseeable future I
至于面向消费者的AI产品,现在说还为时过早,我觉得他们有一些人。
222:36
think I think Google is always ready to say hope might be over the AI mode I think that the question
我觉得 Google 总是准备好说希望可能已经过了 AI 模式,我觉得问题在于
222:42
is if the companies can support the valuations I think I'd see the AI companies being looked at
如果这些公司能撑得起估值,我觉得AI公司会被看作某种程度上的——就像AWS、Azure和GCP都在同一个领域竞争,而且都做得非常成功。有一种可能是,API市场利润实在太低,以至于它们不得不往产品层和硬件层上下延伸。它们手里现金太多,完全可以构建一个合理的结局:这些API对开发者来说既值钱又灵活,最终变得像AWS那样的东西。但AWS和Azure也会推出这些API,所以等于有五六个玩家在API市场里厮杀,这很难。所以也许这就是它们被挤压出局的原因。你提到了RIP Lama,Meta还有赢的可能吗?
222:48
in some ways like AWS Azure and GCP are all competing in the same space in all very successful
某种程度上,像 AWS、Azure 和 GCP 都在同一个领域竞争,而且都是非常成功的业务
222:55
businesses there's a chance that the API market is so unprofitable that
有可能 API 市场利润太低,以至于
222:59
they go up and down the stack to products and hardware they have so much cash that they can build
他们不得不往上下两端扩展到产品和硬件,他们现金流太充裕了,可以构建
223:03
power plants and build data centers which is a durable advantage now but there's also just a
发电厂和数据中心建设是一种持久的优势,但还有一种合理的结果是,这些API对开发者来说如此有价值且灵活,以至于它们会变得像AWS一样,但AWS和Azure也会提供这些API,所以API市场有五六个玩家竞争会很激烈,这可能就是他们被挤压的原因。你提到了RIP Lama,Meta有获胜的路径吗?我觉得没人知道,他们动作很大,正在与Black Forest Labs(一家图像生成公司)或Midjourney签署授权协议,或者在做维护工作。所以我认为在产品和面向消费者的AI前端方面,现在下结论还为时过早,他们确实有一些人才。
223:07
reasonable outcome that these APIs are so valuable and so flexible for developers that they become
一个合理的结果是这些 API 对开发者来说非常有价值、非常灵活,以至于它们变得
223:13
the likes of like it something like AWS but AWS and Azure are also going to have these APIs so there's
有点像 AWS 那样,但 AWS 和 Azure 也会推出这些 API,所以
223:18
some like that's a like five or six people competing in the API market is hard so maybe like
大概有五六个玩家在 API 市场里竞争,这很难,所以可能
223:24
that's why they get squeezed out you mentioned RIP Lama is there a path to winning for meta I think
这就是他们被挤出去的原因。你提到了 RIP Lama,Meta 有没有赢的可能?我觉得
223:32
nobody knows they're moving a lot so they're signing licensing deals with Black Forest labs which
没人知道他们动作很大,所以他们正在和Black Forest labs签授权协议,那是个做图像生成的,或者Midjourney,或者做维护。所以我觉得从产品和面向消费者的AI前端来看,现在下结论还太早。我认为他们有一些人在那里深耕。Llama的情况有点不同,Llama是那个组织最聚焦的表达,我不觉得Llama会得到那么大力度的支持。我认为这对他们来说是个非常成功的品牌,所以他们可能还会在开放生态里参与一部分,或者把Llama品牌延续到不同的应用场景上——如果你知道Llama是什么的话。你觉得还会有更多开源权重版本吗?不是开放权重的那种。这挺有意思的。我觉得也稍微总结一下,我的意思是——
223:41
is an image generation or mid-journey or applying maintenance so I think it's some ways it's on the
图像生成或者Midjourney,或者做维护,所以我觉得从某种程度上来说,在产品和面向消费者的AI前端上,现在下结论还为时过早。我认为他们有一些人在做这方面的事情。Llama有点不一样,因为Llama是这家组织最聚焦的表达方式,而我不认为Llama会得到那么大规模的支持。我觉得这对他们来说是一个非常成功的品牌,所以他们可能仍然会在开放生态中参与一部分,或者把Llama这个品牌延续到不同的应用场景上——如果你知道Llama是什么的话。你觉得还会有很多不是开放权重的版本吗?这挺有意思的。我觉得也稍微回顾一下,我的意思是,我猜,只是假设一下,我在推测,我认为Meta的领导者们,比如……
223:47
product and like consumer facing AI front it's too early to tell I think they have some people that
故事很复杂,Llama有点不同,因为Llama是最专注的表达方式。
223:52
are excellent and very motivated being close to Zuckerberg so I think that there's still a
这些人非常优秀,也很有动力,而且离Zuckerberg很近,所以我觉得这里面还有故事可以讲。Llama的情况有点不同,Llama是这家机构最集中的表达方式,我不认为Llama会得到那种程度的持续支持。我觉得它对他们来说是一个非常成功的品牌,所以他们可能仍然会在开放生态系统中参与一部分,或者把Llama这个品牌延续到不同的方向上——如果你知道Llama是什么的话。你觉得还会有更多不是open weight的模型吗?这很有意思。我觉得也可以稍微回顾一下,我的意思是,Llama可以说是开创性的open weight模型,然后Llama 1、2、3也收获了很多喜爱。但我认为,只是假设和推测,我觉得Meta的领导者们,比如
223:58
story ton fold there Lama is a bit different where Lama was the most focused expression of the
故事有点不一样,Llama 是他们品牌最集中的体现,所以他们可能还会在开放生态里参与一部分
224:06
organization and I don't see Lama being supported to that extent I think it was a very successful
这个组织的情况,我不觉得Llama会得到那么大力度的支持。我觉得Llama对他们来说是个非常成功的品牌,所以他们可能还会在开放生态里参与一部分,或者把Llama这个品牌延续到不同的应用场景上——你知道Llama是什么吧?因为我觉得他们之前有专门针对偏好训练过的模型,在基准测试上表现很好,这有点像那种过拟合的做法,硬要让它成为最好的,然后还能跑这些大模型,其实挺奇怪的。我觉得这主要是因为大家太容易被头条新闻冲昏头脑了,总想着要推动前沿,太执着于基准测试了。而且我觉得它内部的政治斗争和方向不一致,最后把自己搞崩了。
224:12
brand for them so they still might do some part of participation in the open ecosystem or
或者把 Llama 这个品牌延续到不同的产品形态上,如果你知道 Llama 是什么的话,你觉得有没有
224:17
continue the Lama brand into a different surface if you know what Lama is do you think there's a
在 benchmark 上有点像那种 overfitting 的问题,硬要把它推到最好
224:21
lot more five not an open weight one it's interesting I think also just to recap a bit I think I mean
多了五个,不是开源的权重模型,这点挺有意思。我觉得,还是稍微回顾一下吧——我的意思是,我猜啊,只是推测,Meta 的高层当时可能……因为他们有专门针对偏好训练过的模型,在基准测试上表现很好,有点像那种过拟合的操作,硬要让它成为最强。但后来他们又能跑这些大模型了,这事儿就有点奇怪。我觉得,就是因为大家太兴奋了,光顾着用头条新闻来推动前沿,太过于关注基准测试了。结果呢,它就在内部的政治斗争和激励错位中崩了。所以我认为,研究人员是想做出最好的模型,但中间隔了一层。
224:29
Lama was the I would say pioneering open weight model and then Lama 123 lot of love but I think
Lama 可以说是开创性的开源权重模型,然后 Lama 1、2、3 也收获了很多喜爱,但我觉得——当然这只是我的猜测和推测——Meta 的领导者们,比如那些在社区里活跃的人,后来遇到的问题是想办法把开源变现。不是说直接给开源收费,而是利用开源来制造更大的声势,几乎有点强行推动的感觉,比如开发那些非常大的 Lama 4 模型,就为了在基准测试上登顶。但我认为 Lama 模型的目标从来不是要在基准测试上打败 Chaturpedie 或其他模型,而是提供一个人们能用、能信任、能修改、能理解的模型。
224:36
I think what happened just hypothesizing was speculating I think the leaders at meta like the
我觉得当时的情况,纯属猜测啊——Meta 的高层,因为他们好像有专门针对偏好训练过的特定模型,在 benchmark 上表现很好,有点像那种过拟合,硬要让它成为最强,然后又能跑这些大模型,就挺奇怪的。我觉得就是因为大家太兴奋了,光盯着 headline 去推 frontier,太执着于 benchmark 了。然后我觉得它内部政治斗争和激励错位,就崩了。研究员们想造最好的模型,但中间有一层人彻底垮掉了。不过我们也得给 Mark Zuckerberg 点个大大的赞,我觉得这源于……
224:43
upper executive state I think they got really excited about Lama because they saw how popular it
高层管理团队,我觉得他们对Llama特别兴奋,是因为看到了它在社区里有多受欢迎。然后问题在于,他们想试着——怎么说呢——把开源变现。我不是说直接拿开源赚钱,而是利用开源来制造更大的声势,有点像是硬推的感觉。比如开发那些非常大的Llama 4模型,就为了在基准测试上拿第一。但我觉得Llama模型的目标本来就不是要在基准测试上打败ChatGPT或者其他模型,而是提供一个人们能用、能信任、能修改、能理解的模型。这包括推出更小的模型,它们不一定要是最强的。但后来发生的情况是……
224:48
was in the community and then I think the problem was trying to let's say monetize the open
当时在社区里,我觉得问题在于试图——怎么说呢——把开源变现。
224:53
I'm not monetize the open source but I kind of used the open source to make a bigger splash
我不是说把开源本身变现,而是利用开源来制造更大的声势。
224:59
in a set like to kind of force it almost it felt forced like developing these very big Lama
感觉有点像是硬推,比如开发这些非常大的Llama 4模型,就是为了在基准测试上拿第一。
225:04
four models to have like the best like to be on the top of the benchmarks but I don't think the
但我不认为Llama模型的目标是霸榜,去打败比如Chaturpedie或其他模型。
225:09
goal of Lama models is to be on top of the benchmarks beating let's say Chaturpedie or other
我觉得目标应该是提供一个人们能用、能信任、能修改、能理解的模型。
225:14
models I think the goal was to have a model that people can use trust modify understand it so
因为他们确实有一些针对偏好训练过的模型,在基准测试上表现很好,这有点像过拟合,硬要让它成为最强。
225:20
that includes having smaller models they don't have to be the best models and what happened was
包括使用更小的模型,它们不一定要是最顶尖的模型。而实际情况是,我觉得他们可能有一些专门针对偏好训练过的模型,这些模型在基准测试上表现很好,这有点像一种过拟合的做法,强行让它们成为最佳。但与此同时,他们却没有做那些普通人能用的、任何人都能跑得动的小模型。这其实挺奇怪的,我觉得只是因为大家太热衷于追逐头条新闻,一味地推动前沿。我认为这太过于关注基准测试了,结果在内部政治斗争和激励错位的情况下崩盘了。所以我觉得研究人员是想造出最好的模型,但中间隔了一层。
225:25
just these models were of course like the benchmarks suggested they were better than they were
这些模型当然就像基准测试显示的那样,比实际表现要好,因为我觉得它们有专门针对偏好训练过的模型,所以在基准测试上表现很好。这有点像那种过拟合的问题,硬要让它成为最好的,但与此同时,他们也没做那种普通人能跑的小模型——当时根本没人能运行这些大模型,这就挺奇怪的。我觉得这纯粹是因为大家太沉迷于头条新闻,拼命推动前沿,太执着于基准测试了。然后我觉得它内部因为政治斗争和激励错位而崩溃了。所以我认为研究人员是想造出最好的模型,但中间隔了一层。
225:30
because I think they had like specific models trained on preferences that they perform well
因为他们有一些专门针对偏好训练的模型,在基准测试上表现很好,这有点像那种过拟合的做法,强行让它成为最好的,然后就能跑这些大模型,感觉挺奇怪的。我觉得就是因为大家太容易被头条新闻冲昏头脑,总想推高前沿,对模型的定义性本质关注过度了。我不觉得这会成为Mark和Alex之间争论的核心点,他们俩都很聪明,但我自己有时候也很难完全理解所有东西。一直在说开源AI的论据,然后到了2025年7月,突然就变成了——过去五个月我花了很多精力在政策上,这几乎成了我唯一专注的问题。
225:35
on the benchmarks it's kind of like this overfitting thing to kind of force it to be the best but then
然后就能跑这些大模型了,感觉有点奇怪,我觉得只是因为
225:39
at the same time all they didn't do the small models that people could use anything that no one
同时,他们也没做那些大家能用的小模型,当时没人能跑得动这些大模型,这事儿挺奇怪的。我觉得就是因为大家太被那些推动前沿的头条新闻冲昏了头,太执着于刷榜了。而且我觉得它内部的政治斗争和激励机制错位也导致了崩盘。研究人员确实想做出最好的模型,但中间管理层介入后,情况就变了。最后恶化到不可收拾,整个就垮了。我们还得给马克·扎克伯格点个大大的赞,我觉得这想法是从马克,从马克·扎克伯格,从最高领导层那里来的,他们明确说了开源很重要。
225:44
could run these big models then and it was kind of like a weird thing and I think it's just because
大家太被 headline 冲昏头了,拼命推 frontier,我觉得有点过头了
225:49
people got too excited about headlines pushing the frontier I think it's too much like on the
一直在为开源AI辩护,然后到了2025年7月,突然就变成了“我们……”
225:55
benchmarks and I think I imploded under political like internal political fighting and misaligned
benchmarks,然后我觉得我在政治内斗和方向不一致中彻底崩溃了。
226:02
incentives so I think the researchers want to build the best models but there's a layer of
激励机制上,我觉得研究人员确实想做出最好的模型,但中间有一层东西崩了。我们其实也应该给Mark Zuckerberg点个大大的赞,我觉得他从中吸取了基准测试的教训,然后说我们要做GPT的开源版本,提供一套非常棒的开源库。有人说Mark和Alexander Wong之间在AI的影响力上有争论,但这看起来不太可能,因为Mark把他招进来就是为了定义模型的性质。我不觉得这会成为Mark和Alex之间的核心分歧。他们俩都很聪明,但我就是很难完全理解这一切。他一直在为开源AI辩护,然后到了2025年7月,情况就变成了“我们要……”
226:06
organization and manager that is trying to demonstrate that they do these things and then there
有些组织和管理者试图证明他们确实在做这些事情,但后来出现了很多传闻,说某个糟糕的技术决策是怎么做出的,又是怎么一步步演变的,感觉情况越来越糟,最后彻底崩盘了。我们其实也应该给马克·扎克伯格点个大大的赞,我觉得这主要来自马克本人,来自他领导层自上而下地强调开源的重要性。正因为有这种态度存在,未来才可能出现Llama 5,他们能从benchmarking中吸取教训,然后说我们要做GPT OSS,提供一套非常棒的开源库。有人说,马克和Alexander Wong之间其实存在分歧。
226:11
was lots of there's a lot of pieces and rumors were how like some horrible technical decision was
有很多零碎的信息和传言,说某个糟糕的技术决策是怎么做出的,又是怎么一步步演变成现在这样,最后彻底崩盘了。我们真的应该给马克·扎克伯格点个大大的赞,我觉得这源于马克,实际上就是马克·扎克伯格从领导层就强调开源很重要。我认为正因为如此,才可能会有Llama 5,他们会从基准测试中吸取教训,说要成为GPT OSS,并提供非常棒的开源库。有人说马克和Alexander Wong之间在AI影响力上有争论,但这看起来不太可能,因为似乎是马克把他请进来的。
226:17
made and how that comes in and it just seems like it kind of got too bad where it all just
制作过程以及它是如何出现的,感觉好像情况变得太糟了,最后整个就崩了。我们真的应该给Mark Zuckerberg点个大大的赞,我觉得这来自于Mark,实际上是Mark Zuckerberg从领导层开始就强调开源很重要,从benchmarking中吸取教训,然后说我们要做GPT OSS,并提供非常棒的开源库。有人说Mark和Alexander Wong之间在AI的影响力上有争论,但这看起来不太可能,因为Mark把他招进来就是为了定义模型的本质,我不觉得这会成为Mark和Alex之间的核心分歧。他们俩都很聪明,但我就是很难完全理解这一切。
226:23
crashed out we should we should also like give huge props to Mark Zuckerberg I think it comes from
搞砸了,我们真的应该给Mark Zuckerberg大大的赞赏,我觉得他吸取了benchmarking的教训,说我们要做GPT OSS,并提供非常棒的开源库。
226:30
Mark actually from Mark Zuckerberg from the top of the leadership saying open source is important
Mark 实际上从 Mark Zuckerberg 领导层就表示开源很重要,从基准测试中吸取教训,说我们要做 GPT OSS,并提供非常棒的开源库。人们说 Mark 和 Alexander Wong 之间存在争论,关于对 AI 的影响力,但这看起来不太可能,因为似乎是 Mark 把他请来是为了定义模型的本质。我不认为这会成为 Mark 和 Alex 之间的决定性争论,他们俩都很聪明,但我就是有时候很难完全理解这一切。当时一直在讲开源 AI 的理由,然后到了 2025 年 7 月,突然就变成了我们……其中一部分原因,我觉得是因为我们作为开源开发者,或者说开源社区。
226:36
I think that's like that if the fact that that exists means there could be a llama five where they
我觉得是这样的,如果那个东西存在,就意味着可能会有 Llama 5,他们从 benchmark 中吸取教训,然后说我们要成为 GPT OSS,并提供一套非常棒的开源库。人们说 Mark 和 Alexander Wong 之间在 AI 影响力上有争论,但这看起来不太可能,因为 Mark 把他请来是为了定义模型的本质。我不认为这会成为 Mark 和 Alex 之间的关键分歧点。他们俩都很聪明,但我就是很难完全理解这一切,因为 Mark 在 2024 年 7 月写了一篇文章,那可能是当时最好的博客文章,讲的是开源 AI 的理由。然后到了 2025 年 7 月,情况就变成了我们……
226:41
learn the lessons from the benchmarking and say we're going to be GPT OSS and provide really awesome
人们说Mark和Alexander Wong之间有一场关于AI影响力的争论,但这看起来不太可能,因为Mark把他请来是为了定义模型的本质。
226:49
library of open source what people say is that there's a debate between Mark and Alexander Wong
我不认为这会成为Mark和Alex之间的决定性争论,所以他们俩都很聪明,但我就是很难完全理解这一切。
226:56
who is very bright but much more against open source and to the extent that he has a lot of
这个人非常聪明,但在反对开源方面要激烈得多,以至于他对AI有很大影响力——或者说,看起来可能性小了很多,因为马克把他招进来是为了提供新的领导力,指导AI方向。如果“开放与否”不再是模型的核心定义特征,我不觉得这会成为马克和亚历克斯之间的关键分歧。所以他们俩都很聪明,但我就是很难完全理解这一切,因为马克在2024年7月写了一篇文章,那可能是当时最好的博客文章,标题是《为开源AI辩护》。然后到了2025年7月,又说“我们正在重新评估与开源的关系”,所以这有点……但我觉得问题也在于——
227:01
influence over the AI or it seems much less likely because it seems like Mark brought him in for
当时一直在说开源AI的理由,然后到了2025年7月,突然就变成了“我们要……”
227:06
like a fresh leadership aid and directing AI and if the like opener closed is no longer the
就像是一个全新的领导力辅助工具,在引导AI发展。如果说“开放”与“封闭”不再是模型的核心定义特征,我不认为这会成为Mark和Alex之间争论的焦点。他们俩都很聪明,但我就是很难完全理解这一切。因为Mark在2024年7月写了一篇文章,那可能是当时最好的博客文章,阐述了支持开源AI的理由。然后到了2025年7月,又说我们在重新评估与开源的关系。所以这感觉有点……但我觉得问题的一部分也在于,作为开源开发者或开源社区,我认为即使这个模型可能没有达到所有人的期望,它也遭到了很多反对。
227:13
defining nature of the model I don't expect that to be a defining argument between Mark and
定义模型本质时,我不认为这会是Mark和Alex之间的关键分歧——他们俩都很聪明,但我就是很难完全理解这一切。说到开源AI的论据,到了2025年7月,情况变成了:过去五个月我投入大量精力的唯一议题,就是试图处理政策方面的问题。人类体验中那些面对面的部分——我们大家都喜欢的彼此见面、当面交谈——未来几年,实体商品和线下活动的价值肯定会越来越高,而劣质内容(Slop)面临的压力也会更大。所以它们会继续欺骗你,而且会出现在那些提供验证或建立信任方式的平台上,这样你才会信任。
227:18
Alex so like they're both very bright but I just like I have a hard time understanding all of it
过去五个月我花了很多精力的一件事,就是试图做政策方面的工作。
227:24
because Mark wrote this piece in July of 2024 maybe which was like probably the best blog post at
因为Mark在2024年7月写了那篇文章,大概是当时最好的博客文章,讲的是开源AI的理由。然后到了2025年7月,情况就变成了——我们作为开源开发者或开源社区,虽然模型可能没达到所有人的预期,但它招来了很多负面评价和正面头条。结果不是没头条或只有正面头条,反而全是负面头条,最后对公司形象造成了负面影响。我觉得这有点像一种赌气反应:我们本来想做好事,想给你们一个酷的东西,比如一个开源模型,结果却……
227:32
the time saying the case for open source AI and then July 2025 came around and it was like we're
当时在阐述open source AI的理由
227:38
re-evaluating a relationship with open source so it's just kind of like but I think also the problem
重新评估与开源的关系,感觉有点像这样,但我觉得问题也在于——因为我认为,作为开源开发者或开源社区,我们其实……即使这个模型可能没达到所有人的预期,它还是招来了很多批评和负面头条,而不是没有头条或只有正面头条。结果呢,他们得到了负面报道,这一切都让公司形象受损。我觉得这也有点像一种赌气反应:好吧,我们本来想做好事,想给你们一个酷的东西,比如开源模型,但现在看来……也许我们得改变主意了。我也不确定,嗯,大概就是这样。
227:45
not the problem but I think well we may have been a bit also too harsh I think and that caused
不是问题所在,但我觉得我们可能也有点过于苛刻了,这导致了部分情况。因为我认为,作为开源开发者或开源社区的一员,尽管这个模型可能没有达到所有人的预期,但它还是遭到了大量批评。我觉得这有点可惜,因为从公司的角度来看,他们原本希望得到正面的报道,结果不仅没有正面报道,反而招来了负面评价,最终对公司形象造成了不良影响。我认为这有点像一种赌气反应——我们本来想做点好事,想给大家一个很酷的东西,比如一个开源模型,结果却……
227:49
some of that because I think I mean we as open source developers or the open source community because
其中一部分原因是,我觉得我们作为开源开发者或者说开源社区,本来应该得到正面的报道,而不是完全没有报道或者只有负面报道。结果他们反而得到了负面报道,这一切都让公司形象受损。我觉得这也有点像是一种报复心理——我们本来想做点好事,想给你们一些酷的东西,比如一个开源模型,结果却适得其反。过去五个月里,我花了很多精力在政策工作上,试图推动美国在这方面进行投资。给我讲讲Adam项目的故事吧,它是怎么开始的?举个例子,AI2从NSF那里获得了一笔1亿美元的资助,分四年发放。
227:54
I think even though the model was maybe not what everyone hoped for it got a lot of backlash and I
我觉得虽然这个模型可能没有达到大家的预期,它招来了很多负面评价,而不是没有报道或者正面报道,结果反而变成了负面新闻,最后对公司形象造成了不好的影响。我觉得这有点像一种赌气的反应——就好像说,好吧,我们本来想做好事,想给你们一个很酷的东西,比如一个开源模型,结果却这样。过去五个月里,我花了很多精力在政策工作上,试图推动美国在这方面投资。给我讲讲Adam项目的故事吧,它是怎么开始的?举个例子,AI2从NSF那里拿到了一个四年一亿美元的资助。
228:00
think that was a bit unfortunate because I can see that as a company now they were hoping for
我觉得这有点可惜,因为作为一家公司,他们当时显然希望看到正面的报道,结果不仅没得到什么报道,或者没得到那些正面的报道,反而招来了负面新闻,最后全都对公司形象造成了不好的影响。我觉得这也有点像是一种赌气的反应——差不多就是“我们本来想做件好事,想给你们一个很酷的东西,比如一个open source model,但现在既然看起来是这样,那好吧,我们可能就改变主意了”。我也不确定,嗯,大概就是这样。这就是在X上的讨论动态可能会把整个社区带偏的地方,因为有时候感觉就是随机的人挑他们喜欢或不喜欢的东西来吵。你可能在别的事情上也能看到同样的现象。
228:05
positive headlines and instead of just getting no headlines or not these positive headlines in
正面新闻标题反而没有出现,或者根本没新闻,结果全是负面报道,最后全都给公司抹了黑。我觉得这有点像一种报复心理——好比说,我们本来想做件好事,想给你们一个很酷的东西,比如开源模型,结果呢?
228:12
turn they got negative headlines and then all it kind of reflected bad on the company and I think
过去五个月我花了很多精力做的一件事,就是政策方面的工作,试图推动美国在这方面投资。给我讲讲亚当项目的故事吧,它是怎么开始的?
228:17
that is also something like where you it's maybe a spite reaction almost like okay we have not we
举个例子,AI2从美国国家科学基金会拿到了一个四年一亿美元的资助。
228:23
we tried to do something nice we tried to give you something cool like an open source model and now
我觉得这就是联邦政府扮演的角色——他们来设定议程。
228:28
you are like you know kind of like be negative about us even like like for the company so in that
你就像那种,对我们公司有点负面态度,所以从这个角度看,好像我们可能会改变主意吧,我也不确定。是啊,这就是X平台上的讨论动态可能让整个社区走偏的地方,因为有时候感觉就是随机的人挑他们喜欢或不喜欢的东西。你可能在Roc和Roc Code Fast One上也能看到类似的情况——我觉得vi用户不会公开说喜欢它,但很多人实际在用。所以如果你去看Reddit和X,编程社区不会公开夸它,但大家私下都在用。Llama可能也是同样的情况。我真的搞不懂,不管是正面炒作还是负面炒作,背后的动态我完全理解不了。
228:34
sense it looks like well maybe then we'll change our mind I guess I don't know yeah that's that's
感觉像是,嗯,也许我们之后会改变主意吧,我也不确定,是啊,就是这样。
228:39
where the the dynamics of discourse on x can lead us as a community astray because sometimes it
在X平台上的讨论动态有时会把我们整个社区带偏,因为感觉总有人随机挑自己喜欢或不喜欢的东西——可能你也会看到同样的情况:公开场合说爱它,但很多人其实在用。如果你去看Reddit和X,编程社区并不怎么夸它,可他们自己却在用。同样的事情可能也发生在Llama身上。我不理解,我真的不理解这种正面炒作或负面炒作的动态。Llama,以及所有这些中国开源模型的崛起,让我觉得——过去五个月我花了很多精力做一件事,就是试图通过政策工作让美国在这方面加大投入。给我讲讲Adam项目的故事吧,它是怎么开始的?
228:48
feels random people pick the thing they like they don't like maybe you can see the same thing with
感觉就是随机性,人们选他们喜欢的东西,不喜欢的东西,也许你在同一件事上也能看到这种模式。
228:53
rock for one and rock code fast one I don't think vi wise people
rock for one 和 rock code fast one,我觉得 vi 那边的人不会公开说喜欢它,但很多人其实在用。如果你去看 read it 和 x,编程社区不会公开夸它,但他们私下都在用。同样的情况可能也适用于 llama。我不太理解,不管是正面 hype 还是负面 hype 的动态。llama 以及这些中国开源模型的崛起,让我觉得——过去五个月我花了很多精力在做一件事,就是推动政策,让美国在这方面投资。给我讲讲 Adam 项目的故事吧。Adam 项目一开始是我称之为“美国版 deep seek 项目”,但这个说法在 DC 的听众那里不太行得通。
229:04
love it publicly but a lot of people use it so if you look to read it and x they don't really give
公开场合大家说喜欢它,但很多人其实都在用。所以如果你去看Reddit和X,编程社区并没有真正夸它,但他们就是会用。同样的情况可能也适用于Llama。
229:12
it praise from the programming community but like they use it and the same thing with probably
我不理解,我真的不理解正面炒作或负面炒作的动态。
229:18
the llama I don't understand I don't understand the dynamics of either positive hype or negative hype
Llama,以及所有这些中国开源模型的崛起,已经到了让我觉得——这是我过去五个月花了很多精力的一件事,就是试图做政策方面的工作,推动美国在这方面投资。
229:23
I don't understand it I'm in the story of one of the stories of 2025 is the US feeling the gap of
我不太理解,但2025年的一个故事就是美国感受到了差距——来自Llama,以及这些中国开源权重模型的崛起,以至于我过去五个月花了很多精力在做一件事,就是试图通过政策工作让美国在这方面投入。给我讲讲Adam项目的故事吧。它最初被我称为“美国版Deep Seek项目”,但这个说法在华盛顿的听众那里不太行得通。这个故事的核心是:我职业生涯中能做的最有影响力的事情是什么?那就是当中国的开源权重模型正在积累大量能力,而市场对这些开放模型有巨大需求时——尤其是美国的企业,它们非常……
229:30
llama which is like all the rise of these Chinese open-way models to the point where I'm like that
给我讲讲Adam项目的故事吧,它是怎么开始的?
229:34
was the single issue I've spent a lot of energy on the last five months is like trying to do policy
然后2025年7月到了,就像我们
229:39
work to get the US to invest in this it tell me the story of Adam Adam project is it started as
推动美国在这方面投资,给我讲讲亚当项目的故事,它最初是怎么开始的。
229:45
me calling it the American deep seek project which doesn't really work for DC audiences but it's
我管它叫“美国版Deep Seek项目”,不过对华盛顿的听众来说不太贴切。
229:50
the story of like what is the most impactful thing I can do with my career which is that
我职业生涯里最 impactful 的一件事就是——
229:55
when it's Chinese open-weight models are cultivating a lot of power and there is a lot of demand
当中国的开源权重模型正在积累大量能力,并且市场对基于这些开源模型进行开发的需求很大,尤其是美国的企业——
230:00
for building on these open models especially enterprises in the US that are very
这是一个美国主导的倡议,旨在构建并托管高质量、真正开源权重的 AI 模型及其支持基础设施,明确目标是与中国快速发展的开源 AI 生态竞争并迎头赶上。
230:04
cagey about these Chinese models going to perplexity the Adam project American truly open models
对于这些中国模型,他们讳莫如深。Perplexity上的Adam项目,美国真正开放的模型,是一个总部位于美国的倡议,旨在构建并托管高质量、真正开放权重的AI模型,以及配套基础设施,明确目标是与快速发展的中国开源AI生态系统竞争并迎头赶上。我觉得一句话总结就是——或者两句话:第一,开放模型将成为AI研究的引擎,因为人们都是从这些模型开始入手的,因此掌握它们很重要;第二,因此美国应该打造最好的模型,这样最顶尖的研究就会发生在美国,而美国公司也能从成为AI研究发生地中获取价值。
230:11
is a US based initiative to build and host high quality genuinely open-weight AI models
我觉得一句话总结就是,或者两句话:
230:16
and supporting infrastructure explicitly aimed at competing with and catching up to China's rapidly
第一,一个主张是开源模型将成为 AI 研究的引擎,因为人们都是从它开始入手的,所以拥有它们很重要;
230:22
advancing open source AI ecosystem I think the one sentence summary would be that or two sentences
第二,因此……
230:29
one is a proposition that open models are going to be an engine for AI research because that is
第一个主张是:开放模型将成为AI研究的引擎,因为人们都是从这些模型起步的,所以掌握它们很重要。
230:34
what people start with therefore it's important to own them and the second one is therefore
第二个主张是:因此,这会成为那些想做这件事的人的凝聚力量。
230:39
the US should be building the best models so that the best researcher happens in the US
美国应该打造最顶尖的模型,这样最优秀的研究人员才会留在美国
230:45
and the US companies take the value from being the home of where AI research is happening
美国公司也能从成为AI研究发源地这件事中获取价值
230:52
and without more investment in open models we have all the plots on the website where it's like
而且如果没有更多对开源模型的投资,我们在网站上看到的所有图表都是这样的:Quinn、Quinn、Quinn、Quinn,全是这些来自中国公司的优秀模型,它们正在美国、中国以及国际范围内扩大影响力。我认为美国在AI上的投入,以及打造那些比闭源模型前沿落后半代或一代的开源模型的能力,成本大概在1亿美元量级——这确实是一大笔钱,但对这些公司来说并不算多。因此,我们需要一股凝聚力量,把想做这件事的人团结起来。而且我觉得我们已经获得了几乎整个产业链上下的明确参与,比如Paul,还有来自行政部门的支持。
230:56
Quinn Quinn Quinn Quinn and it's all these models that are excellent from these Chinese companies
Quinn Quinn Quinn Quinn,而且这些中国公司推出的模型确实非常出色
231:02
that are cultivating influence in the US and China and internationally and I think the US is
它们正在美国、中国以及国际层面扩大影响力,而我认为美国
231:08
spending way more on AI and the ability to create open models that are half a generation or a
在AI上的投入要大得多,但打造那些比闭源前沿落后半代或一代的开源模型
231:14
generation behind what the cutting edge of the closed lapses costs orders of like 100 million dollars
成本大约在1亿美元级别——这笔钱虽然不少,但对这些公司来说并不算多
231:19
which is a lot of money but not a lot of the money to these companies so therefore we need a
因此我们需要一股凝聚力量,把愿意做这件事的人团结起来,而且我认为我们已经获得了相关人士的明确参与承诺
231:24
centralizing force of people who want to do this and I think we got signed engagement from people
而且我觉得我们确实获得了公开支持——比如有人公开签署了承诺。但我知道,在拜登和特朗普两届政府中从事AI政策工作的人,都非常支持在美国推广开源模型。
231:31
pretty much across the full stack whether it's Paul so there has been support from the administration
几乎在整个技术栈上,无论是Paul还是其他方面,政府层面都有支持。比如有人公开签署了支持,而且我知道在拜登和特朗普政府中从事AI政策工作的人,都非常支持在美国推广开源模型。举个例子,AI2从NSF获得了一笔四年1亿美元的资助,这是NSF有史以来最大的计算机科学资助,目的是让AI2尝试实现这个目标。我认为这是一个起点,但最好的情况是多个组织都在构建模型,因为它们可以互相交叉启发想法,共同培育这个生态系统。我不认为仅仅靠Llama向世界发布模型就能奏效,因为那样的话,你只能看到Llama一家独大。
231:36
I don't think anyone in the like technically in government has
我觉得在政府里,技术上没有人公开签过字,但我知道在拜登和特朗普两届政府里从事AI政策的人,都非常支持在美国推广开源模型。比如,AI2从NSF拿到了一个四年一亿美元的资助,这是NSF有史以来最大的计算机科学资助,目的是让AI2尝试做这件事。我觉得这是一个起点,但最好的情况是多个组织都在构建模型,因为它们可以互相交流想法,形成这样的生态系统。我不认为如果只是Llama向全世界发布模型就能奏效,因为那样你只能看到Llama一家独大。
231:40
like signed it publicly but I know that people that have worked in the AI policy both in Biden
举个例子,AI2从NSF获得了1亿美元的四年期拨款,这大概是NSF有史以来最大的一笔计算机科学资助,目的就是让AI2去尝试这件事。我是这么认为的。
231:46
and Trump administration are very supportive of trying to promote open source models in the US I
特朗普政府非常支持在美国推广开源模型。比如,AI2 从 NSF 拿到了一个四年一亿美元的 grant,这大概是 NSF 历史上给计算机科学领域最大的一笔 grant,目的就是让 AI2 去尝试这件事。我觉得开源模型能促进 ideas 交叉融合,构建起一个生态。我不认为光靠 Llama 把模型发布到全世界就能成,因为你看 Llama 在政策层面……我知道 Nvidia 对此非常兴奋,Jensen Huang 最近一直在强调这件事的紧迫性。他们在 2025 年做了很多调整,现在 Neematron 模型成了重点,也开始陆续放出一些数据了。
231:51
think for example AI2 got a grant from the NSF for 100 million dollars over four years which is
比如,AI2 从美国国家科学基金会获得了四年一亿美元的资助,这相当于
231:56
like the biggest CS grant the NSF has ever awarded and it's for the AI2 to attempt to this and I think
像是NSF有史以来最大的一笔计算机科学资助,给了AI2去尝试这个,我觉得
232:03
it's a starting point but the best thing happens when there are multiple organizations building
这是一个起点,但最好的情况是当有多个组织在构建模型时,因为它们可以互相交叉启发想法,形成一种生态。我不认为如果只是Lama向世界发布模型就能奏效,因为你可以看到Lama在政策方面的情况。我知道Nvidia对此非常兴奋,我觉得Jensen Wong一直在强调这件事的紧迫性,他们在2025年做了很多改变,现在Neematron模型成了更重点的方向,他们开始随Nvidia的开源模型一起发布一些数据。很少有公司会这么做,尤其是像Nvidia这样体量的公司。所以,确实有进展的迹象,我们也听说了Reflection AI的消息。
232:08
models because they can cross pollinate ideas and kind of build this ecosystem like I don't think
模型之所以能这样,是因为它们可以交叉融合想法,构建起这个生态,我不认为
232:13
if it just works if it's just Lama releasing models to the world because then you can see Lama can
如果只是Llama把模型发布到全世界就能成,因为你能看到Llama
232:18
go away the same thing applies for AI2 where it's like I can't be the only one building models
走开,同样的情况也适用于AI2,就像我不能是唯一一个在构建模型的人。而且我觉得这会导致大量时间花在与不同人交谈上,无论是政策领域的人——我知道Nvidia对此非常兴奋,Jensen Wong也特别强调过这件事的紧迫性。他们在2025年做了更多改变,Neematron模型成了重点,还开始随着Nvidia的开源模型发布一些数据。很少有公司会这么做,尤其是像Nvidia这种体量的公司。所以确实有进展的迹象,我们还听说了Reflection AI,他们声称有两亿美元的融资专门用于构建美国的开源模型。
232:23
and I think that it's like that it becomes a lot of time spent on talking to people whether
而且我觉得,这样一来,花在跟人沟通上的时间就变得很多了——不管是跟政策相关的人聊,我知道Nvidia对此非常兴奋,Jensen Wong也一直在强调这件事的紧迫性。他们在2025年做了很多改变,Neematron模型成了更重点的方向,还开始发布一些数据,配合Nvidia的开源模型。很少有公司会这么做,尤其是像Nvidia这个体量的公司。所以,确实能看到一些进展的迹象。我们还听说了Reflection AI,他们说有两亿美元的融资专门用来打造美国的开源模型。我觉得这种文化上的潮流正在开始转变。大概在七月的时候,我们就有四到五个深度……
232:30
they're in policy I know Nvidia is very excited about this I think Jensen Wong has been
他们在政策层面,我知道Nvidia对此非常兴奋,我觉得Jensen Wong一直在
232:35
specifically talking about the urgency for this and they've changed they've done a lot more in 2025
特别强调这件事的紧迫性,他们在2025年做了很多改变
232:40
where the Neematron models are more of a focus they've started releasing some data
Neematron模型成了更重点的方向,他们开始发布一些数据
232:45
along with Nvidia's open models and like very few companies do this especially
加上Nvidia的开源模型,像他们这种体量的公司很少会这么做,所以确实能看到一些进展。我们还听说了Reflection AI的研究人员,但很大程度上,很多非常真实的事情正在发生,美国正在大规模建设AI基础设施。同时也有很多问题被大家讨论,从水资源消耗到各种其他方面。我们当然应该在这个国家搞建设,但也要把精力花在能源上——我觉得这正是联邦政府能发挥作用的地方,他们可以设定议程。而在AI领域设定议程时,把开源作为首要考量,这很大程度上就是他们能做的事。然后人们也会从教育和人才培养的角度来思考这些问题。
232:50
of Nvidia's size so like there is there is signs of progress and they're we hear about reflection AI
以Nvidia的体量来说,所以确实有进展的迹象,我们也听说了Reflection AI
232:55
where they say they're two billion dollar fundraises dedicated to building US open models and I
他们说有两笔二十亿美元的融资专门用于打造美国的开源模型,而且
233:01
feel like their announcement tweet is like it reads like a blog post out right and I think that
感觉他们的官宣推文读起来就像一篇博客文章,我觉得那种文化潮流正在开始转变。大概在七月的时候,美国那边一下子冒出了四五个Deep Seed级别的中国开源权重模型,那一刻就像是——我猜我得花精力在这上面了,因为没人会去做。所以这需要很多人一起贡献,我并不是说Adam项目不是推动生态发展的东西,但像我这样的人在做类似的事情来传播消息。你喜欢2025年美国AI行动计划里包含开源内容吗?白宫AI行动计划里确实有专门的部分。
233:05
that cultural tide is starting to turn I think in in July was when we had like four or five deep
这种文化潮流开始转变了——我记得是在七月,当时我们遇到了四五个深度
233:14
seed caliber Chinese open weight models in zero from the US and that's that's the moment where
从美国那边零基础搞出中国水准的开源权重模型,那才叫真正的突破。发布的时候几乎就是——好吧,我得把精力花在这上面,因为没人会去做。这需要很多人一起贡献,我并不是说Adam项目这种就不算推动生态发展,但像我这样的人在做的事情,就是要把消息传出去。你喜欢2025年美国AI行动计划里包含开源内容吗?白宫AI行动计划里专门提到了这一点。我觉得这可能是这届政府出台的最连贯的政策文件了,我希望它大体上能成功,而且我认识一些参与制定这个行动计划的人。
233:19
it was released as almost like I guess I have to spend energy on this because nobody else is
它发布时几乎像是——我觉得我得在这上面花精力,因为没别人会去做
233:23
going to do it so it takes a lot of it takes a lot of people contributing together and I don't
所以这需要很多人一起贡献,我并不是说
233:26
say that like the Adam project isn't like the thing that's helping to move the ecosystem but it's
Adam项目不是推动生态发展的东西,但正是
233:31
people like me doing the sort of thing to get the word out do you like the the 2025 America's AI
像我这样的人在做这类事情来传播消息。你喜欢那个2025年美国AI
233:38
action plan that includes open source stuff the White House AI action plan includes a dedicated
行动计划吗?里面包含了开源内容。白宫AI行动计划中有一个专门的
233:43
section titled the encourage open source and open way AI defining such models and arguing
标题:鼓励开源和开放方式的AI,定义这类模型并论证其对创新和初创公司的独特价值。
233:50
unique value for innovation startups yeah I mean like the AI action plan is a plan but largely I
是啊,我觉得AI行动计划是一个计划,但很大程度上,它可能是这届政府出台的最连贯的政策文件了。我希望它大体上能成功,我也认识一些参与制定这个行动计划的人。挑战在于如何把政策变成现实,而作为一个AI研究员,我完全不知道该怎么做到这一点。但大体上,很多事情都是非常现实的,而且这个国家正在大规模建设AI。人们听到很多问题,从水资源使用到各种其他问题。我们应该能够在这个国家建设东西,但同时也要……
233:57
think it's like maybe the most coherent policy document that has come out of the administration
我觉得这可能是这届政府出台的最连贯的政策文件了。
234:02
and I hope that it largely succeeds and I know people that have worked on the action plan
我希望这个计划能大体成功,我也认识一些参与制定这个行动计划的研究人员。但说实话,很多事情都是非常现实的,而且这个国家正在大规模建设AI,人们也听到了很多问题,从水资源使用到各种其他方面。我们应该有能力在这个国家搞建设,但同时也要把精力花在——我觉得联邦政府扮演的角色就是设定议程。在AI领域设定议程时,把开放性作为首要考虑,这很大程度上是他们能做的事情。然后人们也会考虑教育和人才的问题,对于这些公司来说,我觉得这非常重要,因为否则的话,你知道,如果它们只搞封闭式的话……
234:07
and the challenge is taking policy and making it real and I have no idea how to do this as an AI
挑战在于把政策落到实处,作为一个AI研究员,我完全不知道该怎么操作。但很大程度上,很多问题都是真实存在的,而且这个国家正在大规模建设AI,人们听到的各种问题——从水资源使用到其他方面——确实不少。我们当然应该有能力在这个国家搞建设,但也要把精力花在刀刃上。我觉得联邦政府扮演的角色就是设定议程,而AI议程的设定,首要考虑的就是这一点——这很大程度上是他们能做的事。然后人们也会考虑教育和人才的问题,对于这些公司来说,我认为这非常重要,否则,你知道的,如果他们只搞封闭式那一套……
234:12
researcher but like like largely a lot of things and that were very real and there's a huge build
研究员,但大体上很多事情都是非常真实的,而且有巨大的建设在推进
234:18
out of AI in the country and it's like there are a lot of issues that people are hearing about
在这个国家,AI领域有很多问题大家都有所耳闻,从用水问题到其他各种事情。我们当然应该有能力在这个国家搞建设,但也要把精力花在——我觉得联邦政府在这方面扮演了一个角色,就是设定议程。而AI设定议程时,把开放性作为首要考量,这很大程度上就是他们能做的事。然后人们也会考虑教育和人才方面的问题,比如怎么招到有才华的人,怎么识别有才华的人。我认为开源和下一代研究人员,这是唯一的途径。我本来可以让这件事更火一点的办法,就是讲一个中国AI与……整合的故事。
234:22
from water use to whatever and like we should be able to build things in this country but also we
从用水到各种问题,我们理应能在这个国家建设东西,但我们也得把精力花在——我认为联邦政府扮演的角色就是设定议程。而随着AI设定议程,让开放成为首要考量,这很大程度上是他们能做的事。然后人们也会考虑教育和人才方面的问题,比如你怎么招聘有才华的人,怎么识别有才华的人。我认为开源和下一代研究人员是途径,或者说唯一的途径。我本来可以让这件事更火的方式,是讲一个中国AI与我们的美国模型整合的故事,但我之所以谈论创新和科学,是很有意图的。
234:27
need to not ruin places in our country in the process of building it and it's a worthwhile
在建设过程中不能破坏我们国家的自然环境,这是值得投入精力的事情。我认为联邦政府扮演的角色就是设定议程,而随着AI成为议程核心,首要考量就是他们能发挥的巨大作用。人们也会考虑教育和人才问题——对于这些公司来说,我认为这至关重要,否则你想想,如果只有闭源模型,下一代人才要如何参与贡献?因为到某个节点,你只能等入职公司后才能学习,但到那时,你又该如何招聘有天赋的人?如何识别人才?我认为开源就是答案。
234:33
to spend energy on I think that's a role that the federal government places like they set the agenda
把精力花在——我认为联邦政府扮演的角色就是设定议程,
234:38
and with AI setting the agenda that open way to be a first consideration is like that's a large
随着AI设定议程,这种开放的方式成为首要考量,这很大程度上是它们能做的事情。然后人们也会考虑教育和人才方面的问题,比如如何招聘有才华的人,如何识别有才华的人。我认为开源和下一代研究人员是这条路,甚至是唯一的路。我本来可以让这个话题更火一点,就是讲一个中国AI与美国模型整合的故事,但我之所以刻意谈论创新和科学,是因为我认为这是一个有价值的模式。是的,我的观点是我们应该处于领先地位。所以所有这些关于LM的有趣对话,所有的将军和士兵,都会——
234:46
part of what they can do and then people think about it also for education and talent for these
这是他们能做的事情之一,然后人们也会考虑教育和人才方面的问题,比如
234:51
companies it's I think very important because otherwise you know if they're only closed
对于公司来说,我认为这一点非常重要,因为否则的话,你想想,如果它们完全封闭,你怎么去招聘有才华的人?怎么识别有才华的人?我认为开源是下一代研究者的唯一途径。我本来可以让这个话题更火,那就是讲一个中国AI与威权编辑国家结合、变成ASI并统治世界的故事,然后我们就需要自己的美国模型。但我之所以刻意谈论美国的创新和科学,是因为我认为这既是一个更现实的结局,而且也是一个我认为有价值的模式。是的,我的观点是,我们应该处于领先地位,但我认为……
234:57
models how do you get the next generation of people contributing at some point because otherwise
模型方面,你怎么让下一代人能够持续做出贡献?否则总有一天,你只能等加入公司之后才能学习,但到那个时候,你怎么招聘有才华的人?怎么识别有才华的人?我觉得开源和下一代研究者就是答案,或者说唯一的答案。我本来可以让这个话题更火,那就是讲一个中国AI与威权编辑体制结合、变成ASI并统治世界的故事,然后说我们因此需要自己的美国模型。但我之所以刻意谈论美国的创新和科学,是因为我认为那既是更现实的结局,而且那也是一个更值得向往的世界。
235:02
you will at some point only be able to learn after you joined a company but then at that point
你总有一天会发现,只有加入一家公司之后才能真正学到东西,但到了那个时候,问题就变成了:你怎么招到有才华的人?你怎么识别有才华的人?而我认为,开源和培养下一代研究者,是唯一的出路。我本来可以让这个话题更火,那就是讲一个故事:中国的AI与威权编辑体制结合,变成ASI,然后统治世界,所以我们美国必须有自己的模型。但我之所以刻意谈论美国的创新和科学,是因为我觉得那才是更现实的结局,而且那也是一个我认为有价值的模式。是的,我的观点是,我们应该保持领先地位,但我觉得……
235:09
like how do you hire talented people how do you identify talented people and I think open source
怎么招聘有才华的人,怎么识别有才华的人。而且我认为开源
235:15
that's even for a lot of things but also even just for educating the population and training the
即使对很多事情来说是这样,但哪怕只是为了教育大众和培养下一代研究人员,这也是唯一的方式。我本来可以让这个话题更火的办法,就是讲一个中国AI与威权编辑国家结合、变成ASI并统治世界的故事,然后我们就需要自己的美国模型。但我之所以刻意谈论美国的创新和科学,是因为我认为这既是一个更现实的结局,也是一个我希望实现的世界。不过我也要说,即使是任何开源权重模型,我确实认为它是有价值的模型,是的。我的观点是,我们应该处于领先地位,但我认为……
235:20
next generation of researchers it's the way or the only way. The way that I could have gotten
是下一代研究者的方式,甚至是唯一的方式。我本来可以让这件事
235:25
this to more go more viral is was to tell a story of Chinese AI integrating with an
更火一点,就是讲一个中国AI与
235:30
editorial authoritarian state and being ASI and taking over the world and therefore we need
编辑威权国家、变成ASI并统治世界,所以我们才需要自己的美国模型。但我之所以刻意强调美国的创新和科学,是因为我认为这既是一个更现实的结局,也是一个我认为有价值的模式。是的,我的观点是我们应该保持领先地位。所以我们现在聊的这些关于LM的有趣话题,所有将军和士兵——我是说普通大众——都会想要拿到它们,或者芯片,甚至AI芯片。但你看,像华为这样的公司也能做出类似的东西。我觉得在当今这个时代,想完全绕过他们是不可能的。我认为,针对开放模型搞一个类似曼哈顿计划的项目,才是可行的方向。
235:34
our own American models but it's very intentional for why I talk about innovation and science in the
我们自己的美国模型融合的故事,但我之所以谈创新和科学,是很有意为之的。
235:39
US because I think it's both more realistic as an outcome but just like that's a world that is
因为我觉得这既是一个更现实的结果,而且那也是一个我认为有价值的模型世界。我的观点是,我们应该处于领先地位,但我觉得我们所有关于LM的有趣讨论,那些将军和士兵们,都希望普通大众能拿到它们,或者芯片,甚至AI芯片。但你看,像华为做出类似的东西,那种知识,我觉得在当今这个时代是不可能的。从这些东西里做出成果,我认为对于开放模型来说,需要像曼哈顿计划那样的事情。他们确实在创新,但我认为总有可能出现那个“大突破”。不过我也觉得,有了现在的LLM,设计像CUDA这样的东西会更容易。
235:45
I would like to manifest. I would say though also even like let's say any open-weight model I do
我想先表明一下立场。不过我也想说,比如任何开权重模型,我确实认为它是有价值的模型。我的观点是,我们应该保持领先地位,但我也认为,出于安全风险考虑,我们应该考虑禁止发布开源模型。而且我想补充一点,实际上如果不让美国建立自己的“Great Firewall”,这根本不可能做到,而众所周知那个防火墙效果也不太好。因为训练这些模型的成本,无论是一百万还是一亿美元,对于世界上很多想要施加影响力的人来说都是可以负担得起的。所以这些模型会在全球各地被训练出来,而我们希望这些模型——虽然确实存在安全隐患——但这些信息和工具是我们需要的。
235:52
think is a valuable model yeah and my argument is that we should be in a leading position but I think
think 是一个很有价值的模型,是的,我的观点是我们应该保持领先地位,但我觉得
235:58
that it's worth saying it's so simply because there are still voices in AI ecosystem that's
值得强调的是,AI生态中仍有一些声音主张,出于安全风险考虑,应该禁止发布开源模型。但我认为有必要补充一点:这种做法实际上根本行不通,除非美国也建起自己的“防火墙”——而众所周知,防火墙的效果并不理想。因为训练这些模型的成本,无论是一亿美元还是一亿美元,对于全球范围内想要施加影响力的群体来说,都是可以负担的。因此,这些模型将在世界各地被训练出来。我们当然要关注安全问题,但更重要的是,我们希望这些信息和工具能在全球自由流通,包括流入美国,这样人们才能使用它们并从中学习。
236:05
say we should consider banning releasing open models due to the safety risks and I think it's worth
有人说我们应该考虑禁止发布开源模型,因为存在安全风险,我觉得有必要补充一点——实际上,除非美国自己建一个“防火墙”,否则这根本不可能,而众所周知,防火墙效果也不太好,因为训练这些模型的成本,从几百万到一亿美元不等,世界上很多想施加影响力的人都负担得起。所以这些模型会在全球各地被训练出来,而我们希望这些信息和工具能被广泛获取——我是说,安全顾虑确实存在,但我们希望这些信息、工具,以及我们正在讨论的所有关于LM的有趣内容,无论是将军还是士兵,都希望普通公众能拿到它们,甚至芯片,包括AI芯片,但你也看到了,华为照样能造出来。
236:10
adding that I think effectively that's impossible without making the US have its own great firewall
并补充说,我认为这实际上是不可能的,除非美国也建起自己的“great firewall”。
236:16
which is also known to not work that well because the cost for training these models whether it's
而众所周知,这招效果并不好,因为训练这些模型的成本——从一百万美元到一亿美元——对于世界上很多想要施加影响力的人来说,都是负担得起的。
236:23
one to a hundred million dollars is attainable to a huge amount of people in the world that want to
所以这些模型会在全球各地被训练出来,而我们希望这些信息和工具——我是说,虽然存在安全顾虑——但所有这些关于LM的有趣讨论,从将军到士兵,都希望普通大众能获得它们,或者芯片,甚至AI芯片。
236:29
have influence so these models will be getting trained all over the world and these we want the
但你看,像华为这样的公司也能做出类似的东西。
236:35
models especially like I mean there are safety concerns but we want these information and tools
我认为在当今这个时代,这根本不可能。
236:41
to flow freely across the world and into the US so that we people can use them and learn from them
在全球范围内自由流动,并进入美国,这样我们普通人就能使用它们并从中学习。
236:46
and we like stopping that would be such a restructuring of our internet that it seems impossible.
而且我们觉得,阻止这种情况发生,相当于要对整个互联网进行彻底重构,这几乎是不可能的。
236:51
Do you think maybe in that case the big open-weight models from China are actually a good thing in a
那你觉得,在这种情况下,来自中国的那些大参数开放权重模型,对美国公司来说,会不会反而是一件好事?
236:56
sense like for the US companies because maybe the US companies you mentioned earlier they are
比如你之前提到的,美国公司通常开源发布的模型,比它们内部使用的要落后一代——
237:01
usually one generation behind in terms of what they release open source versus what they are using for
像GPT-OS可能不是最前沿的模型,Gemma 3也不是——它们这么做,是因为知道这样发布是安全的。
237:06
example GPT OS as might not be the cutting edge model Gemma 3 might not be but they do that because
但当这些公司看到,比如DeepSeek V3.2真的很厉害,而且被广泛使用,却没有引发任何反弹,也没有安全风险——
237:12
they know this is safe to release but then when they see these companies see for example there is deep
那会不会反过来鼓励它们发布更好的模型呢?从某种意义上说。
237:17
seek version 3.2 which is really awesome and it gets used and there is no backlash there is no
去找版本3.2,那个版本真的很棒,而且被广泛使用,没有任何负面反应,也没有
237:23
security risk that could then again encourage them to release better models maybe that in a sense
安全风险,这反而可能鼓励他们发布更好的模型,从某种意义上说,
237:28
is a very positive thing 100% these Chinese companies have set things into motion that I think would
这是一件非常正面的事情,100% 这些 Chinese companies 已经推动了一些事情,我觉得如果它们没有都在发布模型的话,这些事情可能根本不会发生。所以我猜,我几乎可以肯定,领导层内部已经有过这些讨论了。
237:34
potentially not have happened if they were not all releasing models so I think it was like
有没有一种可能的未来,世界上主流的 AI 模型全都是开源的?
237:40
that I'm almost sure that those discussions have been had by leadership.
这取决于你预测的进步轨迹。如果你认为饱和和进步会在几年内到来,也就是在资金支持依然非常充足的时间段内,那么开源模型会被优化得非常好,运行成本也会低得多,以至于它们会占据主导。
237:45
Is there a possible future where the dominant models AM models in the world are all open source?
本质上,这又回到了开源的理念——会有更多的人愿意投入资金。
237:50
Depends on the trajectory of progress that you predict if you think saturation and progress is
这取决于你预测的进步轨迹。如果你认为饱和与进步
237:55
even coming within a few years so essentially within the time where financial support is still very
甚至会在几年内到来,那么基本上在资金支持仍然非常
238:00
good then open models will be so optimized and so much cheaper to run that they will now.
充足的这段时间里,开放模型会被优化到极致,运行成本也会低得多,以至于它们将占据主导。
238:05
Essentially this goes back to open source ideas where so many more people will be putting money
本质上,这又回到了开源的理念——会有更多的人投入资金,
238:11
into optimizing the serving of these open-weight common architectures that they will become standards
在优化这些开源通用架构的推理服务时,它们会成为行业标准
238:17
and then you could have chips dedicated to them and it will be way cheaper than the offerings
然后你可以有专门的芯片来跑这些模型,成本会比那些闭源公司的定制方案便宜很多
238:23
from these close companies that are custom we should say that AI 27 report kind of predicts one of
顺便说一句,AI 27报告在叙事层面预测了其中一点:随着AI系统越来越智能,国家安全问题会浮现
238:29
the things it does from a narrative perspective is that there will be a lot of centralization
实验室会走向集中化,变得极度保密,中美之间会展开一场军事层面的竞赛
238:33
as the AI system gets smarter and smarter the national security concerns will come to be and
所以我们这些关于语言模型、将军和士兵的有趣讨论,最终都会卷入其中
238:39
you'll centralize the labs and you become super secretive and there will be this whole race
而实验室会变得高度集中且极度保密,整个领域会陷入一场竞赛。
238:44
from a military perspective of how to you between China and the United States
从军事角度来看中美之间的博弈,我们聊的这些关于语言模型的有趣话题,所有将军和士兵都会希望普通民众也能用上它们,或者芯片,甚至AI芯片。但你看,华为现在也能造芯片了,虽然花了好几年时间。我觉得像知识这种东西,根本没法封锁,在这个时代完全不可能——互联网时代,我不觉得还有这种可能性。说到曼哈顿计划,我觉得有个有意思的点:如果搞一个类似曼哈顿计划那样的开源模型项目,肯定会反复提到Nvidia。你觉得黄仁勋和Nvidia会一直赢下去吗?我认为他们会的。
238:49
and so all of this fun conversations we're having about LM's all the generals the soldiers will
所以我们现在关于 LM 的所有这些有趣的讨论,那些将军和士兵都会
238:56
come into the room and be like all right we're now in the Manhattan project stage of this whole thing.
走进房间然后说,好了,我们现在已经进入整个事情的曼哈顿计划阶段了。
239:02
I think 2025 677 I don't think something like that is even remotely possible I mean you can
我觉得2025年677这种可能性根本不存在,我的意思是,你可以用同样的逻辑来讨论电脑对吧——你可以说电脑很强大,我们不想让普通大众拥有它们,或者芯片,甚至AI芯片,但你看,华为现在也能造芯片了,虽然花了几年时间。我认为像这样的知识是没法封锁的,在这个时代根本不可能,就像互联网一样,我不觉得这有可行性。
239:09
make the same argument for computers right you can say okay computers are capable and we don't
关于曼哈顿计划这件事,我有个有趣的想法,我觉得对于开放模型来说,搞一个类似曼哈顿计划的东西。
239:14
want the general public to get them or chips even AI chips but you see how like you know Huawei makes
想让普通大众拿到它们,或者芯片,甚至AI芯片,但你看,像华为那种公司,也会做出类似的东西。我觉得在当今这个时代,这根本不可能。从它们身上搞出成果,我觉得就像曼哈顿计划一样——对开放模型来说,他们现在做的就是这种事。他们确实在创新,但我认为总有机会出现那个“大突破”。不过我也觉得,有了现在的LLM,设计出像CUDA这样的东西会更容易。这些团队背后都厉害得不可思议,但你又看到那种非常单一、几乎教条式的专注。看看OpenAI的历史,简直疯狂——这些人多早就想着“我们需要连上一万块GPU,把OpenAI所有的算力都拿来训练一个模型”。这背后有太多故事了。
239:21
chips now you know took a few years but and I think that I don't think there is a way you can contain
芯片,你知道,这花了几年时间。但我觉得,像这样的东西——像知识这种东西——你是没法封锁的。我认为在当今这个时代,这是不可能的,就像互联网一样,我不觉得有这种可能性。至于曼哈顿计划,我觉得有趣的一点是,如果搞一个类似曼哈顿计划那样的开源模型项目,肯定会反复提到Nvidia。你觉得Jensen和Nvidia会一直赢下去吗?我认为他们确实在创新,但总有可能出现一个颠覆性的对手。不过我也觉得,有了现在的LLM,设计像CUDA这样的东西会更容易。你知道,下一个类似的东西——它花了15年,因为很难,但现在我们有LLM了,也许就能做到了。
239:27
something like that like knowledge like that I think in this day and age it is impossible like
类似知识这样的东西,我认为在当今这个时代,这几乎是不可能的
239:33
the internet I don't think this is a possibility. On the Manhattan project thing one of my funny
互联网,我不认为这是一种可能性。关于曼哈顿计划,我觉得有趣的一点是,如果搞一个类似曼哈顿计划但针对开放模型的项目,会多次提到Nvidia。你觉得Jensen和Nvidia会继续赢下去吗?我认为他们确实在创新,但总有可能出现一个颠覆性的东西。不过我也觉得,有了现在的LLM,设计像CUDA这样的东西会更容易。你知道,下一个类似的东西花了15年才出现,因为很难,但现在我们有LLM了,也许能加速。只要它像苹果的Steve Jobs时代那样运作,我对他们的前景还是挺乐观的,因为这是他们的首要问题,而我不知道做这些……
239:39
things making out of them is I think that like a Manhattan project like thing for open models would
从中做出成果,我觉得对于开放模型来说,这就像是一个曼哈顿计划那样的事情
239:43
actually be pretty reasonable because they wouldn't cost that much but I think that that will come
实际上这还挺合理的,因为它们成本不会太高,但我认为这种情况迟早会出现。
239:48
it seems like culturally the companies are changing but I agree with Sebastian all the stuff that
从文化上看,这些公司似乎正在发生变化,但我同意Sebastian说的,你刚才提到的所有那些事情——我觉得既不会发生,也没什么帮助。
239:52
you just said it's like I don't see it happening nor being helpful yeah I mean the the motivating
是的,驱动他们去做这些项目背后的动力,是存在文明级风险。但对于开源模型来说,很难用这个理由去推动,因为开源模型并没有文明级风险。
240:00
force behind them and having projects is there a civilization or risk I it's harder to motivate
你觉得在硬件方面——我们会多次提到Nvidia——你认为Jensen和Nvidia会继续赢下去吗?
240:05
that for open source models. There's not civilization or risk. You think on the hardware side we'll
我认为他们面临的一个劣势是,他们需要大量迭代和大量制造。而且我觉得他们很可能正在做他们该做的事,他们确实在创新,但我认为总会有变数的可能。
240:13
mention Nvidia a bunch of times do you think Jensen and Nvidia are gonna keep winning? I think they have
你提了Nvidia好多次,你觉得Jensen和Nvidia会一直赢下去吗?我觉得他们确实会。他们做的事确实在创新,但我认为总有可能出现那个“大颠覆”。不过我也觉得,有了现在的LLM,设计像CUDA这样的东西会更容易。你知道,下一个类似的东西——过去花了15年,因为太难了,但现在有了LLM,我们也许能更快。只要它像苹果的Steve Jobs时代那样运作,我对他们的处境还是挺乐观的,因为这是他们的头号难题。我不知道这些是否属于人类文明的价值,这些价值会不会被不同的炒作所捕获,但我确实认为——在这一点上,当然有一部分是计划好的,或者说GPU的发展轨迹是规划好的,但另一方面……
240:19
the downside that they have to iterate a lot and manufacture a lot and I think they probably
他们的劣势在于需要大量迭代和制造,我觉得他们可能确实在创新,但总有机会出现那个“大突破”。不过我也认为,有了现在的LLM,设计像CUDA这样的东西会更容易——你知道,下一个类似的东西。CUDA花了15年,因为它很难,但现在有了LLM,我们或许能复制CUDA。我还好奇,随着我们逐渐稳定下来,训练和推理的计算会不会分开?因为推理需要的计算越来越多,这应该是Crock收购的意义所在,也是Vera Ruben推出新芯片的原因——那种没有高带宽内存、或者只有极少量高带宽内存的芯片。
240:25
was what they're doing they do innovate but I think there's always the chance that there is
他们确实在创新,但我认为总有机会出现
240:32
something who does something fundamentally different who gets very lucky and then does something
有些东西,做的方式完全不同,运气特别好,然后做成了某件事。
240:37
but the problem is I think adoption you know like the the mode of Nvidia is probably not just the GPU
但问题在于,我觉得 adoption 是关键。你知道,Nvidia 的模式可能不仅仅是 GPU,
240:43
it's more like the CUDA ecosystem and that has evolved over so many two decades I think I mean
更像是 CUDA 这个生态系统,而这个生态系统已经发展了将近二十年。
240:48
even back when I was a grad student we I was in a lab we did biophysical simulations
我记得,甚至在我读研究生的时候,我们实验室做生物物理模拟,
240:53
molecular dynamics and we had a Tesla GPU back then just for the computations it was
分子动力学,那时候我们就有一块 Tesla GPU 专门用来做计算。
240:58
bar in 15 years ago now and just they built this up for a long time and that's like that's the mode
那是差不多十五年前的事了。他们花了很长时间才建立起这一切,这就是他们的模式。
241:04
I think it's not the chip itself although they have now the money to iterate and build and scale
我觉得关键不在于芯片本身,虽然他们现在有钱去迭代、去构建、去 scaling,
241:11
but then it's really on the compatibility it's like well if you're at that scale as a company why would
但真正重要的是兼容性。问题是,如果你已经达到那个规模,作为一家公司,你为什么要……
241:17
you go with something risky where it's only a few chips that they can make per year you go with
你选那种风险大的方案,一年只能造几颗芯片,那就选大的。但我觉得现在有了LLM,设计像CUDA这样的东西也会更容易。你知道,像下一代这种东西,花了15年,因为太难了。但现在有了LLM,我们也许能复刻CUDA。而且我在想,随着我们逐渐稳定下来,训练和推理的计算会不会分开,因为推理需要的计算越来越多。这应该是Crock收购的意义所在,也是Vera Ruben那边的一部分原因——他们有一款新芯片,没有高带宽内存,或者只有一点点,而高带宽内存是最贵的部件之一。这款芯片是为pre-fill设计的,也就是推理中那部分。
241:21
the big one but then I do think with LLMs now also it will be easier to design something like CUDA
那个“大突破”,不过我也觉得,有了现在的 LLM,设计像 CUDA 这样的东西会更容易
241:29
you know like the next so it took 15 years because it's hard but then now we have LLMs we can maybe
你知道,接下来这一步花了15年,因为确实很难,但现在我们有了LLM,也许可以做到
241:34
replicate CUDA and I wonder if there will be a separation of the training and the inference
replicate CUDA,我在想训练和推理的计算会不会逐渐分离,因为随着我们越来越稳定,推理需要的计算资源会越来越多。
241:39
compute as we kind of stabilize a bit more and more and more computers needed for inference
这应该是Crock收购案的重点,也是Vera Ruben的一部分原因——他们有一款新芯片,几乎没有高带宽内存,或者只有一点点。
241:46
that's supposed to be the point of the crock acquisition and that's why part of what Vera Ruben is
只要它像苹果的Steve Jobs时代那样运作,我对他们的前景还挺乐观的,因为这是他们的头号问题。而我不确定为整个生态做这些芯片是不是其他公司的首要目标,它们也会做好自己的事。
241:52
where they have a new chip with no high bandwidth memory which is one or very little which is one
历史上也有过类似的单一人物的例子,你们怎么看这种单个人(无论男女)主导的局面?
241:57
of the most expensive pieces it's designed for pre-fill which is the part of inference where
其中最昂贵的部分是为pre-fill设计的,也就是推理过程中
242:04
you essentially do a lot of matrix multiplications and then you only need the memory when you're
你本质上就是在做大量矩阵乘法,只有在进行自回归生成时才需要内存,这时候会有KV缓存交换。所以他们设计了这款新GPU,专门针对这个特定场景,每单位算力的拥有成本其实低得多。但我认为英伟达的命运仍然取决于AI的普及程度。他们最大的客户依然是那些超大规模公司——比如Google显然能做TPU,亚马逊在搞训练芯片,微软也会尝试做自己的东西。只要AI进步的速度够快,英伟达的平台就是最灵活的,大家自然会想要它。但如果发展停滞,大家就有更多时间去定制专用芯片。有意思的是,英伟达在这方面其实相当活跃。
242:07
doing this auto regressive generation you have the KV cache swaps so they have this new GPU that's
进行这种自回归生成时,会有KV cache的交换,所以他们推出了这款新的GPU
242:13
designed for that specific use case and then the cost of ownership per flop or whatever is actually
专门针对这个特定场景,然后每flop的拥有成本实际上
242:19
way lower but I think that Nvidia's fate lies in the diffusion of AI still their biggest clients are
低得多。但我认为Nvidia的命运取决于AI的扩散,他们最大的客户
242:26
still these hyper scale companies whether it's like Google obviously can make TPUs Amazon is making
仍然是这些超大规模公司,比如Google显然能做TPU,Amazon在做
242:33
training Microsoft will try to do its own things and like so long as the pace of AI progress is high
训练芯片,Microsoft也会尝试搞自己的东西。只要AI进步的节奏很快,
242:40
Nvidia's platform is the most flexible and people will want that but if they're stagnation then
Nvidia的平台就是最灵活的,人们会需要它;但如果出现停滞,
242:46
creating bespoke chips there's more time to do it. It's interesting that Nvidia is quite active
那么定制芯片就有更多时间去开发。有意思的是,Nvidia其实相当活跃。
242:53
in trying to develop all kinds of different products they tried to create areas of commercial value
在尝试开发各种不同产品的过程中,他们努力创造商业价值领域,这些领域会消耗大量GPU,但他们持续创新,也在做很多令人难以置信的研究。所有人都说这家公司极度围绕Jensen运转,并且他在运营层面深度参与,这听起来和我听说过的许多其他大公司截然不同。只要这种文化还在,我认为他们就会持续取得进展,这就像他仍处于Apple的Steve Jobs时代一样。只要公司以这种方式运作,我对他们的前景就相当乐观,因为这是他们最优先解决的问题。而我不知道为整个生态系统制造这些芯片,是不是其他所有公司的首要目标——他们也会做得很好。
242:59
that will use a lot of GPUs but they keep innovating and they're doing a lot of incredible research
这会消耗大量GPU,但他们一直在创新,也在做很多不可思议的研究。
243:06
everyone says the company is super oriented around Jensen and how operationally plugged in
大家都说这家公司极度围绕Jensen运转,他在运营上深度介入。
243:12
is and it sounds so unlike many other big companies that I've heard about and so long as that's
这听起来跟我听说的很多其他大公司完全不一样,只要这种文化还在,我觉得他们就能持续进步。他现在就像苹果的Steve Jobs时代,只要公司还这么运作,我对他们的前景挺乐观的。
243:17
the culture I think that I will expect them to keep progress happening and it's like he's still in
因为这是他们最优先解决的问题,而我不知道为整个生态造芯片是不是其他公司的首要目标——他们也会做好,但历史上那些单枪匹马的传奇人物呢?你们觉得单个人(无论男女)能起到多大作用?
243:22
the Steve Jobs era of Apple so long as that is how it operates I'm pretty optimistic for
只要它像苹果的史蒂夫·乔布斯时代那样运作,我对他们的前景相当乐观
243:29
their situation because it's like it is their top order problem and I don't know if making these
因为这是他们的头号难题,而我不确定这些
243:35
chips for the whole ecosystem is the top goal of all these other companies they will do a good job
为整个生态系统提供芯片是所有其他公司的首要目标,它们会做得很好。
243:40
but it might not be as good of a job. Since you mentioned Jensen I've been reading a lot about
但可能没那么出色。既然你提到黄仁勋,我最近读了不少历史资料,也关注历史上那些标志性人物。你们怎么看“单个人物决定历史”这种观点?在科技领域,个体对历史走向的影响有多重要?比如,没有黄仁勋,英伟达会怎样?你提到乔布斯,没有乔布斯的苹果会怎样?没有埃隆的xAI,或者没有戴米斯的DeepMind又会怎样?人们能让事情更早、更快地发生。从科学角度看,许多伟大科学家都归功于在正确的时间出现在正确的地点,并最终做出创新——但即使没有他们,迟早也会有别人想到这个点子。所以我认为,从这个意义上说,黄仁勋正在让这场GPU革命以更快的速度和更聚焦的方式成为现实。
243:47
history and both singular figures in history what do you guys think about the single man woman
历史上以及那些单枪匹马的传奇人物,你们怎么看这种孤胆英雄?
243:52
view of history how important their individuals for steering the direction of history in the tech sector
在历史观里,个体对引导科技行业方向有多重要?
243:58
so you know what's in video without Jensen you mentioned Steve Jobs what's Apple without Steve Jobs
你看,没有Jensen的英伟达会怎样?你提到了Steve Jobs,没有Steve Jobs的苹果会怎样?
244:04
what's XAI without Elon or DeepMind without Demis people make things earlier and faster where
没有Elon的xAI,或者没有Demis的DeepMind又会怎样?是人让事情发生得更早、更快。
244:15
scientifically many great scientists credit to being the right place at the right time and still
从科学角度看,很多伟大的科学家都归功于“在对的时间出现在对的地方”,但他们依然做出了创新——而最终别人也会想到这个点子。
244:21
making the innovation where eventually someone else will still have the idea so I think that
所以我觉得,从这个意义上说,Jensen正在帮助这场GPU革命更快、更聚焦地实现。
244:27
in that way Jensen is helping manifest this GPU revolution much faster and much more focused
但我仍然认为,像ChatGPT这样的东西最终还是会出现的,这种大规模建设也终究会发生——只是可能不会这么快,或者这么……
244:35
than without having a person there it would do and this is making the whole AI build out faster
比起没有人在场的情况,它会做得更好,这也在加速整个AI的构建过程。但我仍然认为,像ChatGPT这样的东西最终还是会出现的,类似的构建过程也会发生,只是可能不会这么快。我觉得这就像是一种调性——这些个体的人,他们是在下注,有些人运气好,有些人运气不好。但如果没有这些人掌舵,整个过程会更分散。这几乎就像投资ETF和个股的区别:个股可能涨得更猛,也可能跌得更狠,而ETF更平衡,长期来看最终会上涨,我们也会到达那里,但你知道,关键在于专注度。
244:40
but I do still think that eventually like something like chat GPT would have happened and a
但我还是觉得,像ChatGPT这样的东西最终还是会出现的,这种规模的构建也会发生,只是可能不会这么快,或者说不会这么……
244:45
build out like this would have happened but it probably would not have been as fast or like as
那些下注的人,有些人运气好,有些人运气不好,但如果没有这些人掌舵,整个过程会更分散。这有点像投资ETF和个股的区别——个股可能涨得更猛,也可能跌得更狠,而ETF更均衡,长期来看总会涨上去,我们最终会到达那里,但你知道,关键在于专注。
244:51
like I think that's the sort of flavor that is applied people these individual people are people
我觉得这就是那种味道,现在这些人,就是那些在押注的人,有些人运气好,有些人运气不好。但如果没有这些人掌舵,事情就会更分散,这几乎就像投资ETF和个股的区别。个股可能涨得更猛,也可能跌得更狠,而ETF更平衡,长期来看总会涨上去,我们最终会到达那里。但关键在于,我认为深度学习革命的复兴——它本来可能晚20年才发生——这件事上,我会说,是啊是啊,20年,或者如果GPU当时没出现,另一个AI寒冬可能就来了,那会彻底改变历史。
244:56
who are placing bets on something some get lucky some don't but if you don't have these people
我认为这是深度学习革命的重新焕发,它本来可能晚20年才到来。
245:00
at the helm it will be more diffused it's almost like investing in a ETF versus individual stocks
对于这一点,我会说,是的,是的,20年,或者像另一次AI浪潮,比如深度学习那样的。
245:06
individual stocks might go up might go down more heavily than an ETF which is more balanced it will
个股可能涨也可能跌,波动比ETF更大,ETF更均衡,长期来看它最终会涨上去,我们总会达到那个点,但你知道,重点在于——
245:12
eventually go up over time we'll get there but it's just like you know the focus I think it's
我认为这是深度学习革命的复兴,它本来可能晚20年才出现。
245:18
passionate focus isn't a real case to be made that without Jensen there's not a
那种充满激情的专注,并不是一个能真正站得住脚的说法,说没有黄仁勋就不会有深度学习革命的复兴——那可能得晚20年才发生。确实,如果当时没有GPU,深度学习寒冬可能早就来了,那会彻底改变历史进程。因为你可以想象,在这期间其他技术可能会崛起,人类文明的焦点也会被不同的热潮所吸引。但我确实认为,一方面GPU的发展轨迹确实有某种规划的成分,但另一方面,也有很多幸运的巧合,或者说很好的直觉,比如那些投资决策。
245:23
reinvigoration of the deep learning revolution it could have been 20 years later
这件事上我会说,对对对,20年,或者像另一次AI浪潮,比如深度学习那样,人类文明的价值仍可能被不同的炒作所捕获,但我确实认为——
245:28
is something that it would say yeah yeah 20 years or like another AI when like a deep learning
在这一点上,当然有一部分是早有预谋的,或者说是GPU的发展轨迹,但另一方面……
245:32
winter could have come if GPUs weren't around that could change history completely because
如果当时没有GPU,寒冬可能真的会降临,这足以彻底改变历史进程。因为即便人类文明依然存在,价值也会被不同的炒作热点所捕获。但我确实认为,一方面GPU的发展轨迹确实存在某种规划性,另一方面也掺杂了大量幸运的巧合——比如良好的直觉判断和投资决策。GPU恰好擅长线性代数,因为电子游戏需要大量线性代数运算,后来又延伸到生物物理模拟。不过即便如此,我依然不认为存在什么"AI大棋局"。事情其实很简单:恰好是Alex Krizhevsky这个人,他拿这些GPU尝试训练神经网络,结果效果出奇地好。
245:37
you could think of all the other technologies that could have come in the meantime and the focus
你可以想象一下,这期间本来可能涌现出其他技术,人类文明的焦点和核心价值也可能被不同的热潮所占据。但我确实认为,从某种程度上说,GPU的发展轨迹是有规划的;但另一方面,这里面也有很多幸运的巧合,或者说很好的直觉。比如,GPU恰好擅长线性代数,因为电子游戏需要大量线性代数运算,后来又有了生物物理模拟。不过,我仍然不认为那个“宏伟计划”就是AI。我觉得事情只是碰巧发生了——Alex Krizhevsky这个人,他拿这些GPU试着训练神经网络,结果效果出奇地好。
245:43
of human civilization could still come value would be captured by different hype but I do think
人类文明的价值是否会被不同的炒作所捕获,但我确实认为
245:48
at this I mean there's certainly an aspect where it was all planned or the GPU trajectory but on
在这一点上,当然有某种层面是计划好的,或者说是GPU的发展轨迹,但
245:54
the other end it's also a lot of lucky coincidences for example or good intuition like the investment
另一端也充满了许多幸运的巧合,或者说好的直觉,比如那笔投资。
245:59
into the let's say biophysical simulations or like I mean I think it started with video games and
比如说在生物物理模拟里,或者我的意思是,我觉得它最初是从电子游戏开始的,然后它碰巧在线性代数上表现很好,因为电子游戏需要大量线性代数,接着就有了生物物理模拟。但即便如此,我还是不认为那个计划——那个宏大的计划——是AI。我觉得只是碰巧有Alex Krzyszewski这样的人,有人拿这些GPU,试着在上面训练神经网络,结果效果出奇地好。而且我认为这之所以能发生,只是因为你能买到这些GPU——游戏产业创造了对更快处理器的需求。如果Nvidia早期就倒闭了,我会觉得,那GPU对Alex来说可能就不一样了,但我认为GPU还是会存在。
246:04
then it just happened to be good at linear algebra because video games require a lot of linear algebra
然后恰好因为视频游戏需要大量线性代数,所以他对线性代数很擅长。
246:09
and then you have the biophysical simulations and then but still I don't think the plan the
接着还有生物物理模拟,但我仍然不认为那个计划——那个宏伟计划——是AI。我觉得只是恰好有Alex Krzyszewski这样的人,有人拿这些GPU说“咱们试试在上面训练个神经网络吧”,结果效果出奇地好。
246:15
master plan was AI I think there was just it happened to be Alex Krzyszewski so someone took
我觉得如果没有Alex,GPU可能会不一样,但我想GPU领域还是会有一家公司成功,或者几家小公司做出更差的芯片。
246:21
these GPUs and like let's try to train a neural network on that and happen to work really well
但我不认为那会导致一百年的延迟,可能只是十年的延迟。嗯,也可能是一、二、三、四年。
246:26
and I think it only happened because you could purchase those GPUs gaming would have created a
而且我觉得这之所以会发生,完全是因为你能买到那些GPU。游戏市场本来就会催生对更快处理器的需求,如果英伟达早期就倒闭了,我觉得情况会是——GPU在Alex(指AlexNet)时代会有所不同,但GPU领域要么是一家公司成功,要么是几家小公司做出更差的芯片。我不觉得这会导致一百年的延迟,可能也就十年。嗯,也可能是一、二、三、四、五十年的延迟。我只是觉得英特尔或AMD做不到,我不认为会是现在存在的某家公司,而会是另一家已经倒闭的公司,比如硅谷图形之类的。所以没错,某家已经消失的公司可能会做到,但光看现状的话,似乎就是这样。
246:31
demand for faster processors if Nvidia had gone out of business in the early days that's what I would
如果Nvidia早期就倒闭了,对更快处理器的需求——我本来会以为,GPU在Alex那个时代会完全不同,但我觉得GPU领域要么会有一家像Nvidia一样成功的公司,要么是几家小公司做出更差的芯片,但我不认为这会造成一百年的延迟,可能也就十年。嗯,也可能是一、二、三、四、五十年的延迟,我只是觉得Intel或AMD做不到,我不认为会有现在这样的公司存在,我觉得会是另一家公司,比如Silicon Graphics之类的,对,一些已经倒闭的公司可能会做到。但光看现在,Nvidia背后的团队确实很厉害,只是他们那种非常单一、近乎教条式的专注度,确实很特别。
246:37
think like I think that the GPUs would have been different for the Alex but I think like GPUs would
我觉得,如果当时GPU不一样的话,Alex可能也会不一样。但我觉得,要么是一家公司特别成功,要么是几家小公司用更差的芯片,但我不觉得这会带来一百年的延迟,可能也就十年左右。可能有一家、两家、三家、四家公司存在,我觉得会是另一家公司,比如Silicon Graphics之类的。对,就是那种已经倒闭的公司,本来可能会做成这件事。但光看现在的情况,这些团队确实很厉害,只是他们有一种非常单一、几乎教条式的专注。回顾OpenAI的历史,感觉这些人很早就在想,我们要连上一万块GPU,把OpenAI所有的算力都拿来训练一个模型,这听起来简直有点疯狂。
246:44
still exist at the time of Alex net and at the time of the transformer it was just hard to know if
在AlexNet时代和transformer时代,当时确实很难判断,到底是一家公司能成功,还是多家小公司用更差的芯片也能分一杯羹。但我不觉得这会导致一百年的延迟,可能也就十年吧。嗯,也可能是一、二、三、四、五十年的延迟。我的意思是,我完全看不到Intel或AMD能做到这一点——我不认为会是现存的公司,而是一家已经倒闭的公司,比如Silicon Graphics之类的。所以没错,确实会有某家已消亡的公司来完成这件事。但单从表面看,这些个别的领军人物对世界的发展轨迹产生了巨大影响,当然他们背后有出色的团队,但那种极其个人化、近乎教条式的专注力,确实是存在的。
246:50
it would be one company as successful or multiple smaller companies with worse chips but I don't
要么是一家公司成功,要么是多家小公司用更差的芯片,但我不认为
246:56
think that's like a hundred year delay it might be a decade delay well it could be one two three four
那会导致一百年的延迟,可能只是十年的延迟,嗯,可能是一、二、三、四
247:03
five decade delay I mean I just can't see Intel or AMD doing wouldn't I don't think it would be a
五十年延迟,我是说,我完全看不出Intel或AMD会做这个——我觉得这不会是一家现在还存在的公司,而是像硅谷图形那种已经倒闭的公司会做的事。所以没错,某些已经消失的公司可能会干这事,但光看现状,背后的团队确实令人难以置信,可他们又带着那种近乎偏执的单一专注。回顾OpenAI的历史,这些人早在那个阶段就喊着要接上一万块GPU、把OpenAI所有算力都拿来训练一个模型,这简直疯狂得离谱。当时团队里很多人都不愿意这么干——在scaling还没任何迹象能成真之前,相信scaling本身就不是什么疯狂的事,但偏偏就是有那么几个偏执狂做到了。
247:09
company that exists I think it would be a different company would write silicon graphics or something
家公司存在,我觉得会是另一家公司,比如像硅谷图形那样的公司
247:15
so yeah some company that is died would have done it but it does like just looking at it it seems
所以,有些已经倒闭的公司本来也会这么做,但光看表面的话,背后的团队确实很厉害。不过你会有那种非常单一、几乎教条式的专注感。回顾OpenAI的历史,简直觉得不可思议,这些人那么早就意识到:我们需要连上一万块GPU,把OpenAI所有的算力都拿来训练一个模型。很多AI领域的东西以后还会被记住,比如transformer这个词很可能依然广为人知。我猜深度学习肯定还会被记住,但transformer在一百年后,随着ASI和AI研究者遍布各地,可能已经演变成别的东西了。不过我觉得,乐观来看,所有这些变化在一百年内发生,而那时深度学习依然存在。
247:22
like these singular figures these leaders have a huge impact on the trajectory of the world obviously
像这些非凡的人物,这些领导者对世界的发展轨迹有着巨大的影响,这很明显。他们背后有出色的团队,但那种近乎独断的专注力非常罕见。伊利亚推动了规模化,对吧?达里奥也深度参与其中。如果你读过OpenAI的一些历史,几乎会觉得不可思议——这些人早在什么时候就提出,要连接一万块GPU,用掉OpenAI所有的算力来训练一个模型。当时团队里有很多人不同意,这其实并不疯狂,因为在规模化还没有任何迹象会实现的时候就去相信它,这又是那些非凡人物才有的特质。说到这个,一百年后,这大概就是后奇点时代了,无论奇点到底是什么。
247:29
incredible teams behind them but you're having that kind of very singular almost dogmatic focus
背后有非常厉害的团队,但你会有那种非常单一、近乎教条式的专注
247:38
is necessary to make progress yeah I mean even with GPT it wouldn't exist if there wasn't a person
要取得进展就必须这么做。是啊,就算拿GPT来说,如果没有那个叫Ilia的人坚持推动scaling,它根本就不会存在。Dario也深度参与其中,他们读过一些OpenAI的历史,现在看来简直像天方夜谭——这些人早在那么早的时候就说:我们需要连上一万块GPU,把OpenAI所有的算力都拿来训练一个模型。当时团队里很多人都不愿意这么做,这其实也不奇怪,因为在scaling还没任何迹象表明会成功之前,就相信scaling能成,这本身就不是一件疯狂的事。说到这个,一百年后——那大概是post singularity时代了,不管singularity到底是什么——当历史学家回望我们这个时代,他们会真正强调哪些技术突破呢?
247:44
Ilia who pushed for the scaling right I mean Dario is also deeply involved in that they read some
Ilia 当时力推 scaling 对吧,Dario 也深度参与其中。你看 OpenAI 的一些历史,简直觉得不可思议——他们那么早就有人提出要接上一万块 GPU,把 OpenAI 所有的算力都拿来训练一个模型。当时团队里很多人都不愿意这么做,这其实也正常,因为在 scaling 还没任何迹象会成功之前,相信 scaling 本身就是一件很疯狂的事。说到这个,一百年后,假设已经过了奇点——不管奇点到底是什么——它已经融入电话网络、通信网络了,这不过是那个体系里的一个位置问题。而真正的突破,其实就来自算力的增长,也就是摩尔定律。
247:50
of the histories of open AI it almost seems wild picking about how early these people were like we
从 OpenAI 的历史来看,这些人这么早就有了这样的想法,简直让人觉得不可思议
247:55
need to hook up 10,000 GPUs and take all of open AI's compute and train one model there's a lot
得接上一万块GPU,把OpenAI所有的算力都拿来训练一个模型,这工程量可不小。
248:00
of people there that didn't want to do that which isn't an insane thing to believe that to believe
有些人其实并不想这么做,认为在 scaling 还没有任何迹象表明它会再次实现之前就相信 scaling,这也不是什么疯狂的想法。
248:05
scaling before scaling has any indication that it's going to materialize again singular figures
人们互相谈论时,任何关于神经网络的东西都会被记住,比如你觉得有没有可能……
248:13
speaking of which hundred years from now this is presumably post singularity whatever singularity is
说到这个,一百年后,这大概已经是后奇点时代了——不管奇点到底是什么——
248:21
when historians look back at our time now what technological breakthroughs would they really emphasize
当历史学家回望我们这个时代,他们会真正强调哪些技术突破呢?
248:29
as the breakthroughs that led to the singularity so far we have touring today 80 years I think it
到目前为止,导致奇点出现的突破性进展,我觉得图灵到今天大概80年吧,它仍然会属于计算这个总称概念。我不一定认为100年或200年后还会叫AI,它可能仍然只是计算机,你知道的,我们现在只是更好地利用了计算机。但计算这件事本身,更像是一种讨论,甚至连代码和GPU的细节都不会被记住,也不会有什么“软件术语油”这种说法,它就只是明摆着的计算。我基本同意这个观点,但问题是,互联网的连接性和计算能力能否融合在一起,还是说它们各自独立?我觉得互联网可能还是会跟通信相关,嗯,我是说通信。
248:37
would still be computing like the umbrella term computing just I don't necessarily think it's even
可能还是计算——就像“计算”这个总称,我甚至不觉得
248:43
like 100 years 200 years from now it would be AI it would it could be still well be computers you know
一百年、两百年后,它会是AI,也可能仍然是计算机,你懂的
248:49
just we are now taking better advantage of computers but like the fact of computing it's basically more
我们现在只是更好地利用了计算机,但计算这件事本身,基本上更像
248:54
as a kind of discussion you're not even the details of code and GPUs won't even be remembered
一种讨论,连代码和GPU的细节都不会被记住
249:00
and it won't be all this software term oil it'll be just obviously compute I've generally
也不会有什么软件术语,只会是显而易见的compute。我基本同意
249:08
agreed but it's like is the connectivity of the internet and compute able to be merged
但问题是,互联网的连接性和计算能力能否融合在一起
249:15
or as they both of them I think the internet will probably be related to yeah I mean communication
还是说两者并存?我觉得互联网很可能也会被关联进去,嗯,我是说通信。
249:21
that it could be a phone internet satellite that stuff where yeah when compute is more like
可能是手机、互联网、卫星这些东西,对吧,当算力更像是一种资源时,它的扩展性可能让互联网完全被遗忘,互联网被整合进电话网络这样的通信网络里,这不过是位置问题而已。真正的突破来自于算力的提升,也就是广义上的摩尔定律。嗯,我觉得人与人之间的连接是其中非常根本的一点,就像你可以和世界上任何你想找的最厉害的人交谈,他们可能在世界某个角落,而能够实现这种信息流动,AI也会依赖这一点。我想我一直纠结于那个湖的比喻,就是当我说那个关于单一中心的梦想已经破灭的时候。
249:27
the scaling aspect of it is possible that the internet is completely forgotten the internet is
关于规模化这方面,互联网可能已经完全被遗忘了——互联网被整合进了电话网络,也就是通信网络里,这不过是位置问题而已。真正的突破来自于计算能力的提升,也就是广义上的摩尔定律。我觉得人与人之间的连接是其中非常根本的东西,就像你可以和世界上任何你想找的最厉害的人交谈,他们可能在地球某个角落,而你能拥有这种信息流动。AI也会依赖这一点。我一直在纠结于一点:当我说那个梦想破灭时,指的是那个单一的中心化系统——人们开始用不同的“布料”来应对不同的任务,这被描述为“多”。
249:33
wrapped into the phone networks like communication networks this is just another matter of
它被嵌入到电话网络里,就像通信网络一样,这不过是另一个位置问题。
249:39
position of that and the real breakthrough comes from just the increased compute is the Moore's law
真正的突破来自于计算能力的提升,也就是摩尔定律。
249:45
broadly defined well I think that connection of people is very fundamental to it so it's like
广义上来说,我觉得人与人之间的连接是它的核心,就像——你可以和任何人交流,找到世界上某个角落最厉害的人,让信息自由流动。AI也会依赖这一点。我一直在纠结那个点,就是当我说那个“梦想已死”的时候,关于那个单一的、中心化的东西……人们开始用不同的“布料”来做不同的任务,这被描述成很多条路径。它极度依赖网络和信息的自由流动,而这一切又建立在算力之上。但说到网络,尤其是GPU,它本身就是扩展算力的关键部分——GPU和数据中心之间需要互相通信。任何关于神经网络的东西都会被记住。你觉得呢?
249:52
you can talk to anybody you want to find the best person in the world or something they are
你可以和任何人交谈,找到世界上某个领域最厉害的人,
249:56
somewhere in the world and being able to have that flow of information the AI's will also rely on
他们可能在世界某个角落,而能够实现这种信息流动,AI 也会依赖这一点。
250:02
this I think I've been fixating on the lake that when I said the dream was dead about the one central
我觉得我一直纠结于一点:当我说那个“一个中心”的梦想破灭时,
250:07
model and the thing that is evolving is like people have many agents for different tasks people
模型和正在演进的东西是——人们为不同任务准备了多个agent,已经开始用不同的“衣服”来适配不同任务了。这被描述为数据中心里的多个AGI,每个AGI负责管理,彼此之间互相交流。这整个体系极度依赖网络和信息的自由流动,而这一切又建立在算力之上。但说到网络,尤其是GPU之间的通信,它本身就是算力扩展的关键部分——GPU和数据中心之间需要互相通信。任何关于神经网络的东西都会被记住。你觉得,神经网络本身有没有什么非常独特且不可替代的特质,让它看起来像是一个突破性的天才之举?本质上,你是在用一种非常粗糙的方式复制人类大脑的结构。
250:12
are start doing this with different cloths for different tasks and it's described as many
人们开始用不同的“布料”为不同任务做这件事,这被描述为许多
250:16
AGI's in the data center where each one manages and they talk to each other and like that is
AGI 在数据中心里,每个都在管理,它们互相通信,就像那样——这非常依赖网络和信息的自由流动,而这一切又建立在算力之上。但网络,尤其是 GPU 之间的网络,是扩展算力的关键部分,因为 GPU 和数据中心需要互相通信。任何关于神经网络的东西都会被记住——你觉得是不是因为神经网络本身有某种非常独特且单一的特质,让它看起来像是一个突破,像天才之作?你基本上是在用一种非常粗糙的方式复制人类大脑的结构,因为神经网络最初就是受此启发。但另一方面,我觉得它又太不一样了——我是说,数字和生物之间的区别,所以我确实认为它最终可能会是……
250:22
wrote so reliant on networking and free flow of information on top of compute but like networking
非常依赖网络和信息自由流动的东西,建立在计算之上,但就像网络本身一样。
250:29
especially with GPUs is such a part of scaling up compute like the GPUs and the data centers need
尤其是GPUs,作为扩展算力的一部分,GPUs和数据中心之间需要互相通信。任何关于神经网络的东西都会被记住,你觉得呢?引擎大概就相当于计算机在这个比喻里的角色,但还有很多其他物理层面的转变是人们意识到的,比如congen这类东西。AI中的一些概念仍然会被知晓,比如transformer这个词很可能依然广为人知。我猜deep learning肯定还是会被记住,但transformer在一百年后可能已经演变消失了,那时ASI和AI研究者遍布各地。不过我认为,未来真正的深刻变革在于AI所带来的东西——如果我们从现在穿越到一百年后。
250:35
to talk to each other anything about neural networks will be remembered like do you think there's
引擎大概就相当于计算机在这个类比里的位置,但还有很多其他的物理变革是人们意识到的,比如像 Congen 之类的。
250:40
something very specific and singular to the fact that it's neural networks that seem as a breakthrough
有一个非常独特且具体的点,就是神经网络本身似乎是一个突破
250:45
like a genius that you're basically replicating in a very crude way the human mind the structure
就像是在用一种非常粗糙的方式复制人类大脑的结构
250:51
the structure the human brain the human mind I think without the human mind we probably wouldn't
人类大脑的结构,人类的心智——我认为如果没有人类心智,我们可能根本不会发展出神经网络,因为它最初正是受此启发。但从另一个角度看,两者又截然不同,我是说数字计算与生物计算的区别。我确实认为它更可能被归类为一种算法,能在特定计算平台上实现大规模并行化,就像遗传计算、遗传算法那样,只是恰好这种并行方式效率更高、效果更好。而且很有可能,LM——也就是我们现在设计的神经网络——只是通往奇点这个系统里的一小部分。如果放眼一百年后的社会,我是这么想的。
250:57
have neural networks because it just was an inspiration for that but at the other end I think it's
神经网络之所以存在,是因为它最初受到了启发,但从另一个角度来看,我觉得
251:03
just so different I mean it's digital versus you know biological that I do think it will probably be
它们其实非常不同,我是说数字化的东西和生物的东西,所以我确实认为
251:09
more like grouped as an algorithm that's massively parallelizable on this particular kind of compute could
更像是被归类为一种算法,在这种特定计算架构上能高度并行化——本来也可以是遗传计算,比如遗传算法那种并行玩意儿,只是碰巧现在这种方式效率更高、效果更好。而且很有可能,语言模型——就是我们现在设计的神经网络——只是通往奇点那个系统里很小的一部分。我觉得如果拉长到一百年来看,就像社会层面那样,想想工业革命里我们记住的东西:引擎大概就相当于这个时代的计算机。但还有很多其他物理层面的变革是人们意识到的,比如所有那些康采恩之类的。
251:15
have been like genetic computing like genetic genetic algorithms just this paralyzed thing it just
可能更像是遗传计算,比如遗传算法那种被卡住的东西,只是碰巧
251:20
happens that this is more efficient works better you know and it very well could be that the LM
神经网络更高效、效果更好,而且很有可能,LM
251:25
you know the neural networks the way we architect them now it's just a small component of the
也就是我们现在架构的神经网络,只是通往奇点系统中的一个小组件
251:30
system that leads to singularity I think if you think of it a hundred years like society I think
我觉得如果从一百年的尺度来看社会,
251:37
can be changed more with more compute intelligence because of autonomy but it's like looking at
可以通过更多算力和自主性来改变智能,但这就像在回顾工业革命时,我们记住的是那些东西——引擎大概就相当于今天的计算机,没错。但还有很多其他物理层面的变革是人们知道的,比如内燃机、空调、冰箱这些至今仍被熟知的机器。AI领域的一些东西也会被记住,比如transformer这个词很可能依然为人所知。我猜deep learning肯定还会被记住,但transformer可能会在一百年后随着ASI和遍布各地的AI研究者而演变消失。不过我觉得deep
251:43
looking at this like what are the things from the industrial revolution that we remember we remember
你看啊,就像工业革命里那些我们至今还记得的东西——比如引擎大概相当于今天的计算机,但还有很多物理层面的变革人们也记得,像什么蒸汽机啊之类的。AI里有些东西也会被记住,比如transformer这个词很可能还会有人知道。我猜deep learning肯定还会被记住,但transformer可能在一百年后就被淘汰了,毕竟到时候到处都是ASI和AI研究员。不过我觉得AI带来的深层变革是——如果我们穿越到一百年后,现在直接跳到那里,你觉得会有什么不同?世界会变成什么样?
251:47
like the engine is probably the equivalent of the computer in this yeah but there's a lot of other
AI 中的一些东西仍然会被知晓,比如 transformer 这个词很可能还会被记住。
251:52
like physical transformations that people are aware of like like all the the congen and all these
我猜深度学习肯定还会被记住,但 transformer 可能会在一百年后随着 ASI 和遍布各地的 AI 研究者而演变消失,不过我觉得深度学习……
251:59
things that these machines that are still known air conditioning refrigerators like
那些现在被称为空调、冰箱的机器,未来AI领域的一些东西也会被这样记住。比如transformer这个词,很可能依然会被人们熟知。我猜深度学习肯定还会被记住,但transformer在一百年后可能已经演化成别的东西了,那时ASI和AI研究者遍布各地。不过我认为,未来AI带来的深层“制冷”效应是存在的。如果我们穿越到一百年后,现在直接跳到那里,你觉得会有什么不同?你觉得世界会变成什么样?首先,你觉得还有人类吗?你觉得到处都是行走的机器人吗?我确实认为会有专门化的机器人,用于特定任务,人形形态的话,大概只有一半吧。
252:05
some of these things from AI will still be known like the word transformer could still very well
AI 领域的有些东西还是会被人记住的,比如 transformer 这个词很可能依然广为人知。我猜 deep learning 肯定还是会被记住的,但 transformer 在一百年后可能已经演变得面目全非了,那时候 ASI 和 AI 研究者遍地都是。不过我觉得,乐观来看,一百年内这些变化都会发生,同时这其实也还好——对 GDP 有好处,会有新的工作岗位被创造出来。而人类体验中那些根本性的、属于个体的部分,比如我们大家都喜欢的面对面交流、聚在一起聊天,这些是不会变的。未来几年,实体商品和线下活动的价值肯定会越来越高,Slop 那边的压力也会更大,所以它们会一直存在下去。
252:11
be known I would guess the deep learning is definitely still learned known but the transformer
众所周知,深度学习肯定还会继续学下去,但Transformer在一百年后可能就进化没了,那时候ASI和AI研究员到处都是。不过我觉得深度学习——
252:15
might be evolved away from in a hundred years of with ASI AI researchers everywhere but I think deep
乐观来看,一百年内就能见证这一切,而与此同时——
252:24
learning is likely to be a term that is remembered and I wonder what the air conditioning and the
学习这个词很可能会被记住,我在想,未来一百年后,AI带来的空调和制冷技术会是什么样子?如果我们穿越到一百年后,现在谁在那里?你觉得有什么不同?你觉得世界会变成什么样?首先,你觉得还有人类吗?你觉得到处都是机器人在走来走去吗?我确实认为肯定会有专门用途的机器人,用于某些特定任务。人形机器人嘛,可能一半是人形,我们拭目以待。我觉得在某些事情上,肯定会有类人机器人,因为这样更适应环境,但对于某些任务,可能也有其合理性。更难想象的是,我们如何与设备互动,以及人类用设备做什么。我相当确定……
252:30
refrigeration of the future is that AI brings is there if we travel forward a hundred years from now
未来一百年后,AI带来的制冷技术会是什么样子,如果我们穿越到那时的话。
252:37
who transport there right now what do you think is different how do you think the world looks
现在运输的东西,你觉得有什么不同?世界会变成什么样?
252:41
different first of all you think there's humans you think there's robots everywhere walking around
首先,你觉得有真人,也有机器人到处走来走去。
252:46
I do think specialized robots for sure for certain tasks humanoid form that I'm maybe half
我确实认为会有专门用途的机器人,用于特定任务,人形形态我大概一半认同,因为环境适配性,但某些任务上可能确实合理。更难想象的是,我们如何与设备互动,以及人类用设备做什么。我基本确定,汽车会被别的东西取代,但我们只是把车造得更好了,方向盘还在,轮子还在。我觉得我们还是会随身携带一个物理计算设备,因为人们希望保留一些隐私能力,比如你可能不会像用手机那样频繁使用它,如果所有东西都只存在云端和你的日历里的话。
252:52
humanoid we'll see I think for certain things yes there will be humanoid robots because it's just
人形机器人嘛,我觉得在某些场景下肯定会有,因为环境本身就适合这种形态。但具体到某些任务,可能就没必要了。更难想象的是我们怎么跟这些设备互动,以及人类会用设备做什么。我敢肯定,我们不会完全用别的东西替代汽车,只是把车造得更好而已——方向盘还在,轮子也还在。我觉得我们还是会随身带一个物理计算终端,因为人们需要保留一些隐私空间。如果所有东西都存到云端,连整个日历都在上面,你可能反而不会像现在用手机那样频繁去碰它。毕竟要处理我们肉眼能接收的所有信息量,这事儿想想就头大。
252:58
amenable for the environment but like for certain tasks it might make sense what's harder to imagine
对环境更友好,但某些任务可能确实有道理。更难想象的是
253:04
is how we interact with the devices and what humans do with devices will I mean I'm pretty sure
我们如何与设备互动,以及人类用设备做什么。我相当确定
253:11
will probably not be the cell phone will probably not be the laptop will it be you know implants
大概率不会是手机,也不会是笔记本电脑。会不会是植入式设备呢?
253:16
I mean it has to be brain computer pieces right yeah I mean a hundred years from now it has to
我的意思是,它必须是脑机接口对吧?没错,一百年后肯定得是。
253:20
like given the progress we're seeing now there has to be unless there's legitimately
以我们目前看到的进展来看,除非人类与现实的交互方式发生彻底改变,否则必然如此。
253:27
complete alteration of how we interact with the reality on the other hand if you think of cars
但另一方面,想想汽车——汽车的历史已经超过一百年了,对吧?可它的交互界面还是老样子。我们并没有用别的东西取代汽车,只是把汽车造得更好了。方向盘还在,轮子也还在。
253:34
cars are older than hundred years right and it's still the same interface it's not we haven't
我觉得我们还是会随身携带一个物理计算设备,因为人们需要保留一定的隐私空间。你可能不会像用手机那样频繁地使用它。
253:39
replaced cars with something else we just made the cars better but it's still steering wheel
我们用别的东西取代了汽车,只是把车造得更好了,但方向盘还在,
253:44
it's still wheels you know I think we'll still carry around a physical break of compute because
轮子也还在。我觉得我们还是会随身携带一个物理计算设备,因为
253:48
people want some ability to have a private like you might not engage with it as much as a phone
人们希望保留一些隐私能力。你可能不会像用手机那样频繁地使用它,
253:54
but having something where you can have private information that is yours as an interface between
但拥有一个能存放你私人信息的界面,作为你与互联网其他部分之间的桥梁——我认为这种需求依然会存在。它可能不像iPhone那样,也可能被使用得更少,但我仍然预期人们会随身携带一些设备。
253:58
the rest of the internet I think it's something that people will still exist it might not look like
为什么你觉得智能手机是私密性的体现呢?它上面可是有摄像头的。
254:03
an iPhone it might be used a lot less but I still expect to have people carry things around
嗯,可能对你来说,比如加密消息、加密照片,你知道自己的生活是什么样子的。
254:08
why do you think the smartphone is the embodiment of private there's a camera on it
我认为这取决于你对脑机接口的乐观程度。
254:14
um probably for you like encrypted messages encrypted photos you know what your life is like
如果所有信息都只是存储在云端,包括你整个日历的话……
254:22
I think this is a question on whether how optimistic on brain machine interfaces you are
很难想象要如何处理我们通过视觉能接收到的全部信息。
254:26
if that is all that just going to be stored in the cloud in your whole calendar
如果所有东西都只存在云端,包括你的整个日历。
254:32
it's hard to think about processing all the information that we can process visually
很难想象我们能在对话的时间尺度上处理所有视觉信息。我认为UBI并不能解决自主权问题。我确实认为这需要几十年,但一百年内仍然会发生很多事——想想那些处于发展早期阶段的国家,要获得计算资源和互联网接入,建设所有基础设施,并制定政策让一个国家的财富与另一个国家共享。我认为,乐观来看,所有这些能在百年内实现,而它们仍然是独立实体,没有被某个国际秩序吞并。这能帮助缓解世界上一些基本层面的苦难,你知道,社会的转型。
254:37
through brain machine interfaces presenting something like a calendar or something to you like
通过脑机接口给你展示日历之类的东西时,比如你很难光靠想就知道自己的邮箱收件箱,而不去看它。就像你给电脑一个信号,然后你就能直接知道收件箱里的内容——这到底是怎么回事?这种事情,人类大脑能处理吗?以非视觉的方式直接输入信息?我不太清楚这些转换具体是怎么发生的,因为人类在一百年内并不会进化。我觉得,自主权和社群才是人们真正想要的东西。本地社群,也就是你亲近的人,能和他们一起做事,能赋予生活意义,能去创造、去行动——我认为这才是关键。
254:44
it's hard to just think about knowing without looking you know your email inbox
光靠“知道”很难想象,比如你看邮件收件箱——你对电脑发出信号,然后就直接“知道”收件箱里有什么,这到底是什么意思?
254:49
like you signal to a computer and then you just know your email inbox like what does that
这种事情,人类大脑能非视觉地直接接入处理吗?
254:53
like is that something that the human brain can handle being piped into it non visually
我不太清楚这些转换具体是怎么发生的,因为人类一百年来并没有进化。
254:59
like I don't know exactly how those transformations happen because humans aren't changing in
我觉得,自主权和社群才是人们真正想要的东西。
255:04
a hundred years I think agency and community are things that people actually want
本地社群——你亲近的人,能和他们一起做事,能赋予生活意义,能去创造、去行动。
255:09
local community so people you are close to being able to do things with them and being able to
我认为这是我们可以讨论的时间尺度上的事。
255:15
ascribe mean like describe meaning to your life and to build to do things I think that that is
而且我觉得,UBI并不能解决自主权的问题。
255:21
maybe if not in a hundred years I don't think that human biology is changing away from those
哪怕不是一百年内,我也不认为人类生物学特性会脱离那些根本限制,在我们可以讨论的时间尺度上发生变化。而且我觉得UBI并不能解决自主权问题。我确实预期会有巨大的财富,也希望它能被广泛分配,让普通人的生活在一百年后看起来截然不同。但如果你想想那些处于发展早期阶段、正在获取计算和互联网接入的国家——要建设所有基础设施,还要制定政策让一个国家的财富与另一个国家共享——我认为乐观地看,所有这些在一百年内发生,同时它们仍然是独立实体,而不是被某种国际秩序所吸收,这本身就已经是很大的变化了。
255:28
on a time scale that we can discuss and I think that like UBI does not solve agency I do expect
在一个我们可以讨论的时间尺度上,我认为全民基本收入并不能解决自主权问题。我确实预期
255:36
mass wealth and I hope that it is spread so that the average life does look very different in a hundred
大规模的财富,我希望它能被广泛分配,让普通人的生活在一百年后看起来截然不同。但即便是一百年,要实现这一切也还有很多事情要做——想想那些处于发展早期阶段的国家,它们需要获取计算和互联网资源,建设所有基础设施,还要制定政策让一个国家的财富与另一个国家共享。我认为,乐观地看,所有这些都能在一百年内实现,而它们仍然是独立的实体,而不是被吸收进某种国际秩序。这有助于减轻世界上一些基本的苦难。你知道,社会转型过程中,短期内会有大量工作岗位消失。我认为我们必须牢记,每一个
255:42
years but that's still a lot to happen in a hundred years if you think about countries that are
但一百年内发生这么多事,依然很惊人。想想那些处于发展早期阶段的国家,要获得计算资源和互联网接入,需要建设所有基础设施,还要制定政策让一个国家的财富惠及另一个国家——我认为,能在一百年内看到这一切实现,已经是乐观的看法了。毕竟它们仍是独立实体,而非被某个国际秩序直接吞并。这能帮助缓解世界上一些基本层面的苦难。你知道,社会层面的转型是真正的悲剧。你可以从经济学角度提出各种论点,说什么一切都会好起来、对GDP有好处、会有新岗位被创造出来——但对个体而言,这些根本性的冲击才是关键。
255:47
early in their development process to getting access to computing and internet like to build all the
在他们开发的早期阶段,能接触到计算资源和互联网,去搭建所有基础设施,并且制定政策让一个国家的财富与另一个国家共享——我认为这是一种乐观的看法,觉得这一切能在百年内实现,而那时它们仍然是独立的实体,而不是被吸收进某种国际秩序里。
255:53
infrastructure and to have policy that shares one nation's wealth with another is I think it's
帮助减轻世界上一些基本的苦难,你知道,社会的转型是真实的悲剧。你可以从经济学角度提出各种论点,说什么一切都会好起来,对GDP有好处,会有新的就业机会被创造出来——但对个体而言,这是根本性的问题。
256:03
the optimistic view to see all that happening in a hundred years while that is still being
这没问题,对GDP有好处,还会创造新岗位。人类体验中那些根本性的、面对面的东西——比如我们大家都喜欢的彼此见面、当面聊天——未来几年肯定会更受重视。
256:07
well they are still independent entities than not just like absorbed into some international order
嗯,它们仍然是独立的实体,并没有被吸收到某种国际秩序里。
256:12
by force but there could be just better more elaborate more affectives social support systems that
靠强制手段不行,但也许可以有更完善、更有效的社会支持体系,来帮助减轻世界上一些基本的痛苦。你知道,社会转型期间,短期内会有大量工作岗位消失。我觉得我们必须记住,每一个消失的岗位背后,都是一个正在受苦的人。当工作消失时,那种规模就是真正的悲剧。你可以从经济学角度找各种理由,说什么一切都会好起来的、这对GDP有好处、会有新工作被创造出来——但对那个个体的人来说,那就是真实的痛苦,是个人层面的悲剧。在技术发展的过程中,我们不能忘记这一点。同时,我对所有这些技术的希望是——
256:19
help alleviate some levels of basic suffering from the world you know the transformation of society
帮助减轻世界上一些基本层面的痛苦,你知道的,就是社会的转型。
256:26
where a lot of jobs are lost in the short term I think we have to really remember that each
短期内大量岗位流失时,我们必须牢记,每一次裁员都是真实的悲剧。你可以从经济学角度论证一切都会好起来、GDP会增长、还会有新岗位诞生,但对那个失去工作的个体而言,这就是真实的痛苦,是个人层面的悲剧。在技术发展的过程中,我们绝不能忘记这一点。同时,我对于人类体验中那些面对面交流的部分——比如我们彼此相见、当面交谈——抱有希望:未来几年,实体商品和线下活动的价值一定会提升,而“Slop”将面临更大压力,所以它们会持续存在。
256:31
individual job that's lost is a human being who is suffering that's like when jobs are lost
每一个失去的岗位背后,都是一个正在受苦的人。当工作消失时,这种规模化的损失是真正的悲剧。你可以从经济学角度提出各种论点,说什么一切都会好起来、这对GDP有好处、会有新工作被创造出来——但对那个个体而言,对那个活生生的人来说,这就是真实的痛苦,是个人层面的悲剧。在技术不断发展的过程中,我们绝不能忘记这一点。同时,我也希望人类体验中那些面对面的部分——那些我们都喜欢的、彼此相见、当面交谈的时刻——在未来几年里,实体商品和线下活动的价值一定会越来越高,而那些粗制滥造的内容(Slop)会面临更大的压力。所以它们会……它们会继续存在。
256:38
that scales are real tragedy you can make all kinds of arguments about economics or it's all going
那种规模的损失是真实的悲剧——你可以从经济角度提出各种论点,说什么一切都会好起来的,对GDP有好处,会有新的就业机会产生——但根本来说,人类体验中那些面对面交流的部分,那些我们都喜欢的、彼此见面、一起聊天的时刻,接下来的几年里,实体商品和线下活动的价值肯定会越来越高,而“垃圾内容”会面临更大的压力。所以它们会一直说:“我们没办法,这根本不重要,我们都应付不来。”然后就像……
256:45
to be okay it's good for the GDP there's going to be new jobs created fundamental to the individual
实体商品和线下活动的价值会上升,垃圾内容面临的压力也会更大,所以它们会继续存在。
256:52
level for that human being that's that's real suffering that's a real personal sort of tragedy
对那个人来说,那是真实的痛苦,是个人层面的悲剧。在技术发展的过程中,我们绝不能忘记这一点。同时,我对人类体验中那些面对面交流的部分——比如我们大家都喜欢的见面聊天——抱有希望。未来几年,实体商品和线下活动的价值肯定会越来越高,而“Slop”会面临更大的压力。所以情况会变成这样:我们根本应付不过来,好像什么都不重要了。而实体体验的溢价会变得更高,甚至像经典例子那样——我真心觉得这不只是金钱价值,而是对一幅真迹画作本身价值的更深层欣赏。
256:58
and we have to not forget that as the technologies are being developed and also my my hope for all the
同时我们也不能忘记,随着技术的发展,以及我对人类体验中那些面对面交流的部分——比如大家聚在一起聊天、见面——的期待,未来几年实体商品和线下活动的价值肯定会越来越高,而Slop面临的压力也会更大。所以就会变成这样:我们根本应付不过来,感觉什么都不重要了,而实体体验的溢价会更高。举个经典的例子,我真心觉得这不仅仅是金钱上的价值,而是对一幅真迹画作本身价值的更深层认可——当你走进博物馆,看着那件艺术品,亲眼见到实物,你会想,好吧……
257:05
AI Slop we're seeing is that there will be a greater and greater premium for the the fundamentals
我们现在看到的AI Slop现象是,那些人类体验中本质性的、面对面的东西——比如大家聚在一起聊天——会变得越来越珍贵。未来几年,实体商品和线下活动的价值肯定会上升,而Slop面临的压力会更大。Slop才刚刚开始,接下来几年会有更多、更高级的版本,我们会淹没在Slop里。我希望的是,社会被Slop淹到一定程度后能幡然醒悟,意识到我们根本应付不了,这些东西其实毫无意义。到那时,实体体验的价值会更高,甚至一些经典例子——说实话我觉得这——
257:14
aspects of the human experience that are like in person the things that we all like seeing each
人类体验中那些面对面的部分,比如我们大家都喜欢看到彼此当面交谈,未来几年肯定会让实体商品和线下活动的价值进一步提升,同时给那些垃圾内容(Slop)带来更大压力。所以它们会继续欺骗你,而且会出现在那些提供验证或建立信任方式的平台上,这样你才会相信。
257:20
other talking together in person the next few years are definitely going to be an increased
其他人面对面交谈,未来几年实体商品和活动的价值肯定会增加,而Slop面临更大压力,所以它会一直欺骗你,而且它将出现在提供验证或建立信任方式的平台上,这样你就会信任。
257:25
value on physical goods and events and even more pressure on Slop so it'll be so they'll keep
那个想法空间里,你在制造一个 reality distortion field,这意味着你正在偏离。
257:33
the Slop is only starting the next few years will be more and they were versions of Slop it would
Slop 才刚刚开始,未来几年只会越来越多,而且会有各种版本的 Slop,我们会被 Slop 淹没。我希望的是,我们整个社会被 Slop 淹到足够程度后,能猛然醒悟,然后觉得——不行,这根本无所谓,我们谁也应付不过来。到那时候,实体事物的价值会变得更高,甚至像那些经典例子一样——我真心觉得这不只是金钱上的价值,而是对某样东西的更深层珍视,比如一幅真迹画作和它的复印件相比,哪怕数字复制品可以做到完美,但当你走进博物馆,亲眼看到那幅画,看到那个真实的东西,你会想——这是人做的,是一种手艺,你会对它产生一种欣赏。我觉得这个道理同样适用于——
257:38
be drowning in Slop is that I'm hoping that we society drowns in Slop enough to snap out of it and
被垃圾内容淹没,我希望我们整个社会被垃圾内容淹到足够程度,然后突然醒悟过来,觉得“不行,这根本没用,我们谁也受不了了”,然后实体事物的价值就会变得更高。举个经典的例子,我觉得这不仅仅是金钱上的价值,而是对实物的欣赏程度会更高——比如一幅真正的画和它的复印件相比,哪怕数字复制品再完美,但当你走进博物馆,看着那幅真迹,想到“这是人做的”,你会产生一种对工艺的欣赏。我觉得同样的情况也会发生在像“狄卡马”这样的东西上,就像是一个分叉点,有些事情会被自动化,你懂的。
257:45
be like we can't like none like it just doesn't matter we all can't deal with it and then like the
就像那种“我们没办法,根本搞不定,完全无所谓”的感觉,然后呢
257:50
physical has such a higher premium on it even like classic examples I honestly think this is
实体物品的溢价确实更高,比如那些经典例子——老实说,我觉得这不仅仅是金钱价值,而是对真迹本身有更多的价值认同。你去博物馆看那幅画,看到真品,然后会想:嗯,这就像个分叉点,有些东西会被自动化,区别就在于比例是多少。但就我个人而言,我很难去读那些明显是AI生成的内容——抱歉,就算信息可能很好,我还是有种“算了,不适合我”的感觉。我觉得最终它们会骗过你,而平台上也会提供验证或建立信任的方式,这样你才会信任。
257:56
true and I think we get tired of it we are already kind of tired of it same with I mean even art
确实,我觉得我们也会厌倦的,其实已经有点厌倦了。同样,哪怕是艺术——
258:02
I don't think art will go away I mean you have paintings physical paintings there's more value not
我不认为艺术会消失。你看,油画、实体画作,它们有更多价值,不只是金钱上的,而是那种对真迹本身的欣赏和珍视。就算有一张完美的数字复制品,但当你走进博物馆,亲眼看到那幅画,看到真品,你会想:这是人创作的,是一种技艺,你会对它产生敬意。我觉得这一点同样适用于写作、对话,以及任何类型的体验。会有一个不幸的分叉点,就像分岔路一样——有些事情会被自动化,你懂的。
258:08
just monetary value but just more value appreciation for something that is the actual painting then
不只是金钱价值,而是对那幅画本身有更深的价值认同
258:13
photocopy of that painting it could be a perfect digital reprint of that but there is something when
那幅画的复制品,可以是完美的数字翻印,但当你走进博物馆,亲眼看到那件真迹,你会想,嗯,人类的手艺,你会产生一种欣赏。我觉得同样道理也适用于——就像分叉点,有些东西会被自动化,区别只是比例问题。但就我个人而言,我很难读那些明显看得出是AI生成的内容,抱歉,可能信息确实很好,但我就是有种“算了,不适合我”的感觉。我觉得最终它们会骗过你,而平台上也会提供验证或建立信任的方式,这样你就会信任它。
258:18
you go to a museum and you look at that art and you see that real thing and you think about okay
你去博物馆看那件艺术品,看到真迹,然后你会想
258:22
human it's like a craft you have like appreciation for that and I think the same is true for
这就像一门手艺,你得懂得欣赏它。我觉得同样道理也适用于——比如像Dichama那样,它会像一个分叉口,有些事情会被自动化,你懂的。区别只是比例问题而已。但就我个人而言,我很难去读那些明显能看出是AI生成的内容。抱歉,可能里面确实有很好的信息,但我就是有种“算了,不适合我”的感觉。我觉得最终它们会骗过你,而平台上也会出现验证或建立信任的方式,这样你就会信任这些内容。但人类总会想办法的,我认为人类天生就擅长这个。AI及相关技术的机会真的很大,我觉得当机会来临时——
258:27
writing for talking for any type of experience where it will be I do an unfortunate thing it will
为任何需要朗读的体验写作时,我会做一件不太好的事——它会像分叉一样,某些事情会被自动化,就像你知道的,更多复印机式的操作。但同时它不会消失,这里面还是有价值的。我觉得区别只是比例问题。但就我个人而言,我很难读那些明显能看出是AI生成的内容。抱歉,可能里面信息确实很好,但我就是有种“算了,不适合我”的感觉。我觉得最终它们会骗过你,而平台上会有验证或建立信任的方式,这样你就会相信某些内容不是AI生成的。既然已经走到这一步,你就会对这个渠道产生信任。
258:34
be like a dichama like it will be like a fork where more some things will be automated like you know
就像个分叉点,有些东西会被自动化,你知道的
258:40
there are not as many paintings as they used to be 200 years ago there are more more photographs
现在画作确实没两百年前那么多了,更多的是照片和复印品。但与此同时,画作也不会消失,我觉得它依然有价值。区别可能只是比例上的变化。不过就我个人而言,我很难去读那些明显能看出是AI生成的内容——抱歉,就算里面信息可能很好,我还是会觉得“算了,不适合我”。我觉得将来AI生成的内容会骗过你,而平台上也会提供验证或建立信任的方式,这样你就能相信某个内容不是AI生成的。一旦有了这种信任,你就会信赖这个渠道。但对那些还没有建立信任的新人来说,这会更难。嗯,这倒会挺有意思的。
258:45
more photocopies but at the same time it won't go away there will be you know value in that I think
更多复印品,但同时它也不会消失,你知道,这里面还是有价值的。我觉得区别只是比例问题,但就我个人而言,我很难读那些明显看得出是AI生成的内容——抱歉,可能信息确实很好,但我就是有种“算了,不适合我”的感觉。我认为最终它们会骗过你,而且会出现在那些提供验证或建立信任机制的平台,这样你就能相信某个内容不是AI生成的。既然这样,你就能信任这个频道,能明显看出哪些是AI生成的、哪些不是。但有些内容会好到难以分辨,那时你就只能靠信任了——嗯,事情就会变成这样。
258:52
the difference will just be a bit you know what's the proportion of that but personally I have a hard
区别只是程度问题,比例是多少而已。但就我个人而言,我很难接受那些明显看得出是AI生成的内容——抱歉,可能信息确实很好,但我就是有种“算了,不适合我”的感觉
258:59
time reading things where I obviously see it's obviously I generated I'm I'm sorry it might be
我觉得最终它们会骗过你,而且会出现在那些提供验证或建立信任机制的平台上,这样你就会信任它
259:05
really good information there but I have like a certain nah not for me I think eventually they'll
信息量很足,但我总觉得有点不太对劲,不是我的菜。我觉得最终它们会骗到你,但会出现在那些提供验证或建立信任方式的平台上,这样你就能通过这个过程信任这些好处。我特别兴奋的是,我们有机会
259:09
fool you and it'll be on platforms that give ways of verifying or building trust so you will trust
欺骗你,它就会出现在那些提供验证或建立信任方式的平台上,这样你就会信任。
259:16
that likes it not AI generated having been here so then you have trust in this channel
那种看起来不像AI生成的,既然已经在这里了,那你就得信任这个频道。
259:22
but it's harder for new people than don't have that trust well that that will be good interesting
但对于没有建立这种信任的新人来说,难度会更大,嗯,这将会变得有趣。
259:27
because I think when I'm mentioning I think there's a solvable problem by having you know trust in
因为我觉得,当我提到这个问题时,我认为有一个可解决的方案,就是通过信任某些审计机制来确保他们不会这么做,但这终究是建立在信任基础上的。会有一些系统来授权“这是真的,这不是真的”,也会有一些可识别的科学痕迹,让你明显看出这是AI生成的,而这不是。但有些内容会好到难以分辨,那时你就只能选择信任。嗯,这会变得很有意思,也有点麻烦。最极端的情况是给所有人类内容打上水印——比如我们用自己的设备拍的所有照片都自带某种水印,直到它们被编辑或类似操作。而软件可以管理与设备制造商之间的通信,以维护人类编辑的痕迹。
259:33
certain audits that they won't do it but it's all going to be kind of trust based there will be
某些审核他们不会去做,但这一切基本上都基于信任,会有一些系统来授权——好的,这是真实的,这不是真实的。也会有一些可识别的科学痕迹,让你明显能看出这是AI生成的,而这不是。但他们想要的是——我的意思是,有些内容会好到难以分辨,那时你就只能依赖信任了,嗯,这就会变得有趣,也有点麻烦。
259:37
some systems to authorize okay this is real this is not real there will be some tell tell science
最极端的情况是给所有人类内容打上水印,比如我们自己拍的所有照片都带有某种水印,直到它们被编辑或类似操作。而软件可以管理设备制造商之间的通信,以维持人类编辑的痕迹。
259:42
where you can obviously tell this is AI generated and this is not but they want I mean some
有些内容你一眼就能看出是AI生成的,有些则不是,但他们想要的是——我是说——有些会好到难以分辨,那你就只能选择信任。
259:47
will be so good that it's hard to tell and then you have to trust and well that that will get
而且呢,我们自己拍的所有照片,在编辑或处理之前,都会带点水印。
259:52
interesting and a bit problematic the extreme case of this is to watermark all human content
有意思但也有点问题,这种极端情况就是给所有人类内容打上水印。也就是说,我们自己拍的所有照片都得带个水印,除非被编辑过或者类似处理。然后软件可以跟设备制造商通信,来维护人类编辑的痕迹。哪怕只是相对简单的AI,只要大规模应用,就足以 destabilize 人类文明,更不用说越来越强的超级智能系统了。当然,随着我们开发这些技术,还有那种“做得更多”的方面也需要考虑一下。这确实让你对人类文明的未来抱有希望——我们一直在聊的这些事。但人类确实总能找到办法,我觉得这就是人类存在的意义。
259:57
so all photos that we take on our own have some watermark until they are edited or something like
软件还能和设备厂商沟通,保留人工编辑的环节。
260:03
this and software can manage communications with the device manufacturer to maintain a human editing
哪怕只是相对“傻瓜式”的AI,只要大规模应用,就足以动摇人类文明。
260:10
which is the opposite of the discussion to try to watermark AI images and then
这与给AI图片加水印的讨论正好相反——你明明可以生成一张带水印的谷歌图片,再用另一个谷歌工具把水印去掉。
260:16
you can make a Google image that has a watermark and use a different Google tool to remove the watermark
对对对,这就像一场军备竞赛。我们一直在关注AI的积极面,但说实话,我们讨论的所有这些能力,哪怕只是相对低级的AI规模化应用,都可能用来 destabilize 人类文明。更不用说越来越超级智能的AI系统了——当然还有那种“做得更多”的层面,我们在开发这些技术时确实需要稍微考虑一下。
260:20
yeah yeah it's going to be the arms raised yeah yeah and we've been most focusing on the positive
不过,我们聊到的这一切,也让你对人类文明的未来充满希望。
260:26
aspects of AI I mean there's also the all the capabilities that we've been talking about can be used
在AI的各个方面,我是说,我们一直在讨论的那些能力,即使只是相对“傻瓜式”地大规模应用,也可能被用来 destabilize 人类文明。而随着超级智能AI系统越来越强大,当然还有那种“接管一切”的风险,我们在开发这些技术时也需要稍微考虑一下。那么,是什么让你对人类文明的未来抱有希望呢?我们一直在聊这些事情,但人类往往总能找到出路。我觉得这就是人类的天性——建立社群,想办法解决问题,正是这一点让我们走到了今天。而且我认为,AI及相关技术的机会真的非常巨大。当机会巨大的时候——
260:31
to destabilize human civilization with even just relatively dummy I applied at scale and then
再往后,越来越超级智能的AI系统,当然会带来更多影响。
260:39
further and further super intelligent AI systems of course there's the sort of do more take
这一点在我们开发这些技术时,值得稍微思考一下。
260:45
that's important to consider a little bit as we develop these technologies well gives you hope
嗯,这倒是给了你一点希望。
260:52
about the future of human civilization everything we've been talking about
关于人类文明的未来,我们一直在讨论的那些事。但人类总能找到出路,我觉得这就是人类的天性——去应对挑战。AI及相关技术的机会真的很大,我认为当出现重大机遇时,现在很多人看到的却是世界很可怕,AI又充满不确定性。这需要大量工作,不一定是构建技术本身,而是要去跟人们沟通、让人们理解——历史上那些开发AI的人,他们的动机并不是想要搞出什么坏事。要熬过那段艰难的AI讨论期,如果我们想获得持久的收益,是的,通过这个过程,我特别兴奋的是我们有机会。
260:55
are we going to be okay I think we will I'm definitely a warrior both about AI and non-AI
我们会没事吗?我觉得会的。我绝对是个乐观派,无论是对AI还是非AI的事情。但人类总能找到办法,我觉得这就是人类的天性——建立社群,一起解决问题,这也正是我们能走到今天的原因。而且我认为AI及相关技术的机会非常巨大。当出现重大的社会和政治问题时,我们需要帮助大家理解这一点。我觉得这正是我们现在面临的局面:世界很可怕,AI又充满不确定性。这需要做很多工作,不一定是去构建东西,而是要去告诉人们、让人们理解——那些开发AI的人,从历史上看,并不是出于恶意或想要作恶的动机。
261:04
things but humans that do tend to find a way I think that's what humans are built for is to have
人类虽然会想方设法找到出路,我觉得这就是人类的天性——去应对各种事情。AI及相关技术的机会确实非常巨大,而我认为当存在巨大收益时,通过这个过程,我尤其兴奋的是我们有机会去实现它。
261:11
community and find a way to figure out problems and that's what has gotten us to this point and I think
社区的力量在于一起想办法解决问题,正是这一点让我们走到了今天。我认为AI及相关技术的机会非常巨大,而且当机会摆在眼前时——眼下我们面对的现实是,世界充满不确定性,AI本身也让人捉摸不透——这需要大量工作,而这些工作不一定是搭建技术本身,更多的是去沟通、去让人们理解:历史上那些开发AI的人,他们的动机并非出于恶意,也不希望引发那些漫长而艰难的AI伦理讨论。如果我们想获得持久的收益,就必须经历这个过程。在这个过程中,我尤其兴奋的是,我们有机会更好地理解自己——既包括个体层面的人类,也包括文明层面。
261:17
that the AI opportunity in related technologies is really big and I think that when there's big
AI及相关技术领域的机遇非常巨大,我认为当存在巨大收益时——是的,通过这一过程,我尤其感到兴奋的是我们有机会
261:25
social and political problems to help everybody understand that and I think that that's what we're
社会和政zhi问题,让大家都能理解这一点。我觉得我们现在面对的就是这种情况——世界很可怕,AI又是个非常不确定的东西。这需要做很多工作,不一定是去构建东西,而是要跟人沟通、理解人。历史上那些做AI的人,其实并没有动力或者意愿去经历那种漫长又艰难的AI讨论。如果我们想获得持久的收益,是的,得走过这个过程。我特别兴奋的是,我们有机会更好地理解自己——既在个体层面理解人类,也在文明层面理解人类,还能解答一些大谜题,比如这个“意识”到底是怎么回事。
261:31
staring at a lot of right now it's like the world is a scary place and AI is a very uncertain thing
现在盯着看的话,感觉世界挺吓人的,AI 这事儿又特别不确定。
261:37
and it takes a lot of work that is not necessarily building things it's like telling people and
这需要做很多工作,不光是搭建东西,还得跟人沟通、理解人——历史上搞 AI 的人其实不太愿意或者没动力去经历那种漫长又难熬的 AI 讨论。
261:43
understanding people that the people building AI are historically not motivated or wanting to do
如果我们想要获得长远的收益,就得走过这个过程。
261:50
but it is something that is probably doable just will take longer than people want we have to go
但这件事情其实是可行的,只是需要的时间比人们预期的要长。如果我们想要获得持久的收益,就必须经历那段漫长且艰难的AI讨论阶段。是的,通过这个过程,我特别兴奋的是,我们有机会更好地理解自己——无论是在个体层面的人类,还是在文明层面——并解答一些重大谜团,比如“意识”到底是怎么回事。它似乎真的很特别,我们的思维中存在着某种真正的奇迹,而AI则让我们得以审视自身,并回答一些关于“这一切到底是怎么回事”的大问题。嗯,关于这一点,还有一件事:我认为这正是我们与AI非常不同的地方,也是为什么我……
261:56
through that long period of like hard to straw AI discussions if we want to have the lasting
我很兴奋能有这个机会。
262:03
benefits yeah through that process I'm especially excited that we get a chance
好处是,通过这个过程,我特别兴奋的是我们有机会
262:09
to better understand ourselves also at the individual levels humans and at the civilization level
为了更好地理解我们自己,无论是在个体层面的人类,还是在文明层面。
262:17
and answer some of the big mysteries like what is this whole like consciousness thing going
并回答一些重大谜题,比如意识这整个东西到底是怎么回事。
262:22
on here seems to be truly special like there's a real miracle in our mind and AI puts a merit
这里似乎真的有些特别,就像我们脑海中存在一个真实的奇迹,而AI让我们得以审视自身,并回答一些重大问题,比如这一切究竟是怎么回事。关于这一点,我认为这正是我们与AI截然不同的地方,也是我之所以……它正在为你代劳。所以在后奇点时代、人类与机器之间的末日战争之后,你是说人类值得为之战斗?百分之百。我是说,这就像电影里演的那样——当然,如果某些东西被明确编程去执行有害行为,那就另当别论了。实际上,我认为在《终结者》那种设定下,人类会赢。嗯哼。我觉得我们太聪明了,很难解释我们是如何想出办法的,但我们确实能,而且很可能我们会利用本地资源。
262:29
ourselves and gets to answer some of the big questions about like what is this whole thing going
我们自身也能回答一些重大问题,比如这一切到底是怎么回事。
262:34
on here well one thing about that is also what I do think makes us very different from AI and why I
关于这一点,我认为有一件事确实让我们与AI非常不同,也是为什么我……
262:40
don't worry about AI taking over is like you said consciousness we humans we decide what we want to
别担心AI会接管一切,就像你说的意识问题,我们人类自己决定想做什么。
262:47
do AI in its current implementation I can't see it changing you have to tell it what to do and so
AI在目前的实现方式下,我看不出它会改变这一点——你得告诉它做什么,所以主动权还在你手里。
262:54
you have still the agency it doesn't take the agency from you because you have to you just it
它不会夺走你的主动权,因为你必须主动指挥它,它只是变成了一个工具。你可以把它看作工具:你告诉它做什么,它比以前的工具更自动化,当然也比锤子强大得多,它能自己琢磨出东西,但最终掌控权还是在你手里,对吧?
262:59
becomes a tool you can think of it as a tool do you tell it what to do it will be more automatic
所以AI不是掌控者,你才是掌控者。你告诉AI做什么,它就替你完成。
263:05
than other previous tools it's certainly more powerful than a hammer it can figure things out but
那么在奇点之后、人类与机器之间的末日战争里,你是说人类值得为之战斗?
263:10
it's still you in in in in charge right so the AI is not in charge you in charge you tell the AI
百分之百,我是说,这纯粹是电影里的情节。
263:15
what to do and it's doing it for you so in the post singularity post apocalyptic war between humans
它替你完成了任务,所以在后奇点时代、人类与机器之间的末日战争里,
263:22
and machines you're saying humans are worth fighting for 100 percent I mean this is for the movie
你是说人类值得为之战斗?百分之百。我的意思是,这是电影里的情节。
263:30
Terminator they may have the 80s essentially and I do think well the only thing I can see going
终结者那种设定,可能还是80年代的思维。我其实觉得,唯一可能出问题的地方,就是如果某些东西被明确编程去做有害的事。我认为在终结者那种场景下,人类会赢,嗯哼。我觉得我们太聪明了,很难解释我们是怎么想出办法的,但我们就是能,而且我们很可能会用本地化的、开源的东西来对抗机器。我为刚才的胡言乱语道歉。就像我说的,Nathan很清楚,我一直是他的忠实粉丝,也是你的忠实粉丝,Smash,很久了。所以终于见到你真的很荣幸。感谢你为这个世界贡献的一切,感谢你写的那些精彩的书,感谢你教会我们这么多。
263:37
wrong is of course if things I explicitly programmed to do the thing that is harmful basically I
当然,错误的情况是,如果它被明确编程去做有害的事情。
263:43
think actually in that in a Terminator type of setup I think human win mm-hmm I think we're too
实际上,我觉得在《终结者》那种设定里,人类会赢。嗯哼。
263:49
clever it's hard to explain how we figure it out but we do and we'll probably be using local
我认为我们太聪明了,很难解释我们是怎么想出办法的,但我们确实能,而且我们很可能会利用本地资源。
263:59
elements open-source elements to help fight the machines I apologize for the ridiculousness
我们开源了一些元素,用来帮助对抗那些机器——抱歉这听起来有点荒谬。
264:06
like I said Nathan really knows I've been a big fan of his for a long time been a big fan of yours
就像我说的,Nathan 真的知道,我一直是他的忠实粉丝,很久了,也是你的忠实粉丝。
264:13
smash for a long time so it's an honor to finally meet you thank you for everything you put out
Smash 也是,很久了,所以很荣幸终于见到你。感谢你为这个世界贡献的一切。
264:17
into the world thank you for the excellent books you're writing thank you for teaching us
感谢你正在写的那些精彩的书,感谢你教会我们。
264:22
and thank you for talking today this was fun thank you for inviting us here and having this human
今天聊得很开心,谢谢你邀请我们过来,能有这种human connection真的非常宝贵。感谢大家收听这期与Sebastian Rashka和Nathan Lambert的对话。如果想支持本播客,请查看简介中的赞助商信息,那里也有联系我、提问、反馈的链接。最后,用爱因斯坦的一句话送给大家:并非我有多聪明,而是我面对问题坚持得更久。感谢收听,期待下次再见。
264:28
connection extremely valuable human connection thanks for listening to this conversation with Sebastian
连接——极其宝贵的人际连接。感谢你收听这期与 Sebastian Raschka 和 Nathan Lambert 的对话。
264:35
Rashka and Nathan Lambert to support this podcast please check out our sponsors in the description
为了支持这个播客,请查看描述中的赞助商信息,那里也有联系我、提问、反馈的链接。
264:41
where you can also find links to contact me ask questions give feedback and so on and now let me
现在,让我用阿尔伯特·爱因斯坦的一句话来结束:并不是我有多聪明,而是我坚持与问题共存。
264:48
leave you some words from Albert Einstein it is not that I'm so smart but I stay with the questions
送你一句阿尔伯特·爱因斯坦的话:并不是我有多聪明,而是我始终与问题待在一起。
264:57
much longer thank you for listening and hope to see you next time
非常感谢你的收听,期待下次再见。

Play Queue

☀️