中文整理分析 中文访谈原文

对话田渊栋:模型递归自进化(RSI)的复兴、S型平台期与AI创业者的破局路径

01:29:02 · 原视频

田渊栋:这个时候我觉得

也许五年之后我就被取代了

那么这个时间可能已经快到了

那么在这种情况下

与其自己被取代

不如我就开公司

就RSI非常需要

Coding和Agentic的能力

然后这两个能力

本身其实对这些前沿的

模型公司来说

它已经是它的主项

我觉得RSI比Coding Agent

也要大得多

然后它的难度

然后它的可能的路径

比现在Coding Agent要大很多

曼琪:所以你觉得就光有这个支点

其实不见得你就能做好RSI

你觉得有生之年会看到

图灵奖颁给一个系统吗

田渊栋:我觉得如果到那个时候

可能图灵奖也不是很重要

我可能少数派吧

就是因为大部分人

可能已经觉得绝望了

但是我觉得不是这样子

我觉得一定是

有一个好的principle

能够让这个模型运转起来

就是我觉得它以后终将变成科学

曼琪:欢迎收听《晚点聊》,我是曼琪。

在171期节目《二季度AI季报》中

我们重点聊了RSI——

递归自进化。

那之后不久的6月底

我采访了从去年开始

就在这个方向探索的创业者之一

田渊栋。

他参与创立的

Recursive Super Intelligence的缩写

也是RSI,

这家公司的估值

目前已超过46亿美元。

这期节目录制时

还没有发生一些后续的事件,

比如OpenAI一举

解决了10个数学难题;

TML的联创之一

翁荔重新回到OpenAI,

据报道她将探索的方向就是RSI。

关于RSI,

有一个极有诱惑力

也十分危险的假设,

就是率先达到这个状态的公司

会把其他人越甩越远。

这个推演成立吗?

我们也是节目——本期节目吧。

田渊栋:这个时候我觉得

也许五年之后我就被取代了

那么这个时间可能已经快到了

那么在这种情况下

与其自己被取代

不如我就开公司

就RSI非常需要Coding

和Agentic的能力

然后这两个能力本身

其实对这些前沿的

模型公司来说

它已经是它的主项

我觉得RSI比Coding Agent

也要大得多

然后它的难度

然后它的可能路径

比现在Coding Agent

要大很多

曼琪:所以你觉得

就光有这个支点

其实不见得

你就能做好RSI

你觉得有生之年

会看到图灵奖颁

给一个系统吗

田渊栋:我觉得如果到那个时候

可能图灵奖也不是很可能

我可能少数派吧

就是因为大部分人可能

已经觉得绝望了

但是我觉得不是这样子

我觉得一定是

有一个好的principle

能够让这个模型运转起来

就是我觉得它以后

终将变成科学

曼琪:欢迎收看《晚点聊》,我是曼琪。

今天的嘉宾是

Recursive Super Intelligence

的联创,

这家公司在经过四个月的

隐身研发之后,

刚刚于六月初官宣

A轮融资6.5亿美元,

估值来到46.5亿美元。

他们做的事

和公司的名字缩写一样:

RSI,

Recursive Self-Improvement,

递归自进化。

这是一个去年还相对小众,

而到今年二季度

被硅谷频繁讨论的热门前瞻方向。

Anthropic刚在六月初发布了文章

《When AI Built Itself》,

副标题就是《我们在

RSI方向上的进展和探索》。

OpenAI也再次明确了时间表,

说在今年九月要做出

AI研究实习生,

在2028年三月之前

要实现真正自动化的AI研究员。

我们和田渊栋一起聊了

RSI是什么,

为什么这个领域在现在变得火热,

以及他们在六月中旬

刚刚释放的第一阶段的具体成果,

还有那个关于RSI的有诱惑力

也十分危险的假设:

率先达到这一状态的公司

会把其他人甩得越来越远。

这个逻辑成立吗?

我们正式进入本期节目吧。

终于见到了田老师了。

田渊栋:之前我们都在线上聊的。

曼琪:对。

然后上次采访是去年五月,

当时我们聊的是

你的科幻小说《破晓之中》。

田渊栋:对。

曼琪:然后这一次再聊,

我觉得是科幻已经照进现实,

因为这期间有一个比较大的变化,

就是您和很多其他的顶尖研究员

一起创立了

Recursive Super Intelligence这家公司,

然后你们在做的一些事也跟你当时的科幻设想,

我觉得有一些契合的地方。

你可以先和我们的观众简单地用几句话

介绍一下,

就是这家新的公司是做什么的?

田渊栋:对,

这家公司叫Recursive Super Intelligence,

它的目的就是说

能不能找到用AI来自我进化、

自我迭代的方法,

然后找到新的模式、

新的范式、

新的模型、

新的训练的逻辑,

然后得到更好的AI,

是这样的一个逻辑。

曼琪:对,因为你们的名字

Recursive就是“递归”的这个意思,

然后它的缩写Super Intelligence

就是RSI,

那和现在硅谷讨论特别多的一个概念——

它也叫RSI是一样的,

那个是Recursive Self-Improvement,

就是递归自进化。

田渊栋:对,

其实我们这

Recursive Super Intelligence

意思也就是Recursive Self-Improvement,

对,所以意思上来说是非常接近的。

曼琪:因为这个概念应该说从今年的4月、5月份开始慢慢变得比较火?

田渊栋:就是我们在成立这家公司的时候,应该说大部分人还没有想过这个概念。

但是随着大家的这种意识和思考,

就慢慢慢慢成为一个——应该说慢慢成为共识吧。

对,大家发现这个模型已经比较厉害了,

那个模型能够发现一些模型自己的一些问题。

那通过这种方式呢,

其实可以存在这种可能性,

就是用AI找到对AI自己的模型的问题,

然后让AI带领的模型变得越来越强。

曼琪:我觉得正好也可以讲讲这个背景啊,

RSI也是我想和您深入讨论的一个话题。

也就像你说的,最近这一段时间,

我觉得它在这儿越来越成为一个相对共识性的趋势了。

然后另一方面就是RSI其实这个想法本身并不是那么新,

它之前也一直都有。

田渊栋:对对对。

曼琪:就为什么最近这段时间发生了什么变化,

或者有什么因素导致大家在讨论?

田渊栋:我觉得主要一个还是因为Coding Agent变强了,

另外一个呢就是说模型本身的能力也在提升。

模型能力提升到一定程度之后,

就是模型对AI自己的这个模型的认知,

它有一些比较强的突破了之后呢,

你就可以用模型来充当研究员。

模型充当研究员,

让他来找到现在模型的弱点,

然后去做更好的优化。

那么这样的话呢,

这个闭环就会产生。

产生这个闭环之后呢,

那么下一次这个模型变得更强,

所以递归就是这个循环往前推进的意思。

对对对对对,

但是这个要求条件是这个模型本身已经足够强了,

如果模型不够足够强的话呢,

那这个很难。

曼琪:其实去年5月我们聊的时候,

我们当时就顺着这个科幻小说延展讨论了一个话题:

AI会不会取代顶尖的AI研究员。

田渊栋:对。

曼琪:当时你觉得这个短期内是比较难的,

因为AI研究员它可以从少量的数据里面就获得一些精准而细节的联系,

田渊栋:对对。

曼琪:但是大模型——

至少当时的大模型——

它还是要学很多大量复杂的数据,

然后通过统计得到一种表达。

那到后来年底的时候,

因为11月我们当时也就是在聊了一下嘛,

那会就已经在筹备这个新的公司了。

所以这个过程中间是,

你本身自己的思路是有一些什么变化吗?

田渊栋:首先第一点我还是——现在还是认为,

就是大模型还是替代不了顶尖研究员,

目前还是不行。

只是说是模型的能力已经到一定程度之后呢,

你就觉得它确实可以用,

就是我们确实可以用模型

来做一些研究的工作,

我觉得这个是重要的。

而且存在一种可能性,

就是模型会变得越来越强,

然后最终产生更好的、

更强的能力,

这个是可能的。

其中一个契机就是说,

在五月份之后,

大概在八月份的时候呢,

我用当时GPT-5嘛,

对吧?

我和GPT-5合作做了一篇文章,

就是最近的一篇关于Grokking的文章。

那篇文章呢,

就是说我会意识到——我在做完之后,

我其实意识到这一点,就是模型的能力呢,

已经基本上强到让我觉得我可以不用招实习生的水平。

对,因为有很多的想法和思路,

完全可以通过我跟模型对话来实现。

那么通过这个方式呢,

就是我可以给模型一些具体的细节、

一些比较细的方向,

去找到新的想法、新的思路,

证明新的定理。

那么然后我这边可以写代码呀,

可以做一些实验,

然后把东西做出来。

那么现在写代码都不用人了对吧,

写代码都可以让AI来做,

所以应该说这个loop就开始有转起来的趋势。

这个时候我觉得,就是说也许五年之后我就被取代了,

那么这个时间可能已经快到了。

那么在这种情况下与其自己被取代,

不如我就开公司,

我去做这事情去。

曼琪:所以去年八月你看到这个迹象之后,

首先我想知道就当时这种想法有多少人有?

因为你说到今年四五月越来越多人讨论,

对,

那在去年可能差不多大半年前是什么样的一个情况?

以及后来你怎么找到一些跟你想法比较相似的人,

一起来做这个公司?

田渊栋:我觉得是这样,

就是这个事情呢,

你不亲手实践、亲身去体验呢,

你是感觉不到的,

对吧?

就是如果你不一定把这个模型当成一个实习生,

或者把模型就当成一个聊天对象的话,

你是感觉不到这个变化的。

所以要等到你把模型真的当成一个——

就是聊天当成一个对象,

然后可以跟他去合作,

可以跟他去做一篇文章的时候呢,

把文章说到做完了,

你会觉得这个模型确实能力已经比我想象的要高很多。

曼琪:就你的意思是可能回到那个时间,

对,

这么做的人不见得很多?

田渊栋:就现在我们也见到这样的一个情况嘛,

就是说有一些人,

就比如说特别是那些比较senior的人,

他们一般来说不会去思考太细节的东西,

对吧?

就是他们可能会考虑一些比较high level的、

比较高层次的一些想法和建议,

对吧?

不会真的把模型拿过来

做一个非常具体的项目。

但另外一方面呢,就是一些比较刚从学校毕业的一些学生,

可能把模型作为一些执行上的工具,

不会去做一些比较难的问题。

所以这样两边其实是有个gap在里面的。

曼琪:这个也cue到了我们上次聊的一个话题。

对,

因为当时我们聊到了你有这两年有在写年终总结嘛,

有一年我记得应该是二三年的时候年终总结,

好像说的一些你觉得怎么带团队的一些经验;

那到了后面一年其实你就变了,

你说的就是你想更地hands-on。

田渊栋:因为其实大模型有一段时间之内,

你会发现你不hands-on的话,

你就没有办法去真的知道这个模型内部发生了什么,

然后整个系统发生了什么。

你不知道这些东西的时候呢,

你指挥的方向就会出现偏差,

那么这个偏差的方向呢,

其实很难获得反馈。

因为在传统的这个研究过程中嘛,

一般来说是一个比较senior的导师,

可能跟学生们说我们要做一个方向,

然后呢,

这个导师本身呢,

可能不会真的去碰代码,

不会真的碰数据,

但是呢,

让学生们真的去做这事情,

让学生把这事情做完之后呢,

然后反馈给导师,

说这个事情是对的还是不对的。

很多时候呢,

学生跟老师说

这个事情没做好,

这个事情呢

不work。

为什么不work呢?

是因为有1、2、3、4、5这种困难。

导师会说:

我这idea一定是对的,

然后去让学生继续去挖掘。

所以有两种可能:

一种可能就是说,

学生发现了导师说的是对的,

然后呢

把事情做成了;

还有种可能是,

是导师的想法其实并不对,

但是学生呢

证明这件事情是不对的,

然后呢

找到下一个方向继续做。

一般来说这个逻辑本身是,

应该说至少要有几个月的时间,

这个也是一般的一个科研项目的一个周期。

曼琪:这也是一个loop。

田渊栋:这是一个loop,

但这个loop的问题是

导师不直接跟具体的实验打交道。

那么这样的话呢,

导师从跟学生讨论,

然后给学生一些指导,

然后学生把指导做出来,

然后得到反馈之后

跟导师汇报,

这个过程呢,

一般来说你至少需要几天的时间。

有一个数字

就意味着就是

大概是以天为周期

进行这个问题的科研探索。

就是说你可能需要几周

甚至几个月

才能把事情做成。

但是现在有AI之后呢,

应该说——

特别是有非常强AI之后,

这个时间被压缩到几分钟

甚至更短的时间。

曼琪:你就说验证一次的算法?

田渊栋:对对对,

验证一次,

比如说几小时到几分钟的时间。

就是特别是对一些

比较简单的项目来说,

就是很多时候

你有个想法之后,

你只要告诉AI,

AI很快地把代码写出来,

然后跑完之后

告诉你这个结果。

很多时候就是,

也许你写完之后

出去喝个口水、

喝茶,

然后跟别人聊两句,

或者开个会,

开完会之后,

你解决问题有了,

结果有了之后,

那你就

可以看到自己的问题在哪里,

然后可以有下一步的循环。

曼琪:就是你在描述

你最开始

看到RSI的这个方向和前进的时候,

对,

就让我想到——

就是稍微岔开一点的一个问题,

就是什么样的人

他能最早地去看到这个信号?

所以你描述的是,

又有比较多的经验,

他对什么问题是难的、

是重要的有判断,

同时在那个时间点,

他又是非常

一手地在做一些事。

田渊栋:是的。

曼琪:这样的人是容易敏感地感觉到

就是当前风向的变化。

所以这个人有可能

也不是特别年轻,是吗?

他和现在就是AI叙事里面——

因为现在会有一种观点,

会觉得说

你特别年轻,

你来什么东西

你都可以很快地学习了,

然后以前的一些经验

可能是负经验,

是没有那么有用的。

田渊栋:还不太一样,

对,可能不太一样。

因为我觉得以前是因为

就是说在Coding Agent

还没有普及之前,

或者还没有达到

这个人类能力之前,

就是年轻人很有

市场的一个原因,

主要还是因为

年轻人

他的冲劲比较足,

然后这个决策、

这个执行能力很快。

很多时候

其实不要想太多,

就是说OK,

我上来就干。

曼琪:干就完了。

田渊栋:干就完了,

对吧。

基本上我应该觉得

过去的三年里面

都是这样子。

对,就是从大语言模型

出来之后,

基本上年轻人

很多时候是有这样的优势,

因为并不需要想太多,

我们就scale up,

scale, scale, scale,

然后就完了,

这是非常简单的事情。

所以通过这个方式,

其实应该说

大语言模型得以快速发展。

曼琪:所以你觉得RSI

这个风潮来了之后,

反而是可以让

以往的一些经验积累,

包括你沉淀的各种直觉判断

或者说技术品味,

有更好的发挥?

田渊栋:对,我觉得是的。

那天平又会摆到

就是怎么说

更有经验、

更年长的一群研究员。

对,有可能是这样子,

有可能是这样。

当然就是说,

这个也是有很多的争议的,

这个只是我的观点。

因为确实

现在 Coding Agent 来了之后,

有很多的

以前从来不写代码的,

或者说已经当了

比如说 10 年的经理

或者总监的人,

突然开始写代码了,

他们就觉得

这个“爷的青春又回来了”。

对。

所以就是有很多的人

会有这种感觉。

因为可能以前有想法,

但是没有时间去实现,

然后团队也没有时间和精力

去完成

就是上面的人的

每个想法和思路。

这样的话,

其实这些人的经验

其实很难被发挥出来。

但是现在有 AI Agent 之后,

应该说这个变化发生——

就是对比发生变化。

以前可能需要人去执行,

那么现在执行的

那个重任

现在落在了 AI 身上。

然后人更多的是判断,

然后逻辑上的一个指导,

还有这个大方向的把握,

还有研究的这个品味,

这些东西是重要的。

曼琪:那回到 RSI 这个主题。

其实像 10 年前

Google 做的一个工作

AutoML,

它也有一个类似的想法,

就是它也是在用 AI

去优化 AI。

你觉得现在的 RSI

和小十年前的像

AutoML 这种类似的尝试,

它的区别是什么?

田渊栋:我觉得区别其实很大了。

因为我们上一波

也是做过了,

我有很多文章

也是做那个

就是 Architecture Search,

架构搜索;

还有文章呢,

比如说做那个

AI Guided Optimization、

AI Guided Design,

AI 辅助设计

这些方向。

所以我觉得就是

上一波的问题,

就主要在于就是

我们没有一个模型

能够建模人类的

高层的知识、

高层的这个思路,

这个是没有的。

就是上一代的时候,

很多时候是让研究员

来定义这个

搜索空间的大小、

搜索空间的那个行为,

然后呢,

让 AI 写成、

做成一个算法,

去找到更好的那个解。

那么当然现在呢,

就是因为这一波

大模型来了之后呢,

然后它能达到这个程度,

就是让这个模型本身

对这个 AI、

对这个 AI 本身,

或者对这个架构本身

是有理解的。

那么这个理解呢,

可以部分代替人类的一些

那个定义问题的工作。

那么这样的话呢,

其实让这解空间

变得非常大,

而且应该说比较智能,

不像以前

就是你需要人

去定义这个解空间。

曼琪:那它的一个区别,

是在于人参与的

多少的变化吗?

田渊栋:是的。

就是说以前可能说,

就是人需要深度参与

解空间的每个细节,

然后 AI 比较笨,

只有在这空间里面去搜索。

但是现在呢,

更大的问题是怎么样

最大限度去发挥

这个 AI 的能力,

能让它自己找到

这个解空间的那个结构,

自己找到这个解空间的

一个比较好的一个方法

去解它。

这个是可能更重要的一个事情。

曼琪:您说到这个也涉及到

就对 RSI 的理解和定义。

田渊栋:对。

曼琪:因为很多时候

大家提起 RSI,

比如说 OpenAI

也会说他们自己要做 AI intern,

然后说到 28 年 3 月

要实现真正的

自动化的 AI 研究员。

田渊栋:对。

曼琪:它都是和自动化联系在一起的,

它好像都是指向说

把人从这个 loop 里给解放出来。

但是另一方面,

就是递归自进化,

就它递归的这一部分,

我理解它又是有一个

循环上升的这个意思。

所以就是你觉得

这两个东西,

就是递归和

人不在这个 loop 里面,

它是一件事、

是一起发生的,

还是它会有一点区别?

田渊栋:我觉得完全自动化呢,

不一定很快会发生。

就是说我觉得自动化的程度呢,

很多时候是因为看

就是人在上面

会做什么样的工作,

而且就做工作它的层级是什么、

什么程度,

这个是最重要的。

对。

因为就比如说吧,

你现在有 AI 了之后,

有这个大语言模型之后呢,

有些程度的工作

其实不需要人去做;

但是呢,

更高一级的工作

还是需要人去做,

而且再更——

对更高一级的工作

要求更高了。

所以这个时候呢,

其实某种程度来说,

人是减少了他的时间;

但是呢,

人可能需要更多脑力

去做一些

就是更高层次的工作。

所以人还在这个 loop 里面,

这个 loop 的 level

变高一点。

曼琪:所以你觉得递归

是有可能会先发生?

田渊栋:我觉得递归会先发生。

就是完全自动,

我觉得现在还看不到,

就是跟我以前的“AI 代替不了顶尖人类研究员”的

观点是一致的。

曼琪:那你觉得递归和自动化

这两件事,

哪个更重要?

田渊栋:我觉得这个事情

不存在重要不重要的问题。

就是说一定是

按照就是模型能力

会慢慢慢慢地发展,

对吧。

你肯定会发现

完全自动是不行的,

还是需要人的一些指导,

那么这个时候

自然就有递归的一个结构。

曼琪:对,因为讨论到这个问题

也是就是在最近

确实和很多人在聊这个概念。

然后有一种观点

就是觉得递归这个事

更重要是因为,

你一旦这个循环

跑到一定程度之后,

掌握这些循环的组织

或者人或者团队,

它就有可能进入一个加速度、

加速越来越快的阶段,

然后它就会可能

把别人就甩得越来越远,

对吧?

比如 Anthropic 和 OpenAI

也许就有这种可能性。

田渊栋:对,是有这种可能性。

对,因为就是模型

可能会让自己变得越来越强,

变得越来越强之后呢,

这个模型能理解更深的东西,

然后接下来

就会有更强的那个 AI agent、

AI 那个 scientist,

那么有了这之后呢,

它会发现自己更大的问题,

然后就可以迭代上去。

但这个讲的更多是

就是这个范式的一个转变,

对吧,

跟人在不在这个 loop 里面

其实关系不大。

曼琪:所以你也是觉得

这个循环的加速本身是——

田渊栋:这个是可能的,

这是可能的。

对。

但是呢,

它在什么程度上可能,

然后我们需要做到什么程度

让 AI 变得很强才可能,

这个事情呢,

还是需要做探索。

曼琪:最近就是这个方向很热闹。

除了刚才我说到

OpenAI 他们有一个时间表,

关于他们怎么去产生

真正自动的 AI 研究员,

但是他那个说得比较笼统。

然后 Anthropic 是在今年六月,

他们发了一个长文,

叫 *When AI builds itself*,

就是《当AI来建造自己》,

以及这篇文章副标题

就是我们在 RSI 方向上的

进展和实践。

不知道你看了这篇文章没有?

田渊栋:我大概看了一下。

其实就是应该说

还是刚才我们聊了

那个差不多的一个想法,

就是 AI 能够让 AI

自我进化、

自我迭代,

然后越做越好。

曼琪:它里面讲了一些

它们内部具体的一些进展,

比如说他说四月的时候,

Claude 的 AI agent

端到端地独立完成了

一个开放式的

AI 安全研究。

田渊栋:对。

曼琪:说它累计工作了 800 个小时,

田渊栋:对。

曼琪:然后把一个 Weak-to-Strong 的

性能差距缩小了 97%,

如果是人来干的话,

是一周可以缩小 23%。

这好像更多是一个提效,

这到了我们刚才说的

递归自进化的程度吗?

田渊栋:应该还没有吧。

就是说我其实

主要看了一下这个博客,

就是说基本上还是

提效。

就是说你看它的具体的解法,

就是说找到一些

各种各样的方案,

让这个 Weak-to-Strong 的

Generalization 能够做得更好。

对。

然后它有指标,

通过这种方式

把这指标提上去,

对吧。

那么里面的这种方法

应该说,

比如说把里面

representation 拿出来,

然后做一些分析,

然后想办法

把这个模型做得更强,

大概是这样的一个逻辑。

但这些算法本身,

应该说还是比较常规的。

它就让它把它

很多常规的想法

和思路放在一起,

然后放在一起之后,

然后最后它分数

能够往上提。

因为有分数之后,

你才能做自我进化,

因为现在除了分数之外,

你没有其他办法

能够衡量这个模型

现在能力有多强,

比如说这个

self-improving models

最后它的效果好不好,

所以一定还是要靠那个分数。

所以分数一般是会具体体现——

会提效,

或者说提高速度,

或者减少 latency,

这样的一个指标。

所以这个应该说是,

就是说自进化的一个第一层。

曼琪:所以你觉得在第一阶段,

它确实就是这样展现的:

拆成子任务,

然后看子任务上

AI 自己

是不是越来越好?

田渊栋:是,

这个是一般——

这一般会这样子。

曼琪:你觉得 Anthropic 和 OpenAI

它们理解的递归自进化,

和你们有什么相同和区别?

田渊栋:应该说大的方向上

都是差不多的,

我不觉得有什么特别大的一个区别。

就是可能有一些不一样的地方是,

你像 Anthropic 那个文章,

对吧,

就是它这么写的话,

基本上感觉上是

就是说特别是在代码上

有自进化这个能力。

但是我觉得

更难的地方是研究上的问题,

就是 AI research 这个方向,

应该说跟代码之间还是有差距的。

Anthropic 之前的一些工作,

其实它们都是展示出来,

就是说如果对一个已有的项目,

我们能不能让它自进化自动做好,

比如说从头开始写一个 Linux,

或者从头开始写一个 C 语言编译器,

那么这个东西都是说,

应该说是有路径的,

对吧。

那么我们都知道怎么写,

只是说这工作太繁杂、

太繁重、

太累了,

然后很难去让人

或者让个团队去把它写出来,

但是这个问题本身是有章可循的。

但是就是说很多就比较难的

AI research problem,

其实应该说人都不知道怎么做,

有很多的这个很难的一些、

一些比较要有突破性的进展

或者突破性的发现的东西,

那么这个东西呢,

其实应该说是,

应该说现在 AI 还是很难做。

曼琪:除了两家最受关注的 Frontier Lab,

就是 OpenAI 和 Anthropic 之外,

这个领域

现在也有些新的公司的尝试。

就你们之外的,

有一个是 6 月 25 日才刚刚官宣的,

叫 Periodic Labs,

然后他们是种子轮融了两亿美元。

田渊栋:对对对。

曼琪:这些团队应该是来自 DeepMind 和 Anthropic。

另外就是之前更早成立的 Sakana AI,

他们也是在 6 月刚刚成立了一个

RSI 的新的 team,

田渊栋:对对对对。

曼琪:在东京。

这些更多的尝试,

一个是你觉得

可能反映了行业的什么变化,

一个是你从他们的一些表达里面

看到了什么有意思的东西?

田渊栋:我觉得他们基本上还是高层次来说,

还是一样的就是做这个递归自我进化,

就方向上总的

应该说是比较接近的。

应该说就是像那个 Periodic 那边,

就是像 Anthropic 的那个创始人们,

应该说之前也跟我聊过。

曼琪:对。

你说是更早之前在筹备创业的时候?

田渊栋:对对对,

也没有说找我,

只是说是当时问我要不要来,

或者说就是要不要去——

曼琪:那不就是找你吗?

那不就是找你吗?

田渊栋:看看。

曼琪:对,当时他还在 Anthropic 的时候,

就是那会你从 Meta

就是要可能要出来的时候。

田渊栋:对对对。

曼琪:Anthropic 也有一个邀约相当于?

田渊栋:对对对,

就聊聊吧,

当时也聊过一次,

也聊过一次。

对,后来就很有意思的是,

后来他就走了。

对,所以我之前也跟大家说,

我说跟我聊过的那些人

都跑路了,

离开 Anthropic 就是他。

曼琪:所以相当于你们看到了

相同的方向之后,

你们都觉得出来做,

就重新有一个 Lab 来做,

这个事可能是更好的?

田渊栋:对,我觉得是有可能会

这样的情况。

因为一个是就是说,

现在 OpenAI、Anthropic

其实已经算大公司了,

有很多人在里面,

对吧。

所以,

肯定没有 OpenAI 那么大,

两三千人吧差不多。

但是还是应该说,

但另外一方面就是说,

像这样一家公司,

应该说现在都要冲这个 IPO,

对吧。

那对他们来说,

最重要的是

要把手上的业务做好。

手上的业务是什么?

Coding Agent,

对吧。

如果 Coding Agent

赚很多钱,

能够让这个事情

做得比较好的话,

那他们可能会

优先把这个事情先做好,

对吧。

那么所以

有可能

他看到了这一点,

所以觉得还是

自己出来比较好。

因为

RSI 这个方向

毕竟来说是比较远的,

没有那么近。

曼琪:你说还有其他公司的人

找你也出来了,

他们出来之后

新做的公司

现在是已经浮出水面了,

还是有些

仍然在水下?

田渊栋:没有,

我当时说的是,

就是说有些人

是作为大厂的一个高管

来找我,

问一下

我要不要跳槽、

跳那边去。

所以很多时候

他们都走了,

就很多人

就是像苹果也

又走了,

对吧;

Amazon 的人也走了,

有些人也出来创业了。

像 Amazon 那边的

那个

有一个

那个 San Francisco Lab 的头

David 他也出来了。

对。

但是现在他们出来

准备做什么,

我现在不知道。

曼琪:那你当时也和大公司

其实也聊了你想

就是继续做的

RSI 的这个方向?

田渊栋:大公司的时候,

基本上你跟大公司聊的时候,

你很难去决定

你能做什么方向。

很多时候,

对,跟大公司聊,

大公司会说

我们能够想做这个。

曼琪:对。

田渊栋:他们当时会有

自己的一个想法,

他们希望

我加入之后呢,

能够给他们提供助力。

曼琪:所以去年秋天的时候,

就是你和这些公司交流,

确实在当时没有很多人会提到说想做这个?

田渊栋:对,

当时 RSI 还不是一个大众的认可,

当时 RSI 还是一个小众方向。

曼琪:我觉得现在至少在一些宣称和表态上,

我觉得它看起来是变成一些公司的重点了。

就是 OpenAI 和 Anthropic

都是有这个现象的,

而且我就是跟一些这些 Lab 的人聊嘛,

我觉得他们自己确实,

就里面的人啊,

他们也很关注这个方向。

所以你觉得像 OpenAI 和 Anthropic,

他们对这个事有多重视,

有多认真啊?

田渊栋:这个我不好说吧,

对吧,

至少现在大家在说这事。

只是就是怎么样能够让这个事

最终能成呢,

其实应该说是更难的问题,

对吧。

现在可能大家讲的还是一个概念,

一个是就是怎么样把这事情做成,

怎么样那个觉得这件事情有多重要,

然后它是不是将来的方向。

至于怎么把事情做成,

或者说什么是具体的一个 metric,

现在大家讲的不多。

曼琪:你觉得这有可能会成为他们

即 Coding Agent 之后的下一个主线吗?

田渊栋:这个我不知道,

这个要看问要问他们。

曼琪:因为有这样一种推论的逻辑,

就是他们会认为说,

这个东西就 RSI,

非常需要 Coding 和 Agentic 的能力,

然后这两个能力

本身其实对这些前沿的

模型公司来说,

它已经是它的主线,

所以 RSI 可能就是在这个主线

往下延伸的下一个方向上。

就从这个逻辑来推论了,

它有可能是它的主线,

不知道你怎么看这种想法?

田渊栋:我觉得 RSI 比 Coding Agent

也要大得多,

要大得多,

对对我不觉得。

就 Coding Agent 只是一个执行者。

曼琪:你每次是说它是要解决的问题?

田渊栋:它的问题。

曼琪:对。

田渊栋:它的问题,

然后它的难度,

然后它的可能的路径,

比现在 Coding Agent 要大很多。

曼琪:所以你不是指的市场规模,

还是也包括那一部分?

田渊栋:我觉得不是,

市场规模当然是一部分,

还有部分就是包括

研究上的一些可能的方向和逻辑。

曼琪:所以你觉得就光有这个支点,

其实不见得你就能做好 RSI。

田渊栋:是的,我觉得是这样子。

因为其实很简单,

因为对 Coding Agent 来说,

一个是大家已经有可以用的 Coding Agent,

对吧,

就是大家都用,

比如说 Claude 的 Codex,

然后最近的一些开源模型,

效果也很好。

这个方向就是在做一些基本功能的情况下,

它也都已经做得还挺不错的了。

那么也就是说,

而且因为有开源模型的存在,

所以就是说这件事情变成

所有人都有了

这个能力。

曼琪:那你觉得开源模型的能力和

Anthropic 还有 OpenAI 的能力,

还是比肩的吗?

比如说像 GM 5.2,

像 KIMI 267 这些?

田渊栋:我觉得肯定还是有差距的,

差距还是有一些,

但是应该在接近中。

曼琪:你自己的体感是越来越近?

田渊栋:我之前就是...

曼琪:当然就是至少跟 Opus 4.7 相比,

你觉得就是 GM 5.2 还是挺不错的。

那和 4.6 比呢?

田渊栋:C640 差不多吧。

曼琪:C640 差不多。

因为有一种体感是会觉得

4.7 还比 4.6 好用。

田渊栋:我没有那么大的感觉,

但是我感觉上是 4.6、

4.7、4.8 没有太大区别,

没有太大区别,

只有版本号的区别。

可能唯一的区别就是说,

4.8 它的 context 长度变长了,

所以这样的话用起来更舒服一点。

因为像 4.6 你在用的时候,

用到一半突然跟你说,

我要 compact history,

然后你就等半天,

等半天之后,

它重新 reset 了之后,

你再去问它以前的一些事情,

它就不记得了。

这个是它一个表达的问题。

4.8 现在来说,

没有这个限制的话,

用起来会更舒服一点。

曼琪:所以在你自己现在的实际使用中,

像 GM 5.2 这样的模型,

你觉得是已经很够用了?

田渊栋:我应该说还可以吧,

应该说我也用过了,

我其实也就是

最近刚刚从国内回来,

紧急用了一下。

曼琪:紧急用了一下。

田渊栋:因为大家都觉得它好,

对,我肯定要试一试。

一个是这样的,就是

它还是比较顺畅做一些

比较执行上的一些工作。

曼琪:对,执行上的工作能做得不错。

田渊栋:有一些事情,

它就有些思考,

可以做的还不可以。

但有些时候呢,

它可能会陷入死循环,

或者说

有一些各种各样的毛刺吧,

但是总的来说,

应该说还是挺好的。

曼琪:你刚才提到就是 RSI

它整个要比 coding 要大得多嘛,

你觉得它除了 coding 之外,

可能它还需要一些

什么样的能力吗?

田渊栋:我觉得一个很重要的能力,

就是说你要做 AI scientist,

你要做人的这个能力的话,

就是人类研究员的这个品位,

对吧,

它的方向的这个感觉和理解,

还有就是说

对一些问题的一个抽象能力。

这个东西应该说

现在的模型都不太有。

曼琪:这个东西它如果总结一下的话,

它在模型里是属于什么能力?

属于推理,

属于 reason 吗?

田渊栋:对,

这当然推理能力,

真是应该说很难去形容这种东西,

就也不是说 reason 就能包含的。

曼琪:你觉得,

对对对,

它比 reason 更大?

田渊栋:在人的能力里面...

曼琪:它属于哪一种?

因为推理能力可以有很多种,

推理这个字非常广泛,

不是说你说你想要的那种能力,

在人的能力中可能属于那种?

田渊栋:在人的能力中就是说,

大部分人也并不是有的,

就是有一些很强的

这个研究员他有这个能力。

曼琪:这是创造力吗?

田渊栋:对,应该说创造力。

应该这么说,

就是说可以把一些概念

从一些纷繁复杂的这个表象中抽取出来,

并且加以总结,

加以思考,

然后继续在应用新的问题上这样的能力。

曼琪:其实就是你之前说到的,

从少量的样本

你就可以看到精准

而细节的灵性?

田渊栋:对,

但这个能力应该说,

现在模型还很难具备。

曼琪:其实这是对人来说真正的

Grokking 的?

田渊栋:对的。

这是应该说是人跟大模型相比,

人比较大的

就是一个优势。

就是因为大模型现在能力很强,

还是因为有大量数据,

对吧。

所以对于那些

非常

常见的数据,

然后说是重复的领域工作,

这些工作来说,

大模型有无穷无尽的数据,

所以它可以学会。

但是对那些就是数据量很少的,

就是或者说像科学家这样

开创性的这个领域,

就是问题

应该说是层出不穷的,

然后你每次做实验,

然后每次探索,

都会发现新的问题。

那么这个时候,

这些问题的这个理解呢,

就是它的项目数据很少,

那么这样的话,

你让 AI 去做,

恐怕是比较难。

曼琪:你觉得就是计算机科学,

或者具体的 AI 这个领域,

它本身在学科特性上,

相比于其他一些自然科学,

会不会它本身就数据更丰富,

更不需要你说的那种能力,

它也能往前推?

田渊栋:计算机科学,

你看嘛,

计算机科学也很大,

它也有工程的上面。

很多能力呢,

其实应该说是

大家已经踩过实践过了,

对。

那么这些能力,

其实应该说 AI 已经有了,

对。

曼琪:就可能不太需要你刚才说的?

田渊栋:不太需要。

曼琪:灵光乍现的东西,

它也能往前走。

田渊栋:对的。

还有一些能力,

比如说像应用研究的能力,

就是比如说你把

你按照这个

某个固定的逻辑,

或者某个固定的计算方案,

或者说是个思维方式,

解决一些问题的能力,

这个能力,

AI 现在已经也是有的。

就比如说你让 AI 去

解一道数学题,

对吧。

那么对数学题来说,

这道数学题,

可能就相似的题目

已经出现很多次了,

那么 AI 就能够学会

这个里面的这个模式,

然后找到更好的解。

但是有很多问题,

就很难去找到固定的模式,

或者这个模式

应该说是以前

没曾出现过的,

这些问题就是

AI 就很难去找到答案。

曼琪:对。

因为我想问的就是,

至少在第一个阶段,

就不说 AI for

其他的自然科学,

对,

就在 AI for AI 的这个阶段,

AI 学科里面,

实际上它有很多

这种情况的问题吗?

就是我需要在很少的

样本里,

我就找到一些

可能没有固定模式的

新的...

田渊栋:是啊,

就是一个非常明显的

这个例子,

就是说,

比如说像 Grokking,

像就是怎么样理解

模型本身的那些问题。

那么模型本身

有学习能力,

然后它怎么从数据中

学到这个模式,

然后怎么把这个模式

拓展到其他方向,

那么这个问题本身,

一个它没有

现有数据集,

因为如果有数据集的话,

这问题就解决了,

没有数据集。

然后对这问题的

这个理解的方式都不一样,

其实应该说就是

怎么样去理解 AI,

怎么能够

就是认识世界,

怎么能够发现

这个新的 Pattern,

怎么产生涌现呢,

应该说有很多很多人

做很多尝试。

我们比如说 2013 年 14 年开始,

就是大模型

或者说深度学习

一开始的时候,

就很多很多

那个做理论的人,

他们想各种方式去解释它。

比如说物理上,

比如说做

这个重整化群,

对吧,

然后物理上还有像

那个什么

那个 Spin Glass,

就是什么

那个自旋玻璃,

那么有人用过,

对。

还有比如说

数学上的一些方法,

比如说

之前有过很火的

像那个

Neural Tangent Kernel,

就是那个神经正切核,

对吧。

这些方法,

就是他们有很多

不同的观点。

还有用贝叶斯的方法来解决,

对吧,

还有像高斯过程的方法

来解决,

那么有很多很多方式

去研究这个模型

是怎么样产生这个涌现、

怎么样学习东西的。

那么这些角度,

应该说是都尝试过,

但是都没有特别满意的结果。

如果你要真的

找到一个新的

对 AI 的这个理解,

那么这个理解

可能是跟其他的方式

都不一样。

对,

这个时候你要让那个 AI 去找,

让 AI 去发现,

这个时候呢,

你就很难

就是通过照搬已有的这个逻辑

到 AI 上来完成。

曼琪:这里我的一个问题就是,

你看从 13 年到 14 年,

这么多尝试,

它都没有去很好地能解释 AI,

但好像另一方面,

这也不影响

AI 在突飞猛进的发展?

田渊栋:对的,

对的。

我没有说这件事情

会影响 AI 突飞猛进的发展。

我只是说,

就是做一个

AI scientist 的工作来说,

对吧,

如果比如举个例子,

我要 AI scientist 去研究

去理解这个 AI 是怎么运作的,

那么这个问题本身就是难问题,

因为过去的人都试过,

而且那个

用的范式都是不一样的。

曼琪:对,

因为我是在想,

就是回到你们公司的目标,

或者 RSI 的这个目标嘛,

对,

就这个目标,

他说让 AI 自进化,

或者说 AI 帮助 AI 进化的

更快这件事情上,

对,

是不是我不用处理一些

特别深的理论问题,

我可能也能实现这个目标?

田渊栋:是的,

这就是 RSI 好的地方。

因为对 RSI 来说呢,

就是它不是那种

像无人车那样

要么是零要么是一百,

而是就非常有很多阶梯的。

因为你 RSI 初级阶段

就能够做很多事情,

就比如说你刚才说

那个优化各种

那个算法,

然后提高性能,

这个部分 RSI 也能做了。

但是它本身也有效果,

也有实际用处,

所以说你

它的第一级台阶

本身就有很多实用的价值。

等到它第二级台阶的时候呢,

它可能有更深的东西

能挖出来,

那么可能实用量就会更大。

那么最终呢,

可能我们会有一个非常难的

非常高的一个目标,

比如说我们希望 AI 成为

像爱因斯坦或者牛顿这样的大脑,

那么这样大脑

可以通过很少的样本

获得很深的支持。

那么如果这件事情成了,

那么应该说

那个 AI 就非常非常厉害了。

但这件事情呢,

就是是个非常难的问题,

就算我们没有做出来的话呢,

本身这个东西的应用呢,

也是有很多的。

曼琪:那回到就是我们

刚才这一轮话题的起点,

是说在 coding 之外,

RSI 还需要什么能力,

你刚才说有一个

就是类似于 Grokking 的这种人,

其实可以产生某种灵感

和联想的这种能力?

田渊栋:对。

曼琪:还有什么你觉得?

田渊栋:对,我觉得这个是重要的。

但还有就是说,

一些就是 agentic 的 behavior,

对吧,

这个也是重要的。

就是说你 AI 怎么用

订用工具啊,

怎么动用各种各样的

那个已有的知识,

然后获取新知识,

然后获取各种

把这些事情放在一起

完成任务这样的能力,

对吧。

那这个能力其实某种程度上,

可以说是核心的公司

已经有了。

曼琪:对,

已经在探索,

已经在往前推的。

田渊栋:对对对对。

曼琪:所以对新公司来说,

我觉得好的一面是,

你们有很多能力

是可以直接用?

田渊栋:是的。

曼琪:然后可能会有压力的一面,

就是因为他们

也有这些能力嘛,

所以他们可能也会

往这个方向推。

田渊栋:对,

但是这样的能力,

应该说很多开源模型

或者说很多

那个已有的

那个解决方案

已经在那了,

对吧。

所以就这些能力

它有多大程度

会左右最后的 RSI 的结果,

其实他们应该说

每个人想法是不一样的。

曼琪:对。

田渊栋:还有些能力,

当然说你怎么去收集信息,

然后把从信息中

找到一个最重要的

那个信号,

那么这个部分应该说

就之前做 Deep Research

这些方向上,

也已经就有很多

有很多工作。

曼琪:我的一个感受就是,

最近这段时间

硅谷非常热衷的讨论

RSI,

它有一个假设,

就是谁最先达到这个状态,

就会把其他人

甩得越来越远,

而且这件事是有个窗口的,

就可能你过了这个时间,

你还达不到的话,

你就无缘这个决赛圈了。

你觉得这个逻辑

它有什么漏洞吗?

田渊栋:这个逻辑呢,

应该说还是比较正确的。

但是呢,

应该说有这种可能性,

就是说,

对于 AI 来说,

如果它没有突破性进展的话,

所有人 AI 都差不多,

对吧,

就是说它不是一种渐进式的

这种一点点往上走的,

它那是一种突破式的往上走的

这种路径。

比如说所有人

在没有达到某个 level 的

这个模型之前,

大家都差不多,

都还是不错的,

但是也许有一两个人

才能突破了,

那么突破了之后呢...

它会达到下一个层次,

那个层次上的 AI,

它的能力呢,

是远远高于

其他人类层次的 AI 的。

那么这样,

这种情况下呢,

就是说,

那么整个 level 会提得

更快一点。

对,

所以它可能不是渐进式的。

它的一个推论就是说,

其实也许

还是有一定空间

给初创公司的。

因为如果是渐进式的,

如果你觉得

现在这个 Scaling Law 这条路线

就一定能通向了这个 RSI,

那么初创公司

是没有什么机会的。

为什么呢?

因为现在 OpenAI

和 Anthropic 都已经

做得很好了。

那么他们如果加入 RSI,

他们是不是一直往前走,

越走越快,

他们永远比别人

更快。

曼琪:我理解你说的意思,

它其实就是一个

加速度,

你可以一直往前冲。

田渊栋:或者我可以举这样的例子,

就是说,

比如说一个 RSI

这个系统,

这个系统肯定会

让效果变得越来越好,

对吧。

就是说你看,

从这个情况开始出发,

它会有个 S 型曲线,

一开始长得很快,

然后呢,

因为有些瓶颈会停下来,

就有条平台期,

直到下一个突破出现,

然后再出现

S 型曲线

再上去,

这样的一个过程。

曼琪:对,

就是 S 型之后平台,

然后 S 型之后再平台,

再平台,

这样。

所以你每个平台

应该都对应一个突破。

所以如果你没达到

这个突破的话,

那大家做得再好的话,

就可能在这个,

就是无限地,

就是逼近

之前那个效果的上界。

你对它接下来的这个发展,

是直接这样往上的,

还是它是渐进式的、

有平台的?

田渊栋:我觉得是有平台的。

你发现了新的东西,

新的想法,

那么你这个,

因为这想法产生的模型

会变得更强。

然后变得更强之后呢,

你才有更好的想法去做,

那么就是它是一个

阶段式跳跃的。

曼琪:你觉得这个想法

现在它主流吗?

田渊栋:现在应该还不算主流吧。

对。

但是我觉得

这当然是完全取决于

大家对 Scaling Law

有多大信任感。

如果大家觉得

Scaling Law

百分之一百是对的,

那么就是说,

其实并不存在

这样的平台期。

就是说,

我只要大家堆算力,

堆计算资源,

堆那个各种东西,

我们的能力

就会越来越强。

那么这样的话,

这个递归自我进化

这件事情

就一定是一个

非常平滑的过程。

我比你快一点,

我就一定比你快更多,

比你快更多,

然后就会上去。

那么这样的话呢,

任何一个初创公司

不能追上

OpenAI 和 Anthropic,

因为他们一定会在

更前面,

让它追得更快。

但是我觉得,

就是,

不是这样。

就是 Scaling Law

可能不是全部吧。

就它可能是对的,

只是说,

它需要百分之一百……

就需要很多很多样本,

它是指数级的,

所以就是说,

你需要十倍的资源,

十倍的数据,

十倍的这个

各种东西,

然后最终能够达到

就是线性的增长。

那么,

这样十倍的这个资源,

其实应该说

现在已经开始

有瓶颈了。

所以哪怕这个理论

它是对的,

但是它也有一些

别的现实上的限制。

对,

这个限制应该说

是很大的限制。

就是说,

你不可能让全世界、

整个地球的电力

都供应给你一个人

做这个自我进化,

是不可能的。

肯定会有博弈,

肯定会有一些限制,

所以应该有更好的、

更有效的方法

去做这事情。

曼琪:这个也是你之前

反复有讲到过,

你曾经说过

如果 Scaling Law

就是未来的话,

你觉得那是一个

比较悲哀的未来。

田渊栋:那就非常无聊,

非常无聊。

曼琪:对,

没有新的

知识上的突破。

田渊栋:是,

我相信是会有

智能上的突破。

有智能上的突破的话,

就是这个

RSI 这个 loop

本身是一个

元叙事上的这个 loop,

因为不管你是什么模型

都能够做这事情。

但是具体的,

就是支撑这个叙事的

这个底层的架构,

和底层的这个数学,

和一些这个模型的

一些结构,

应该说是会有突变。

曼琪:对,

就刚才我们说

是否达到 RSI 这个状态之后,

强者愈强,

领先者越来越领先。

你说有一个变量是

它接下来的走势

是渐进式的

还是有 S 型的平台的。

田渊栋:是。

曼琪:还有一个

我觉得有可能的变量,

就是说,

这个智能未来的空间

它有多大?

田渊栋:空间是很大的,

我觉得我们刚开始。

我们现在还是,

就像我那本书一样,

叫《破晓之中》,

就是我们刚才……

我们刚才看到

一点点的星光,

就太阳还没露头,

我觉得应该是这样的状态。

曼琪:只是你觉得

它的前途是光明的,

但道路是曲折的。

田渊栋:对,

因为我们毕竟是

生活在地球上面

一些非常可怜的

猴子变来的

那个生物吧,

对吧。

就是说,

一直以来看的那些东西

都比较粗浅,

或者说比较简单,

对吧。

这上面应该有

很多很多东西

可以做,

只是我们看到的东西

非常少,

所以我们只能看到这些,

我们不能看到

非常非常远的未来。

曼琪:那这个想象往后是什么了?

我们最开始是

猴子变来的生物,

可怜的生物,

看到粗浅的东西,

再往后呢?

田渊栋:对,

再往后就是说是,

如果真的是有,

就是 RSI 普及了,

然后所有人都有超越

我们以前智能

很多很多层次智能的时候,

那么整个世界

会完全不一样。

曼琪:你可以稍微讲讲

你觉得会怎么不一样吗?

田渊栋:就是说,

就是以后我们之前

所有的世俗上的一些东西

可能都能够满足,

因为所有的那个欲望,

或者所有的要求,

都能够被 AI 所满足,

就是就进入了修仙社会。

就是说言出法随,

什么言出法随?

我说了一句话,

这句话一定会成真。

比如说我今天,

我要个大房子,

马上就给你大房子;

我今天说我要去海边旅游,

马上旁边就是海。

对。

我说我今天要

那个改变整个世界,

把它变成我想的样子,

它马上变成我想的样子。

你可以回去当皇帝,

你也可以去任何地方,

做你想做的任何事情。

曼琪:但是在你自己写的

科幻小说里面,

它后来虚拟世界里

还是加了一层限制,

就本来是

想要房子就有房子,

后来也有了房价系统。

田渊栋:对的,

那是因为就是

如果是这样的话呢,

对于这个世界来说,

就是大家可能失去了一个动力。

对。

失去动力的话呢,

就会有一个新的问题,

一旦失去动力之后,

那么人类社会怎么发展?

这个是一个很大的问题。

在小说里面呢,

其实应该说迭代两次嘛。

就第一次迭代的时候,

发现这个事情不是很成功,

那么推翻重来之后,

再迭代一次的时候呢,

就是作为这个……

作为这个虚拟世界的管理者,

可能会思考一下

怎么能让人类在享受

这些那个非常便利的

那个技术进步之后,

同时依旧保持向前的动力,

这个其实是很大的问题。

曼琪:你说这个未来里

至少有一件事

我觉得是很美好的,

就是一些

现在很难克服的病痛

是可以消失的。

田渊栋:对,

对,

我相信是这样子。

曼琪:这是你自己的一个

个人的愿景,

还是你们……

因为你们新的公司

其实也是以这个

RSI 为一个共同的方向,

对,

你们合伙人之间

也会去讨论这种事情,

也会有相同的愿景?

田渊栋:那些什么

修仙社会之类的东西,

那肯定是我自己的愿景,

对。

那是更像是偏小说的,

更偏那个

类似于科幻的

这样的一个想法,

对。

对,

就是至于公司来说,

我们还是希望

把这个事情做成,

因为这是一个实现上,

或者说是

一个具体的执行层面上的

一个工作。

曼琪:而且 AI for AI

只是你们的第一个大阶段,

你们后面还要

进入别的科学领域?

田渊栋:对。

比如说你对

AI for AI

能做得比较好的话,

我们如果能够

找到新的方式,

就是说,

产生新的架构,

或者新的这个理论,

或者新的这个

模型的优化算法的话,

那你就认为了,

就是这个系统本身

对一个问题的理解

深入很深,

那么这样的话,

我们是不是可以

用这个系统做别的东西。

曼琪:那我们接下来

来聊聊你们

最近的一些

具体的进展。

因为你们在 6 月初

正式官宣之后,

到 6 月 11 号

是释放了第一个成果,

当时你们发了一篇

技术博客

《First Steps Toward

Automated AI Research》

(通往 AI 自动化

研究的第一步),

可以讲讲

这是一个什么样的进展吗?

田渊栋:对,

这是一个初步的进展,

就是说,

证明我们的系统

还是可以做一些事情。

比如说我们

用它来优化

NanoChat

五分钟的训练,

然后让它

BPB 这个数字

降到比较低,

比如说比 Community

的数字还要低;

比如说我们可以用它来

做 NanoChat 的

Speed Run,

让速度变得更快;

最后就是

算子优化这部分,

就是我们找到了一个

新的算子,

这个算子也是通过

我们的系统来优化的,

优完之后,

算子的效果

应该说比现在

最好的 SOTA

还要好不少。

曼琪:这些成果

你们都是开源了的?

田渊栋:对的。

曼琪:这一次的进展发布之后

有什么有意思的反馈吗?

田渊栋:总的来说

有很多的比较 Positive Feedback,

大家都会觉得

这个结果还是不错的,

比较 Impressive。

那么我特别……

我个人特别觉得,

特别是第三部分,

就是关于算子优化这部分,

对吧。

因为这部分

应该说是

一开始是我一个人,

加 AI

做到 SOTA 了。

曼琪:一个人加个 AI

就 SOTA?

然后,

可以透露加的哪个 AI 吗?

田渊栋:你说现在很多

我就不能说了,

因为这也是我们自己做的,

对吧。

曼琪:哦,

你们自己,

就是你们自己的这个系统。

田渊栋:对对对,

不是,

并不是说是外面的那个系统。

然后在网上的话,

就是大家都很兴奋,

因为一开始

大家都觉得它挺难的。

对。

后来做到 SOTA 之后,

就很兴奋,

就有很多人一起来做,

那最后达到更好的结果。

曼琪:为什么要去做这件事?

就是你怎么看待

SOL-Exact Bench

这个 Benchmark?

田渊栋:这个 Benchmark

应该说

一开始是

那个英伟达的,

最近才发布的

Benchmark,

应该是比较新嘛,

对吧。

另外就是说,

算子优化本身

也是很重要的一个工作,

因为算子变快了的时候,

它能够对于这个 AI

这个,

这个 Model Training 和 Serving

都产生影响。

曼琪:那英伟达

它去做这样一个 Benchmark,

它也是为了去服务

RSI 的推进吗?

田渊栋:不是。

因为对英伟达来说,

做这 Benchmark

应该说是,

它最多就是看一下,

就是我们……

因为对 AI 来说,

AI 算子变快

对英伟达来说是好事,

所以它无所谓

你是人来做的,

它并不是说……

它无所谓

还是系统做到的,

对。

对它来说就是,

为它的硬件

配备更好的算子,

然后让它这个速度变快,

效率变高,

对它来说总是好事。

曼琪:然后你们这次做的

这三个测试

是用同一个系统去跑的吗?

还是说它需要

针对不同的测试和任务

做一些修改呢?

田渊栋:然后它同一个系统去跑。

曼琪:同一个系统去跑?

所以是个通用的东西?

田渊栋:对,是通用的。

曼琪:我觉得你们选的

这三个 Benchmark

还挺有意思的。

一个刚好是我算力是限定的,

我去看性能,

对吧;

然后另一个是

我是看它的 efficiency 的,

对,

就是我是看效率的,

对;

然后最后一个算子

优化是可以作用在 infra 上的,

对,

也涉及到就是模型

其实几个

比较主要的不同的环节。

田渊栋:是的。

曼琪:你们当时是怎么计划和思考

去做这样一个成果的?

田渊栋:很多时候也是,

一个是机缘巧合吧。

曼琪:对,

你当时最后那个算子优化

是有些机缘巧合。

田渊栋:对,

机缘巧合是一个,

然后还有就是说,

也有很多的,

看什么东西

确实对我们来说

相对来说

是比较容易的第一步,

我们一定会先去做它。

就是这样的话,

有一个很好的

一开始的结果,

通过这方式,

也可以慢慢

去做得更好。

曼琪:你们是把你们做的这个东西

称作系统,

为什么不把它

叫做 agent?

田渊栋:因为我们还是希望

细节比较保密吧,

称为系统来说呢,

就是说,

这样的话,

就是你可以保留

各种可能性。

曼琪:那如果说系统本身

你觉得不方便展开讲的话,

你可以讲讲就是

你们现在就选的

这三个 Benchmark,

它分别是在测试

什么能力?

如果再往后,

它有没有一些

比如说组合起来的

更大的空间?

田渊栋:这个就是说,

其实应该说是,

主要还是测试……

比如说它预训练上

又是能不能找到

更好的想法

更好的思路

对吧

然后它算子上

能够找到更好的算子

所以它们的共同特点

就是说

它们的反馈比较快

对吧

就是很快能够

获得一个反馈

然后这个系统

能很快地跑起来

曼琪:因为你们把这个

成功叫做 first steps

田渊栋:对

曼琪:那更总结来说

你们是怎么设定

递归自我进化的

第一阶段的目标

田渊栋:第一阶段目标

当然是希望

这系统能跑起来

然后有一些初步的结果

对吧

所以我们现在是达到

曼琪:那你们这个系统

接下来是你们自己

继续用之外

因为其实之前

你也说过

你们一开始

就有考虑一些

商业化的事情嘛

就是你们有了

这个初步的成果之后

它在商业化上

是马上会有些动作吗

还是一个什么样的

田渊栋:我们当然会继续

去优化这系统

然后让它做到

更好一点

商业化呢

我们也在思考中

在思考中

当然就是说

我们还是希望

这系统做得比较一般化

就是解决通用的问题

那么这样的话呢

我们不会说

因为一两个

具体这个 vertical

让这系统变得非常特殊化

这样的话

可能就失去了

这个一般化的意义

曼琪:然后回到这次

具体的成果

你们在这三个

Benchmark 上

都取得了 SOTA

但如果只看

这些数字的话

直观的感觉是

它一些改进

好像是非常小的

田渊栋:其实不是这样

其实应该说

这些数字

还是比较让人

印象深刻的

比如说拿算子的话来说

因为这个方向

一开始

是我这边来带起来的

我觉得一个是

重要的是说

你看就是

我们当时战胜第二名

第二名有个公司

叫 AAI

Table AI 这公司

是以色列的那些人做的

那么他们

他们那边的 CEO 是 Sasha

他应该说是

以前 Mobileye 的 CEO

Mobileye 应该说

是一个非常

著名的公司

他一直做非常强的

端侧的

或者说在 chip 上的

一个处理

曼琪:对

田渊栋:他以前做过

特斯拉的供应商

曼琪:对

田渊栋:就是车上的芯片

曼琪:对

田渊栋:所以它是一个

半导体的专业的公司

曼琪:对

田渊栋:而且他们这次开了一个新公司

叫 AAI

那么他们里面那些人

都是专业的

做那个 GPU 的

这样的一些工程师

他们当时也是提交了一个版本

但是我们的效果

比他们要高 10%

曼琪:相当于他们是专家

田渊栋:对

但是应该说

对于我们来说

我们其实组里面

没有什么人是 GPU 的专家

但是我们系统比较

比较高效

也比较有效率

就是说你可以这么说

你可以说

所以最懂

这个算子优化的应该是我

很有意思就是

我其实应该说

你要去看我以前的简历

以前的那个故事

我没有真的做过算子优化

曼琪:对

田渊栋:所以我只能说

我做过一些

就是大模型的 efficiency

大模型的效率

其实这样的一些工作

所以就算是这样的一个

就是非专业的团队

但是我们有

这个 RSI 的一个

通用的思考

和这个逻辑

然后通用的方式来

做这个大系统

能够达到更好的效果

曼琪:就能够达到

业界顶尖专家团队的效果

田渊栋:对

比他们更好一点

曼琪:所以你自己对这个

还是比较满意的

田渊栋:对的

这应该说是一个

比较好的一个结果

像那个 nanoCHAT 的五分钟

就是像 nanoCHAT Speed Run 的

这个东西应该说

是 Community 做了两年了

曼琪:对

田渊栋:那么这个数字

也是很难在网上提

但是我们在这上面

又提了两秒左右

所以数字看起来

绝对数字不大

但是

其实应该说是

对那些已经做过

这个方向的人来说

这个数字还是比较大的

曼琪:对

我就是想请你解释一下

因为很多

不是做这些事的人

他可能看的就是

你从 79 秒到 77 秒

就感觉好像

那也只缩减了一点点

田渊栋:但你要知道

79 秒是过去

整个 Community

做了两年在 SOTA

曼琪:对

田渊栋:那就接下来就很难

再往上提了

曼琪:就相当于也是

技术社区里面

专门主攻这个

效率这个方向的人

的努力的结果

田渊栋:是的

曼琪:还有一个问题

还有一个问题就是

你们现在测的

这个 nanoCHAT 和 nanoGPT

它都是比较小规模的

测试

比如说 nanoCHAT 的话

它是训一个 GPT-2

级别的模型

它和现在主流的

大模型的参数

其实差了很多

那你们目前的这些成果

如果要迁移到

更大的模型上

更大规模的架构上

它会难吗

它中间会有

比较大的 Gap

田渊栋:应该说还是

会有一些 Gap 的

这个我们也在

继续做

曼琪:那有可能之后

我们就能看到相关的

具体的东西

我就不套路了

再往下的话

你们会

着手去做一些什么事

比如说 First Step

是现在我们看到的这个

那比如第二步是什么

田渊栋:那我们会继续优化

这个系统

就是继续优化

这个系统

让它变得更强

变得更有效率

然后变得更好

对

然后就看

这个系统本身

能够优化更多

更广泛的方向

对吧

比如说预训练

后训练

这些东西都会做

曼琪:预训练

后训练

你们现在有

类似之前 OpenAI

总结的

AGI 的那几个阶段的

这种 Roadmap 吗

田渊栋:这个目前还没有

曼琪:这个你觉得是要

就是在探索一段时间

有更清晰的思路的时候

可能会有

田渊栋:对

毕竟我们公司刚成立

OpenAI 有这个 Roadmap

也是在他们成立

十年之后了

曼琪:对

很久之后了

田渊栋:15 年底就成立了他们

差不多是

23 年 24 年

最多才提的

曼琪:对

只要有 8 到 9 年的时间

田渊栋:当然了

就是现在这个时间会缩短

因为大家的热情很高涨

然后整个过程

是变很快了

但是应该还不至于

快到

只要半年的程度

曼琪:你觉得这个领域

现在急缺什么样

你说 RSI 吗

田渊栋:对

RSI

曼琪:比如说

一般来说

你要做一个 AI

肯定是要看

它的数据是否充裕的

像做 RSI 的话

它的什么数据

是可以用上的

田渊栋:这个问题应该说

现在还没有定论

现在有很多

很多方法可以做数据

比如说

这些数据的

具体的做法

然后它的逻辑

然后它的准则

它的思路

现在都不是很清楚

有各种各种方法可以做

应该说现在还是探索期

曼琪:可以分享一些

大致业界的数据的思路吗

田渊栋:这个我们暂时也不太方便说

曼琪:所以其实也没有很多人

知道怎么做

田渊栋:对

都是在团队内探索的状态

现在都在探索

曼琪:不说具体它什么

类型的数据

我想知道

比如它成本很高吗

获得难吗

就目前大家想到的

几种方法里面

田渊栋:有难的也有不难的吧

但是难的跟不难的之间

就是问题在于

它到底效果怎么样

就是 trade-off

可能难的就是效果好

曼琪:对

田渊栋:不难的就是效果不好

曼琪:对

除了数据之外

你觉得还可能缺什么

田渊栋:算力肯定是一部分

因为比较重要的是

你怎么样能够

RSI 本身就需要一些算力

去探索的

去研究的

所以在这上面

其实应该是花不少时间

去怎么样减少算力的消耗

但同时获得更多的成果

曼琪:其实你们首轮的融资是很多的

融了 6.5 亿美元

田渊栋:对

曼琪:这个在第一阶段

因为你刚刚说算力也是个问题

在第一阶段

它对你们来说充足吗

田渊栋:应该说还可以

这个数字还是不错的

对

可以做一些事情

当然你要达到像

那个

御三家的这个级别

达到大厂的级别

还有一定距离

曼琪:你觉得就是

实现你说的那个 RSI

就更往下来说

它之后是不是也需要一些

Scaling Law 之外的新的创新

田渊栋:我觉得是

因为如果是完全拼 Scaling Law 的话

像小公司是拼不过大厂的

就跟我说

跟人家说的是一样的

对吧

曼琪:就关于 Scaling Law 之外有什么方向

你现在有什么想法可以投入吗

田渊栋:现在还不太好说

曼琪:就是你就想到了一些

但是要验证是吗

田渊栋:对

我觉得就是一个大的方向

就是可解释性

我觉得可解释性很重要

对

它能够发现很多的

那个 insights

然后这 insights

可以加快这个速度

然后同时让这个模型

变得更加 safe

但具体是什么呢

我就不好说

曼琪:其实像 Grokking 就是一个

可解释性方向的研究

解释了

就人们眼中的那种涌现

是怎么来的

田渊栋:对

曼琪:你们之前公司的愿景里

特别强调了

你们要在安全的条件下来追求 RSI

如果摊开来说一下的话

你觉得 RSI 实现之后

它可能还会有什么风险

田渊栋:风险呢

其实还是挺多的

经常有很多人跑过来问我说

如果 AI 能够自我进化了之后

那他们会不会变得很疯狂

曼琪:你说的很多人是什么类型的人

是从业者还是

田渊栋:有些可能不是这个领域的

其实很有意思的

就是说越是就是

领域之外的人

其实问题会越来越多

对

领域之内的人

其实倒没有那么多问题

就是说他们不会觉得

这个问题太严重

因为这可能不是一天就到来了

对

其实现在 AI 还有很多问题

这些问题应该说非常难解决

现在还是很大的挑战

但是领域之外的人

可能会问这个问题

AI 自我进化之后

会不会有一天超过人类控制

或者说达到一些方向

让人类无法去理解

这个其实是应该说比较大的问题

曼琪:那你一般会怎么回答这个问题

田渊栋:总的一个就是说

我们在训练 AI 的时候

我们当成狗一样的训练

就是说我们在训练

它的这个 signal 是

相当于我们当年训练狗

这样的训练方式

就训练 AI

使得 AI 能够很快

很好地服务于人

能够很好地帮助人解决问题

那么在这样的进化压力下

就是 AI 是没办法进化出

跟人一样的

就是某些自我意识和这个

就是自我认知的这样的一个概念

我觉得这个是一个很大的

具体大的区别

曼琪:你觉得如果要达到

你所设想的更终极的 RSI

那种能产生新的创造力

和一些灵感的状态

它需要有意识吗

田渊栋:意识和这个事

我不觉得它需要

就这样不是一回事

不是一回事

对 这样不是一回事

我不觉得这个东西是一定必备的

你其实可以想一想

就是比如说有很多天才的那个

就是数学家和物理学家

对吧

他们在各自领域上

可以做得非常天才

但是另外一方面呢

就是说他们也与世无争

他们并不是想要权力

并不是想要各种东西

所以就是说这两个部分的

这个就是能力和它的欲求

是完全可以分开的

这是第一点

然后第二点就是说

我觉得以后可解释性是很重要的

因为通过解释性

你可以真正知道

模型在干什么

到底什么地方是起作用的

曼琪:对的

田渊栋:什么地方是模型起作用

什么地方

模型利用什么样的能力

获得什么样的支持

得到什么样的结果

就是这样的话呢

就可以消弭人们对这种

黑箱的这种恐惧

曼琪:是不是从业者里也分两派

有的人认为

这个东西一定是可以解释的

是可知的

田渊栋:我可能少数派吧

就是说因为大部分人

可能已经觉得绝望了

就是说

大模型那么复杂

应该是没希望

在了解里面的干什么

曼琪:对 我就是说可能

有另一派是觉得

就是可知这件事

也许是很难追求到的

田渊栋:是的

很多人是没想

但是我觉得不是这样子

我觉得一定是

有一个好的 principle

能够让这个模型运转起来

那么这个方面

如果你真的能够找到

这个 principle 的话

一个方面就是

能够让这模型变得更强

另外一方面呢

就是说能够让模型变得更安全

曼琪:你的这种少数的相信

是来自什么

田渊栋:这个应该说是

根据我过去的那些经验

和我们过去的那些做的工作

曼琪:如果展开来讲是什么

什么东西会给你这种

田渊栋:对 我一直在做一些

比如说关于就是

神经网络的训练算法的

这个理解

对吧

神经网络是怎么学会

各种知识

各种各种模式的

神经网络是怎么学会的

然后比如说你训练的时候

你做梯度下降

那么梯度下降会给

神经网络的动力学

上带来什么样的影响

神经网络里面

权重是怎么生成的

然后它怎么学会一些 pattern

这部分的分析

应该说我已经做了很多

很多年了

曼琪:你之前也提到

其实在这一轮

AI 热潮的起点

就是一二年前后

就有很多理论的研究

想去解释机制

有从物理里借鉴的

有从数学里借鉴的

但是成果都其实比较少

田渊栋:对

曼琪:这不会影响你的信心吗

田渊栋:我不会影响我的信心

我觉得也许

我会是那种少数派

会把它做出来的那个人

曼琪:这还是个挺大的

我觉得知识上和学术上的

一个抱负和追求

田渊栋:应该试一下

就是如果你没这个想法的话

你也可能就能随大流

对吧

但是如果你有这个想法的话

那可能你就会

有这个想法往前一直走

曼琪:你什么时候开始

有比较明确的这个想法

田渊栋:我应该说是

应该说是从2020年

2021年之后

就慢慢慢慢对这个问题

理解得更深入了之后

我会觉得

也许我在一条正确的路线上走

曼琪:那个前后有什么

整个技术环境的变化

让你的这种想法

更明确吗

田渊栋:我会觉得是这样

就是至少因为对于我来说

我对于AI的一些分析

和一些工作

这些工作本身

让我

因为这个方向本身

我做了很多年了

应该说一开始

不是很顺利

有很多东西我做得不好

但是

从2021年之后

我会觉得这个东西的分析

和理解

我会觉得越来越深入

有很多问题

本来想不通

现在突然想通

所以因为有这个过程

你会觉得

我也许在这条正确的路径上

再往前走

曼琪:现在还在追求

这个事情的人

你的同行人有哪些

田渊栋:应该说不多

对

因为很多人可能都放弃了

其实有很多人

就包括

这次那个……

他的那个

Anthropic那个人

对

叫Behnam

Behnam其实应该说

很早以前

我就知道他了

因为他以前是做

也是做理论的

就是对于模型的分析和理解

他也发了很多文章

很多文章还不错的

他也是

之前是跟很多

就是像

跟普林斯顿的

那个Sanjeev Arora

经常会合作的

但是很多人就是

在这一波

AI

这场之后呢

就放弃了之前的工作

然后直接说

OK

我们就Scaling Law all the time

那么他们就

他们做别的东西去了

所以

有这些东西

就是大部分人

可能很多做理论的人

后来也就放弃了

他们就说

他们有的加入OpenAI

或者加入其他地方

他们就说

OK

加入这个Scaling Law大军

然后把事情做成

曼琪:就打不过就加入

田渊栋:对

曼琪:因为像今年年初

就有理论

计算机的理论大牛加入OpenAI

田渊栋:是的

很多人是这样子

那么加入

其实有很多这种可能性

一种是

当然是说

我是有自己的追求的

但是我想用AI来做事

那么这时候呢

你加入大公司

用他们的模型

做事情是很正常的

这是一种

还有一种是说

OK

我已经放弃

我现在手上做的东西

我就觉得AI就是一切

那么他们将来

会成为AI的研究员

还有一种就是说

想进去看一下

然后过两年

再回学术界

这也是有可能的

曼琪:我之前采访过的人里面

我觉得马毅老师

比较追求这个

田渊栋:对

曼琪:他比较追求可解释性的事情

还有白盒大模型的

一些研究

田渊栋:对

但我觉得就是说

一样就是

我希望就是以后

人类还是有一些

多样性的

不可能说

所有人都追求一个东西

对

如果所有人都相信

Scaling Law是一切了

那世界会非常无聊

曼琪:你觉得

勒昆他做的AMI

是在追求这个吗

田渊栋:他的追求东西

应该说是不一样

就是一个是基于视觉的

然后呢

世界模型

然后在隐空间上

做一些推理

推导

做一些预测

他在这三个点上

抓住了之后

他觉得这个方向是正确的

他就往这边走

就算这个方向

跟大模型是不一致的

但是他也希望

往这个方向往前走

曼琪:但是他的重点

不一定是可解释性

对吧

田渊栋:对

他重点可能是说

他认为这个新的范式

能够解决一些

现有大模型

做不了的事情

他可能更多是

工程上的一个方向

曼琪:其实我觉得

你在追求的是

就是你希望

把这个东西

变成一个真正的科学

田渊栋:对

这个可能是我一个追求

曼琪:因为现在

它可能很难说

是一门科学

因为有些原理

确实搞不清楚

田渊栋:是的

我觉得它以后

终将变成科学

因为这个应该说是

历史一定会出现一个

就是不会重复吧

但是历史会

会在某种程度上

是会跟以前的那个

东西相互呼应

曼琪:AI终将变成科学

是跟以前历史上的

什么过程呼应

田渊栋:就跟以前的

比如说

炼金术变成化学

或者说

从第谷的这个

天文观测

对 第谷的天文观测

到开普勒的一个总结经验

然后最终到牛顿的一个第一性原理

那么这个过程一定会发生

曼琪:科学革命的结构就是从第谷

从第谷到开普勒

从开普勒到牛顿

永远是这样子的

田渊栋:当然了 就是你在牛顿没有出现之前

大家都会觉得这事情不可解释

太难

都会这样子

那么等到牛顿出现了之后

会觉得这个事情

全貌……其实没那么难

曼琪:你觉得下一个出现的牛顿还是人类吗

田渊栋:不一定 可能是AI

曼琪:可能是AI

田渊栋:可能是人类加AI

对 有可能是这样子

所以为什么要做AI

是这个原因

因为你如果想做这件事情的话

你一定要用世界上所有的计算资源

和所有的最强的大脑

包括人的大脑和AI的大脑

把这事情做成

曼琪:你觉得有生之年能看到

图灵奖颁给一个系统吗

田渊栋:我觉得如果到那个时候

可能图灵奖也不是很重要的

如果这系统很强的话

那它可能会在很快的速度

获取很多知识

然后得到很多的结果

它变成了一个

就是knowledge discovery system

你可能每隔一个月

每隔两个月产生新的东西

东西非常有意义

曼琪:到了那个状态

你觉得人类研究员的乐趣是什么

比如说你自己的乐趣是什么

你会在做什么

田渊栋:我觉得首先第一个就是

如果能理解AI

到底是怎么工作的

我会很开心

然后另外就是说

如果真的

已经不太需要人类去介入的话

AI能自动发现新的东西的话

那时候能去

一个是当然是欣赏它的美了

你有很多东西你来不及去做

但是你至少能看一下

你能够感觉一下这个美感

这种有意思的东西

被发现

我现在其实还有这种习惯

就是我经常去看一些

比如说数学证明

看一些有意思的这个问题

怎么发现的

那么这个

你发现里面一些有意思的东西

你发现

哦 是这么做的

这种豁然开朗的感觉

曼琪:这个和你日常工作

其实不直接相关

田渊栋:对

对 不直接相关

但是这本身是一个

很有意思的一个过程

曼琪:这对你是一种

精神享受活动

田渊栋:对 是有乐趣

或者说发现

这个系统是怎么work的

或者怎么样能够理解

这里面在干啥

这是很有意思的事情

曼琪:其实最近AI系统

也就是宣称

有一些证明

有些数学上的突破

这些你去看了吗

有没有

你觉得比较优美的东西吗

田渊栋:比如说呢

你有什么东西

你觉得你……

曼琪:我愿意去看的

去年的Google的

Alpha Evolve

它是

应该是有一种

矩阵乘法

它减少了一次的次数

对吧

从多少次

缩减到了多少次

田渊栋:对对对

是的

这个当然就是说

就是它把矩阵乘法

换了一些顺序

然后比如说

可以少一次加法

或少一次乘法

通过这种方式呢

就减少这个代价

对吧

你真的去看的时候

觉得它还是挺有意思

因为它通过某种方式

变换之后

它少一次乘法

让它的效率变高

曼琪:那你刚才问

就是有什么值得看的

你的意思就是说

其实可能

真的AI做出来的东西

目前来说

也还没有那么优美的

你觉得能有享受感的东西

田渊栋:对

就是说很多时候

还是要看人做的东西

对吧

因为现在AI做的东西

很多时候是处于

这个“术”上的level

没到“道”上的level

就是说“术”和“道”是不一样的

“术”是指就是具体的细节

就比如说

我们把这个

矩阵乘法的次数少了一次

那么你当然可以看到

就是通过某种

很巧妙的变化

你把东西先加起来

然后再乘

那么这样的话呢

你可以减少一次乘法的次数

因为你加完之后再乘呢

那其实就是说

你同时相当于

同时把很多东西都乘起来了

当然你通过一次乘法

可以相当于乘四个数字

通过这个方式呢

可以算出一个

比较巧妙的数字

这个相当于说是

应该说是在

高维空间中做的穷举

然后找到一个穷举的一个

好的一次结果

但是“道”呢

可能是另外一个东西

就是说你发现一个新的理论

或者发现了新的这个逻辑

或者新的链条

这个东西呢

它本身是美的

但这种美呢

你以前没有见过

这是不一样的东西

曼琪:最后这一部分想聊一聊

就是你过去的一些经历

和你现在做的事

之间有什么关联

包括你过去的那些选择和学习

让你走到了

今天这种探索的状态

就是我看你过往的经历

我觉得比较标志性的转折是

你之前在Google X的时候

其实做的是

无人驾驶的工程师嘛

那个我理解是更偏工程的

田渊栋:对

曼琪:然后后面你去Meta

最开始去FAIR

它就又回到了一个

更研究的状态

当时为什么要主动

又一次做这个选择

田渊栋:对 因为一个是

当时工程比较无聊

对 当时应该说恰逢

就是深度学习的一个变革期

是13、14年的时候

曼琪:13、14年的时候

对吧

田渊栋:因为13年的时候

我加入了Google无人车

当时一开始呢

应该说比较兴奋的

对 因为一个是

这个方向本身是一个

比较大的事业

对 大家会觉得

哇 无人车这个方向

以后可能会很火

曼琪:而且那也很早期

田渊栋:无人车很早期的时候

对吧

但是呢 就是

但是我也有想法

因为当时我也知道

深度学习已经开始起来了

当时我其实非常希望

能够在无人车

那一步做深度学习这个工作

比如说你用深度学习

这个算法来训练一些

无人车的一些分类器啊

什么的

但是很可惜

在那个时候

一个是我没有这个

没有这个资源做这件事情

因为当时资源很有限

当时GPU也很少

因为像现在说

这些资源都会分给一些

比如说比较senior的人

他们先去用它

那像我们这样的人呢

就相对来说

只能做些打杂的工作

打杂的工作可能

我能看到它没有

对我来说

没有什么职业发展的

一个前途

曼琪:所以13、14年

你入行的那会儿

它和现在不一样的一个氛围

是说那个时候

那个时候年轻人

没有那么受追捧是吗

田渊栋:因为还是一个

比较论资排辈的过程嘛

对吧

因为谷歌内部

还是有很清楚一个级别

上的一个分界

就是说级别很高

比如说当时说

我们当时组里面

有个级别7的人

那么7级的人

他就能获得一些

比较好的一个自由度

他能够可以用

比如说做深度学习

用深度学习来

训练一些模型

但我刚进去的时候

级别是4

那么对4级别的人来说

他只能做一些打杂的工作

曼琪:你觉得在那个技术阶段

就是当时的环境下

级别高的人

他和级别低的人

谁更了解

正在变化的

深度学习的浪潮

田渊栋:实际上

其实那个时候

应该说

年轻人还是比较容易接受的

但是很多时候

不是说是学习上的

那个区别

而是概念上的区别

就是很多高级别的人

或者很多就是很老的

比较资深的人

他们拒绝学习

深度学习

曼琪:为什么呢

田渊栋:是因为他们一下意识

觉得这东西不行

或者东西效果不好

或者说这东西有很多猫腻

就是这样的一个想法

那么要等到

就是两三年之后

慢慢人

他们待会开始

意识到

这东西是个变革

然后这次大模型出来之后

一个思想不一样

还是存在的

还有一个

另外一个维度

就是说年轻人动得很快

年轻人愿意熬夜

年轻人愿意把事情做成

很多时候

也不问任何的想法

我就说

我干就完了

那么

那大模型

确实需要很多

hand on的人

因为没有hand on的能力的话

你就没有办法

知道大模型的很多问题

曼琪:那回到

当时你说在Google

做无人驾驶的工程师

你觉得有点无聊了

田渊栋:对

就是一开始新年进

过去之后

你会觉得

工作做的东西

可能对我职业发展

没有什么太大

它有利的地方

我当时是要做一些

就是紧急车上的检测

就这样的一个问题

因为这个问题本身

一个是它是小样的问题

样的非常少

然后少到

就是说

你连个分裂器

都训练不出来

你肯定需要

就是手工写

写规则

那样的话

我觉得做下去

没有什么前途

曼琪:确实这个行业

后面有很长时间

就是很多东西

就是手动写的

如被写的东西

田渊栋:是的

对

就是当时我对这个行业的判断

也是对的

因为这个行业

一个问题是

它要不就是成功

要不就是完全不成功

它没有中间状态

就是如果这个

在车上

在路上是

有风险的话

大家就不会用它

那么你就必须得

一直做这做

做到最后

就是产生那个

无风险

就是比人更强

才能大规模上路

所以这个其实

是很大的问题

曼琪:所以13C年的时候

你就看到说

它其实可能很晚

才会落定

田渊栋:对

因为我已经感觉到了

就是它有很多

Cone Case要修

然后Cone Case的修法呢

应该说是一个

非常漫长的过程

曼琪:那在1516年的时候

就比如说你看到马斯克

包括当时

Google后来

成立的Waymo的一些leader

田渊栋:我其实就是在Waymo

我就是在Waymo

Google SC后来

就是在Waymo

曼琪:对

其实他们都有一些

很乐观的宣言

就比如说什么16年

这个车就可以上路的

田渊栋:这个我已经

当时我已经已经

应该是已经免疫了吧

因为他们每次都这么说

永远是还有五年

就是特别是

当时2011年

听说这个事

就说有五年

然后等到我进去

2013年时候还有五年

然后现在

可能还是要需要五年

曼琪:现在在周星山

在LA已经在路上跑了

田渊栋:对

曼琪:那你后来去MetaFair

因为你之前在Google X的

那个经历

是更偏工程吗

去Fair是更偏研究

这一步跨的难吗

田渊栋:其实应该说不难

应该说是

其实我在Fair的前几年

还是偏工程的

曼琪:对

田渊栋:我们当时做围棋

曼琪:对

田渊栋:围棋的时候

我很多时候

也是我自己搭工程项目

从头到尾搭一些

比如搭这个

Montacaros Tree Search

搭这个系统

分布式的

Air reinforcement系统

这都是我自己搭的

所以这个很工程

就当时以至于被人

就是说

当时我记得

就是当时给我的评价

还是说

就是你觉得这个人太工程了

不像一个研究员

别人开

打开电脑全是那个文章

我打开电脑全是代码

当时有这样的一个评价

那么当然

后来我在2018年

19年做了

我们的那个

就Open Go之后

就是那个是

当时战胜韩国的

专业棋手

曼琪:对

田渊栋:当时打给他们

个20比0

所以做了这之后呢

其实我后来

就更偏研究一点

当时慢慢

应该说从2019年开始

到2022年

慢慢形成了

自己的一些Taste

曼琪:对

田渊栋:就是我有感觉上

我知道怎么做这事情

曼琪:这个事情是不是

你之前就是比较工程化

然后写很多代码的经验

也是有帮助的

就后面的一些Taste

田渊栋:对

当时看起来帮助不是很大

因为是不一样的

就是你会明显感觉到

就是那个写代码

和你这个做这个研究

它其实不然是不一样的东西

曼琪:那现在咯

田渊栋:现在再回头看

现在还是不一样

现在还是不一样

曼琪:因为就我们最开始聊的时候

你不是提到说

在去年八九月的时候

秋天的时候

因为你一边又很汗糟

然后你又有做研究

其实你有些问题意识

田渊栋:对

曼琪:所以其实让你能更快地感受到

就是这个加速的研究的循环

在到来的

田渊栋:对

对

是的

曼琪:我觉得这和你当年

就是有比较多的

一手的写代码的经验有关系

田渊栋:对

就是应该说

就是就算在2022

2019年之后

我还是会有很多的

写一手代码

就是说你会发现

我每年还是有

至少一篇的一作文章

当然就很多这样的文章

很多还是偏理论的

但是呢

就是至少还是会有

一个一手的感觉

这问题怎么做

这问题怎么做

就是说

不会说是

就是方法而谈

因为如果很多人

如果有一个研究员

他一直是做最后一作

或者做那种

就是高层的

这个思考的这样的角色呢

他很多问题就是

他会慢慢地

把所有的精度

花在高层思考上

他不会去想

这件事情怎么完成

那么这样的话呢

他就会把很多的

难的问题

和比较难的问题

和非常难的问题

混在一起

就他没有一个

特别清楚的思路

说这些问题怎么做

这是一个比较大的问题

曼琪:为什么不做实现

不做完成

就会把你刚刚说的

不同难度等级的问题

混在一起

田渊栋:因为就是说

如果你不做实现

不做完成的话

那你就会

不记得去思考

这个问题本身

要怎么做

因为更多的问题是

因为有两类研究员

有一类研究员说

OK 我只看方向

这个方向我很重要

我就把我去指的方向

但是指完这方向之后呢

他不会想太多

这个方向是怎么做出来的

这个问题

可能会交给下面的人去做

那么对研究员来说

他只要把方向指出来

就可以了

所以这个逻辑

是不一样的

比较接地气的人来

研究员对他们来说呢

他就指方向

然后同时给大家指出来

就是这个方向

为达这个目的

你必须走12345

然后把这些东西拼起来之后

得到这个方向

对吧

曼琪:你觉得这两类研究员里面

都有非常好的研究员

还是你觉得

田渊栋:都有非常好的研究员

都有

曼琪:对

可以分别举一个例子吗

比如说你比较respect

或者你比较欣赏的

两类的研究员

都有哪些

田渊栋:你比如说前面那一类吧

比如说像一样吧

对吧

曼琪:乐坤

乐坤这样的

田渊栋:乐坤是说OK

比如他说他想要做的是

Safe Super Learning

Safe Super Learning

就是说就是自建路学系

那么自建路学系

有很多细节

对吧

你很多东西要去尝试

但看到有个点很重要

就是数据的那个样本

是他的特别是有监督的样本

是很少的

非常少

那么所以他当时不是画了一个

就是一个经典蛋糕吗

就是说所以就是

当时他把reinforcement

放在最上面

因为reinforcement

他的眼睛里面呢

他就reinforcement

他的反馈非常非常少

曼琪:强化学系

田渊栋:非常少

所以他不觉得这东西有前途

他觉得有前途

是自建路学系

为什么呢

因为自建路学系的反馈

非常非常多

这个本身是有道理的

但他不会去想

就是这件事情

这个监督和反馈

究竟是怎么样

让这个模型学出来的

这个问题他不会去想

就是说监督多多监督少

监督少一定比监督多要差

监督多的话

这个模型会更快

他抓住这一点不放

他就会

他坚持到底的话呢

他就会

他就会让大家觉得

嗯 这个东西有道理

然后他就会做到他

那么确实自动学系

在那个

在之后是有很大的那个用处

甚至你可以说

GPT的整个训练过程

也是自动学的一部分

因为他预测下一个词嘛

就是自监督嘛

所以就是说

就是说方向上

就是说他指的好的话呢

确实有很多人可以破了他

曼琪:所以就是第一类研究员的优秀的典型是

他能去提一个问题

提一个好的问题

田渊栋:提好的问题

然后抓住好的点

开一个好的坑

对吧

曼琪:对好的坑

田渊栋:对 这个方向是可以做的

那么提出这样的一个思路

就是就是可以的

还有比如说就是像我们这边以前特点的coconet

曼琪:嗯

田渊栋:这个东西其实应该说也是一个第一类问题

一个一个一个一个一个一个一个一个一个一个一个

就是说可能很多人再跑过来说啊这个东西并不怎么work

或者说那个有很多需要很多的这些训练去解决

但是这要指出一个方向说我们

是不是会用那个影红间的那个头肯来学习

曼琪:对 latent reason

田渊栋:不是说是用语言来学习

那么这个本身的提法能够让大家觉得这个方向可以做

那么具体怎么做的

那么很多人在做

那么这也是一种第一类研究员这种这种视角

那么第二类研究员的视角就是说

我不仅要知道做什么

还要怎么做

那么这就是就是我这很多工作是这样子

就是我们要去把机制剪刮出来

找到它的这个路径

在路径上能把事情做成

曼琪:你觉得像伊利亚和达瑞尔他们属于哪一种

田渊栋:伊利亚应该都属于第一类的

都属于第一类

对他们就是说特别是伊利亚

他对于Skin Law有一种就是应该说是执念吧

或者说有非常非常宗教般的信仰

他让大家觉得就是你别想太多了

你就是scale scale scale scale

然后你有时间把工程为你做好

然后把事情做成了

然后我们就把数据放进去然后训练出来

曼琪:我看他去年底技术采访的时候

他倒是有说过他觉得房间里的所有

scale已经到头了吗

田渊栋:对有点类似吧

他就说房间里所有的空气都被scale给吸走了

曼琪:对

他觉得应该去研究点别的

田渊栋:对对对

这当然是这个意思

我非常同意

对吧

非常同意这一点

对因为他之前的scale scale

他这波红利已经差不多吃完了

对吧

因为不管怎么样任何一个研究方向

他都是有底的

就不是说是你可以一直scale下去的

他当时在正确时间是正确的那个地方

其实正确的一个想法

并且让很多人去执行他

然后成功了

又本来成功了

对吧

非常非常成功的一个方向

但不可能他这一辈子都是吃这个方向的

这应该说这跟以前不一样了

因为以前可能一个物理学家

一个方向可以吃到他退休

那么现在这个进行展是非常快的

可能很快的就大家把事情做成了

那么他就必须想别的东西

曼琪:所以你刚刚说的这个红利就吃到了

是指的作为研究来说

可能已经就已经不在研究的阶段了

但是一个实现就

田渊栋:不是应该说不仅是研究

而且实现他都已经吃到了

然后接下来就是说你可以继续吃

但是他作为他作为一个startup的那个CEO

对吧

他也没办法再去seal这个事情

为什么呢

因为对startup来说

你基于skill不是他的长项

如果就现在你和Google都已经skill

然后真的open AI都快skill了

那么在这种情况下

你的startup就非常不同

曼琪:或者说反过来说

是你确实看到了什么事

不一样的事

你才应该去做一个startup

你才应该去创业

田渊栋:对对对

否则就是你要说

如果你非常相信skill

那你就应该在大厂

曼琪:对你去Srp或open AI

田渊栋:对对对对

就是其实在Meta的最后阶段

因为那个整个公司

也有比较多的动荡

曼琪:然后整个AI组织

也有比较多的变化

Meta自己的模型

也经历了LLaMA开源

本身开始口碑比较好

然后后面又出现问题的过程

这个过程

你有一些什么组织层面

或者说怎么做好研究的总结

田渊栋:我觉得其实应该说

是不是这样

就是大公司

因为现在这一波AI

都是反大厂的

什么反大厂

就是大厂里面

所有的incentive

所有的职级

然后所有的

就是人和人之间的关系

或者说所有的那些

那些岗位

调配和设计

都是跟现在AI的方向背道而驰

应该这么说

所以你会发现

一个组织越来越臃肿

越来越大

那么它对应的AI的进展会越来越慢

为什么呢

就是刚才我说了

AI非常需要

或者现在大模型

非常需要人去hands-on

就是知道

我真的去用它

真的去感受它

真的去发现它的问题

你就会很好的知道

它应该怎么去

跟我们的概念不一样的地方

然后很快地把这事情做成

一旦产生了经理和执行者

二级架构之后

这个速度就变慢了

就跟刚才说的是一样的

就是导师和学生

一旦有这样二级关系

整个进展的速度就会变慢

因为导师没有办法

就是去了解学生100%做的东西

然后学生也不一定理解

100%导师的想法

人际沟通速度

因为是最慢的

对不对

所以就这样

那么大厂有这个问题

而且大厂很多时候

就是特别是中层管理

他们的目标

不是为了让项目做成

很多时候的目标

还是为了让自己

能够过得更好

曼琪:那大厂里的小团队

能独善其身吗

比如说新组建的TBD

Meta的TBD

它人数其实相对少

没有那么多人

田渊栋:其实可以

但是就是也要看

但是一旦这个组

一旦变大了

一旦有很多人

有职级

有中层管理的时候

有问题

曼琪:你觉得多大算大

田渊栋:就你看就是以前

LLaMA 4和xAI

都是超过150人之后

就开始不行

曼琪:超过150人就不行

田渊栋:对

所以150人

就是说

从人类组织学上来说

150人是一个临界点

就是再往上的话

人和人之间的关系

就不一样了

就是以前是

比如说你一个30人、40人小团队

每个人都认识每个人

那么人和人之间

关系是非常简单的

但一旦人变多了之后

就会有问题

就是因为

人和人之间

不再相互认识

这个时候一般是通过

就是组织架构

然后用组织架构

去获取这些知识

然后汇报给上面

曼琪:只要它核心的那部分

保持在

你说的这个量级

对吧

其实像Anthropic和OpenAI

人都挺多了

OpenAI有7000多人

田渊栋:对

但是就是OpenAI

做模型的人

其实也不是很多

最重要的是

做模型的人

曼琪:对吧

有没有很小的团队

就像Claude Code的

之前团队很小

就它核心的那一部分

是收缩的是精干的

田渊栋:对

曼琪:那你们接下来

肯定也是在一定时间里

是会比较精干的

一个团队

田渊栋:对

我们不会招太多人

曼琪:最近会有人在

Frontier Lab

和你们之间

选择你们吗

田渊栋:其实有一些人

还是从Frontier Lab

对我们有兴趣的

曼琪:就你们在聊

或者有的

已经加入了

田渊栋:对

曼琪:但是你们创始人里面

很多是本来就认识的

如果总结一下的话

就你过去的

这么多经历

给你带来的直觉

判断

还有技术上的品味

是什么

你的偏好是什么

田渊栋:偏好我还是喜欢美的东西

对吧

我觉得我本质上来说

应该算是一个

喜欢数学的人

曼琪:喜欢数学

田渊栋:对

就是我喜欢各种

精巧的结构

喜欢美的东西

应该是这样子一个

但是同时呢

另外一方面呢

就是也是意识到

这种偏好的

一个局限性

这样的一个人

就是一方面

我可能是个工程师

我会做很多

工程上的东西

另外一方面呢

我本质上来说

我追求美的一个人

对吧

但是追求美

但同时又

知道美的局限

曼琪:这个局限展开来说

是什么

你做工程师

是你认知到

这种局限之后

你试图去

弥补这个局限的

一种方式吗

田渊栋:对

就是说应该这么说

就是理想和现实之间的碰撞

对理想来说

我们希望找到

很美的东西

但是世界上不是这样子的

所以你要不停提醒自己

就是说很多时候

你不能陷到美的

这个幻觉里面去

你要做一些事情

就是可能对

大家都有用

然后对世界都有用

或者说对公司都有用

不是很美的

但是同时在

这个条件下

还是要去追求美

曼琪:你觉得像RSI

这个方法

它第一步是在AI

然后后面是自然科学

这是大家能看到的

那它再往下

它能进入

你说的这种

更复杂的世界吗

比如说它有可能

去这么改良

社会科学的一些

理解和认知吗

田渊栋:我觉得这是有可能的吧

但是应该说

我对社会科学认知

也不是很多

所以我很难

给任何建议

曼琪:因为社会科学

反正至少在以前的

学科分类里

它也是把它

算成了Science一种

比如像经济学

里面其实有很多

统计的东西

有很多数据的东西

田渊栋:是的

因为这里面就是说

这跟自然科学的

很大不同的地方是

自然科学本身是

默认这个信息

是完全透明的

但经济很多时候

是有反身性的

就是我把这句话

说出来

这句话就不灵了

对吧

所以这个事情

也很难讲

所以我觉得

我们这个问题

还是很大的问题

曼琪:你刚才也提到

就是以前的一些科学家

比如说物理学家

他一个领域

可能会研究一辈子

然后现在因为

整个技术变化得很快

很多事情

你不是能一直做到头的

你能预见到说

自己在这个旅程之后

你接下来想探索的东西是什么

一个是说RSI

什么时候

可能到你设想的

比较成熟状态

一个是你再往后

你想探索什么

田渊栋:我觉得现在我们

还是先把RSI做好吧

对

我们不会考虑其他问题

曼琪:那今天非常感谢

田渊栋作客

晚点聊

分享了RSI

这个在去年

下半年

你们开始

组建公司的时候

还没有那么多人讨论

但到了今年的四五月

已经成为硅谷的

一个相对共识性的

热门话题的领域

然后我们也回顾了说从

十年前就有一些相似的尝试

到现在RSI

有了什么变化

以及各个主要的

公司的进展

尤其是

你们刚刚在六月初

发布的

你们的第一阶段的成果

那今天节目就到这

拜拜

田渊栋:谢谢

曼琪:本期晚点呈现

讲一讲

最近几期节目里

关于RSI的一些

共同讨论

这段时间

AI研究自动化

和自进化这个方向

让我想到

李白的一句诗

脚着谢公屐

身登青云梯

正是穿着谢公屐

李白在梦中

忽然就来到了天界

看到仙之人

怳列如麻

这双谢公屐

无疑就是

模型的coding能力

在171期

和Henry聊

二季度AI季报时

那期的标题就是

从coding到RSI

强者愈强的未来

问号

另一期较多展开RSI的

就是上一期节目

177期

详解Kimi K1.5 / K3

K3的技术报告里就提到

Kimi用K3的早期checkpoint

就是他们早期的大模型版本

已经能做kernel的优化

也就是这期里田渊栋提到的

算子优化

RSI这家公司

今年6月发的第一批成果里面

有一个就是在

英伟达今年刚推出的

SOL Exact Bench上

取得了SOTA结果

这个Bench就是用来测试

算子优化能力的

在K3那期节目里

我们还聊到了

田渊栋所在的

RSI这家公司去测的

另一个Bench

就是GPT Speedrun

这是Muon这个优化器的开发者

Jordan Keller

两年多前发起的一个项目

之前主要是人在做

而现在越来越多是变成

AI和大模型来做

我们当时也讨论了

一个小小的畅想

其实AI也非常适合

来自动化地优化优化器本身

这三期节目里的一些

共同观察都指向一个事实

就是在一些具体的

模型训练任务上

RSI已经发生

而这主要是因为

模型的coding能力大幅提升

这自然带来了一个推演

就是目前掌握最强coding能力

公司的Anthropic和OpenAI

是不是会更快地进入RSI

也更快地进入一个

加速度越来越快的状态

而把其他对手越甩越远

田渊栋在这期节目里

讨论了另一种可能性

那就是智能提升的曲线

是会有台阶的

会有阶段性的平台期

而不一定是渐进式的

也就是说

曲线不一定是平滑向上的

如果是后者的话

那确实绝大部分机会

都会在现在已经最强的

公司的这一边

但如果Scaling Law

再往前推进

不管是在技术和理论上

还是在一些其他现实限制上

比如能源和算力上

会有束缚

那么就可能需要新方法的加入

而原创性的想法

现在还不是靠

越来越长的coding

就能马上解决的

它至少是一个变量

你会更相信哪种未来呢

本期节目就到这里