178: 与田渊栋聊 RSI:模型自进化如何到来?
【嘉宾】这时候我觉得,也许五年之后我就被取代了。那么这个时间可能已经快到了,那么在这种情况下,与其自己被取代,不如我就开公司。
【嘉宾】RSI非常需要coding和agentic的能力,然后这两个能力本身其实对这些前沿的模型公司来说,它已经是它的主项。我觉得RSI比coding agent要大得多,然后它的难度、可能的路径比现在coding agent要大得很多。
【主持人】所以你觉得就光有这个支点,其实不见得你就能做好RSI。你觉得有生之年会看到图灵奖颁给一个系统吗?
【嘉宾】我觉得如果到那个时候可能图灵奖也不是很重要了。我可能算少数派吧,就是因为大部分人可能已经觉得绝望了。但是我觉得不是这样子,我觉得一定是有一个好的分层,能够让这个模型运转起来。我觉得它以后终将变成科学。
【主持人】欢迎收听晚点聊,我是曼琪。在第171期节目二季度AI季报中,我们重点聊了RSI的递归自进化。那之后不久的6月底,我采访了从去年开始就在这个方向探索的创业者之一田园。他参与创立的Recursive Superintelligence的缩写也是RSI,这家公司的估值目前已超过46亿美元。这期节目录制时还没有发生一些后续的事件,比如OpenAI一举解决了10个数学难题,TML的联创之一翁荔重新回到OpenAI,报道他将探索的方向就是RSI。关于RSI有一个极有诱惑力也十分危险的假设,就是率先达到这个状态的公司会把其他人越甩越远。这个推演成立吗?我们进入本期节目吧。
【嘉宾】这时候我觉得也许5年之后我就被取代了,那么这个时间可能已经快到了。那么在这种情况下,与其自己被取代,不如我就开公司。
【嘉宾】RSI非常需要coding和agentic的能力,然后这两个能力本身其实对这些前沿的模型公司来说,它已经是它的主项。我觉得RSI比coding agent要大得多,然后它的难度、可能的路径比现在coding agent要大得很多。
【主持人】所以你觉得就光有这个支点,其实不见得你就能做好RSI。你觉得有生之年会看到图灵奖颁给一个系统吗?
【嘉宾】我觉得如果到那个时候可能图灵奖也不重要了。我可能算少数派吧,就是因为大部分人可能已经觉得绝望了。但是我觉得不是这样子,我觉得一定是有一个好的principle,能够让这个模型运转起来。我觉得它以后终将变成科学。
【主持人】欢迎收听晚点聊,我是曼琪。今天的嘉宾是Recursive Superintelligence的联创田园。这家公司在经过四个月的隐身研发之后,刚刚于6月初官宣A轮融资6.5亿美元,估值来到46.5亿美元。他们做的事和公司的名字缩写一样,RSI,recursive self-improvement,递归自进化。这是一个去年还相对小众,而到今年二季度被硅谷频繁讨论的热门前瞻方向。Anthropic刚在6月初发布了文章"When AI Betters Itself",副标题就是我们在RSI方向上的进展和探索。OpenAI也再次明确了时间表,说在今年9月要做出AI研究实习生,在28年3月之前要实现真正自动化的AI研究员。我们和田园一起聊了RSI是什么,为什么这个领域在现在变得火热,以及他们在6月中旬刚刚释放的第一阶段的具体成果。还有那个关于RSI有诱惑力也十分危险的假设,率先达到这状态的公司会把其他人甩得越来越远。这个逻辑成立吗?我们正式进入本期节目吧。
【主持人】终于见到田老师了,之前我们都是在线上聊的,然后上次采访是去年5月嘛,当时我们聊的是你的科幻小说《破晓之中》。然后这次再聊我觉得是科幻已经照进现实,因为这期间有一个表达的变化,就是你和很多其他的顶尖研究员一起创立了Recursive Superintelligence这家公司。然后你们在做的一些事也跟你当时的科幻设想,我觉得有一些契合的地方。你可以先和我们的观众简单地用几句话介绍一下这家新的公司是做什么呢?
【嘉宾】对,这家公司叫Recursive Superintelligence,它的目的就是说能不能找到一种AI来自我进化、自我迭代的方法,然后找到新的模式、新的发展范式、新的模型、新的训练的逻辑,然后得到更好的AI,是这样的一个逻辑。
【主持人】对,因为你们的名字Recursive就是递归的这个意思,然后它加上Super Intelligence的缩写是RSI,和现在硅谷讨论特别多的一个概念,它也叫RSI是一样的。那个是Recursive Self-Improvement,就是递归自进化。
【嘉宾】对,其实我们这个Recursive Superintelligence意思也就是Recursive Self-Improvement,所以意思上来说是非常接近的。因为这个概念应该说从今年的4、5月份开始慢慢变得比较火,我们在成立公司的时候应该说大部分人还没有想过这个概念。但是随着大家的意识和思考,慢慢慢慢成为一个共识,大家发现这个模型已经比较厉害了,那个模型能够发现一些模型自己的一些问题。那通过这方式其实可以存在一种可能性,就是用AI找到对AI自己的模型的问题,然后让AI迭代这个模型变得越来越强。
【主持人】我觉得正好也可以讲讲这个背景,RSI也是我想和您深入讨论的一个话题。也就像你说的最近这一段时间,我觉得它越来越成为一个相对共识性的趋势了。然后另一方面就是RSI其实这个想法本身并不是那么新,它之前也一直都有,为什么最近这段时间发生了什么变化或者什么因素?
【嘉宾】我觉得主要一个还是因为coding agent变强,另外就是说模型本身的能力也在提升,模型能力提升到一定程度之后,就是模型对AI自己的模型的认知有了一些比较强的突破了之后,你可以用模型来充当研究员,让它来找到现在模型的弱点,然后去做更好的优化。那么这样的话,这个闭环就会产生,产生了闭环之后,那么下一次模型变得更强。
【主持人】所以递归就是循环往前推进的意思?
【嘉宾】对,对,对,但是这个要求条件是模型本身已经足够强,所以模型不够强的话,这个很难。
【主持人】其实去年5月我们聊的时候,我们当时顺着科幻小说是延展讨论了一个话题,AI会不会取代顶尖的AI研究员?当时你觉得这个短期内是比较难的,因为AI研究员他可以从少量的数据里面就获得一些精准而细节的联系。
【嘉宾】对,对。
【主持人】但是大模型,至少当时的大模型,它还是要学很多大量复杂的数据,然后通过统计得到一种表达。那到后来年底的时候,因为11月我们当时也就是在聊了一下嘛,那会儿就已经在筹备这个新的公司了。所以这个过程中间是你本身自己的思路是有了一些什么变化吗?
【嘉宾】原来第一点我还是现在还是认为大模型还是替代不了顶尖研究员,目前还是不行。只是说是模型的能力已经到了一定程度之后,你就觉得它确实可以用模型来做一些研究的工作,我觉得这个是重要的。而且存在一种可能性,就是模型会变得越来越强,然后最终产生更好的、更强的能力,这个是可能的。
【嘉宾】其中一个契机的就是说,应该说在5月份之后,大概在8月份的时候,我用当时GPT-5,对吧?我和GPT-5合作做了一篇文章,对,就是最近的一篇关于glitching的一些文章。那篇文章呢,我在做完之后期就意识到这一点,就是模型的能力已经基本上强到让我觉得我可以不用招博士生的水平。因为有很多的想法和思路完全可以通过我跟模型对话来实现。通过这个方式呢,我可以给模型一些具体的细节,一些比较细的方向,去找到新的想法、新的思路、证明新的定理。然后我这边可以写代码,可以做一些实验,然后把东西做出来。那么现在写代码都不用人了,对吧?写代码都可以让模型来做。所以应该说这个loop就开始有转起来的趋势。这个时候我觉得,也许5年之后我就被取代了,那么这个时间可能已经快到了,那么在这个情况下,与其自己被取代,不如我就开公司,然后我就做这个事情去。
【主持人】所以去年8月你看到这个迹象之后,首先我想知道当时这种想法有多少人有,因为你说到今年4、5月越来越多人讨论吗?
【嘉宾】对。
【主持人】在去年可能差不多大半年前是什么样的一个情况,以及后来你怎么找到一些跟你想法比较相似的人一起来做这个公司?
【嘉宾】我觉得是这样,就是这个事情你不亲手实验、亲身去体验是感觉不到的,对吧?就是如果你并不把这个模型当成一个实习生,或者把模型就当成一个聊天对象的话,你是感觉不到这个变化。所以要等到就是你把模型真的当成一个聊天的对象,然后可以跟它去合作,可以跟它去做一篇文章的时候,把文章做完了,因为觉得这个模型确实能力已经比我想象的要高很多。
【主持人】就你的意思是可能回到那个时间,这么做的人并不见得有很多?就现在我们已经见到这样的一个情况吗?
【嘉宾】就是说有一些人,就比如说特别是那些比较senior的人,他们一般来说不会去思考太细节的东西,对吧?就是他们可能会考虑一些比较high-level的,比较高层次的一些想法和建议,对吧?不会真的把模型拿过来,就做一个非常具体的项目。但另外一方面呢,就是一些比较刚从学校毕业的一些学生,可能把模型作为一些执行上的工具,不会去做一些比较难的问题。所以这样两边其实是有一个gap在里面的。
【主持人】这个也cue到了我们上次聊的旧话题。因为当时我们聊到了你有哪几年有在写年终总结吗?有一年,我记得应该是二、三年的时候那种总结,好像说的一些就是你觉得怎么带团队的一些经验。到了后面一年,其实你就变了,你说的就是你想更hands-on。因为其实大模型就当有一段时间之内,就是你会发现你不hands-on的话,你没有办法去真的知道模型内部发生了什么,然后整个系统发生了什么。你不知道这些东西的时候,你指挥的方向就会出现偏差,那么这偏差的方向其实很难得到反馈,因为在传统的研究过程中,一般来说是一个比较资深的导师,可能跟学生们说我们要做一个方向。然后这个导师本身可能不会真的去敲代码,不会真的跑数据,但是让学生们真的去做这事情。让学生把这事情做完之后,然后反馈给导师,说这个事情是对的还是不对的。有时候学生跟老师说这个事情没做好,这个事情不OK。为什么不OK?是因为有一二三四五这种困难。导师会说我这idea一定是对的,然后去让学生继续去挖掘。总有两种可能,一种可能就是说学生发现了导师说的是对的,然后把事情做成了。另一种可能是导师的想法其实并不对,但是学生证明这件事情是不对的。
【嘉宾】然后找到下一个方向继续做。一般来说这个逻辑本身是,应该说至少要有几个月的时间,这个也是一般一个科研项目的周期,这也是一个loop。但是这个loop的问题是,导师不直接跟具体的实验打交道。那么这样的话,导师从跟学生讨论,然后给学生一些指导,然后学生把指导做出来,然后得到反馈之后,跟导师汇报这个过程,一般来说你知道需要几天的时间,有一个数字,就是意味着大家是以天为周期,进行这个问题的科研探索,就是说你可能需要几周,甚至几个月才能把事情做成。但是现在有AI之后,应该说特别是有非常强的AI之后,这个时间被压缩到几分钟,甚至更短的时间。
【主持人】你就说验证一次的循环?
【嘉宾】对对对,验证一次,比如说几小时到几分钟时间,就是特别对一些比较简单的项目来说,就是很多时候你有一个想法之后,你告诉AI很快地把代码写出来,然后跑完之后告诉你这个结果,很多时候就是也许你写完之后,出去喝个水,喝茶,然后跟别人聊两句,或者开个会,开完会之后,你结果就有了,结果有了之后,那你就可以看到自己的问题在哪里,然后可以有下一步的循环。
【主持人】就是你在描述你最开始看到RSI的这个方向和情境的时候,就让我想到稍微岔开一点的一个问题,就是什么样的人,他能最早地去看到这个信号。所以你描述的是,又有比较多的经验,他对什么问题是难的、什么是重要的有判断,同时在那个时间点,他又是非常亲手地在做一些事。
【嘉宾】是的是,这样的人是容易敏感地感觉到当前风向的变化。所以这个人有可能也不是特别年轻,他和现在AI趋势里面,因为现在会有一种观念,会觉得说你特别年轻,你来什么东西你都可以很快地学习了,然后以前的一些经验,可能是负经验,是没有那么有用的,还不太一样。
【主持人】对,可能不太一样。因为我觉得以前是因为,在Coding Agent还没有普及之前,或者还没有达到人类能力之前,年轻人很有市场的一个原因,主要还是因为年轻人他的精力比较足,然后决策、执行能力很快,很多时候其实别想太多,就是说我上来就该干,干就完了,基本上我应该觉得过去的十年里面都是这样子。对,就是从大语言模型出来之后,基本上年轻人很多时候是有这样的优势,因为并不需要想太多,我们就skill up,skill,skill,skill,然后就完了,非常简单的事情。所以通过这个方式,其实应该说大语言模型得以快速发展。
【嘉宾】所以你觉得RSI这个风潮来了之后,反而是可以让以往的一些经验积累,包括你沉淀的各种直觉判断,或者说技术品位有更好的发挥的?
【主持人】对的,我觉得是的。那天平又会摆到,就是怎么说,更有经验更年长的一些人身上。
【嘉宾】对,有可能是这样子,就可能是这样。当然了,这个也是有很多的争议的,这个只是我的一个观点,因为确实现在好的年轻人来了之后,有很多就是以前从来不写代码的,或者说已经当了十年的经理,或者总监的人,突然开始写代码了,他们就觉得这个爷的青春又回来了。对,所以其实有很多的人会有这种感觉,因为可能以前有想法,但是没有时间去实现,然后团队也没有时间和精力,去完成上面的人的每个想法和思路。这样的话,其实这些人的经验,其实很难被发挥出来,但是现在有AI Agent之后,应该说这个变化发生,比方发生变化,以前可能需要人去执行,那么现在执行的重任,现在落在了AI身上,然后人更多的是判断,然后逻辑上的一个指导,还有大方向的把握,还有研究的品位,这些东西是重要的。
【主持人】回到RSI这个主题,其实像十年前Google做的一个工作,AutoML,它也有一个类似的想法,就是它也是在用AI去优化AI。你觉得现在的RSI和十多年前的像AutoML,
【嘉宾】类似的尝试是之前做过的事情吗?我觉得区别其实很大了,因为我们上一波也是做过了,对,我有很多文章也是做Architecture Search,架构搜索,还有文章比如说做AI Guided Optimization,AI Guided Design,AI辅助设计这些方向。所以我觉得上一波的问题主要在于我们没有一个模型能够借鉴人类的高层的知识、高层的思路,这个是没有的。上一代的时候,很多时候是让研究员来定义搜索空间的大小、搜索空间的行为,然后让AI作出一个算法去找到更好的解。当然现在因为这一波大语言模型来了之后,它能到这个程度,让模型本身对AI本身,或者对架构本身是有理解的,这个理解可以部分代替人类的一些定义问题的工作。这样的话,解空间变得非常大,而且应该说比较智能,不像以前你需要人去定义这个解空间。
【主持人】但它的一个区别是在于人参与的多少的变化吗?
【嘉宾】是的。以前可能说人需要深度参与定义解空间的每个细节,然后AI比较笨,只有在这个空间里面去搜索;但是现在更大的问题是,怎么样最大限度发挥这个AI的能力,能让它自己找到解空间的结构,自己找到这个解空间的一个比较好的方法去解它,这个是可能更重要的一个事情。
【主持人】您说到这个,也涉及到对self-play的理解和定义,因为很多时候大家提起self-play,比如说OpenAI也会说他们自己叫做AI Intern,然后说到28年3月要只限真正的自动化的AI研究员,它都是和自动化联系在一起的,它好像都是指向说把人从这个loop里给解放出来。但是另一方面,就是自规自进化,它自规的这一部分,我理解它又是有一个循环上升的这个意思。所以你觉得这两个东西,就是自规和人不在这个loop里面,它是一件事是一起发生的,还是它会有一点区别?
【嘉宾】我觉得完全自动化不一定很快会发生,我觉得自动化的程度很多时候是因为看人在上面会做什么的工作,而且做的工作它层级是什么程度,这是最重要的。因为就比如说你现在有AI了之后,有这个大语言模型之后,有些程度的工作其实不需要人去做了,但是更高一级的工作还是需要人去做,而且对更高一级的工作要求更高了。所以这个时候其实某程度来说,人是减少了实践,但是人可能需要更多脑力去做一些更高层次的工作,所以人还在这个loop里面,这个loop的level更高一点。
【主持人】所以你觉得自规是有可能会先发生的?
【嘉宾】我觉得自规会先发生,完全自动我觉得现在还看不到,就是跟我以前AI代替比较顶尖人类研究员的观点是一致的。
【主持人】那你觉得自规和自动化这两件事,哪个更重要?
【嘉宾】我觉得这个事情不存在重要不重要的问题,就是说一定会按照模型能力慢慢的发展,你肯定会发现完全自动是不行的,还是需要人的一些指导,那么这个时候自然就有自规的一个结构。
【主持人】因为讨论到这个问题,最近确实和很多人在聊这个概念,然后有一种观点就是觉得,自规这个事更重要是因为,你一旦这个循环跑到一定程度之后,掌握这些循环的组织,或者人,或者团队,它就有可能进入一个加速度,加速越来越快的阶段,然后它就会可能把别人就甩得越来越远,对吧,比如说Safe Superintelligence Inc(SSI)和OpenAI,也许就有这种可能性。
【嘉宾】对,是有这种可能性。因为就是模型可能会让自己变得越来越强,变得越来越强之后,这个模型能理解更深的东西,然后加来就会有更强的AI agent,AI scientist,
【主持人】那么有这之后,它会发现自己更大的问题,然后就可以调上去,但这个讲的更多是范式的一个转变,对吧,跟人在不在这个loop里面,其实关系不大。所以你也是觉得这个循环的加速本身是更本质?
【嘉宾】这是可能的,对。但是它在什么程度上可能,然后我们需要做到什么程度让AI变得很强才可能,这个事情还是需要做探索。
【主持人】最近这个方向很热闹。除了刚才我说到OpenAI,它们有一个时间比较久关于我怎么去产生真正自动的AI研究员的项目,但是它那个时候说得比较笼统。然后ISOPIC是在今年6月,它们发了一个长文,叫When AI Builds Itself,就是当AI来建造自己,以及这篇文章副标题,就是我们在RSI方向上的进展和时间。不知道你看了这篇文章没有?
【嘉宾】我没有,我大概看一下。其实就是应该说还是刚才我们聊的那个差不多的想法,就是AI能够让AI自我进化、自我迭代,然后越做越好。
【主持人】它里面讲了一些它们内部具体的一些进展。比如说它说4月的时候,Cloud的AI智能体端到端独立完成了一个开放式的AI安全研究,说它累计工作了800个小时,然后把一个Week2Strum的性能差距缩小了97%。如果是人来干的话是一周可以缩小23%。这好像更多是一个提效,这到了我们刚才说的递归自进化的程度吗?
【嘉宾】应该还没有吧。我其实看了一下这个博客,基本上还是提效。就是说你看它的具体的解法,就是找到一些各种各样的方案,让Week2Strum的设计能够做得更好。然后它有指标,通过这个方式把这个指标提上去,对吧。那么里面的这些方法应该说,比如说把里面的representation拿出来,然后做一些分析,然后想办法把这个模型做得更强,大概是这样的一个逻辑。但这些算法本身应该说还是比较常规的。它就是让它跑到很多常规的想法,把这些想法和速度放在一起,放在一起之后最后它的分数能够往上提。因为有分数之后你才能做自我进化,因为现在除了分数之外你没有其他办法能衡量这个模型现在能力有多强,就是说这个Self-improvement最后它的效果好不好,所以一定还是要靠分数。所以分数一般是具体提效,或者说提高速度,或者减少Latency这样的一个指标。所以这个应该说是自进化的一个第一层。
【主持人】所以你觉得在第一阶段,它确实就是这样展现的,拆解子任务,然后看子任务上AI自己是不是越来越好?
【嘉宾】是,是,是,这个是一般会这样子。
【主持人】你觉得SRPEAK和OpenLine它们理解的递归自进化,和你们有什么相同和区别?
【嘉宾】应该说大方向上都是差不多的,我不觉得有什么特别大的区别。可能有一些不一样的地方是,你讲SRPEAK那个文章对吧,它这么写的话基本上感觉上是有时候特别是在代码上有自进化这个能力。但是我觉得难点的地方是研究上的问题,就是AI Research这个方向,应该说跟代码之间还是有差距的。SRPEAK之前一些工作其实它们都是展示出来,就是如果对一个工程的项目,我们能不能让它自进化自动做好?比如说从头开始写一个Linux,或者从头开始写一个C的编译器。那么这些东西都是说应该说是有路径的,对吧。我们都知道怎么写,只是说这工作太繁杂、太繁重、太累了,然后很难去让人或让团队去把它写出来,但是这个问题本身是有章可循的。但是很多比较难的AI Research Problem,其实应该说人都不知道怎么做,有很多很难的……
【主持人】要突破性的进展,或者突破性的发现的东西,那么这东西其实应该说是现在AI还是很难做。除了最受关注的前沿梯队,就是OpenAI和Anthropic之外,这个领域现在也有一些新的公司尝试,就你们之外的。有一个是6月25日才刚刚官宣的叫Mirandell,然后他们种子轮融了两亿美元,这些团队应该是来自DeepMind和Anthropic。另外就是之前更早成立的Sakana AI,他们也是在6月刚刚成立了一个新的研究团队在东京。这些更多的尝试,一个是您觉得可能反映了行业的什么变化?一个是您从他们的一些表达里面看到了什么有意思的东西?
【嘉宾】我觉得他们基本上高层次来说还是一样的,就是做这个自我对弈方向,这方向上总应该说是比较接近的。
【主持人】像Mirandell那边,就是像Anthropic那个创始人们,应该说之前也跟我聊过,您说是更早之前在筹备创业的时候?
【嘉宾】对对对。
【主持人】也没有说找我,只是说是当时问我要不要来,或者说要不要去。
【嘉宾】那不就是找您吗?
【主持人】Anthropic看看,当时他还在Anthropic的时候,那会您从Meta可能要出来的时候,Anthropic也有一个邀约。
【嘉宾】对对对,就是聊聊吧,当时也聊过一次,对。后来就很有意思的是,后来他就走了,对。
【主持人】所以我之前也跟大家说,我说跟我聊过的那些人都跑路了,包括Anthropic就是他。所以现在你们看到了相同方向之后,你们都觉得出来做,重新来做一个,这个时候可能是更好的。
【嘉宾】我觉得是有可能会这种情况。因为一个是现在OpenAI和Anthropic其实已经算大公司了,有很多人在里面,对吧。
【主持人】现在没有OpenAI那么大吧?两三千人吧,差不多。
【嘉宾】但是还是应该说讲另外一方面,像这两家公司应该说现在都要冲这个IPO,对吧。那对他们来说最重要的是把手上的业务做好。手上的业务是什么?AGI,对吧。如果AGI能赚很多钱,能够让事情做得比较好的话,那他们可能会目标先把这个事情先做好,对吧。所以有可能他看到了这一点,所以觉得你还是自己出来比较好,因为AGI在这个方向毕竟还是说比较远的,没有那么近。
【主持人】你说还有其他公司的人找你,也出来了,他们出来之后新做的公司现在是已经浮出水面了,还是有些人仍然在水下?
【嘉宾】没有没有没有,我当时说的是有些人作为大厂的一个高管来找我,在水下呢。我要调到那边去,所以很多时候他们都走了。就很多人,像苹果也走了,对吧。Amazon的人也走了,有些人也出来创业的,像Amazon那边的。
【主持人】有一个San Francisco Lab的头David他也出来,对,但是现在他们出来做什么,我现在不知道。那你当时也和大公司其实也聊了,你想就是继续做RCI的这个方向?
【嘉宾】大公司的时候基本上,你跟大公司聊的时候你很难去决定你做什么方向。很多时候跟大公司聊,大公司会说我们都不想做这个,对,他们当时会有自己的一个想法,他们希望我加入之后呢能够给他们提供助理。
【主持人】所以去年秋天的时候,就是你和这些公司交流啊,确实在当时没有很多人会提到说想做这个,对,当时RCI还不是一个大众的认可,但RCI还是一个小众方向。我觉得现在至少在一些宣称和表态上,我觉得看起来是变成一些公司的重点,Anthropic都是有这个现象的。而且我就是跟一些这些Lab的人聊嘛,我觉得他们自己确实,就里面的人啊,他们也很关注这个方向。
【主持人】所以你觉得,像OpenAI和Anthropic他们对这个事有多重视,有多认真啊?
【嘉宾】这个我不好说吧,对吧,至少现在大家在说这事儿,只是就是怎么样能够让这个事儿最终能成呢,其实应该说是一个更难的问题,对吧。现在可能大家讲的还是一个概念,一个是怎么样那个觉得这件事情有多重要,然后它是不是将来的方向。至于怎么把事情做成,或者说什么是具体的一个metric,现在大家讲的讲的不多。
【主持人】你觉得这有可能会成为他们Coding Agent之后的下一个主线吗?
【嘉宾】这个我不知道,这个要开会要问他们。
【主持人】因为有这样一种推论的逻辑啊,就是他们会认为说这个东西就RSI非常需要coding和agentic的能力,然后这两个能力本身其实对这些前沿的模型公司来说,它已经是它的主项,RSI可能就是在这个主线往下延伸的下一个方向上,就从这个逻辑来推论了,它有可能是它的主线,不知道你怎么看这种想法。
【嘉宾】我觉得RSI比coding agent要大得多。对对对,我不觉得coding agent只是一个执行者,你每次是说它是要解决的问题,它的问题,对,它的问题,然后它的难度,然后它的那个,
【主持人】可能路径比现在coding agent要大很多。所以你不是指市场规模,还是也包括那一部分?
【嘉宾】我觉得不是,市场规模当然是一部分,还有一部分就是包括研究上的一些可能的方向和逻辑。
【主持人】所以你觉得就光有这个支点,其实不见得你就能做好RSI?
【嘉宾】是的,我觉得是这样子。因为其实很简单,因为对coding agent来说,一个是大家已经有可以用的coding agent,对吧?就是大家都用,不说Copilot,Codex,然后最近的一些开源模型效果也很好。这个方向就是在作业基本功能的情况下,它也都已经做得还挺不错的。那么就是说这件事情变成所有人都有了这个能力。
【主持人】那你觉得开源模型的能力和Anthropic,还有OpenAI的能力,还是比较大吗?比如说像GLM的R,像Kimi R7这些。
【嘉宾】我觉得肯定还是有差距的,差距还是有一些,但是应该在接近中,体感是越来越近的。
【主持人】你自己现在,当然至少跟OpenAI的o4.7相比,你觉得就是GLM5.2还是挺不错的,那和o4.6比呢?
【嘉宾】4.6比差不多。4.6差不多。
【主持人】因为有一种体感是会觉得o4.7还不如o4.6好用。
【嘉宾】我没有那么大的感觉,但是我感觉上是4.6,4.6,没有太大的区别,没有太大的区别。只有8分号的区别,可能唯一的区别就是说o4.8它的刚才功能变长了,所以这样的话用起来更舒服一点。因为像4.6你在用的时候用到一半,突然跟你说啊我要compact this history,然后就等半天。等半天之后它重新reset了之后,你再去问它以前的一些事情,它就不记得了。这个是它一个表达的问题。o4.8现在来说没有这个限制的话,用起来更舒服一点。
【主持人】所以在你自己现在的实际使用中,像GLM5.2这样的模型,你觉得是已经很够用?
【嘉宾】还可以吧,应该说我也用过了。我其实也就是最近刚从国内回来,紧急用了一下。因为大家都觉得它好嘛,对,我肯定要试一试,一个是这样,还是比较擅长。
【嘉宾】做一些比较执行上的一些工作,嗯对,而且这样的工作能做得不错。有一些事情它用一些思考可以,有一些做的还不可以,那你去的时候呢,它可能会陷入死循环,或者说有各种各样的毛刺吧。但是总的来说应该说还是挺好的。
【主持人】你刚才提到就是RSI,它整个要比coding要大得多嘛,嗯哼,你觉得它除了coding之外,可能它还需要一些什么样的能力?
【嘉宾】嗯,这个能力的话,就是人类研究员的这个品位啊,对吧,它的方向的这个感觉和理解,还有就是说对一些问题的一个抽象的能力。这个东西应该说现在模型都不太有。
【主持人】这个东西如果总结下的话,它在模型里是属于什么能力,属于推理,属于reasoning吗?
【嘉宾】对,这当然是推理,但是应该说很难去形容这种东西,就也不是说reasoning就能包含的。
【主持人】对对对,它比reasoning更大。
【嘉宾】能力里面还属于那种,因为推理可以有很多种嘛,推理这个字非常广泛,不是说,你想要的那种能力在人的能力中,可能属于那种,在人的能力中就是说大部分人也并不是有的,就是有一些很强的这个研究员他有这个能力。
【主持人】这是创造力吗?
【嘉宾】对,应该说创造力,应该这么说,就是说可以把一些概念从一些纷繁复杂的这个表象中抽取出来,并且加以总结,继续应用在新的问题上,这样的能力。
【主持人】其实就是你之前说到的,从少量的样本你就可以看到精准而细节的联系。
【嘉宾】对对对对,但这个能力应该说现在的模型还很难具备。
【主持人】其实这是对人来说真正的,对的。
【嘉宾】应该说是人跟大模型相比,人比较大的一个优势,就是因为大模型现在的能力很强,还是因为有大量数据嘛,然后说是重复的领域工作,这些工作来说,大模型有无穷无尽的数据,所以它可以学会。
【主持人】但是对那些数据量很少的,或者说像科学家这样开创新的这个领域,问题应该说层出不穷,然后你每次做实验、每次探索,都会发现新的问题。那么这个时候,这些问题的理解,它的项目数据很少,那么这样的话你要让AI去做。计算机科学,或者说具体到AI这个领域,它本身在学科特性上相比于其他一些自然科学,会不会它本身数据就丰富,更不需要你说的那种能力,它也能往前推?
【嘉宾】计算机科学你看嘛,计算机科学也很大,它又是工程的上面,很多能力呢,其实应该说是大体还会实践过了,那么这个能力其实应该说AI已经有了。对,就可能不太需要你刚才说的那种灵光乍现的东西。对对对。还有一些能力,比如说像应用研究的能力,就是比如说你按照某个固定的逻辑,或者某个固定的计算方案,或者说是个思维方式解决一些问题的能力,这个能力AI现在已经也是有的。就比如说你让AI去解一道数学题,对吧,那么对数学题来说,这道数学题可能已经相似的情况出现很多次了,那么AI就能够学会这个里面的模式,然后找到更好的解。但是找到固定的模式,或者说这个模式是以前没出现过的问题,AI就很难去找到答案。对。
【主持人】因为我想问的就是,至少在第一个阶段,就不说AI,其他的自然科学,对,就在AI、AI学科里面,实际上它有很多这种情况的问题吗?就是我需要在很少的样本里,我就找到一些可能没有固定模式的新的。
【嘉宾】是啊,就是一个非常明显的模式本身有学习能力,然后它怎么从数据中学到这个模式,然后怎么把这个模式拓展到其他方向。那么这个问题本身,一个它没有现有数据集,因为如果有数据、数据集的话,这个问题就解决了。
【嘉宾】没有数据集,然后对这个问题的理解的方式都不一样。其实应该说,怎么样去理解AI,怎么能够认识世界。比如说2013、2014年开始,就是大模型或者说深度学习一开始的事,就很多很多做理论的人,他们想用统计力学的方式去解释它。比如说物理上,比如说重整化群,对吧,然后物理上还有什么,那个正切核,对吧,这些方法,就是他们有很多不同的观点。还是说用贝叶斯式的方法来解决,对吧,还有像高斯过程的方法来解决,那么有很多方式去研究这个模型是怎么样产生这个涌现,怎么样学习东西的。那么这些角度,应该说都尝试过,但是都没有特别满意的结果。如果你要,这个时候,你要让那个AI去找,让AI去发现,这个时候呢,你就很难,就是通过照搬已有的这个逻辑,让AI上来完成这样一个问题。就是你看,从一三年到一四年这么多尝试,它都没有去很好地能解释AI。但好像另一方面,这也不影响AI突飞猛进的发展。
【主持人】对的,对的。我没有说这件事情会影响AI突飞猛进的发展,我只是说,就是作为一个,比如举个例子,我要让AI自己去研究,去理解这个AI是怎么运作的,那么这个问题本身就是个难题,因为过去的人都试过,而且用的盘子都是不一样的。
【嘉宾】对,因为我是在想,就是回到你们公司的目标,或者说ASI的这个目标嘛,对,就这个目标,它说让AI进化,或者说AI帮助AI进化得更快这件事情上,对,是不是我不用处理一些特别深的理论问题?
【嘉宾】我可能也能实现这个目标。是的,这就是AI3好的地方,它不是那种像无人车那样,要么是零,要么是一百,而是有很多阶梯的。因为你用AI3处理,就能够做很多事情,就比如说你跟它说优化各种算法,然后起高性能,这个部分AI3就能做了,而且它本身也有效果,也有实际用处。所以说它的低级台阶本身就有很多实用的价值,等到它第二级台阶的时候,它可能有更深的东西能挖出来。那么最终呢,可能我们会有一个非常难的、非常高的一个目标,比如说我们希望AI成为像爱因斯坦或者牛顿这样的大脑,那么这样大脑可以通过很少的样本,稳固得很深的知识。那么如果这件事情成了,那么应该说那个AI就非常非常厉害了。但这件事情呢,就是一个非常难的问题。就算我们没有做出来的话,本身这个东西的应用也是很多的。
【主持人】那回到我们刚才这一轮话题的起点是说,在coding之外,AI3还需要什么能力?你刚说有一个就是具备逻辑思考的这种人,其实可以产生某种灵感和联想的这种能力,还有什么你觉得?
【嘉宾】对,我觉得这个是重要的,但还有就是说一些agentic的 behavior嘛,对吧,这个也是要的。就是说你AI怎么用电算工具啊,怎么用各种各样的已有的知识,然后获取新知识,然后获取各种,把这些事情放在一起,完成任务这样的能力,对吧。那这个能力,其实某种程度上可以说是核心的大公司已经有了,已经在探索,已经在往前推的,对对对。所以对新公司来说,我觉得好的一面是你们有很多能力是可以直接用的,是的。然后可能会有压力的一面,就是因为他们也有这些能力嘛,对,所以他们可能也会往这个方向推,对。但是这样的能力,应该说很多 agent 或者说很多已有的解决方案已经在那了,对吧。所以现在的结果,其实他们应该说每个人想法是不一样的,对。
【主持人】还有一些能力,当然说你怎么去筛选信息,然后从信息中找到一个最重要的那个信号,那么这个部分,应该说之前做 deep research 这些方向上也已经有很多工作。我的一个感受就是,最近这段时间行业内非常热衷地讨论 ASI,它有一个假设,
【主持人】就是,谁最先达到这个状态,就会把其他人甩得越来越远。而且这件事就在这个决赛圈了,你觉得这个逻辑它有什么漏洞吗?
【嘉宾】这个逻辑应该说还是比较正确的,但是应该说有这种可能性。就是说,对于AI来说,如果它没有突破性进展的话,所有AI都差不多,对吧。它不是那种渐进式的、一点点往上走的,它是那种突破式的往上走的路径。比如说所有人都在没有达到某个level的突破,那么突破了之后,它会到下一个层次。那个层次上的AI,它的能力是远远高于之前一个层次的AI的。在这样的情况下,就是说它可能不是渐进式的。一个推论就是说,其实也许还是有一定空间给出场公司的,因为如果是渐进式的,如果你觉得现在Scaling这条路线就一定能通向这个RL,为什么?因为现在OpenAI稍微都已经做得很好了,那么它们如果加入RL,它们是不是一直往前走,永远比别人更快。
【主持人】我理解你说的意思,它其实就是一个加速度,你可以一直往前冲。或者我可以举个例子,比如说一个RL这个系统,这个系统肯定会效果变得越来越好,对吧。你看从这个系统开始出发,它会有Scaling曲线,一开始这样的一个过程,对,这样就是S型之后平台,然后S型之后再平台,再平台这样。所以你每个平台应该都对应一个突破,如果你没有打破这个突破的话,那大家做得再好,就可能在这个效果的上限上受限。你对它接下来的这个发展是直接这样往上的,还是渐进式的有平台的?
【嘉宾】我觉得是有平台的,因为你这个基座大模型……
【嘉宾】会变得更强,然后变得更强之后呢,你才会有更好的想法去做。那么就是,它是一个阶段是跳跃的。
【主持人】你觉得这个想法现在它主流吗?
【嘉宾】现在应该还不成主流吧。对,但是我觉得,这当然是挑战 Scaling Law,就是大家对 Scaling Law 有多大信任感。如果大家觉得 Scaling Law 百分之一百是对的,那么就是说,其实并不存在这样的平台企业,就是说只要大家对算力、对各种东西投入,我们的能力就会越来越强。那么这样的话,自我进化这件事情就一定是一个非常平滑的过程,我比你快一点,我就一定比你快更多,越看越多然后就会上去。那么这样的话呢,任何一个传统公司不可能追上,因为他们一定会在更前面让他追得更快。但是我觉得不是这样,就是 Scaling Law 可能不是全部吧,它可能是对的,只是说它需要有指数级的增长,所以就说你需要10倍的资源、10倍的数据、10倍的各种东西,然后最终能够达到线性的增长。那么这样10倍的资源,其实应该说现在已经开始也有瓶颈了,所以哪怕这个理论它是对的,但是它也有一些别的现实上的限制。
【主持人】对,这个限制应该说是很大的限制,就是说不可能让全世界整个地球的资源都投进去,那是不可能的,肯定会有博弈,肯定会有一些限制,所以应该有更好的、更有效的方法去做这事情。这个也是你之前反复有讲到过的,你曾经说过如果 Scaling Law 就是未来的话,你觉得那是一个比较悲哀的未来。
【嘉宾】那也非常无聊,非常无聊,没有新的智识上的突破。
【主持人】是。
【嘉宾】我相信是会有智识上的突破。有智识的突破的话,就是 AGI 这个 loop 本身是一个元程序上的 loop。因为智识这个序列,底层的架构和底层的数学和一些模型的一些结构,应该说是会有突变。对,就刚才我们说是否达到 AGI 这个状态之后……
【嘉宾】强者,或者说领先者,越来越明显。有一个变量是它接下来的走势是渐进式的,还是有S型平台的。还有一个我觉得有可能的变量,就是说智能未来的空间还有多大?空间是很大的,我觉得我们刚开始,像我那本书一样的,叫破晓之中嘛,就是我们刚刚开始,我刚刚看到一点点星光,太阳还没露头呢,我觉得应该是这样的状态。
【主持人】只是你觉得它的前途是光明的,但道路是曲折的。
【嘉宾】对对对。因为我们毕竟是生活在地球上的一些非常可怜的、猴子变来的生物吧,对吧?就是说一直以来,看到那些东西都比较粗浅,或者说比较简单,对吧?智能上面应该有,只是我们看到的东西非常少,所以我们只能看到这些,我们不能看到非常远的未来。
【主持人】那这个想象往后是什么呢?我们最开始是猴子变来的可怜生物,看到粗浅的东西,再往后呢?
【嘉宾】对,再往后,就是说如果真的是有ASI普及开来,然后所有人都有超越我们以前智能很多很多层次的智能的时候,你们整个世界就完全不一样。
【主持人】你可以稍微讲讲,你觉得会怎么不一样吗?
【嘉宾】就是以后我们之前所有的世俗上的那些东西,可能都能够满足,因为所有的欲望或者所有的要求,都能够被AI所满足。就是进入了休闲社会嘛,就是说言出法随。什么言出法随?我说了一句话,这句话一定会成真。比如说,我今天有个大房子,我今天说我要去海边旅游,马上旁边就是海。所以我说我今天要改变整个世界,把它变成我想象的样子,它就把它变成我想象的样子。
【主持人】科幻小说里面它后来在虚拟世界里,还是加了一层限制的。就本来是想要房子就有房子,后来也有了房价系统。
【嘉宾】对的,那是因为如果是这样的话,对于这个世界来说,大家可能失去了一个动力。失去动力的话,就会有一个新的问题,一旦失去动力之后,那人类社会怎么发展?这个是一个很大的问题。在小说里面,其实是说迭代了两次嘛,就是。
【主持人】第四阶段的时候,发现这个事情不是很成功。那么虚拟世界的管理者可能会思考一下,怎么能让人类在享受这些非常便利的方式进入之后,同时保持向前的动力,这个其实是很大的问题。你说这个未来,至少有一件事我觉得是很美好的,就是一些现在很难克服的病痛是可以消失的。
【嘉宾】对,我相信是这样子。
【主持人】这是你自己的一个个人的愿景,还是因为你们新的公司其实也是以这个为一个共同的方向嘛,你们合伙人之间也会去讨论这种事情,也会有相同的愿景?那些什么修仙社会之类的东西……
【嘉宾】那肯定是我自己愿景,对,那是更像是偏小说的,更偏那个类似于科幻的这样一个想法,对,对,对。至于公司来说,我们还是希望把这个事情做成,因为这是一个实现上,或者说是执行层面上的一个具体的工作。
【主持人】而且AGI(AFO AI)只是你们的第一个大阶段,你们后面还要……
【嘉宾】对,比如说。如果AGI能做得比较好的话,我们如果能够找到新的方式,就是说产生新的架构,或者新的这个理论,或者新的这个模型的优化算法的话,那就认为这个系统本身对一个问题的理解更加深入了。那么这样的话,我们是不是可以用这个系统做别的东西?
【主持人】那我们接下来来聊聊你们最近的一些具体的进展。因为你们在6月初正式官宣之后,到6月11号是释放了第一个成果,First steps toward automated AI research,通往AI自动化研究的第一步。可以讲讲这是一个什么样的进展吗?
【嘉宾】对,这是一个初步的进展,就是证明我们的系统还是可以做一些事情。比如说我们用它来优化那个MLA(Natal Chat),五分钟的那个训练,然后让它这个BPP这个数字降得比较低,比如说比Community的数字还要低;比如说我们可以用它来做MLA的那个Speed Run,让这个速度变得更快;然后最后呢,优化这部分呢,就是我们找到了一个新的那个算子。这个算子也是通过我们的系统来优化的,优化之后呢,就是算子的效果应该说比现在这个最好的这个SOTA还要好不少。
【主持人】就是一些成果你们都是开源了的,对的。这一次的这个进展发布之后,有什么有意思的反馈吗?
【嘉宾】总的来说,有很多的positive feedback,大家会觉得……
【嘉宾】这个结果还是不错的,比较impressive。那么我特别,我个人觉得,就是特别是第三部分,这部分对吧,因为这部分应该说是,一开始是我一个人,大家加AI来做到Sortar,一个人加AI就Sortar。然后你可以去涂一下,是加的那个AI吗?那当然,我就不能说了,因为这也是我们自己做的,对吧。
【主持人】就是你们自己的这个系统。
【嘉宾】对对对,不是并不是说,是外面那个系统,然后在网上的话。那就是大家都很兴奋嘛,因为一开始大家都觉得挺难的,对。后来做到Sortar之后呢,就很兴奋,就有很多人一起来做,就有达到更好的结果。
【主持人】你为什么要去做这件事?就是你怎么看Sortar is a benchmark,这个benchmark?
【嘉宾】这个benchmark,应该说,一开始是那个英伟达的那个,最近才发布的那个benchmark,应该说比较新嘛,对吧。然后另外就说,算子优化本身也是一个重要的工作,因为算子变快了之后,它能够对于这个AI,model training和serving产生影响。
【主持人】那英伟达他去做这样一个benchmark,他也是为了,去服务CUDA的推进吗?
【嘉宾】不是,对于英伟达来说,作为一个benchmark,应该说是,他最多就是看一下,就是我们,因为对AI来说,AI算得变快,对英伟达来说是好事。
【主持人】所以他无所谓,你是人来做的?
【嘉宾】对,他并无所谓。
【主持人】还是系统做到的?
【嘉宾】对,对,对,对。对他来说就是,对,为他的硬件配备更好的算子,让上层这个速度变快,效率变高,对他来说都是好事。
【主持人】然后你们这次做的这三个测试,去跑的吗?还是说他需要,针对不同的测试和任务,做一些修改了?
【嘉宾】同一个系统去跑,同一个系统去跑,所以是个通用的东西。
【主持人】对,是通用的。我觉得你们选的这三个benchmark还挺有意思的,一个刚好是我算力是限定的,我去看性能,对吧?然后另一个是我看它的efficiency的,对,就是我是看效率的,对。然后最后一个算子优化是可以作用在infra上的。
【嘉宾】对对对,也涉及到底层模型,其实。
【主持人】你们当时是怎么计划和思考去,做这样一个成果的?
【嘉宾】可能是,也是机缘巧合吧,对。
【主持人】你刚说最后那个算子优化是有机缘巧合,对。
【嘉宾】机缘巧合是一个,然后还有,
【嘉宾】就是说也有很多,看什么东西确实对我们来说相对来说是比较容易的第一步,我们一定会先去做的。这样的话有一个很好的一个一开始的结果,通过这方式也可以,因为我们还是希望细节比较保密吧。
【主持人】成为系统来说了,就是说真话,就是你可以保留各种可能性。那如果说系统本身你觉得不方便展开的话,你可以讲讲,就是你们现在选的这三个基准测试,分别是在测试什么能力?如果再往后,它有没有一些比如说组合起来的更大的空间?
【嘉宾】其实就是实际上说,主要还是测试,比如说在这三个基准测试上,能够找到更好的那个算法。所以他们的共同特点,就是说他们的这个反馈比较快吧,对吧,就是很快能够获得一个反馈,然后这个系统能很快地跑起来。
【主持人】因为你们把这个称作叫做first steps,那更总结来说,你们是怎么设定底层进化的第一阶段的目标?
【嘉宾】第一个目标当然是希望这系统能跑起来,然后有一些初步的结果,对吧。所以我们现在是达到这个目标。
【主持人】因为其实之前你也说过,你们一开始就有考虑一些商业化的事情吗?就是你们有了这个初步的成果之后,它在商业化上是马上会有些动作吗?也是一个什么样的系统?
【嘉宾】我们当然会继续去优化这系统,然后它做得更好一点。商业化呢,我们也在思考中。当然就是说,我们还是希望这系统做得比较通用化,就是解决通用的问题。那么这样的话,我们不会说因为一两个具体的垂直领域让这系统变得非常特殊化,这样的话可能就失去了通用化的意义。
【嘉宾】其实不是这样,其实应该说这些数字还是比较让人印象深刻的。比如说拿算法优化来说吧,因为这个方向一开始是我这边来带起来的。我觉得,一个重要的是说,你看我们当时战胜第二名,第二名有个公司叫他不爱,这公司是以色列的人做的。那么他们那边的那个CEO是Sasha,他应该是以前摩托罗拉的CEO。
【嘉宾】Mobile AI应该说是一个非常硬核的公司,他一直做非常强的端侧的,或者说在芯片上的一个处理。对,他以前做过特斯拉的供应商,对对对,就是车上的芯片,对。所以他是一个半导体的专业的公司,对,而且他们里面那些人都是专业的做GPU的这样的一些工程师。他们当时也是提交了一个那个版本,但是我们的效果比他们要高10%。相当于他们是专家,对,但是应该说,对于我们来说,我们其实组里面没有什么人是GPU的专家,但是我们比较高效,也比较有效率。那么,就是说你可以这么说,所以最懂算子优化的那个是我,那意思就是说,应该说你要去看我以前的简历、以前的那个故事,我没有真的做过算子。对,所以那个我只能说,我做过一些就是大模型的Efficiency,大模型的那个效率,其实呢,这样的一些一些工作。所以,就算是这样的一个非专业的团队,但是呢,我们有这个通用的这个思考和这个逻辑呢,然后,通用的方式来做,做这个大系统,能够达到更好的效果,就能够达到这些顶尖专家团队的效果,对,比他们更好一点。
【主持人】所以你自己对这个还是比较满意的。
【嘉宾】对的,对的,对的,对的,这应该说是一个比较好的一个结果。像那个NVIDIA Chat,五分钟,就是像NVIDIA Chat Spear And这个东西,应该说也是Community做了两年了,对。那么这个数字也是很难再往上提了,但是我们在这上面又提高两百多钟左右,所以数字看起来绝对数字不大,但是,其实应该说,对于那个,这个数字还是比较大的。
【主持人】对,我就是想请你解释一下,因为很多不是做这些事的人他可能看,就是你从79秒到77秒,就感觉好像那也只缩减了一点点。
【嘉宾】但你要知道,79秒是过去整个Community做了两年在缩打,对,那就接下来就很难再往上提了,就像是技术社区里面专门主攻这个效率这个方向的人,对,对。
【主持人】还有一个问题,
【主持人】就是你们现在测的这个NotChat和NotGPT,比如说NotChat的话,它是一个GPT-2级别的模型,对,它和现在主流的大模型的参数其实差了很多。那你们目前的这些成果,如果要迁移到更大的模型上、更大规模的架构上,它会难吗?它中间会有比较大的gap吗?
【嘉宾】应该说还是会有一些gap的,这个我们也在继续做,那有可能之后我们就能看到相关的具体东西,我就不透露了。再往下的话,就是说first step是现在我们看到的这个,那比如说第二步是什么?那我们会继续优化这个系统,就是继续优化这个系统,让它变得更强,那边更有效率,然后那边更好。对,然后呢,就看就是这个系统本身,那么优化更多,更广泛了的方向,对吧,比如说预训练、后训练这些东西都会做。
【主持人】预训练、后训练,你们现在有类似之前RLHF更清晰的思路的时候,可能会有?
【嘉宾】对,毕竟我们公司刚成立嘛。不过我本来有这个RLHF,也是在他们成立十年之后了。
【主持人】对,很久之后了,对,一五年底就成立了他们,差不多是二三年、二四年最多的时候提的。
【嘉宾】对,你只要有八到九年的时间吧。嗯,当然了,就是现在这个时间会缩短,因为大家的热情很高涨,然后整个这个过程是会很快的,但是应该还不至于快到只要半年的程度。
【主持人】你说RLHF吗?对,RLHF,比如说一般来说你要做一个RLHF,肯定是要看它的数据是否充裕的,对,做RLHF的话,它的什么数据是可以用上吗?
【嘉宾】这个问题应该说现在还没有定论嘛,因为现在有很多很多看法可以做数据,比如说这些数据的具体的那个做法,然后它的逻辑,然后它的那个准则,它的那个思路,现在都不是很清楚,有各种方法可以做。应该说现在还是探索期。
【主持人】可以分享一些大致业界的吗?
【嘉宾】不太方便说,所以其实也没有很多人知道怎么做,对,都是在团队内探索的状态,现在还在探索吧。
【主持人】不说具体它什么类型的数据,我想知道比如说它成本高吗?会很难吗?
【嘉宾】就目前大家想到的几种方法里面,有难的也有不难的吧。但是难的跟不难的之间呢,问题在于它到底效果怎么样。可能难的就是效果好,不难的就是效果不好。
【主持人】除了数据之外,你觉得还有可能缺什么?
【嘉宾】算力肯定是一部分吧。因为比较重要的是,你怎么样能够做ASI本身,就需要一些算力去探索、去研究的。所以在这上面,其实应该是花不少时间去怎么样减少算力的消耗,但同时扩大更多的成果。
【主持人】其实你们手头的融资是很多的,融了6.5亿美元。在第一阶段,就是你刚刚说算力也是个问题,在第一阶段它对你们来说充足吗?
【嘉宾】应该还可以,还是不错的,可以做一些事情。当然你要达到像PS三家这个级别,或者达到大厂的级别,还是有一定距离。
【主持人】你觉得,就是实现你说的那个ASI,就更往下来说,它之后是不是也需要一些Scaling Law之外的新创新?
【嘉宾】我觉得是,因为如果是完全拼Scaling Law的话呢,像小公司拼过大厂,就跟我想说的是一样。
【主持人】对吧,就关于Scaling Law之外有什么方向,你现在有什么想法可以透露吗?
【嘉宾】现在还不太好说。
【主持人】就是你想到了一些,但是要验证是吗?
【嘉宾】对,我觉得就是一个大的方向就是可解释性。我觉得可解释性很重要,它能够发现很多的那个insights,然后这些insights可以加快这个速度,通过让这个模型变得更加safe。但具体是什么呢,我就不好说。其实像Groking,就是一个可解释性方向的研究,解释了人们眼中的那种涌现线是怎么来的。
【主持人】对,它来追求ASI。如果展开来聊一下的话,你觉得ASI实现之后,它可能还会有什么风险?
【嘉宾】风险呢,还是挺多的,因为有很多人可能过来问我说,如果AI能够自我进化了之后,那它们会不会变得很疯狂?
【主持人】你说的很多人是什么类型的人,从业者还是?
【嘉宾】有些可能不是这个领域的。其实很有意思就是说,越是,就是,
【主持人】领域之外的人其实倒没有那么多问题,他们不会觉得这个问题太严重,因为这可能不是一天就到来了。对,其实现在AI还有很多问题,这些问题应该说非常难解决,现在还是有很大的差异。但是领域主要的人可能会问这个问题,AI自我进化之后会不会有一天超过人类控制,或者说达到一些方向让人类无法去理解,这个其实是应该说的比较大的问题。那你半会怎么回答这个问题?
【嘉宾】总而言之我们在训练AI的时候,我们当时当然像狗一样的训练,相当于我们当年训练狗这样的训练方式。训练AI使得AI能够很快很好的服人,能够很好的帮助人解决问题。在这样子的进化压力下,AI是没办法进化出跟人一样的某些自我意识和自我认知的概念。我觉得这个是一个很大的区别。
【主持人】你觉得如果要达到你所设想的更终极的RSI,那种能产生新的创造力和一些灵感的状态,它需要有意吗?意识和这个事儿有关系。
【嘉宾】我不觉得它需要,就这俩不是一回事。对,这俩不是一回事。我不觉得这个东西是一定必备的。你其实可以想一想,比如说有很多天才的数学家和物理学家,他们在各自领域上可以做到非常天才,但是另一方面他们也与世无争,他们并不是想要权利,并不想要各种东西。所以这两个部分的能力和它的欲求是完全可以分开的。这第一点。然后第二点就是我觉得以后可解释性很重要的,因为通过可解释性你可以真正知道模型在干什么,到底什么地方是起作用的,对,什么地方是模型系统,什么地方模型利用什么样的能力,获得什么样的支持,得到什么样的结果,就是这样的话,你就可以消弭人们对这种黑箱的这种恐惧。
【主持人】是不是从业者也分两派,有的人认为这个东西一定是可以解释的,是可知的,我可能是少数派吧,就是说因为大部分人可能已经觉得绝望了,就是说大模型那么复杂,应该是没希望在了解里面的什么。对,我就说可能有另一派是觉得,就是可知这件事也许是很难追求到的。
【嘉宾】是的,很多人是这么想,但是我觉得不是这样子。我觉得一定是有一个好的Principle,能够让它运转起来。那么这个方向,如果你真的能够找到这个Principle的话,一个方面就是能够让模型变得更强,另外一方面就是说能够让模型变得更安全。
【主持人】你的这种少数的相信是来自什么?
【嘉宾】这个应该说是我根据我过去的那些经验和跟我过去的那些做的工作。
【主持人】如果展开来讲是什么?什么东西会给你这种?
【嘉宾】对,我一直在做一些比如说关于神经网络训练算法的理解,神经网络是怎么学会各种知识,各种各种模式的,神经网络是怎么学会的。然后比如说你训练的时候,你做那个Tilt下去,那么Tilt下去会给神经网络的动力产生的影响,神经网络里面那个权重是怎么生成的,然后它怎么学会一些pattern,这部分的分析应该说我已经做了很多年。
【主持人】你之前也提到其实在这一轮AI热潮的起点,就是12年前后就有很多理论的研究想去解释机制,有从物理学界界的,有从数学学界界的,但是成果都其实比较少,这不会影响你的信心吗?
【嘉宾】不会影响我的信心,我觉得也许我会是能少多派会把它做出来的那个人。
【主持人】这还是个挺大的,我觉得技术上和学术上的一个抱负和追求。
【嘉宾】没笑一下,就是如果你没这个想法的话,你也可能就这样随大流,对吧。但是如果你有这个想法的话,那可能就会有这个想法我以前一直走。
【主持人】你什么时候开始有比较明确的这个想法?
【嘉宾】我应该是从2020年2021年之后,就慢慢对这个问题理解更深入了之后,我会觉得也许我在一条正确路线上走。
【主持人】那前后有什么整个技术环境的变化,让你的这种想法更明确吗?
【嘉宾】我会觉得是这样,就是至少因为对于我来说,我对于AI的一些分析和一些工作,这些工作本身因为这个方向本身我做了很多年了,应该一开始不是很顺利,有很多东西我做得不好。但是从2021年之后,我会觉得这个东西的分析和理解,我会觉得越来越深入。有很多问题本来想不通,我好像突然想通。所以因为有这个过程,你会觉得我也许在这条正确路线上再往前走。
【主持人】现在还在追求这个事情的人,你的同行人有哪些?
【嘉宾】应该说不多,因为很多人可能都放弃了。其实有很多人,就包括这次Meta的Yann LeCun那个人,叫白衣汉。白衣汉其实应该说很早以前我就知道他了,因为他以前是做理论的,就是对于模型的分析和理解,他也出发了很多文章,很多文章还不错的。他也是之前是跟普林斯顿的做研究,尽量回合做的。但是很多人在这一波AI起来之后,就少了对之前工作的坚持,放弃了之前的工作,然后直接说OK,我们就scale all the time,那么他们就做别的东西去了。所以有些东西大部分人可能很多做理论的人,后来也就放弃了,他们就说怎么加入OpenAI,或者加入其他地方,他们就说加入scale all大军,然后把事情做成,打不过就加入。
【主持人】因为像今年年初就有理论、计算机的理论科学家也加入了OpenAI。
【嘉宾】是的,很多人是这样子。那么加入的其实有很多种可能性,一种当然是说我是有自己的追求的,但是我想用AI来做点啥,那么这时候你加入大公司,用他们的模型做的事情是很正常的,这是一种。还有一种就是OK,我已经放弃了我先前做的东西,我就觉得AI就是一切,那么他们将来会成为AI的研究员。还有一种就是说想进去看一下,然后过两年再回学术界,这也是有可能的。
【主持人】我之前采访过的人里面,我觉得蚂蚁老师比较追求这个。
【嘉宾】对,是的。他比较追求科技的事情,还有白盒大模型的一些研究。对,但我希望以后人类还是有一些多样性的,不可能说所有人都追求一个东西,对,如果所有人都相信scale all就是一切了,那世界非常无聊。
【主持人】你觉得乐坤他做的具身智能是在追求这个吗?
【嘉宾】他的追求东西应该说是不一样,一个是基于视觉的,然后世界模型,然后在硬件上做一些推理、推导,做一些预测。在这三个点上抓住了之后,他觉得这个方向是正确的,他就往这边走。对,就算这个方向跟大模型是不一致的,但是他也希望这个方向往前走。
【主持人】但是他的重点不一定是解释性,对吧?
【嘉宾】对,他重点可能说他认为这个新的范式,能够解决一些现有大模型做不好的事情,他可能更多是工程上的一个方向。
【主持人】其实我觉得你在追求的是,就是你希望把这个东西变成一个真正的科学,对吧?
【嘉宾】对,这个可能是我一个追求。因为现在它可能很难说是一个科学,因为有些原理确实搞不清楚。
【主持人】是的,我觉得它以后终将变成科学。因为历史一定会出现类似的过程,虽然不会完全重复,但是历史在脉络上会跟以前的东西相互呼应。
【嘉宾】对,AI终将变成科学是跟以前历史上的什么过程呼应,就跟以前的比如说炼金术变成化学,或者说从开普勒的这天文观测,到第谷的天文观测到开普勒的一个总结经验,然后做到牛顿的一个第一性原理,这过程一定会发生。
【主持人】科学的结构就是从第谷到开普勒,和开普勒到牛顿,永远是这样子的?
【嘉宾】对,当然你在牛顿没有出现之前,大家可能会觉得这事情不可解释、太难,你会这样子。那么等到牛顿出现了之后,会觉得这个事情还挺简单的。
【主持人】你觉得下一个出现的牛顿还是人类吗?
【嘉宾】不一定,可能是AI,可能是人机结合,对,有可能是这样子。所以为什么要做AI,其实原因就是,你如果想做这件事情的话,你一定要用实际上所有的计算资源,和所有的最强的大脑,包括人的大脑和AI的大脑,把这件事情做成。
【主持人】你觉得有成之灵会看到?
【主持人】图灵奖颁给一个系统吗?如果到那个时候,可能图灵奖也不是很重要了。如果这个系统很强的话,它可能会以很快的速度获取很多的知识,然后得到很多的结果,它变成了一个not a discovery system。你可能每隔一个月、每隔两个月就产生新的东西,东西非常牛逼。到了那个状态,你觉得人类研究员的乐趣是什么?比如说你自己的乐趣是什么,你会去做什么?
【嘉宾】我觉得首先第一个,就是如果能理解AI到底是怎工作的,我会很开心。然后另外就是说,如果真的什么事已经不需要人类去介入的话,AI能自动发现新的东西的话,那时候你去事实上欣赏它,欣赏它的过程都没了。你有很多东西来不及去做,但是你至少能看一下,能够感觉一下这种美感,这些有意思的东西可以发现。我现在还有这种习惯,就是我经常去看一下,比如说数学证明,看一下有意思的这个问题是怎发现的,你发现里面一些有意思的东西,发现是这么做的,这种忽然看懂的感觉。
【主持人】这个和你日常工作其实不直接相关什么的?
【嘉宾】对,不直接相关,但是这本身是一个很有意思的过程。
【主持人】这对你是一种精神上的享受?
【嘉宾】对,是有乐趣。或者说发现这个系统是怎么做的,或者怎能够理解这里面在干啥,这是很有意思的事情。
【主持人】其实最近AI系统也是宣传有一些证明,有一些数学上的突破,这些你去看了吗?有你觉得比较优美的东西吗?比如有什么东西你觉得你会去看看?
【嘉宾】去年的Google的AlphaEvolve,它应该是关于矩阵乘法,它减少了乘的次数,对吧?从多少次缩到多少次。
【主持人】对,是的。
【嘉宾】这个当然就是说,它把矩阵乘法换了一些顺序,然后比如说可以少一次加法或者少一次乘法,通过这种方式就减少了计算代价。你真正去看的时候,觉得它还是挺有意思,就是它通过模式变换之后才少一次乘法,让它能够效率更高。
【主持人】那你刚才问就是有什么值得看的,你的意思就是说,其实可能AI做出来的东西,目前来说也还没有那么优美、你觉得能有享受感的东西?
【嘉宾】对,就是很多时候还是要看人做的东西,因为现在AI做的东西很多时候是出于术上的level,没有到道上的level。就是说术和道是不一样的,术是指具体的细节。就比如说我们把乘法的次数少了一次,那么你当然可以看到,通过模式很容易要做个变换,你把东西先加起来然后再乘,那么这样的话,你可以减少一次乘法的次数。因为你加完之后再乘,那其实是相当于同时把很多都乘起来,当然同一次乘法可以相当于乘四个数字,通过这种方式可以算出一个比较强大的数字。这个相当于说是,应该是在高空中做一个穷举,然后找一个穷举的一个讨巧的结果。但是道可能是另外一个东西,就是说你会发现一个新的理论,或者发现一个新的逻辑,或者是新的链条,这个东西本身是美的。但这种美跟前面你见过的,是不一样的东西。
【主持人】最后这部分相当于聊聊,就是你过去的一些经历,和你现在做的事之间有什么关联,包括你过去的那些选择和学习,让你走到了今天这种探索的状态。就是我看你过往的经历,我觉得比较重要的转折是,你之前在Google X的时候,其实做的是无人驾驶的工程师,那个我理解是更偏工程的;然后后面你去Meta,最开始去做Fair,它就又回到了一个更偏研究的状态。当时为什么要主动有意识做这个选择?
【嘉宾】对,因为一个是当时工程满足不了,当时应该是恰逢深度学习的一个变革期,你是13、14年的时候。
【主持人】13、14年的时候,对吧?因为13年的时候
【嘉宾】我加入了Google无人车。一开始应该是比较兴奋的,因为一个是这个方向本身是一个比较大的视野,大家会觉得无人车这个方向以后可能会很火,而且那也很早起,无人车很早起的时候。但是我也有想法,因为当时我也知道深度学习已经起来了。当时我其实非常希望能够在这个无人车那一步做深度学习这个工作,比如说你用深度学习这个算法来训练一些无人车的分类器什么的。但是很可惜那个时候,一个是我没有这个资源做事情,因为当时算力有限,而且机器也很少。有限的时候这些资源都会分给一些比如级别比较高的人,他们先去用它。像我们这样的人就相对来说只能做一下打杂的工作。打杂工作我能看到它对我来说,没有时候职业发展的一个前途。
【主持人】所以13、14年你入行的那会儿,它跟现在不一样的一个氛围,是说那个时候年轻人没有那么受重视是吗?
【嘉宾】因为还是一个比较论资排辈的过程。因为谷歌那边还是有很清楚的一个级别,上了个分级,级别很高,比如说当时我们组里面有个级别7的人,那么级别7的人他就能获得一些比较好的自由度,还能够用比如做深度学习,用深度学习来训练一些模型。但我刚进去的时候级别是4,那么对于级别4的人来说,他就只能做一些打杂的工作。
【主持人】你觉得在那个技术阶段,就是当时的环境下,级别高的人他和级别低的人,谁更了解正在变化的深度学习的浪潮?
【嘉宾】其实那个时候应该说年轻人还是比较容易接受的。但是很多时候不是说学习上的区别,而是概念上的区别。就是很多高级别的人,或者很多比较老的人,他们拒绝学习深度学习。为什么呢?是因为他们下意识觉得这东西不行,或者是这东西效果不好,或者是说这东西有很多猫腻,有这样的一个想法。那么要等到两三年之后,慢慢他们才开始意识到这东西是个变革。然后这次大模型出来之后,其实这个现象也还是存在的。还有另外一个维度,就是说年轻人动作很快,年轻人愿意熬夜,年轻人愿意把事情做成,很多时候也不问任何的想法,我就说我干就完了。那么大模型确实需要很多干活的人,因为没有干活的能力的话,你就没有办法知道大模型有很多问题。
【主持人】回到当时你说在Google做无人驾驶的工程师,你觉得有点无聊了。
【嘉宾】对对对。一开始前进去之后,你会觉得工作做的东西可能对我职业发展没有什么太大有利的地方。我当然是要做一些紧急车辆厢的检测,就这样的一个问题。因为这问题本身一个是它是小样本的问题,样本非常少,少到就是说连个分类器都训练不出来,可能需要手工写规则,那样的话我觉得做下去是没有什么前途。
【主持人】确实这个行业后面有很长时间就是很多手工写的规则。
【嘉宾】是的。就是当时我对这个行业的判断也是对的。因为这个行业一个问题是,它要不就是成功,要不就是完全不成功,它没有中间状态。就是如果在车上在路上是有风险的话,大家就不会用它,那么你就必须得一直做,做到最后产生那个无风险,就是比人更强,才能大规模上路,所以这个其实是很大的问题。
【主持人】所以13年的时候,你就看到说它其实可能很晚才会落地。
【嘉宾】对。因为我已经感觉到了它有很多corner case要修,然后corner case的修法应该说是一个非常漫长的过程。
【主持人】那在15、16年的时候,比如说你看到马斯克,包括当时Google后来成立的Waymo的一些leader,他们其实都有一些很乐观的宣言,就比如说16年这个车就可以上路。
【嘉宾】我其实就在Waymo。我知道Waymo其实后来就是在Waymo,他们都有一些很乐观的宣言。这个我已经当时已经免疫了吧,因为他们每次都这么说。因为永远才5年,特别是当时2011年听说这个事就说还有5年,然后等到我进去2013年的时候还有5年,然后现在可能还是需要修5年。
【主持人】现在在旧金山在LA已经路上跑了。
【嘉宾】对。
【主持人】那你后来去Meta FAIR,因为你之前在Google X的那个经历是更偏工程吗?
【主持人】去FAIR是更偏研究,这一步跨的难吗?
【嘉宾】其实应该说不难,应该说是其实我在FAIR的前几年还是偏工程的。我们当时作为实习生,很多时候也是我自己搭工程项目,从头到尾搭一些,比如搭这个Monte Carlo Tree Search搭这个系统,分布式的一些系统,这都是我自己搭的,所以这个很工程。当时我记得给我的评价还是说觉得这个人太工程了,不像一个研究员。别人打开电脑全是文章,我打开电脑全是代码,当时有这样的一个评价。那么当然后来我在2018、19年做了我们的OpenGo之后,那个是当时战胜韩国的专业棋手,当时是打了他们10比0,所以做完这之后其实后来就更偏研究一点,慢慢应该说从2019年开始到2022年,慢慢形成了自己的一些taste,我有感觉上我知道怎么做这事情。
【主持人】这个事情是不是你之前比较工程,然后写很多代码的经验也是有帮助的,对后面的一些taste?
【嘉宾】对。当时看起来帮助不是很大,因为是不一样的。就是你怎么也会感觉到,写代码和你做这个研究,其实是不一样的东西。那现在再回头看还是不一样。因为我们最开始聊的时候,你不是提到说在去年8、9月的时候,秋天的时候,因为你一边又很 hurry,然后你又有做研究,其实你有些问题意识,所以其实让你能更快地感受到,加速的研究的情况再到来。
【主持人】对,是你觉得这和你当年有比较多的一手写代码的经验有关系?
【嘉宾】对,应该说是就算在2019年之后,我还是会有很多写一手代码。就是说你会发现我每年还是有至少一篇一作的文章,当然很多这样的文章,很多还是偏理论的,但是至少还是会有一个一手的感觉。这问题怎么做,这问题怎么做,就是说不会是纸上谈兵。因为如果有一个研究员,他一直是做最后作者,或者做那种高层思考的角色,他很多问题就是他会慢慢地把所有的经验都花在高层思考上,他不会去想这件事情怎么完成。那么这样的话,他就会把难的、比较难的、和非常难的问题混在一起,所以他不会有特别清楚的思路说这些问题怎么做、这是一个比较大的问题、为什么不做实现、不做完成。
【主持人】就会把你刚说的不同难度等级的问题混在一起。
【嘉宾】因为就是说如果你不做实现、不做完成的话,那你就不会记得去思考这个问题本身要怎么做。因为有两个研究员,有一两个研究员说OK我只看方向,这个方向很重要,我就只看方向。指完方向之后,他不会想太多这个方向是怎么做出来的,这个问题可能会交给大家下面的人去做。对研究员来说,他只要把方向指出来就可以了,所以这个逻辑是不一样的。比较接地气的研究员对他们来说,他就是指方向,然后同时给大家指出就是这是个方向,为达这个目的你必须走一二三四五,然后把这些东西拼起来之后推到这个方向。
【主持人】你觉得这两个研究员里面都有非常好的研究员,还是你觉得?
【嘉宾】对,非常好的研究都有。
【主持人】可以分别举一个例子吗?比如说你比较respect,或者你比较欣赏的,两类的研究员都有哪些?
【嘉宾】你比如说前面那一类吧,比如说像样吧,乐坤,乐坤这样的。
【主持人】乐坤是说OK,比如他说他想要做的是自监督学习,自监督学习就是自建学习系。那么自建学习系有很多细节,对吧,很多东西要去尝试。但是他有一点很重要,就是数据的样本,是不是有监督的样本,是非常少的,非常少。那么所以他当时不是画了一个经典蛋糕,所以当时他把Reinforcement放在最上面,因为Reinforcement在他的眼睛里面,Reinforcement他的反馈非常少,成功学习非常少,所以他不觉得这东西有前途。他觉得有前途的是自建学习系,为什么呢?因为自建学习系的反馈非常多,这个本身是有道理的。但他不会去想,就是这件事情,这监督和反馈,究竟是怎么样让这个模型学出来的,这个问题他不会去想。就是说建图多,建图少,建图少一定比建图多要差,建图多的话这模型学更快,他抓住这一点不放,他就会,在坚持到底的话,他就会,他就会让大家觉得这个东西有道理,然后变成就会做它。那么确实自监督学习在之后是有很大的用处的,甚至你可以说GPT的整个训练过程也是自监督的一部分,因为它预测下一个词,就是自监督。所以就是说方向上,他指得对的话,那确实有很多人可以跟着它做。所以第一类研究员的优秀典型是,他能去提一个问题,提一个好的问题,提好的问题,然后抓住好的体验,开个好的坑对吧,对好的坑,对,这个方式是可以做的。那么提出这样一个思路就是可以的。还有比如说,像我们这边以前提到的Coconut,这个东西其实应该说也是第一类问题的一个范式。就是说,可能在很多人看来,这个东西并不怎么好做,或者说有很多需要去解决的问题,但是这只是指一个方向,说我们是不是会用那个隐空间的那个向量来学习,连续层,不是说是用语言来学习。那么这个本身的启发,能够让大家觉得这个方向可以做,那具体怎么做的,那很多人在做,那么这也是一种第一类研究员的视角。那么第二类研究员的视角就是说,我不仅要知道做什么,还要知道怎么做,那么这就是我这里很多工作是这样子的,就是说我们要去把机制简化出来,找到它的这个路径,找路径上能够把事情做成。
【嘉宾】你觉得像Ilya和Wo他们属于哪一种?
【主持人】Ilya、Wo应该都属于第一类的,都属于第一类。对,他们就是说特别是Ilya,它对于Scaling Law有一种,应该说是执念,或者说有非常宗教般的信仰。大家觉得就是你别想太多了,你就是scale,然后趁机把工程问题做好,然后把事情做成了,然后我们把数据放进去,然后训练出来。
【嘉宾】我看他去年底接受采访的时候,他倒是有说过,他觉得 Scaling 是不是到头了?
【主持人】对,有点类似吧,他就说房间里所有的空气。
【嘉宾】对,他觉得应该去研究点别的。这当然是这个意识,其实我会非常同意,非常同意这一点。因为他之前的Scaling,这个红利已经差不多吃完了,对吧。因为不管怎么样,任何一个人的方向他都是有底的,就不是说你可以一直Scaling下去的。他当时在正确时间,是正确的那个地方,起了一个正确的一个想法,并且让很多人去执行他,然后成功了,非常非常成功的一个方向。但不可能他这一辈子都是吃这个方向的,这应该说跟以前不一样了。因为以前可能一路的学家,一个方向可以吃到他退休。那么现在这个经济点是非常快的,可能很快的就是大家把事情做成了,那么他就必须想别的东西。所以你刚说的这个红利就吃到了,是指作为研究来说,可能已经就不在研究的阶段了,但是一个实现,不仅是研究,还有实验他都已经吃到了。然后接下来就是说你可以继续吃,但是他作为一个startup的CEO,对吧,他也办法再去CEO这个事情。为什么呢?因为对startup来说,你基于Scaling不是他长项。如果现在Google都已经在Scaling,OpenAI也在Scaling,那么这种情况下,你的startup就fundamentally different。或者反过来说,是你确实看到了什么不一样的事,你才应该去做一个大的事,你才应该去创业。否则就是,如果你非常相信Scaling,那你就应该在大厂,你去Anthropic或OpenAI。
【主持人】对对对。其实在Meta的最后阶段,因为那个整个公司也有比较多的动荡,然后整个AI组织有比较多的变化。Meta自己的模型也经历了,Llama开源本身开始口碑比较好,然后后面又出现问题的这个过程。这个过程你有一些什么组织层面,或者说怎么做好研究的总结吗?
【嘉宾】我觉得其实应该是这样,就是大公司,因为现在这一波AI都是反大厂的。大厂里面所有的incentive,所有的机制,所有的那些人和人之间的关系,或者说所有的那些岗位调配和设计,都是跟现在AI的这个方向背道而驰的,应该这么说。所以你会发现一个组织越来越臃肿,越来越大,那么它对于AI的推进会越来越慢。为什么呢?就是刚刚说了,AI非常需要,或者说现在大模型非常需要人去很主动地知道我真的去用它,真的去感受它,真的去发现它的问题,你会很好地知道它跟我们概念不一样的地方,然后很快地把这事情做成。一旦产生了这个经历和执行者的二级架构之后,这个速度就变慢了,就跟我刚才说的是一样的,就是导师和学生,一旦有这种二级关系,整个进展的速度就会变慢。因为导师没有办法了解学生100%做的东西,然后学生也未必能理解100%导师的那个想法,这种沟通的速度永远是最慢的,对不对。大厂有这个问题,而且大厂很多时候特别是中层管理,他们的目标不是为了让他们项目做成,很多时候目标是為了让自己能够过得更好。
【主持人】那大厂你的小团队能独善其身吗?比如说新组建的Team,Meta的Team,它人数其实相对少没有那么多人。
【嘉宾】就是可以。但是也要看,一旦这个组织变大了,一旦有很多人开始有机制、有中层管理的时候,又还是会有问题。
【主持人】你觉得多大算大?
【嘉宾】就是你看以前,Llama和XCR都是超过150人之后就不行了。超过150人就不行。
【主持人】对,所以150人。
【嘉宾】就是說從人類組織圈上來說,150人是一個臨界點,就是再往上的話,人和人之間的關係就不一樣了。就以前是比如說你一個三十人四十人的小團隊,每個人都認識每個人,那麼人和人之間關係是非常簡單的,但一旦人變多了之後就會有問題,就是因為人和人之間不太認識。這個時候一般是通過組織架構,然後用組織架構去獲取這些知識,然後匯報於上面。它可以合的那部分保持在你說的這個量級。
【主持人】其實Sophie和OpenAI的人都挺多了,OpenAI有七千多人,對。但是OpenAI做模型的人其實也不算多,最重要的是做模型的人,對吧。有沒有很小的團隊,就像克拉克的團隊很小,就它核心的那一部分是收縮的是精簡的。那你們接下來肯定也是在一定時間裡是會比較精簡的一個團隊,對吧?
【嘉宾】對,我們不會招太多人。
【主持人】最近會有人在Frontier Lab和你們之間選擇你們嗎?
【嘉宾】其實有一些人還是從Frontier Lab對我們有興趣的。
【主持人】就你們在聊或者有的已經加入了?
【嘉宾】對。
【主持人】但是你們創始人裡面很多是本來就是的。如果總結下的話,就你過去的這麼多經歷,給你帶來的直覺判斷,還有技術上的品味是什麼?你的偏好是什麼?
【嘉宾】偏好我還是喜歡美的東西,對吧。
【主持人】我也喜歡。
【嘉宾】就是我覺得我本質上來說,應該算是一個喜歡數學的人。
【主持人】喜歡數學,對。
【嘉宾】就是我喜歡各種精巧的結構,你講美的東西應該是這樣子。但是同時呢,另一方面也是意識到這種偏好的一個局限性。
【主持人】講那個人,一方面我可能是一個工程師,我會做很多工程上的東西,另一方面我本質上來說追求美的一個人,對吧。但是追求美的同時就知道美的局限。這個局限講開來說是什麼?你做工程師是你認知到這種局限之後,你試圖去彌補這個局限的一種方式嗎?
【嘉宾】對,就是說應該這麼說,就是理想和現實之間的平衡。對理想來說我們希望找到很美的東西,但是現實不是這樣子,所以你要不然你自己比如說很多時候你不能陷到美的這個幻覺裡面去,你要做一些事情,就是可能對大家都有用,然後對世界都有用,或者說對公司都有用,不是很美的。但是同時在這個條件下還是想要去追求美。
【主持人】你覺得像RSI這個方法,它第一步是在AI,然後後面是自然科學,這是大家能看到的。那再往下它能進入你說的這種更複雜的世界嗎?比如說它有可能去這麼改良社會科學的一些理解和認知嗎?
【嘉宾】我覺得這是有可能的,但是應該說我對社會科學的認知也不是很多,所以我很難給任何建議。因為社會科學至少在以前的學科分類裡,它也是把算成了一種,比如像經濟學,裡面其實有很多統計的東西,有很多數據的東西。
【主持人】是的。
【嘉宾】因為這裡面就是說,這跟自然科學的很大不同的地方是,自然科學本身是默認這個信息是完全透明的。但經濟很多時候是有反身性的,就是我把這句話說出來這句話就不靈了,對吧。所以這個事情很難講,所以我覺得我們這個問題還是很大的問題。
【主持人】你剛才也提到就是以前的一些科學家,比如說物理學家,他一個領域可能會研究一輩子。然後現在因為整個技術變化的很快,可能事情你不是能一直做到頭的。你能遇見到說自己在這個旅程之後,你接下來想探索的東西是什麼?一個是說RSI什麼時候可能到你設想的表層樹狀態,一個是你再往後你想探索什麼?
【嘉宾】我覺得現在我們還是先把RSI做好,我們不會考慮其他問題。
【主持人】今天非常感謝田淵棟做客晚點聊。分享了RSI在去年下半年你們開始組建公司的時候,還沒有那麼多人討論,但到了今年的四五月已經成為矽谷的一個相對共識性的熱門話題的領域。然後我們也回顧了說從10年前就有一些相似的嘗試,到現在RSI有了什麼變化以及各個主要的公司的進展,尤其是你們剛剛在6月初發佈的你們的第一階段的成果。那今天節目就到這兒,拜拜。
【嘉宾】謝謝。
【旁白】本期連點呈現,講一講最近幾期節目裡關於RSI的一些共同討論。這段時間AI研究自動化和自進化這個方向,讓我想到李白的一句詩:腳著謝公屐,身登青雲梯。
【主持人】正是穿着蟹公鸡,李白在梦中忽然就来到了天界,看到先至人犀利如马。这双蟹公鸡无疑就是模型的coding能力。在171期和Henry聊二季度AI机报时,那期的标题就是从coding到RSI,强者欲强的未来?另一期较多展开RSI的就是上一期节目177期想解Kimi K3。Kimi K3的技术报告里就提到,Kimi用K3的早期checkpoint,就是他们早期的大模型版本,已经能做CUDA的优化,也就是这期李田园栋提到的算子优化。RSI这家公司今年6月发的第一批成果里面,有一个就是在英伟达今年刚推出的SOL XZ Bench上取得了SOTA结果,这个Bench就是用来测试算子优化能力的。
【主持人】在K3那期节目里,我们还聊到了田园栋所在的RSI这家公司去测的另一个Bench,就是GPUSmith Bench。这是Muon优化器的开发者Jordan Keller两年多前发起的一个项目,之前主要是人在做,而现在越来越多是变成AI和大模型来做。我们当时也讨论了一个小小的畅想,其实AI也非常适合来自动化地优化优化器本身。这三期节目里的一些共同观察都指向一个事实,就是在一些具体的模型训练任务上,RSI已经发生,而这主要是因为模型的coding能力大幅提升。这自然带来了一个推演,就是目前掌握最强coding能力的Anthropic和OpenAI是不是会更快地进入RSI,也更快地进入一个加速度越来越快的状态,而把其他对手越甩越远。
【主持人】田园栋在这些节目里讨论的另一种可能性,那就是智能提升的曲线是会有台阶的,会有阶段性的平台期,而不一定是渐进式的,也就是说曲线不一定是平滑向上的。如果是后者的话,那确实绝大部分机会都会在现在已经最强的公司的这一边。但如果Scaling Law再往前推进,不管是在技术和理论上,还是在一些其他现实限制上,比如能源和算力上会有束缚,那么就可能需要新方法的加入。而原创性的想法,现在还不是靠越来越强的coding就能马上解决的,它至少是一个变量。你会更相信哪种未来呢?
【主持人】本期节目就到这里。欢迎收听,如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也将成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,欢迎推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果Podcast等渠道关注晚点聊LateTalk,也欢迎关注我们的公众号晚点LatePost。下期再见。