150. 对英伟达研究副总裁刘洺堉的4小时访谈:Cosmos 3、世界模型、武术、黄仁勋影响我的,和你不需要击败所有对手
【主持人】Hello大家好我是小俊。今天我在上海,访谈对象是英伟达的研究副总裁刘明玉。我们的访谈时间是黄仁勋刚刚访华之后的一个月。明玉给我的印象一直是穿着很朴素,背着一个有点旧的斜挎包,态度很谦和。不过英伟达内部的人告诉我,他不像是一个典型的研究者,更像是一个工程上的领导者。黄仁勋给他的一个评价是GFD,Get Shit Done。不久前,刘明玉带领团队刚刚发布了英伟达的世界模型Cosmos 3,所以在这次访谈中,我们聊一聊Cosmos 3世界模型,同时也聊到一名研究者长达20年的求索。而这名研究员的身份很特殊,他身处在英伟达这样一个基础设施型的巨大的系统之中,这改变了他的很多的研究思路。当然我们也很不自觉地聊了一些关于英伟达和黄仁勋的内部的故事。明玉说做模型就要low ego,模型竞争不应该是一场零和游戏。那接下来就是我对英伟达研究副总裁刘明玉的访谈。
【嘉宾】就很常常在讲,就是他喜欢这种zero billion dollar business。你可以是不赚钱,但当这个生意成功的时候,必须是很influential的,是很巨大的。经济的冒充程度应该是根据钱多快从一个人的口袋流到另外一个口袋。研究的冒充程度应该是根据钱多快从一个人的口袋流到另外一个口袋去。我们做完Cosmos 1的时候,问Jensen要不要继续往下做,然后Jensen跟我说你就做到Cosmos 1917。因为他是一个很有定力的人,有些东西其实很重要,他会叫你pace your steps,让你不要急。他擅长打马拉松战,他每天会觉得公司只剩下30天的现金流,30天后就要破产。
【主持人】你刚好加入英伟达10年了,这10年你变化大吗?你在英伟达的股票涨了多少倍了,一共?Hello Mingyu,要不跟观众朋友们先打个招呼?
【嘉宾】线上的朋友大家好,我是刘明玉。
【主持人】因为刚才我们也聊到你到美国了20年,然后在英伟达了10年,你现在讲中文还多吗?在公司里面。
【嘉宾】就是有时候会讲中文,但大部分时候还是讲英文。因为大部分的时候团队里还是很多人不会讲中文,所以沟通上就是以英文为主。但如果说在一个小组会议里面,参与的都是讲中文的,那很自然而然就会切换到中文模式。
【主持人】这次你来中国的行程是什么样的?你多久会来一次中国?
【嘉宾】我现在大概是每一年会来2到3次中国。因为我主要的公司给我的任务、我个人的兴趣在Physical AI。在中国这里,Physical AI的发展是非常的茂盛,很多公司、很多研究员都在做出重大的突破。我们在这里跟大家交流,也理解一下我们如何可以帮到他们。
【主持人】这次来感觉到有什么不一样吗?跟之前。
【嘉宾】这次来我看到的是,越来越多的关于中国的“灵巧手”在关键的科技上面做出突破,去追求下一个Physical AI可以达到的一些重点能力。跟上次来发觉就是速度非常的快,进展非常的快,每次都学到很多东西。
【主持人】这应该是你第一次做一个中文的podcast。我想能帮助观众或者听众朋友们建立一个印象,你现在在英伟达的title是研究副总裁,介绍一下这个职位,以及你们团队的一些构造和人数。
【嘉宾】我现在是研究副总裁,另外也是Cosmos Lab的副总裁。那我们的团队呢,就是研究员加工程师,隶属于我这里的大约有八九十人。那另外,工程师还有其他的团队也是在做Cosmos,英文叫dotted line。虽然他不直接report给我,但是我是整个mission的overall PIC,就是发号施令的人,然后决定方向的人。所以这些人也是遵循我的指示,就是跟这个团队一起合作,把目标给推出去。整个做Cosmos的人应该有两到三百人之间。这是一个在英伟达里面很重大的一个专案,我们花很多资源,这样的人员投入是我们觉得需要的,做出好的成果。
【主持人】我看到你之前还管一个团队叫Deep Imagination Research Group。Cosmos是他演化来的吗?他们是什么关系?
【嘉宾】是的。我大概是十年前的时候加入英伟达,那我在加入英伟达的时候,我的目标就是,我那时候给job talk
【嘉宾】在跟英伟达推销我自己的时候,我的job talk讲的是,一年前我讲的是说,有一天最主要生成视频的运算将会是deep learning,而不会是传统的computer graphics。在那时期就是电脑特效、电影特效用这种graphics,传统的graphic pipeline去生成漂亮的graphics是主流。然后我是在领域里面早期认为就是deep learning是未来的趋势。我记得那时候我跟我的chief scientist Bill Dally在那时候的presentation,我的presentation里面就是讲deep learning因为他是data driven,他可以做到很多传统graphics做不到的事情。比如说有一天我可以把小说当成是input放进这个deep learning,就可以产出电影,然后你可以做很多现在computer graphics需要大量人力才能做出来的这些控制。那时候公司对这个东西很有兴趣,我就很荣幸地加入了NVIDIA。
【嘉宾】进去之后呢,我就一直朝着这个方向努力,但那时期最主要的模型是generative adversarial network,就是对抗生成网络。我是领域里早期去从事这个对抗生成网络研究的人,我就在里面一直做这方面的研究,做了几个自己感到骄傲的工作。其中一个就是,我是最早提出可以做这种我们叫做unsupervised或是unpaired image translation的。在AI里面学习很多时候靠supervision,你要对应的input跟output,你才可以学出这个input output relationship。unsupervised就是说,你并没有对应的input output,你并不知道这个人笑的时候是怎么样,你不知道这个马变成斑马会是怎么样。我们那时候是早期利用一些information bottleneck,可以做出我们叫unsupervised image to image translation。
【嘉宾】那时候我加入NVIDIA的时候,NVIDIA并不是一个大家认同的AI公司,那时候Deep Learning还没有像现在那么的火热。因为大家传统也都是做这种computer architecture去设计这个GPU,没有人在做这种比较应用端的科研。我等于是早期把大家把这个方向做起来的。我在做了许多东西,其中一个叫GauGAN,好像中文翻成马良神笔,像是小画家一样,涂几个颜色,每个颜色代表不同的语义,那你涂一涂之后就可以变成漂亮的山水画。这个work让我等于是帮NVIDIA建立起一个形象,不只是可以做出很好的GPU,也可以做出很好的AI模型。
【嘉宾】那时候我还有一些同事在一起做style gan方向的研究,我们就是这群人把NVIDIA从deep learning,就是等于是第一个把这种生成式网路来做这种media生成,把它带下来。那做了一段时间之后,公司就觉得我可以了,然后就可以开始成立自己的团队。我那时候成立的团队就叫Imagination Research,就是跟我当初给job talk的目标是一致。是在19到20年之间,那时候变成一个research director,但就是那时候知道自己要成立团队,就跟着几个一起工作的伙伴就开始建立Imagination Research。那Imagination Research之后就一直是在解相关的问题,就一步一步想从这个就是朝着把小说放进去产生电影这个目标前进,就是一步一步往下走。
【嘉宾】我们做了几个有趣的这种demo,就是有一年Jensen我们的CEO,他想要用一个数字人来取代他来给这个keynote。那时候我们就帮他做这个假的Jensen的keynote的demo,然后陆陆续续,那时候是疫情期间,然后在那段时间里面,数字人的发展非常的快,然后我们也贡献了一些我们自己觉得很骄傲的technology。
【嘉宾】我十年前在给job talk的时候,我就想要解这个小说变成电影这个题目。但那时候我觉得这个题目可能需要很久的时间才能解,应该是说,我那时候并没有意识到我们其实已经有这个条件了。当你的算力,当你的数据足够的时候,就可以做出这样的一个大的突破。
【嘉宾】那但是那时候我就忙着做数字人,忙着做各种有趣的应用。到某一天OpenAI出了这个DALL-E,这个最早的一个text-to-image model,我才理解到我的野心不够大,我不够勇敢,没有决心去把这东西做出来。
【嘉宾】在算力最多的地方,在算力最多的地方,那时候NVIDIA是这样运作的,你要Jensen投资你算力,你要讲出来这为什么对公司重要。我记得那时候DALL-E出来的时候,我写了一封信给Jensen,跟他讲说,这个未来已经很明确了,就是靠deep learning来做这个图像生成。那NVIDIA很多客户都是用NVIDIA GPU,用传统的graphics来做这个图像生成,那我们不能在这个用deep learning来做图像生成上落后,我们必须投资GPU给给我们这个团队去帮助这个领域成长。
【嘉宾】那那段时间里面,我跟Getty Images也有很多合作,因为我一直在做这方向。那这些传统的content公司,他们也对这个AI很感兴趣,但他们也就是就是试看看,但没有足够多的决心。那看了DALL-E之后,我写一封信给Jensen要GPU,写了一封信给Getty Images说我们应该合作,你们这样未来才有比较的保障。然后我们就谈成的这个合作方案,就是他们提供数据,然后我们有算力,然后我们GPU这个大模型来做这个text-to-image。这就是我踏入大模型的时间点。
【嘉宾】那时候我们成立的一个专案叫Picasso,我们目标是做AI foundry,就是有些公司有数据,但他并没有这种AI的人才,没有这种AI的infrastructure,但他有客户,那我们就是等于帮他做一个Generative AI的模型。
【嘉宾】然后再把模型给他们,让他们去服务他们的客户,然后彼此就是这样一起获利。那时候就是跟Getty Images还有跟Shutterstock去做这件事情。那这是,那时候我还在Deep Imagination Research这个团队的时候,我们在做这件事情。那从这里就是慢慢的,我的research不只是产生一个模型,不只是产生一个论文,我们也产生了一个可以帮助客户成功的产品。就是这样逐步的发展,我当初以为我现在已经决心充足,然后就是愿意挑战最困难的问题。因为已经跟Jensen要了GPU,当时要多少GPU?那时候我是要了1000个A100 GPU。当时的1000张很多吗?那时候是非常的多。那时候还在Ampere的时代,1000张已经很多。那要把1000张的这个GPU串在一起做一个高效的训练也不容易。那这次我们那时候尝试就是当然遇到很多瓶颈,就是逐一克服。因为我是最早一批去做这个Gen AI的,整体在computer vision里面做Gen AI的人,我也很荣幸就是跟很多很优秀的伙伴一起合作。因为我比较资深,然后很多当时很有为的年轻人还在学生的时代,他们会来我这边做实习。然后包含现在在Meta的Yuke Zhu,还有做出这个Sora的Tim Brooks,都在我这里实习。
【嘉宾】我记得Tim Brooks刚加入我团队做实习的时候,他就一直想做这个video生成,想做他想做的Sora的东西。但那时候我们并没有这个technology,我们是用GAN一起去做合作。那时候就看到他的充满的决心、充满的热情,然后当然是人非常的聪明,然后手脚非常的快。那我跟他一起合作,我们也学到很多东西,我们也写了一个蛮不错的论文。那后来毕业之后想留住他,但他去了OpenAI也很开心。他在OpenAI那边就是获得很好的发展,然后后来就做出Sora这个work。
【嘉宾】那Sora这个work出来之后,对,就我的,我是感到非常开心,但我就觉得决心还是不够,还是不够,还是不够。我们那时候就几位就是都在做这个领域的人,就一起写了一封信给Jensen说,我们必须要更多的算力。这就是Cosmos Project的由来。我们这一群学者,我那时候还有Sanja Fidler,然后还有我们公司带这个NVIDIA Omniverse团队的Rev Lebaredian,Jonathan那时候也在这个meeting里面,我们就一起讨论。
【嘉宾】我们就决定要去做这个world model,我觉得这对公司、对人类像是一个重要的一个科技。然后那时候君正就叫我,还有Sanja Fidler,两个人来带这个Cosmos这个effort。那时候不叫Cosmos,那时候就是我们知道要做world simulator。然后君正就叫我们每个人去想这个project叫什么名字,我们就回去想,要叫什么。我已经忘记那时候有几个名字在那边选,但最后君正就说叫Cosmos,然后我们觉得Cosmos这个名字非常的好。所以这个Cosmos这个project这样产生了。
【嘉宾】然后我这个还是在Generative Imagination Lab的时期。在那个时期就是我原本是在做Picasso,就是这个AI foundation for media generation。然后但是同时又负责Cosmos,我后来觉得就是Cosmos这个project,对公司、对整个Lilian更加重要。然后也没办法分身乏术,没办法同时搞两个重大的project,然后慢慢就把这个Picasso这个project给收起来,帮这些客户找到其他可以继续支援他们的科技公司,然后就去开始做Cosmos。
【嘉宾】那Cosmos做一段时间,从一做到二,二做到三,这段时间里面使用它的客户越来越多,需要一定的规模才能去把这个Cosmos这个project做好。你可以想象在research可能就是像一个萌芽阶段,当现在这个Cosmos已经被这么多人给依赖,不管是外面的客户或者是公司内部的团队,到一个不能、就是一定要成功的一个阶段,所需要的资源更加的庞大。那就是在今年年初的时候,我就从media research离开了,我现在是report给我们的新的VP of Software,我们公司最大的一个leader,之前是汇报给Bill,带着deep image generation团队,然后我现在report给Dwight,就是他公司的第一个software engineer,在君正的传记里都有他的故事。对,那我现在report给他。然后我离开research之后,我们就换了一个名字,我就不叫自己的团队deep image generation research team,就叫自己Cosmos lab,这是整个这样的一个变化。
【张小珺】我听说Sora没有出自你的团队,让你很遗憾是吗?
【嘉宾】也不是遗憾就是,我是感到很开心,就是自己曾经一起共事过的人可以做出这么大的一个贡献,感到非常的开心。遗憾的是说每个研究员都想做出贡献,那看到这个Sora产生的贡献这么大,当然自己会觉得很开心,但一方面也觉得说,到底是什么地方,在我的决策过程当中,在我的判断的过程当中,是哪些地方我没有看对,而导致我没有在正确的时期做出正确的事情。一定就是,我其实是一个很喜欢自我反省的人,我就是往往都会去试图的理解怎么样让自己更好,因为说到Sora还是会想多说一句。
【主持人】你觉得为什么OpenAI把这条产品线基本上算是关掉了?Sora它是一个研究工作,它当然本身也有很多应用。
【嘉宾】OpenAI是一个很有商业性的公司,然后他们有大量的人才。Sam Altman一直是,从他早期在Y Combinator,他就是一个投资者,他当然是希望就是有这种投资者的心态,然后希望公司内部有各式各样的project、各式各样的成功、各式各样的portfolio。我觉得在过去一年当中,他们受到Anthropic巨大的竞争压力,他们看到Anthropic在coding agent上面产生了巨大的经济效应。你在跟ChatGPT聊天的时候,你产生的token数可能最多一分钟就生成完了;你做coding agent,可以工作14-18小时,这个token量非常的大。那他们就是,我觉得就是觉得这是一个很好的方向,那就集中公司的精力往coding的方向走。孙子兵法讲的“备多则力寡”,大家的资源都是有限的,那他们就是重新调整资源,然后去往coding这边发展。我不觉得他们认为Sora不是一个好的work,只是我觉得在这个时间点,他们公司有更重要的事情必须要去做,那就要做出一个不容易的决定。
【主持人】我很好奇,因为像Anthropic、OpenAI这种前沿实验室,他们做研究天经地义,因为这就是他们的产品。但是对于英伟达这样的一个基础设施公司,或者说是一个平台公司,我卖token给这些前沿实验室就好了,为什么还要自己做自己的研究呢?就是研究这件事情本身对于英伟达的意义是什么?
【嘉宾】你的基础设施要做得好,做得好的定义就是适合这些应用公司来用。如果你自己不做这些应用,你更不能理解他们所需要的东西。所以就是要去走他们可能会走的路,从中间去解答。而且设计芯片、设计这个电脑的架构,它的周期是很长的,你不能说我现在马上改,需要很长的一段时间来做这个规划。所以你要做这方面的研究,做他们投资去解答可能是重要的问题要解,然后再设计出更好的这个芯片、更好的infrastructure来满足这些AI大公司。
【嘉宾】我总觉得这世界上如果每个想有抱负有理想的人,都有这个工具可以做出他们想做的事情,这世界会是一个更好的世界。一方面看到OpenAI、Anthropic还有中国几家大公司做出的突破,觉得非常开心,我们这个社会会永远不觉得有抱负的年轻人,我们也希望他们有他们的机会。我们可以做出这些模型然后分享给他们,他们可以做出很好的应用、很好的延伸模型,或是从此里面获得灵感,做出他们更好的模型。大家不同的想法都可以落地,我觉得当这么多多元的这些idea都有机会被实现,然后被呈现给这些用户,我觉得大家选择更多,我觉得这社会进步会更好。
【主持人】这方面为什么?因为大家做开源模型的原因。那你们的研究成果会跟客户去有一些竞争关系吗?
【嘉宾】我们做这些
【嘉宾】而且我们做这种开源的模型,我们基本上就是无架放在网络上面,让大家都可以去运用。这事实上真正要落地,真正要满足客户的需求,还有很多东西要做,尤其在巨生领域,好多硬体的问题,好多商业的问题,都必须要解。
【嘉宾】我觉得我们给community一个讯号是说,我们会帮助你在这方面。当你看到这个趋势,看到我们的commitment,我们从一代做到二代,做到二点五代,做到三代,这样一代做下去,你看到我们一步一步就是想把这个地方做得更好,让大家都可以更加预期到说,因为大家在上面会一直投资,一直进步。
【嘉宾】那大家有这个认知、有这个信心,他就可以把他的资源投在更重要的导国上面,去做出重大的贡献。因为每家公司,再有钱的公司,资源都是有限的。那你不找到痛点,找到这个关键点,去做投资、做进步的话,也是不容易脱颖而出的。
【嘉宾】那巨绅这么的难,这么多东西要解,我觉得我们他做出这些模型,帮助他们分担部分的压力,我不觉得是在竞争,我觉得是在帮助大家成功。
【主持人】所以为什么你们当时要立一个非常重要的项目,没有选择当时最后的大语言模型,也没有选择像Sora这样的模型,而是选择了巨绅的一个世界模型?
【嘉宾】大语言模型他在当时就是发展的已经非常好的。然后再就是我的背景不是大语言模型,我是computer vision出生的,CV出生的,对,CV出生的。那这样的一直在这个media这边拍怀,就是image video拍怀。那大概是过去的背景就是把自己走向这个导如荡。
【嘉宾】因为我的背景关系,所以跟着我一起合作的伙伴也都是类似的背景,所以我们就是往这方向走。这是为什么没有走大语言模型。那另外就是NVIDIA也有很强大的大语言模型团队在那里,我觉得我没有太多的贡献,我觉得这Nemo床越做越好,那我这边主要就是想去解一些更适合我来解的问题。
【嘉宾】那Sora当初出来的时候,它也是一个world simulator,那时候主要的应用比较像是这种创作方面的应用。创作非常有趣,每个人都希望可以用更好的方式来去讲故事,去呈现自己想的东西,就是具象化,然后帮助大家去理解。
【嘉宾】你看到的世界,这是一个很好的应用。那时候看到的就是我们在这种digital AI发展极大的、非常的快,同时间设备很多问题需要这些physical tool真正能改变这个物理世界状态的physical tool来满足。比如说当人年纪大的时候就没法开车,但没法开车,整个人的生物品质就降低很多。但如果有自动驾驶车,年纪大的人还是可以有他的mobility。再来就是有很多工作非常劳力密集,也非常的危险,如果有这种physical AI的这种robot可以帮忙做,也可以改善人的生活。然后在家里面总是一堆琐事,要洗碗筷、要整理,这些不见得是你在家里面想做的事情,有机器人可以帮忙去做这件事情,提升人的生活品质。我们看到world model可以对physical AI所产生的贡献,所以那时候就往physical AI方向走,而不是走content creation的路线。
【主持人】Jensen对这个团队提过什么要求没有?
【嘉宾】Jensen对团队的要求非常的严格,然后目标高,当然第一目标可以帮助到客户,这不是一件容易的事情。NVIDIA是一个运算公司,是一个AI基础设施、刷新的公司,我们最厉害的就是整个compute stack,从底层基础设施到CUDA,一路往上。但是我们并不是一个solution的公司,就是给一个机器人的solution,或者是其他应用的solution。但我们的目标是帮助这些建solution的公司成功。有时候会觉得有点像隔靴搔痒,因为你不太了解痛点在哪里,你设计模型的时候,你设计一个产品,如果你不了解你的客户的话,你就没法最佳化。这也就是为什么我会常来中国的原因,就是想理解一下大家遇到的问题是什么,怎么去帮助他们,就是一个难处,一个Jensen的要求。做东西是需要make an impact,Jensen常常在讲,他喜欢这种zero billion dollar business,你可以是不赚钱,但当这个生意成功的时候,其实是很influential的,是很巨大的。你不能说就是满足在每年赚个100个million这种scale,这对很多公司而言都很大,但对英伟达这样大公司而言,这并不是一个contribution,是个分心。
【嘉宾】是个分心,就是你要去解最重要的问题,产生最大的贡献。我们觉得physical还是一个,问题可以产生最大的贡献,所以在这个方向的时候要很小心,就是要去解最重要的问题,而不只去解一些短暂可以产生成果,但它的impact并不是很大,这是其中一个问题。当然就是要做到最好,那这也是很难的。
【主持人】听起来过去十年的英伟达,越来越具有野心了。那接下来我也想探索一下,就是你个人作为一个研究员的履历,你是怎么一步一步探索你的研究之路的?
【嘉宾】我再回答你的问题,我先想想回答之前的问题,我觉得我是一直很有野心的,因为我那时候就认为可以用小说直接生成视频,只是我觉得我的执行力不够,我看时间点不够。那时候还是刚进业界不久,还不太理解怎么样做才是可以在公司中获取资源,然后获得巨大的资源去从事方向。那我觉得过去十年履历里面,我就跟大家理解怎么样看清楚在对的时机,然后怎样就是帮助公司理解这是对公司重要的决定,然后去影响公司怎么去投资。这是我觉得一个变化,是一直很有野心,只是不知道怎么实行。
我最早,那时候我在台北长大,然后在我读高中的时期,最热门的科技是无线通讯,那时候那个手机刚出来,是巨大的手机,然后还是Nokia style,那时候对这个科技感到非常的好奇。在台北长大,那总想离开台北,然后我这时候就去了台湾的交通大学在新竹,那边去学习这个无线通讯。那无线通讯在那边学的一段时间之后,就比较理解它是怎么做的。我的同学,那时候一起在新竹交通大学学无线通讯这些同学,很多人就留在台湾,去比如说在联发科,或者是有些人去台积电,去做这些台湾本身就很擅长的工作。
那我在那时候就有点怀疑,是不是这就是我要选择的道路。因为我从小到大其实没有想过会去美国留学,没有想过。所以我其实一直不太重视我的英文,就是觉得数学物理学得好就够了。那时期我就开始有点怀疑到底什么路是对的。在大三那一年,我就好奇去看看美国的研究所、博士班在说什么东西,然后我看看我自己,现在那时候在台湾的交通大学在说什么东西。然后那时候我就发觉,就是做东西很不一样。然后我觉得,我那时候在算怎么样设计一个polar code可以让传输更加快,然后我觉得这是一种提升,但不是一个0到1的变化。那我看到在美国这些高等学府做东西,我就觉得这个看起来每一个成功都是一个0到1的变化。所以那时候我就觉得我应该出去闯一闯。然后我记得我跟我爸妈说我要去美国留学的时候,他们就吓了一跳,因为他们认识我二十几年,没有听过我讲说我要去美国留学这件事情。这是大三的时候,所以他们听到。
【嘉宾】就是还蛮震惊的。那时候我想去美国学习的是量子通讯,因为我觉得这东西很神奇,就是靠着量子可以直接把讯息从A传到B去。但后来我到去美国之前,我在台湾的Intel在那边待了一年,然后我认识了一个朋友,我们都在那里实习,他在那里做影像辨识。这是我第一次接触到AI,因为之前都是学通信。我看到他在做影像辨识,我觉得很神奇,他就是可以从这些pixel里面去判断里面是什么东西、是谁、是什么物件。然后我就对这个AI Computer Vision开始有些印象。
【嘉宾】那我那时候申请到了美国马里兰大学,在那边开始我的博士。那最早期的Computer Vision都不是blog,那最主要的那个经费研究都是国防。那马里兰离那个华盛顿特区很近,所以那时候具体有一些非常厉害的,就是早期的做Computer Vision AI方向的大佬在那里。那我到那个学校之后,我原本是要研究量子通讯的,然后后来发现那里有做这种Computer Vision,我那时候在Intel实习看到的东西,很接近你的这个题目,我就觉得说,嗯,这看起来更有趣。然后我就找了我的指导教授Rama Chellappa,他是这个领域里面等于是先锋,然后我就开始跟他学习AI Computer Vision。
【嘉宾】那最早做的第一个题目,是从video里面去看这个走路的姿态去判断是谁,哇,然后那时候也是蛮有趣的问题。那我就是在这样逐渐逐渐就是转换跑道,然后去做这个AI,然后最早期去做这些影像辨识、video辨识。然后后来在博士期间,还学习怎么用Shape Matching,然后Segmentation,这些常见的这个understanding方向的这个AI Computer Vision的研究,这样逐渐踏进这个AI的。
【嘉宾】那时期并没有Deep Learning,是一个传统计算机视觉的事情。那时候什么都不work,所以什么都要学。我们那时候做Support Vector Machine,那是一个很传统的用Machine Learning的方式。Support Vector Machine跟优化有很大的关系,然后就是一个不管是连续、离散的优化都需要去学。然后也要去学习一些Graphical Model、Energy Minimization,还有各式各样的就是3D Calibration这些东西,学的蛮多,我觉得算是很扎实。但就是在毕业的那一年,ImageNet出来了,然后改变了整个世界。所以PhD的后期,就到一家叫Mitsubishi Electric Research Lab的一家公司,三菱电机研究院。
【主持人】这是你后来的一个工作对吧?
【嘉宾】对,这是我的第一份工作,在美国的第一份工作。对,在美国的第一份工作,它是在Cambridge。
【嘉宾】在MERL(三菱电机研究实验室)在MIT的旁边,这家公司在90年代是非常强大的一个研究单位。那时候跟施乐研究院在Graphics上面都是非常领先的一个研究机构。那MIT里面有许多教授以前都是在那个三菱电机研究院里面当研究员,包含Bill Freeman、Antonio Torralba都在那边做。那我加入的时候已过那个事情,但是还是很多优秀的研究员下来。那我记得那个公司之后几件事情,那一年AlexNet出来,所以我过去学的东西就是跟未来的世界开始有些divergence。
【主持人】那一刻会失落吗?
【嘉宾】不会,我其实是对这些新的科技一直很感兴趣的,因为computer vision因为什么都不work,所以我已经养成这个习惯,什么都学。那时候什么都不work,然后后来Deep Learning出来之后就觉得很有趣。我还记得那时候是博士班做一年了嘛,等于是实验室里的大师兄,然后我就组织学弟妹们继续要研究Deep Learning,就是去研究。那我还记得那时候有一位师弟跟我讲说,这东西只有几个人会,没有必要去研究,然后我还是没有理他,就是去办这个研讨会。然后后来我的第一份工作是在这个三菱电机研究院,研究院通常就是研究风气比较自由,那我有很多时间去学习,所以我在那里就学这个Deep Learning。Generative Model是我的指导教授Antonio Torralba,他很相信Generative Model,他相信vision,就是相信你要把那个生成放在这是understanding的一部分。所以我在那时候学Deep Learning的时候,就也带留意生成的这一块。那后来有一年去了NIPS,看到Ian Goodfellow的那个生成对抗网络的工作,就对这个问题感到非常有兴趣,然后就开始在这方向里面就开始做大量的投资,然后越学越多这样。
【主持人】你好像很早也开始做生成了。
【嘉宾】对,我是最早做生成的一批研究员。那时候还在,只要能生成32乘32pixel的分辨率,然后看起来不像鬼,然后就觉得自己很成功了。
【主持人】所以为什么生成是理解的一部分?
【嘉宾】Richard Feynman他讲的,if I cannot create, I cannot understand。就是当你可以去生成他的时候,你生成去彻底地理解他。这跟人的学习有点像,对,当你可以讲的时候,意味着你已经理解了。还有早期就是computer vision
【嘉宾】也分这种discriminative model跟generative model。discriminative model是它其实没有深层能力,但它可以判断这是A还是B,判别式。判别式那深层模型就是,一样可以被用来做判别,但是它还是包含可以去重建讯号,可以去描述它。然后当你可以描述清楚的时候,大家是可能认为你更加理解这个东西的,对,那就是discriminative跟generative。所以像最早期的LeNet,可以说ImageNet Classification,我们就把它看成是一个判别式网络。
【主持人】其实你最早做了一年的工程师,你觉得这个经历对你后来做research有影响吗?你就是在英特尔做工程师,以及你觉得做Engineering和做researcher的本质的差异是什么?你又更适合你自己?
【嘉宾】这是一个好问题。做research最重要一部分就是问对问题,问对问题,当你问到对的问题,你就大概就是找对一个方向。那Engineering等于是帮助你跟大家讲,对这是对的问题,就是要把东西做出来,因为那个实现能力让你去做点事情。那Engineering当做大Scale的时候,还有很多东西是很重要的。在去美国之前的那一年做Engineering对我影响,我跟,最大的影响就是认知了这个有这个领域叫AI computation,然后从中间,我今天那时候在巨大的Software Stack里面帮公司去找问题,那这是很磨练耐心的一个过程,我觉得都是很好的训练。
【主持人】所以AI对你来说也是一场意外,它本来不在既定的轨迹之中?
【嘉宾】不算。我不是那种从小就是说我要去理解为什么人类为什么可以有这个智能的发生。我等于是就是一步一步看到这东西,觉得非常有趣,想去理解,然后就一步一步往那个方向前进。
【主持人】它最初打动你的是什么呢?
【嘉宾】为什么打动我吗?最初,后来当然可以有很多原因了,因为不懂,因为不懂。对,不懂。那又比较容易去理解它的重要性,就是有些科技领域像通讯那样子的,你可能要很懂你才知道它到底为什么重要。这个AI就是很容易可以理解,就是你可以重造这个智力,那它有些表现会跟人非常的像,这就很好奇了。因为还有就是,当然每个人都对自己的存在会产生这个困惑,整个群体就是到底什么是人,我们跟其他生物有什么不同,那这就是一个很自然你会问的问题。
【主持人】那我觉得你也是因为这个原因,这个领域会吸引这么多人,在上面做出投入。嗯,如果要找到一个早期对你研究生涯...
【主持人】非常重要的一个时刻,你会这么描述它,它是哪个时刻?是你在做工程师的阶段,还是你到美国之后?太多了,对。那哪一个是最重要的,或者最重要的三个呢?
【嘉宾】我觉得第一个时刻就是在早期,我喜欢漂亮的数学。在computer vision早期阶段,什么东西都不过computer vision,运用大量的优化的算法。那优化呢就是要去找最佳解,如果是连续性的呢,常常我遇到这种non-convex的问题,就是你没办法找到最佳解。那如果是离散呢,就这种NP-hard的问题,就是你也没有足够多的算力去找到最佳解。你还是研究出算法去找一个答案,但你不知道答案离最佳解多远。那为了去确保你的答案离最佳解不是太远,就是有一定的保证,然后就去证明这个叫bound的,就是也许这个最佳解,虽然找到的答案不是最佳解,但它离最佳解可能就是差10%或是差20%,这比随便一个答案好。为了去证明这个bound的,很多时候在早期的研究就会开始做一些假设,那假设让你的数学变得比较干净,可以找到答案,但假设也让你离现实比较远。然后那时候早期会有点偏向于去追求数学的美,而去忽略了跟真实世界的距离。后来一段时间之后,我自己知道这不是一个正确的方式,因为AI本身就是一个应用,就是应该拿来被应用的。然后我是越来越喜欢接近这个问题的本质,而不会被这些花巧的数学给迷惑。
【嘉宾】后来还有一个阶段,就是可能跟从小成长的背景有关,就是总是专注在把事情做出来,而不专注在让别人懂你做出什么东西。然后我开始做NVIDIA之后,就是我觉得我做的research做得蛮不错的。在别人看到这种image translation之前,我就把这个东西做出来,但我不太理解、不太会去表现我做出来的东西一般人可以懂。然后我常常讲,我自己做100分,但是我的解释只有10分,所以别人看到只有10分。那时候我就更加重视如何让我做的东西让别人理解它的重要性,然后让他去理解这个过程,那就是我觉得可能一个很重要的一个lesson。那但是我早期做GAN的时候……
【嘉宾】第三个是我后来理解到,尤其是开始做大模型的时候,我开始理解到团结合作是非常重要的一件事情。人跟人的沟通,其实是一个高复杂度的问题,比如说你……我不知道……
【嘉宾】叫n square。假设你有n个人,你跟这些另外n个人沟通是n square。那n square在那个复杂度来讲,是一个不好的复杂度,就是不容易scale。当里面很多人的时候,每个都要点对点沟通就不容易。比较好就是这种n啊,或者linear,或者sublinear。我开始知道说,要做出一些巨大贡献,需要大家一起团结合作的时候,必须要把事情讲得非常明确,让大家都能懂,然后大家目标能一致,就是自己能把东西做出来。然后也希望大家都能懂是在做什么东西,然后可以朝同一个方向前进。那其实还需要很多,就是帮助大家去理解为什么这个重要。这是后来我做科研,尤其是做到大scale的科研里面,觉得很重要的一件事情,你要做应用,然后你要销售你的工作,你要团队协作。
【主持人】对,这其实也是你的成长的路线,对吧?
【嘉宾】是。当我做出了第一个,那时候我做一个很popular的,我叫高gan。那时候大家都在用它,就是我刚讲的马良神笔。我看到用户的反馈,让我充满了成就感。那我觉得说,我能影响的不只是读我paper的研究员,而是一些更大的一个族群。然后可能就觉得自己的生命更有价值,然后就朝这个方向前进。
【主持人】高gan是取自高gan吗?
【嘉宾】对,这个名字是这样。那时候我是跟一个我那时候的实习生,叫Tessan Park,我们一直在研究这个方向。然后还有朱俊彦,然后还有王鼎俊,然后我们这四个就是一起在研究这个题目。那时候我们开发出一个算法,我们叫十倍的,就是adaptive modulation demodulation,这是一个算法。那时候做出来之后很开心,我在公司内部做个demo。俊诚看到非常的兴奋,然后他问我叫什么名字,我说叫十倍的。他就不喜欢,就是这东西,就是不用懂,还不是用户语言。那时候就是paper已经写完了,投了CVPR,但还没有放在arXiv上面。然后公司看到之后,就叫我不要放在arXiv上面,让俊诚在GTC,那是2019年的GTC的时候,可以在他的大会里面跟大家宣布。然后我觉得很兴奋,很好的机会。那他们就在想,这叫什么?我们公司有一个marketing genius,就说这叫……因为那时候算法都是什么,GAN……
【嘉宾】对,GAN的时代,然后那个市场他要做那个。然后他就提出叫高更,他是法国人,就把这个名字取出来。然后大家一听到名字,很合理,著名画家,然后那时候做应用也是这个画画这件事情,然后就出来了。那时候本来是在GTC,就是技术大会上面要去宣布的。结果那一年他太多产品要介绍了,他最后一刻就……我记得我在礼拜天晚上还跟他对面排练,就是要在台上给个demo。然后当天晚上就接收到通知说,太多产品要讲了,他决定把这个高更就不放在他的keynote上面,一样是发的新闻稿,一样就多demo给这个媒体朋友去看,但就没有放在这个他的大会上面。很多媒体朋友看到他之后,反而是GTC里面最受瞩目的一个work。然后就那一年就这样的,就是说很多种事,然后我们做一个online app让大家都去测试,然后从里面就是大家使用里面获得很多,就是很好的反馈,就是越做越往应用方向迁进。
【主持人】其实高更是不是跟你之前的研究轨迹是一步一步递进的,他不是第一天就坐在那里了。因为你从博士毕业以后加入了三菱电机研究所做computer vision,就进入GAN的时代,然后你其实围绕GAN做了一系列的工作,包括CoupledGAN、MocGAN,再到加入英伟达之后的比如说GoGAN这一系列的工作,对吗?它是怎么延展的?
【嘉宾】我最早的一个GAN的工作叫CoupledGAN,就是把两个GAN的生成网络把它couple在一起。然后couple在一起,产生了一个information bottleneck。然后所有的representation就是在学什么,压缩信息,然后bottleneck是帮助你,帮你给这个网络一个机会,可以去找到本质。那你一个GAN是在model一个distribution,然后你有两个GAN是model两个distribution,一个是码,一个是半码。当你coupled在一起以后,它就有一个限制,就会找到一些共同性,然后就可以让你做这个转换,从码变半码,从这个方向走过整个生成网络。就是在做这个distribution modeling,那distribution modeling就是你可以sample,就产生一个image,一个山。
【嘉宾】一个image或一个video,但是人不只是想要去生存,他要去能控制自己去生存的东西。那控制呢,就是要讯号。那讯号有很多种,一种常见的讯号就是拿image当讯号,就是我这是一个半码,这会变半码,对,这是一个讯号;另外一种码就是image,就是你数秒;然后还有一个就是segmentation,就是这个像小画家一样,什么颜色代表这山,什么颜色代表这水,这是一个讯号;然后再来呢就是比如说class,类似说这是山、这是车、这是机车,那就是生存;然后最sophisticated、最接近人的natural language就是text,就是text to image、text to video,这是最自然的一种形式。但text跟这种segmentation最不同的地方是,segmentation是给你很具体这个pixel是什么,它帮你对位对好,然后text呢,它是一个比较不一样,它的structure跟image structure是很不一样,跟video structure是很不一样。因为structure很不一样,所以它是比较难学的,需要更多的数据。
【嘉宾】所以我研发过程当中,我是理解到这个问题,所以我是从比较容易的方向一步一步往上走。然后容易的最早是这种segmentation、这种image或一个image。这也是为什么我之前讲说DALL-E让我觉得我自己的决心不够,因为我那时候总觉得text to image是很困难的一个问题,然后觉得这个领域还没有足够多的data跟算力来做这件事情,那其实是有的,然后就是因为没有去做,所以做不出来。
【主持人】所以你是沿着image然后到text的路径一点点的延伸的?
【嘉宾】对。就其实在早期,我有几个朋友,我们每年一起参加NeurIPS,我们就在讨论。那时候还没有GPT,都是早期,我们就在讨论说如果真正有AI、就是真正会产生突破,第一个会产生突破的领域是哪一个。那时候我跟大家讲说是text、是language。是哪一年?应该是16、17吧。我当然自己不说text,但我知道就是影像的讯号太多杂讯了,很多东西就是那个,它离那个知识的本质是比较远的。
【嘉宾】它是比较一个,就是这个世界的observation test已经是很纯净的,比较纯粹symbol,所以要产生一些类似智力的表现,最早就是language。我虽然知道最早的AI会是在language发生,后来也是真的是这样,但那时候我就是比较喜欢这种视觉讯号,所以就一直留在这个视觉讯号的深研这边。后面这几个GAN的工作你来讲一下,那时候就是image translation,从A就是那种码变斑,那个风景画变真实的这个风景,然后后来又开始做video。然后我们那时候做一个叫vid2vid,那时候是把一个车子的simulator产生那种很简单的这种卡通的图片,然后把它变成一个真实的驾驶场景,就很接近现在的World Model这些东西。就已经到NVIDIA了,对,都到NVIDIA了。我只有couple GAN不是在NVIDIA做的,剩下的GAN都在NVIDIA做的。那时候他们早期做这些工作,然后也因为这样子,跟Ian Goodfellow,就GAN的那个发明人成为好朋友。然后我们就很多的讨论,然后也很幸运就是在英伟达有很多优秀的研究员,余家辉、Tim Brooks,还有很多来我这里实习,然后跟他们学习,然后做了很多一些work都是围绕这是image translation、video translation这方向走,对。
【嘉宾】然后后来有一年,我在读PhD的时候学的都是传统的这个computer vision的东西,那PhD毕业之后Deep Learning进来了。好那时候就是想说,你不应该做hand-craft的algorithm design,不应该做hand-craft的feature engineering,就是应该data驱动。然后那时候也理解到就是这种更加scalable的approach,简单scalable的approach是更容易成功的,所以就常常跟自己讲,就是说你在做选择的时候要找这种更加scalable的,就是后来大家讲bitter lesson。那我在做GAN的时候很开心,但我一直在思考GAN到底是不是scalable,因为GAN大家都知道说它很难去训练,所以我担心这东西就是可能最后不scalable。那一年余家辉来我这边实习的时候,我跟他研究的题目就是要去scale GAN。那时候很早,那时候我就看到余家辉他的才华洋溢,然后就是做出很多,就是虽然我们那时候没有写出一个paper,但那时候做的实验量非常的惊人,他的想法我看到。
【嘉宾】哇,还可以这样想。然后就是,比如说那时候GAN是一个generator跟discriminator,那时候我有信心的是有很大量的GPU,一个class来出一个GAN。他就想到说每一个GPU都放一个discriminator,但是它的weight都不一样,所以就好像很多人同时跟这个生成式网络做对抗。在那时代能去实现的东西是很不容易的一件事情。然后那时候还有另外一个实习生,他叫Germain Burstin,他就是后来发明Adam optimizer、现在大家都在用的Adam optimizer的人。然后他那时候来我这边实习,那我跟他研究的方向是如何在这种架构上面用更好的算法来去把GAN给做得稳定。当然这两个最后方向都没有成功,但他们各自都开发出了非常技能的、很有成就的工作。Germain就是从那时候开始,我们写了一系列的paper,就是如何用Adam早期的算法来去稳定、来去让训练更稳定。他就是一路一路往下走来开发这个Adam的算法。是很开心的一段时光,学会很多东西。到某一年很努力,跟着这么多聪明的人,在研究这个怎么让GAN更加scalable。但每个结果都走向、得到一个结论,就是GAN不scalable。然后我建立这个团队,那时候大家加入原因就是想做GAN。然后那一年我就跟大家讲,不能做GAN了,要往、就是这方向不scalable。我们那时候看到diffusion,觉得这个方法极其稳定。这应该是17年,不是17年,应该是2021吧,就是那时期。17年是transformer发明出来了,对,17年transformer。transformer发明出来之后,我必须讲我不是早期去接触transformer的。
【主持人】当时的英文还是LLM,对,这是LLM那一块。
【嘉宾】我一直在专注在GAN。然后早期的GAN比较好训练的都是用convolution network,到后来他把diffusion transformer带进来之后,做diffusion那边的人才慢慢地往这个transformer这边走。所以那时候就是从算法层面来看,觉得这个GAN不scalable,然后就跟团队讲说,不scalable的东西最后走不远,然后做diffusion,然后就开始做diffusion,然后往下走,对。
【主持人】这是一个重大的转变时期。
【嘉宾】那做diffusion一开始是做image,然后来做multi-view image,multi-view image就做变成3D generation。我们就做一系列这方面的work,就是AnyDoor系列的,AnyDoor image generator,AnyDoor 3D、AnyDoor video,然后做各式各样用diffusion来做的生成。
【主持人】我听这个我会想到两个点,就是你在CV这么漫长探索过程中,其实计算范式发生好几次变化,从传统的,然后到了GAN,然后又到了diffusion,现在每次转变的时候,做一个研究员在其中应该是一个什么样的心态?我发觉这越变越简单了,会不会觉得我之前的工作都白做了?
【嘉宾】真正常常讲就是suffering from a reference of greatness,然后在这么多就是……
【嘉宾】经历当中,我觉得我现在越来越能掌握这个事情的本质,然后我觉得有点就像是传统的科研一样,就是把事情找到真正找到本质,找到最简单的方式去描述这世界是怎么运作的。然后我觉得现在的方法就是把事情越变越简单,在Cosmos这边我们也是从数个模型就变成了现在这个Cosmos。
【主持人】也同意了。
【嘉宾】对,就是今天理解到原来这就是事情的本质,然后每一个方向我都是花了5到10年在投入。我觉得未来的决定我会深受这些过去的那个经历影响,然后我也不能说那是错误的,那时候不能说那是错误,就是那时候的条件、那时候的算力、那时候的数据,在那时候做那些事情是合理的。那时候学的东西对我现在做很多事情理解很有帮助。
【主持人】还有我发现你好几次提到你的实习生在AN的lab里,是不是就是通过实习生来涌泄一些idea,是已经很常见的事情?怎么看待年轻人?比如说经济的矛盾程度是根据钱多快从一个人的口袋流到另外一个口袋,那研究的矛盾程度应该是根据idea多快从一个人的脑袋流到另外一个人的脑袋去。
【嘉宾】你听到我的idea,你有些想法把它变更好,我听到你新的idea,我觉得诶不错,但这个地方也更好,你就一直流动流动流动,然后idea越来越好。那因为我走向业界的这条路,就不是去学校做教授,那如果你只是在业界整天交流只有你的同事,idea的diversity就低一点。那英伟达这边我们找很多博士生,就是跟这些很有想法、不同背景人一起合作研究,然后互相学习,我觉得这东西是帮助我成长,也帮助他们成长的一个很重要的一个发展。
【主持人】你12年加入了30,博士毕业加入了30研究所,然后16年加入英伟达,后面这个职业的变化是怎么发生的?你怎么加入英伟达?
【嘉宾】自从开始做deep learning之后,我很相信算力。在30研究不是一个重视算力的公司,只是一个重视算法吧。然后那时候为了能做出研究、做出好的研究,我就常常跟我那时候的manager要求要买GPU,对。
【嘉宾】然后开会就是说我们需要GPU做这件事情。在三零研究有一个long term mentor安周埔照,也是一个很有名的研究员,然后他那时候就决定离职加入苹果做自动车。然后我突然间觉得说,当初把我留在三零电机的主要原因走了、没有了,然后我就开始思考说我是不是也要换工作。那很自然而然的换工作就是到微股跟这些大公司聊一圈。那时候大家都看到就是Google、Apple、Meta这些大公司。然后后来他们的recruiter找到我,然后我看到NVIDIA。对,每次我都想买他们的GPU,然后我这么缺GPU、这么想要GPU,那为什么我不加入一个就是生产GPU的公司?所以那时候我之后就决定就是加入那个英伟达。
【嘉宾】那我那时候父亲不太能理解,因为英伟达是他们没听过的公司。那时候没听过的公司,苹果不错,谷歌不错,你为什么要加入英伟达?然后我那时候因为我觉得GPU是最重要的,尤其是那时候我开始做Contrastive Game的时候,那是Unsupervised Approach,所以Unsupervised Approach代表数据取得比较容易一点,你不需要标注。那我就觉得那最重要就是算力跟数据,那我既然数据不需要标注,那我就去。
【嘉宾】然后一件事情很有趣的是,我后来发觉,就是我那时候在三零电机的manager,我每次跟他argue GPU,只要我吵赢了,他给我一些那个经费去买GPU,同时之间他会买NVIDIA的股票。然后后来他就退休了,他后来跟我说了,当时没有告诉你,不然你也可以买了。
【主持人】是的,我看到你在三零电机工作的时候,就已经和NVIDIA的人有一些合作的什么在一些论文上面。
【嘉宾】不是,我多半是那时期就是写的那个paper,因为学术的论文就是审稿,有时候你不是第一次投就会上了,然后可能是多投了几次后才上。那在三零做的研究,可能后来到了NVIDIA之后,就继续在上面做一些提升,然后所以这个才会一些paper的作者同时有三零的作者跟NVIDIA的作者,对并不是在那时候有合作。
【主持人】公司跟公之间合作没那么容易,我以为是之前有一些合作基础,所以你加入了NVIDIA,其实不是的,还是正常的一个求职的过程。
【嘉宾】对,就是正常求职。我那时候并不知道NVIDIA有一个研究机构,我那时候觉得主要是买GPU。然后那时候面试我的几位同仁,我后来跟他聊之后才知道他们真的是在做研究才过去的。那时候大家的研究机构没有什么名气,多少人啊?
【主持人】那时候去的时候不到100个人吧?而且不是纯粹做AI研究。
【嘉宾】大部分人都是做Graphics。那时候做StyleGAN那一帮人,那时候也不是在做GAN,他们在做别的东西。然后我都印象很深刻,就是在NVIDIA Research每一年都会有一个叫Offsite,就是把世界各地的NVIDIA Research的同学飞到加州,在硅谷南边有一个小镇,Monterey下面的一个小镇,然后那边就有一个地区,我们在那边做了两三天的研讨。然后是我第一次见到Tero Karras,就是发明StyleGAN的人,还有一个Jaakko Lehtinen、Samuli Laine这几个重要的GAN的研究员。那时候他们都没有做GAN,然后我已经做一段时间了。那我遇到他们的时候,嗨琳我想说他要把GAN的问题给解了,然后我想说OK,你可能不知道我多难,我是很希望他们成功,但是觉得他们有人低估它的难度。然后后来他们就是投入在做这个StyleGAN,从V1啊2啊3啊,然后就不断的突破。然后我跟他们当中学到很多东西,他们一直在做这种unconditional的,不是这种我做的那种控制性的,但是他们就是对这个细节的追求,对这个结果的那个追求,就是影响我这个研究的发展很多。
【主持人】进入因为做研究,有像你预期那样可以有很多的GPU吗?
【嘉宾】对,这世界上没有任何一个地方GPU是够的,然后你总是看到不够的地方。对,那我是很幸运,就是我是最早在英伟达里面做大模型的,那个就是用大量GPU来做这个生成式网络的,一个研究员。那因为我早期办公室做了一些就是visibility很高的work,所以公司很多人都认识我,然后那个老黄也对我蛮有信任的,所以我就可能有幸有很多GPU资源可以去做这些研究。但每次都是看到别人的GPU更多,觉得自己总是不够。
【主持人】怎么在一个像英伟达这样的公司获得更多的GPU,你需要学会什么?
【嘉宾】你要懂公司要解的问题是什么,你要想办法就是跟公司解释,为什么你做的东西会对公司产生影响。每个研究员都有自己的想法。
【嘉宾】研究员某方面来讲都是very high ego,文人相轻自古皆然,每个人都觉得自己的想法比别人好。但公司的本质跟(学术)还是不太一样,公司是为了为股东谋利。那对真正来讲,他是希望可以take care of family,就是整个公司这么多人一起打拼把英伟达建出来,他希望可以帮大家照顾好family,就是公司要赚钱。所以我学到的一件事情就是,我深信我做的东西对自己很重要,那这东西会产生改变,产生改变会帮助公司。那我要怎么去把这事情讲清楚,让这个leadership,让这些不懂AI的一些leader就是理解到这东西对公司重要,就是一个重大的变化。
【主持人】这是你刚才分享的三个时刻你的第二个时刻,这具体是在哪个项目里发生的转变?
【嘉宾】我那时候讲第二个时刻是如果让其他的研究员更加理解自己做的东西,就是最重要的心,我一直不断的变化过程,我很难讲是具体在什么时候发生。但我想讲三菱电机那个案例对我印象很大,因为三菱电机在90年代非常的重要,因为它是早期这种没有任何限制的这个地方来做research,包含领域里面很多著名的人,像有Bill Freeman那时候在三菱电机研究院,然后Bill Freeman吸引了一堆比如说Alicia、Ephra,这些是一些著名的教授,都在那边实习过,那边就是做出很多重大的research,所以那时候可以跟未来研究院可以一起竞争。
【嘉宾】但某一时期公司的方向改变,他们开始怀疑这些这种blue sky research对公司的(价值)影响是什么,就越来越难去justify为什么要去配这些research,然后就产生了一个很著名的,现在年轻人大家都没有接触到的事情。那时候开始就是一堆重要的学者,在三菱电机的学者就陆陆续续被fire了,离开公司。有些就加入维罗兰,有些加入学校当教授,那个MIT、那个Rice,然后有些人去那个Disney,就是人就陆陆续续的走。那留下来的一些人,他们还是做的类似的research,但是比较难跟公司的发展方向相关。比如说三菱电机对做相机、做这种工业用的相机很感兴趣,做机器手臂很感兴趣,所以你方便研究就是可以获得公司的支持。
【嘉宾】继续往下走。那我加入的时候已经是这东西都结束了,那但是我那时候得到的训练就是说,不管是研究还是兴趣跟公司的兴趣也是可以align的。然后我就常常看到,因为在这些很久,常常看到这种周期,就是很多公司都会一开始的时候给很多自由度,然后很多很有趣的idea都出来了,但某段时间后开始紧缩,然后就是留下那一批跟公司这个兴趣比较相关的人。那就是你可以看到不管是Google,不管是Meta,都是有这样一个过程。那我可能是很有幸的,在我的生涯的早期我就看到这个过程的发生。所以我在英伟达的时候,我就知道,我那时候就是一直认为就是,首先我知道我做的东西跟这个用diffusion来生成影响对公司绝对是相关的。我更加花心思去理解怎么跟公司的决策层解释为什么我做的东西重要。这个特别重要,是因为可能是公司在上升期或者是狂涨期的时候,他允许你做很多blue sky的探索,但是他只要是下沉的阶段,他就会收缩。对,他一定要你回答为什么你做这个事情重要,你跟我有什么关系。是,而且diffusion非常花钱,对,所以你更加要注重解释为什么这对公司是一个重要的投资。因大家也会注意到你的研究,其实很多时候的理念就是研究即产品。
【主持人】这个跟那段经历有很大的关系,是不是这后面影响你在英伟达的很多做的研究和产品?因为比如说你的GauGAN,你刚刚提的那个项目,就是基于的那个算法,其实也是做成了一个实时绘图的一个产品,然后包括后面也做了视频会议增强、AI增强的一个产品,就是所有的研究都会变成一个产品去发布。
【嘉宾】是,我是算很运气的。我是一个随着年纪越来越大越重视效率的人,所以我很精准地把自己的research变成了一个产品。我不能说GauGAN是个产品,我还汲取事情是一个学习,一个重要的学习,AI单独存在并没办法改变一切。怎么说?在做AI的时候,大家都是追求越来越好的模型,但你慢慢就会发现,就是模型慢慢收敛,大家都差不多。但有些人会说我在不断地进步,但你看到就是,这个月那个Answer比较好,下个月那个GPT比较好。
【嘉宾】然后可能下下个月,那个Gemini就追上来了。然后中国这些强大的公司,智谱和Kimi,百川、通义千问,然后DeepSeek,然后MiniMax,这些公司都不断在做突破。那慢慢的,就是大家的模型能力都会差不多。然后你模型能力都差不多的时候,你就会理解到说,你光靠模型是不够的。
【嘉宾】然后我可能是比较运气比较好,就是早期就认为这个模型会收敛。然后我一直重视,就是不能只靠模型,要跟公司的其他的业务生态结合在一起。你看Gemini做那么好,就是Gemini有Google一整套的Google Docs、Google Search一整套的平台合在一起。那就是当越多人使用你的模型的时候,你都会反馈越多,然后就越方便,那就更容易就是对公司产生贡献。公司愿意给你更多的投资,你就会做出更好的模型,那就一路可以把这个长期的这个发展一路做下去。
【嘉宾】所以,那我在早期做AI的时候,就是跟其他的研究员差不多。就是研究员、PhD学生毕业的方式就是写出高引量的论文。什么叫高引量的论文呢?往往就是你在Benchmark的结果比别人好,就是你就是要一个killer,把别人的方法给推翻。然后再来就是文人相轻嘛,总觉得自己的比较行。那我就是一路往下做,所以很多时候早期做研究的时候就讲说比别人好。然后到晚期的时候,我后来接近的理解就是,比别人好只是其中一个,就是证明你的东西有价值的方式。那另外一个方式就是你可以帮助到别人,让大家都变更好。
【嘉宾】然后你会发觉就是我,我现在的想法越来越接近就是,我做出什么东西可以帮助整个领域变好,而不是追求说我比别人好。这是一种high-level,还是一种low-level?嗯,我不知道是high-level还是low-level。我有幸在过去20年当中,遇到好多聪明人物,总觉得就是这些人才非常的多,然后他们很多实际上都比我优秀。然后我会觉得这是非常开心的一件事情。那我觉得我自己能做出东西来服务这个社会,但我也不会觉得说我一定是比大家都还要优秀。所以我不是说high-level,也不是说low-level,我就觉得我是有办法产生贡献。
【主持人】嗯,你刚才其实说到一个你做模型的思路,就是你觉得模型最终会收敛,它的能力可能会同质化。但是我理解那些frontier lab,他们的认知是说智能现在还没有到底,智能还要继续高速提升,你不认可他们这个观点吗?
【嘉宾】就智能的scale,我当然一方面很好奇嘛,然后呃,我自己也在用这些模型,我也看到它不断地都在提升嘛。但是有些人总是会讲说接下来会有exponential growth,如果你不敢在投资这家公司或加入这些公司的话,你就会miss out the opportunity。对,然后我觉得,看过去历史,从来没有这样发生过,就是一下某家公司掌握了所有的筹码,其他的公司都没有办法去追上,这从来没有在世界上发生过。嗯,然后我不觉得AI会是一个例外。对,我觉得大家都很聪明,对,就是人员会流动,总是在A公司做一段时间,总觉得我自己的才华没有受到肯定,我可能就跳到B公司去,对。那呃,这些技术这些东西就自然会在这个领域里面扩散,嗯。对,然后我总觉得不会有一个公司做巨大的抄底(注:应为“抄起”或其他),其他公司都没有机会,我觉得这本身就不是一个稳定的社会状态。如果推演一下,如果模型的智能大家达到了一个差不多的水平,接下来大家竞争的是什么呀?就是整合,跟自己的这个生态、跟自己的产品的整合,嗯,对。
【嘉宾】就是,这是大公司。创业公司呢?创业公司的优势就是可以走大公司不能走的路。比如说对Meta来讲,任何生意只要是小于一个Billion就没有兴趣去做,但那些本身就是有一些很值得做的东西。然后有一本著名的书叫那个叫什么,Innovative Dilemma,这是一个创业者的重镇(注:疑为“指南”的误识别),对。就是往往这些小公司在走向那些当初不是很被看好的这个领域,看到有一些东西可以慢慢逐渐起来,很多公司都是这样起来的。
【嘉宾】英伟达也是这样的,英伟达是这样起来的。所以我觉得还是充满机会。我不觉得一定要做,你如果现在开一间公司要跟OpenAI等等一样的事情,很危险。你的资金绝对没有他们雄厚,然后你没有客户,你要怎么去得一席之地?然后他们这么大的资源可以把东西做便宜,然后你不容易存活。所以你要去解一些痛点,是他们没办法去解的,否则他们不想解,就是他们没办法去解。他们不能just do it,为什么要去解这件事情?所以哪怕是你要做大模型这件事情本身,最后你要找到你自己独特的生态位。不管是OpenAI还是Anthropic,我们可以看到Anthropic早期被认为是落后于OpenAI的,但他是最早相信coding的。当OpenAI在做分散式投资,把鸡蛋不放在同个篮子里的时候,Anthropic是做集中式投资,然后最早去做出这个coding的东西的。所以他那时候就看到了一些机会,然后他又坚信,有决心把他做出来。所以我觉得对创业者而言,应该就是要有决心,要去看到一个机会,然后看到一个你独特的机会,运用你的资源把事情做成。
【主持人】但是今天不管是硅谷还是中国,大家又开始全部同质化地都在做coding、agentic coding,你怎么看这个现象?你觉得这是对的吗?
【嘉宾】每个公司做这件事情背后都有不同的目的。我不是站在他们的立场,我无法去讲。但从我角度来看,这其实是很辛苦的一件事情。
【主持人】你说的是同质化竞争。
【嘉宾】同质化竞争是很辛苦的一件事情。我觉得他们做这件事情可能是被迫的,因为本身这是一个重要的technology,这可能大家都不希望自己核心科技是被掌握在别人的手里,对吧。但我不觉得这个是他们计划的全部,他们一定有其他的计划去做出一些差异化。你没有差异化,就没办法做出差异化的产品,最终还是要差异化,我觉得是。
【主持人】嗯,刚才我们其实回溯了你的很长的一段经历,你作为就是刚到美国时候的……
【主持人】那个第一份工作的研究员,刘茗玉,然后到后来在英伟达变成了一个tech lead,然后再到现在是一个研究的VP,你觉得你在不同时期解的题是一样的吗?
【嘉宾】嗯,skill是越来越大。然后那个,这个skill指的不只是管理的skill对吧?对,不只是管理的skill,不管是运算、人员的skill。然后呃,这跟整个AI发展也有关系嘛,AI从探索到可以落地,嗯,那就是一个变化。然后这些不同的时期都有不同的经历,有时候还是会怀念以前那些各种方式都、各种东西都不work,整些想什么东西会work的时光。为什么?有多种可能性的时候也蛮开心的,就是多个选择,多选择会给你一种开心的方式。现在的状态就是也有很多选择,只是就是我觉得越来越缺进。我自己蛮喜欢就是呃,回到事情的最核心,然后现在发现就很像是现在的解法都是呃,重剑无锋大巧不工。就是呃,很扎实的一步一步把这个base infra做好,然后把东西解出来。在这个执行过程当中,我也觉得是一个很不错的历练,从里面学到很多东西,怎么让这个帮助团队看到最核心的本质,然后去提升这个执行力,但同时间又可以在创新的地方,让团队做出重大的创新来去跟上这个时代的变迁。各种同时写有不同的挑战,都很有趣。
【主持人】嗯,从一个研究员到英伟达的VP,这个多见吗?
【嘉宾】我可能是第一个吧。
【主持人】你是第一个,你觉得为什么呢?这是我想问你的。
【嘉宾】我在英伟达前几年是每一年跳一级,然后就一直跳跳跳跳到VP。对,然后我觉得是因为我呃,早期在NVIDIA还没有AI人才的时候,我觉得在那里就是帮助公司,然后提升不管是AI research的知名度,或者是解释AI怎么影响公司。然后我自己又很喜欢落地,就是一步一步获得公司的信任,呃,公司就愿意把这个越来越大规模的专案给我做。
【嘉宾】像现在想想看,整个团队这么多人,运用这么多运算资源,每天都是几百万美金的运算成本,日积月累下来,就是公司有一定的信任才有这个机会。
【主持人】嗯,所以你跟公司align非常重要,对吧?一个纯粹的研究员的天性和一个管理者可能有某种程度上是相背的。
【嘉宾】对,研究员要创新,研究员需要recognition,然后有时候跟公司要recognition可能不太一样。
【主持人】嗯,那你在成为管理者的道路上,有没有可能一直保留一部分研究员的天性呢?有没有可能是在带着镣铐跳舞?
【嘉宾】我觉得我还是个研究员,我还是常常读论文,然后我有时候会做一些实现去理解。我最担心在这个一路成为管理者的历程当中,我跟底层脱钩,我不理解问题的核心所在。然后我会强迫自己review大家的code,去读paper,去challenge每个人的idea,然后跟大家做一些debate,来确保这个方向是对的。
【嘉宾】嗯,我公司的人大家都知道,我可能是少数还在继续看code的VP,然后还是会继续揪细节。但我觉得我如果不做这些东西的话,我自己会不理解痛点在哪里,就不能去理解每个人对这个项目的贡献在哪里。我只是希望自己一直stay grounded,看清楚一切,然后这样可以帮助团队成长,也可以看清楚谁的贡献在哪里。
【主持人】嗯,如果说过去20年,就是你到了美国之后的这20年,对你影响很大的几个人,你会说谁?
【嘉宾】哦,那第一个就是我的导师教授。他帮我把基本能力建立起来,嗯,他非常厉害。然后他也是非常善于沟通,他可以让任何场面都充满想象。其实是这种很严肃的review meeting,然后他对人都非常的尊重。
【嘉宾】然后就是在他那边学到很多东西,嗯,然后再来就是,我实际上做实习的第一个mentor,他说独造啊,他就是手把手教会我很多那个美讯能力的东西啊,他对我影响非常非常大。到英伟达之后,就是多半跟这个同才学习,terrokeras,就是那个style game的一作,我也受到他影响非常大。
【主持人】对,是哪方面影响?
【嘉宾】他对东西追求到极致,你如果读过他的论文,你看他做的实验分析,去把这个本质套出来,这个过程这个坚持啊。我跟很多不同的研究员合作吗,在那个实验然后那实验,很多研究员就是一个想法写一篇paper,同时间一个系域可以写20篇paper或是40,一年可以写个40篇paper。terro就是每年之下写一篇paper,那就是把他所有的,他工作也非常努力,嗯,然后就是把他所有的就是人生的经历啊,就投注在同一个ID,越专越细,然后问题的本质,然后产生重大的贡献,需要压强更大,就是这个stay focused这件事情。我可能是从这里面,从他跟这些人共识当中,学到很多东西。
【主持人】嗯,那老黄呢,他对你有影响吗?
【嘉宾】非常大的影响,嗯。他这个工作非常认真的人,我在早期加入英伟达的时候,他常常会传论文叫我看,然后对叫我看,然后我就要写一些summary给他,跟他帮他讲是什么事情。他是一个非常热爱学习,一直去学习,一直去理解,他当初也不懂computer graphics,他敢踏入做GPU,他去把computer graphics学起来,他也不懂deep learning,也踏进AI,直动deep learning。然后这是他强大的学习能力,强大的兴趣一直往下走。
【主持人】嗯,他都懂他,为什么敢透露呢?
【嘉宾】他有一套自己的那个决策法则,他就是叫first principle,他就是他会把事情的本质把他理性清楚,不会受到外界的讯号的干扰,他就是看得很清楚,就是说这方向最make sense,然后就往那边走,他在早期就敢all in deep learning。对。
【嘉宾】当公司获得巨大的领先,在早期就敢all in CUDA,让公司产生这个很好的foundation。我在认识宣明之前,我觉得我的决策都是偏比较短期的,然后我看到他怎么去做这种长期的决策,然后坚持,然后我觉得影响非常的惊人。他还有一些很惊人的地方,他每天的信都非常多。
【主持人】邮件是吗?
【嘉宾】对,邮件都非常多,但他都是很仔细的去读,然后去找一些别人看不到的讯号,然后做出一些重大的决定。而且他是一个很理性的人,当你事情很多的时候,你如果没办法把重要事情去做的话,就是你把时间放在不重要的事情上面,你就不会做出重要的事情。所以你决定哪些事情很重要,是很重要一件事情。
【嘉宾】然后我自己是这样推想的,他强迫自己每天读大量的email,强迫自己快速的就去决定什么是重要的,什么是不重要的。在每天不断的练习之下,看的事情看得非常清楚。好,当你看清楚事情什么是重要、什么是不重要的时候,接下来都是执行。那很多人执行的时候会把自己的个人情感放在里面,就说这不重要,但是我跟那个人不错,然后我是不是应该让他去做,他不会这样做,他就是觉得说我做的目标就是take care整个公司,我只要一直做对公司最重要的决定,你只要留在公司里面,我就take care of you。
【主持人】对,然后就从里面去学习他怎么去做prioritization。
【嘉宾】然后我觉得这件事情让我印象非常的大。就是我现在当research的一年的时候,可能同时处理两三个prioritization,我觉得好累,每天要换两三个topic。我现在几乎就是每半个小时换一个topic,然后我觉得以前是没办法想要做这件事情,但是在这种不断一直做context switch的状态里面,也帮助我去更加的理解什么东西是比较重要。对,这是很重要的一件事情。然后这件事情就是,如果你学过computer science,computer science最重要的一件事情就是懒做,就是不用算的东西不要算,可以晚点算的东西晚点算,可以直接就是一个no,我就全部一个no。那你人生就是这么多时间。
【嘉宾】如果你知道什么东西不要算,就把它溢出的话,你的人生运用就更有效率。所以我觉得还是很值得去学习computer science,不要因为AI就不去做computer science。老黄又把什么排入了他的计算范围之外?每个时期不一样,每个时间段不一样,这不是永远固定的。比如说现在呢,他要处理的事情实在是太多,也很难说现在什么东西不重要。我自己看到的东西跟他看的东西完全不同的等级,他看到的是……他本来是全球AI重要的一个推手,对吧?他看到的东西远超过我看到的东西,那我不好评论他觉得现在什么东西不重要。
【主持人】你是怎么保持自己的精力的?你有什么一些技巧啊?
【嘉宾】我是很喜欢运动的人,我以前喜欢做这种团体运动,打篮球啊,打网球。那我后来就是……我还有一个很大的兴趣就是,我是一个投入中国功夫很多年,好几个十年,就是从十八岁开始一直在练习中国功夫的人。
【主持人】对,我听说你练功夫是吧?
【嘉宾】对,有功夫老师。我的武术老师是徐济,他是一个很有名的武术老师。他的老师是刘云桥,刘云桥老师是李书文,当初是那个大家讲神枪李书文,是沧州的武术家的代表。他的八极拳劈卦掌,对整个那个……只是整个武术是一个重大的击技。他除整理出来的八极拳劈卦掌。那我很有幸就是在台湾那时候因为讲切实的关系,有一群这个武术家到了台湾,那我的老师徐济在那边跟刘云桥学,那我跟徐济学,才学学会这些传统武术。那武术就是一个很好的身体的锻炼,不管是心智啊,然后磨练啊,对体力啊,对心智磨练都很好。还有武术外的好处就是,他只要一个人就可以做运动,然后我早上起来就是做这个武术的锻炼,自己在那边做训练啊,蹲桩啊,打打拳啊。然后我最近还有一个新的喜好就是叫Ice Punch,就是你用一个冰桶,然后把像运动员一样做完激烈运动之后跳进一个冰冷的水池里面,然后就是帮助身体的修复。然后我觉得这东西也帮助我保持的精力,可以面对每天高强度的挑战。
【主持人】这都是你上班之前要做的事情?
【嘉宾】对。
【主持人】我对你的印象还蛮不一样的,因为我每次看你都是一个非常谦和的人,但是你还是做一些相对有一点点激烈的运动,对吧?冰水啊,武术呀。
【嘉宾】是,但我学武术的目标不是为了打架,一开始是受到武侠小说的影响,然后当然就是对这些中国武术充满了兴趣。学了之后发现是对自身的一种磨练,中国武术最重要就是控制全身,控制自己。
【嘉宾】因为你要发挥,要打出一拳的时候,最大的力量会来自你全身协调,可以把力量从脚一直贯到的手,这么长的路径你要控制到全身协调,这个力量传到是循序渐进的,就是一步一步到位,是很难的,因为一瞬间发生。所以你要进入不断的练习,不断的自我修改。然后我觉得这个跟我喜欢一直自我检讨、一直追求都有很深的影响。然后我并不是为了展现我这是强大的破坏能力,我是觉得后来变成了一种对自己的追求。嗯。
【主持人】你的性格这种比较温和,能算温和吗?你在公司应该不这样吧?
【嘉宾】当然不是这样。做久之后都有点恨铁不成钢,然后看到年轻的研究员就是差那么一点火候,就可以把事情做更好,就会忍不住就会提出来,所以还是会凶的,对吧。在公司里面我是觉得是一种直接指出这些问题所在。取决于听的人,听的人如果是觉得我是正面的,他就会很开心,因为这世界上不是每个人都愿意跟你讲出什么地方可以做进一步的提升,对。然后他们可能会感激我跟他讲说这个地方你可以做得更好。但如果你听者是觉得说我就在挑剔的话,那你就会觉得我很凶。嗯。
【主持人】你这个希望能够一击制胜的课题,组织Cosmos,就是我们整个组织一个project就是Cosmos,对?
【嘉宾】然后我是非常专注在做Cosmos,我们会就是我们就是希望透过Cosmos来对这个世界产生巨大的贡献。嗯。
【主持人】这也是你接下来也许长达十年最重要的一个课题吗?
【嘉宾】是的,我们做完Cosmos,能这么说吗?我们做完Cosmos一的时候,问那个卷沈要继续往下做。然后卷沈跟我说,你就做到Cosmos 97,对。我现在做到3而已,所以还有还有还有这个94代可以往下走。
【主持人】为什么不是100是97?
【嘉宾】没有,他是随口说说的,就是他,他数字是随口说说,但他的决心是展现在他这个数字上面。他是认为这是一个重要的方向,然后希望我们可以继续专注去做这个物理AI的Foundation来帮助整个领域。
【主持人】往下走,我们接下来重点来聊聊Cosmos和世界模型吧,也是你当下最重要的一个议题。我看你在你的个人主页上说,你一直被这样的一个愿景所驱动,就是为机器人构建一个黑客帝国,你们展示一下这个愿景。
【嘉宾】我认为世界模型可以帮助这些具身智能有来做到这个泛化的效果。那我觉得任何AI的问题要解的问题,就是这个泛化的问题,你能不能在你看过的训练数据之外也能表现得非常的好,泛化,对不对?就是在coding、在这个chat里面都是去训练模型,让它可以去解在它训练没看到的东西的问题,很很就是变得像人一样,对吧。那物理世界的AI也不例外,就是要解泛化的问题。
【嘉宾】那解泛化的问题,在Cosmos我们想这样帮忙三个点:第一个,提供更好的数据;第二个是提供更好的起始点;然后第三个是提供更好的环境。
【嘉宾】数据是,你可以用生成数据,数据是帮助AI模型更加泛化的关键,就是你可以想象这个世界上你看到的数据就是这么多的点,你可不可以去生成一些你需要看到的数据,你真实世界没有采集到的数据,我把它叫Beta Data。
【嘉宾】那再就是,如果可以训练出一个好的世界模型,这个世界模型理解世界怎么运作,可以去预测未来会发生什么事情,这样的一个模型,它本身的这个representation是不错的,其实是可以提供一个物理世界AI,就不管是Parsing Model还是什么Model,有更好的一个Backbone,从里面可以去衍生出你想要做的Parsing,这是更好的起始点。更好的数据,更好的起始点。
【嘉宾】那第三个,人是怎么学习在这个物理世界学习?就是经验实验,经验跟这个环境做交互,跟真实环境做交互往往是比较昂贵的,然后你能获得的经验、累计的实验是短暂的,就是一个机械,如果说你可以用这种像黑客帝国……
【嘉宾】这种生成的方式可以同时产生多个真实无比的环境,你可以跟它交互,然后给你讯号,你是可以学习得非常快的。那就是更好的环境,更好的数据,更好的起始点,更好的环境。那里面最具有挑战性的就是更好的环境。我们不想在我的网页里面把它写得非常长。像SAI就提出了像黑客帝国这样,是一个比较好的,就是帮大家理解我们想怎么做,怎么帮助这个智慧的社会。
【主持人】Cosmos这个在内部具体是怎么立项的?这是24年还是25年?
【嘉宾】24年吧,应该。24年大概3月份左右我们决定要做,然后就是在Sora之后,对,在Sora之后,就是完全是那个时间点。对,然后大家都在想说,这个是充满了决心,一定要做。然后很荣幸的,真正就是信任我,让我去带这个设计。
【主持人】说服他的过程难吗?
【嘉宾】在这件事情上其实已经不难了。之前要说服比较难,大家看到Sora之后就不难了。他是很聪明的人,他一看就知道这个东西对,这个东西对公司的影响。而且他是一个很有节奏感的人,有些东西其实很重要,他会叫你pace your steps,就是让你不要急,他擅长打马拉松战。
【主持人】对。
【嘉宾】好,所以他是很有节奏感,就是慢慢地一步一步往目标前进。
【主持人】为什么之前这个时机还没到?
【嘉宾】在Sora之前,在Sora之前,就是first mover有first mover的advantage,对不对?好,然后每家公司有不同的定位,对吧?取决于你想要解决什么样的问题,要怎么样发力。没有足够多的资讯来判断,但我不觉得……你看像现在很多家公司都做得很好,现在做video生成最赚钱的应该是字节、CapCut,对吧?所以这个轨迹是很难说的。嗯,好,到Sora的时候觉得时机到了。
【主持人】对,是你又跟他……
【主持人】写了一封邮件吗?你这天会有什么记忆深刻的事情吗?有什么场景吗?哦,然后在那个会议上达成了。你这天会有什么记忆深刻的事情吗?有什么场景吗?为什么你们当时选的就是physical AI呢?
【嘉宾】所以我们这一群在做生成式模型的用multimodal generation的人一起决定。我猜每个人都会写吧,不是一起写一封,我们会讨论,然后一起写一封,然后让大家都会加一件,然后就变成一个公司的共识,就是我们必须要把这东西做出来。对,就是把我们聚集在一起开会了。然后在那个会议上达成了,其实会议之前大家都打成公司了。然后那个会议只是更具象化到底要怎么做,然后谁负责,这样子。就是他叫我们去想名字嘛,然后我那时候其实已经知道最后他会提出更好的名字,有点拒绝,不想浪费我的力气想个名字之后他想出更好的名字。但我还是跟他讲说,你就直接跟我们讲吧,你觉得什么名字好。他说不行,你要去思考,去想。我觉得有道理啊,这个名字跟产品的定位会非常的相关。你看我们叫Cosmos,就是一个语作,我们目标就不是产生这个content,不是为了要做创作,就是为了要解物理世界的问题,才慢慢往physical AI这面前进。因为Sora其实是一个服务创作者的一个事,他早期的demo是这样讲。在这个市场那时候已经陆陆续续看出来,就是physical AI它会是一个revolution。因为这个是个刚需嘛,每个人都会老花,每个地方都缺劳动力,每个人都想提升更好的生活品质。还一方面来讲就是,NVIDIA是走这个developer market,就是帮助这些开发者做出更好的产品。我们自己不会经营一个社群玩家,也不会去建一个创作工具,这有点太to C了,对于NVIDIA来说。
【主持人】所以你们订了,我要做一个世界模型,然后这个世界模型是为了Physical AI的,为服务Physical AI的community。嗯,今天大家对于世界模型的定义还是非常不清晰,你跟我们讲讲你的世界模型的定义吧。
【嘉宾】我是个很讲究实用性的人嘛,那你去设计一个模型的用法有很多种。比如说你设计一个模型来描述这个世界,经由这个模型你可以去预测接下来发生什么事情,所以它的目的呢是为了预测,这是为什么去设计世界模型的原因和用处:预测。那另外一种是为什么这事情发生了。其实你从模型方面来讲,整个物理学就是去建世界模型,去了解这世界是怎么运作。从牛顿力学一直到量子力学,就是去了解这世界怎么运作,建一个模型嘛,然后去帮助我们理解怎么运作。那当然,从底层能力里面,我们把这种understanding,就是经由一些标出的数据去教这个模型这个事情,然后经由大量的数据泛化,然后帮助未来新的事件发生的时候,你经由这个看到的视频信号,然后去解释、帮助人去理解发生什么事情。比如说在工厂里面,为什么这个地方突然间产线卡住了,然后可能是之前某个工人忘记把什么东西打开,这也是一个世界模型。建了它的一个目的性,就是为了去理解发生什么事情,找到问题。
【嘉宾】对,这个模型就是为了要去重建这个三维的世界,重建这个三维世界有很大的用处。你可以去规划你的东西、路线要怎么走,然后你可以就是让人去体验一下,你人虽然不在这个真实世界,但你可以在虚拟的状态下,在这个世界里面去游历,就是模型。
【嘉宾】for the world,来,然后因为你的不一样,终究我们是在同一个世界里面。这些模型就是不同的,就是经由不同的观察来去描述同一件事情,那种重建,重建是一个很重要的学问。那我自己本身以前如果做重建,但我现在已经不再做重建了,我现在主要是做物理世界的理解跟物理世界的生存,对不对,就是prediction这些事情。就是大家都会对世界模型有不同的解释。现在在几年前,同一件事情发生,就是大家定义什么叫AGI,对不对,然后经过这么多年还是没有共同的定义,对。然后我认为去定义world model很可能会走像同样的道路,我觉得可能不是很特别重要的一件事情。
【主持人】这是因为这个词太大了吗,太笼统?对,是太笼统,那定义出来后对人类有什么影响?
【嘉宾】那为什么LLM就是一个相对精确的词,LLM就是large language model,它模型很大,然后做language,对。就这个词为什么大家都是一个有共识的精确的定义,但是世界模型大家一直在争论不休,对。LLM就是LLM,large language model,language model可以predict接下来会发生什么词汇,对吧。large代表说它的模型很大,对,很明确,对吧。就是世界模型就是一颗颗可以帮助你去model世界的工具,嗯。那你model这个世界的一个工具,你要做什么用途呢,因为用途不同,所以你model世界的方式不一样,嗯。所以只要你对这个世界这个模型有不同的用途之后,就有不同的定义。
【主持人】所以,你觉得世界模型能够描述cosmos吗,还是应该用另外一个词来描述你在做的事情?
【嘉宾】是我们一开始的时候,我们是把cosmos叫做world foundation model。嗯,我们的目标是建立一个foundation,让大家都可以建出……
【嘉宾】他们要用的世界模型,所以我们把自己叫foundation model,是因为我们希望我们是一个更底层、更底层的东西来满足大家。嗯,所以我,我是这样,我们是这样定义的,就哪怕他是一个要做世界模型的人,他也可以基于你的foundation model来做。
【主持人】是的,你是希望提供那个基座?
【嘉宾】是的,你将是physical AI里面重要的一个环节,但不是每一个想从事physical AI的公司都有足够多的资源去做自己要用的世界模型,从零开始做。嗯,但他们又需要,为了帮助他们,我们就做这个Cosmos这个世界基础模型。
【主持人】因为你们也同时投资了杨立昆的AMI Labs和Fei-Fei老师的World Labs,你们做的世界模型有差异吗?
【嘉宾】NVIDIA是站在一个enable的角度,我们希望就是在我们的GPU生态上建立的公司,我们都希望帮助他们成功,我们希望大家可以一起走向成功win win。然后每个公司看到的点都不太一样,想解的问题也不一样,说会有各式各样的,就Fei-Fei的World Labs、杨立昆的这个AMI,都是不一样,走不一样的路线。我们都帮助他们,然后也希望成功,我们能投资他们,我们跟他们也有合作。那如果说他们对我们的Cosmos东西有兴趣,他们可以利用。那其他家公司他们需要世界模型,但他们可能没办法,不像Fei-Fei或是杨立昆资金雄厚,对,他们可能更需要帮助,他们可以leverage我们的Cosmos,我们的目标是帮助整个领域成功。那这几家重要公司我们当然希望成功,但我们还有很多需要需要去帮助的人。
【主持人】那你没有竞争对手吗?
【嘉宾】我觉得NVIDIA竞争对手就是跟NVIDIA做同样的事情的公司,就是去做整套AI的生态。
【主持人】那你说没有竞争对手,那你有一些公司也做出算力。
【嘉宾】我在做Cosmos的时候,我是不想竞争对手的。我想的就是怎么去帮助这个生态,在我的生态里面,在NVIDIA的生态里面。对,这些用我们GPU、用我们运算平台、用软件的公司,他们如果有成功的话,那NVIDIA就会成功,对吧?因为他们然后推,帮一些还没在我们生态的公司会产生信心。那我觉得这是帮助的方式。
【嘉宾】我不太想竞争,我已经过那个时期,就是为了要毕业把论文发出去,是我的算法要比别人好。我现在目标就是要帮助这个领域,可以一起往下走。因为从第一代到第三代的Cosmos,其实也经历了很多变化。
【主持人】是,你们在第一代到第二代的过程中,有没有什么历史的经验教训?
【嘉宾】是的,就是去年的工作,对,这个步调很快。那时候开始做那个Cosmos的时候,我强调一个点,就是我们要迭代快速。那时候深受DeepSeek的影响,因为DeepSeek是很惊人的公司,它可以一年内迭代三次,产生DeepSeek V3,对。然后所以我一直强调,就是我们要迭代速度快,迭代速度快,给一直不断的进步,一代比一代好。
【嘉宾】那,但是我们那时候挑战的题目是这个物理世界模型。然后在那时候,其实2023年不是很清楚,大家都还在摸索什么样的事件模型对大家有帮助。那,我刚才讲就是,不外就是用事件模型是怎么用它,Prediction或是Understanding,那就是做这种World Model来帮助Predict Future,然后我是做这种Reasoning Model来解释发生什么事情。嗯。
【嘉宾】然后所以就是,一开始的时候就是跟一些伙伴合作,去理解他们的需求,然后自己本身有一些想法,然后就做这些模型。然后跟这些伙伴迭代之后,才慢慢收敛。就是在过程当中,就是慢慢的收敛。然后我们那时候做了Predict之后,可以预测未来,然后想说,仿真环境是大家常用的环境,但它的生成的这个Video,就是跟这个真实世界的信号一定有差距。可不可以就是,用这个模型来帮助它跟真实做Transfer。那为了解释发生什么事情,就做了Reasoning,当日三个,对。然后后来理解到说,我如果可以去描述这个Pixel,Pixel是怎么变化的,那我这个Pixel变化,跟我这个Action的变化其实很接近的。所以我们就做一个叫Cosmos Parse,给一个Parse Model。然后后来陆陆续续的发觉就是,就像刚刚讲的一样,这是同一个世界,不管你从哪个路来看。
【嘉宾】你的模型是同一个世界,你模型就是在学一个internal representation of the world,就是这个世界你在做压缩过程当中学到怎么样的一个表示方式。那既然是同一个东西,还有一个东西就是Foundation Model,它的核心概念就是一个可以纳百川,就是可以从各式各样的数据里面去学会那个就是这个世界模式的一个模型。所以如果你可以把做reasoning用的data、chain-of-thought用的data、chain-of-thought self-correction用的data、chain-of-thought parse用的data全部合在一起的话,你模型的上线更高。第一个你是描述同一个世界,然后第二个Foundation Model就是纳百川,把东西合在一起。好,那所以就慢慢地往这个单一模型走。它中间还有一个是执行上的问题,我记得我刚出去见了这个第一版的Cosmo的时候,我自己算一算,就是因为我是希望真的模型可以帮助到其他人,然后跟这些partner的合作可能需要这个模型ABCDEFG,我自己算一算那时候可能需要22个模型。然后那时候我就有一个会议跟Jensen一起开会,我就跟Jensen讲说我预计需要22个模型,然后Jensen听到就觉得我工作非常认真,他就讲说非常好非常好,然后他讲说但是你知道吗,Louis Vuitton LV这家店当他减少他的货品陈列的货品数之后,反而sell是提升的。你不希望太多的东西困惑你的那个消费者让他没办法做出决定。那个对我印象很大,就是我理解到说嗯对,我为自己也遇到问题,因为我自己都分不清楚要用A还是用B的,那其他人更加不清楚。然后再就是执行上的困难,你每个模型出来我们不是发paper就结束走下一个paper,帮助使用者去用。那只要每个模型出来我们就要维护,要解决问题,然后当你有数个模型的时候就是很辛苦,背拖着力寡,然后影响到你迭代的速度。所以在做一的时候是在滴血的过程当中,然后还快速做二,然后再做二的同时就滴血到不行,就是这样做不长久。所以就决定要做这个Omni model的One model就是Cosmo 3,那就数个方向。
【嘉宾】第一个是描述同一个世界,所以其实是可以合在一起的。然后第二个Foundation model就是吸收各式各样的data合在一起,然后在开发上也简单很多,所以就是走向Cosmo3的指导。所以二到三其实是一个大的变化。
【主持人】是的。一到二的变化是数据的提升,还有一些那时候在二的时候帕琪带起来是有一些变化,但我觉得二到三是一个很大的一个gap。
【嘉宾】三做了多久。
【嘉宾】三从去年十月开始做,就是刚好发了二之后,十月分发的二。
【主持人】对。
【嘉宾】其实那时候在大概是更早的时期,就知道说必须要做三,然后但那时候已经开始了2.5,然后把2.5收尾之后大概做三。所以可能三可能就是大概是九月的时候开始知道说要做三,然后我真正执行可能就是十月十一月,然后做了将近半年。
【嘉宾】对,超过半年。
【主持人】一个中国做世界模型的创业者,他说他看Cosmo3论文看了一周,而且是每天看,里面有很多的细节。我觉得他们的观点是说,就是觉得Cosmo3他在技术的大创新上不多,但是他把很多的细节都工程验证出来了,对。你觉得他们这个评价中肯吗?
【嘉宾】Michael Transformer之前有人提出,然后Mamba之前有人提出,我们是第一个把Michael Transformer scale到这么大的模型,把audio、video、action都合在一起。然后这些东西从概念上来讲就是东西合在一起,但你真正要把它做出来不是那么容易。那真正做出来就是这些细节,所有的这些大语言模型都是Transformer的架构,你可以讲大家都没有创新,但是它的那些细节会让这个模型比另外一些模型好很多。我认为就是这么多年之后,我就更加重视这东西能产生的效果,我就往往越来越不重视这些东西是不是革命性的一个原创。
【主持人】对。
【嘉宾】对我来讲,它有用产生impact,解掉大家能想解掉的问题,是它的重点。对,那这个paper我们是希望帮助整个开源社区做开源模型,帮助到整个Physical AI。那我们这几年看到的现象就是这些大tier lab很多的走向闭源,然后即使写paper也不愿意讲出那些关键的环节。那我们决定走不一样的大路,我们把能讲的东西都讲得,就是尽量把东西讲得非常的清楚,然后能就是我们开源这个模型。
【嘉宾】也开源我们怎么去训练这个模型的框架,然后部分的synced data我们都开源了。我们是希望保持透明,让大家看到怎么做,也希望别人可以利用我们开源的东西做出跟Cosmo类似的东西。如果他没有这个兴趣的话,我们目标就是enable这整个community。对,我不担心别人可以说出一模一样的东西。
【主持人】我想到你刚才提到DeepSeek,你选择开源跟他有关系吗?
【嘉宾】也不算是。有关系就是DeepSeek,他的工作对整个AI的影响深远。第一个把mixture of experts开源的一个公司。然后你看他最近的模型,他的用心,把这个机制的细节,这些对整个领域都产生了深远的影响。我觉得很重要,从这影响的角度来看,我觉得是相同的,我们是想产生影响,把这些细节都讲出来。NVIDIA有很多建在NVIDIA ecosystem上面的公司,那我们希望保证他们成功,我们的目标可能跟DeepSeek是不一样。对,我们是希望帮助我们的使用者成功。
【主持人】你们天然就是这个生态了。
【嘉宾】对,我们就是希望,就是那个希望可以帮助这个,这个physical AI降临世界快一点。
【主持人】你们在这次为什么选择首先在输入层,同时能够输入video、audio和action,这是一个重要的决策吗?
【嘉宾】是,我觉得这个世界不是只有视觉,对吧,然后也有听觉。但我也想加入触觉,但触觉的讯号还不好,这个touch sensor这些东西,我觉得还在快速迭代当中,这个需要从零敲手。对,需要从零敲手,需要数据。那我觉得大模型基本上思路有两个:一个是让language当成first-class citizen,就像coding、像chat;另外一种是让视觉讯号、video当成是first-class citizen,像seedance,像Veo。我们认为物理世界的模型跟这个数字世界的模型最不一样的地方,就是物理世界的agent会take action,会改变这个世界的状态。我们认为一个好的物理世界的foundation model,也要把action当成first-class citizen,就是为什么我们把language、video跟action合在一起。
【主持人】现在这个Cosmos,我记得以前杨植峰跟我说,他们做语言模型,他就是把语言当作最重要的。
【张小珺】智能提升的工具,对,他会很担心Vision加入进来就是影响他的智商,变成一个傻的多模态。但是谢赛宁今年又跟我说,他说他担心语言对于视觉的污染。他觉得语言才是人类的脚手架,并不本质,这是他的观点,是吧。所以你怎么看待他们这两种观念,已经你把他们这些信号都训练到一起的时候,会出现问题吗,就互相的污染。
【嘉宾】这些信号他们带进来都有他们的目的,就是language可以把这些人类的knowledge带进来,然后也帮助人类跟这个物理AI做沟通,对吧。然后video是大量的视觉资讯,或audio大量的听觉资讯,去描述这个世界怎么运作。那这个用这个video更精准的去capture这个世界的物理运作,用language反映很难,对吧。但是人跟这个模型,这个模型之后建出来是要服务人的,那你他不懂language,你是没法跟他沟通的。然后这个模型之后是要帮助这些machine to take action的,所以他不懂action他是没办法去改变这个世界的。应该这样讲吧,就是我们的目的不同。对,我的目的是希望这成为一个好的foundation model for physical AI,他需要懂language,需要知道这个东西怎么变动,然后action,然后既有这个Architecture,我们把它合在一起去做。那我的目标不是去追求AGI,对吧,然后AGI本身也很难去定义嘛。当你定义的AGI就是纯粹要去解这个了解这个人类的本质的时候,或是什么去做coding的时候,可能这些视觉讯号会影响到你,那是必然的,对吧。遥远的古代是没有任何语言的,然后这些人类的文明的发展就是经由这个看这个世界怎么变动而产生的。那你可以觉得毕竟这个语言是发展适合人类的,但你不知道机器是不是接受这一套。也许你就从这个视觉讯号里面直接去学这个世界的怎么运作,得到一个intelligence,然后发展出另外一个文明。那你从小就看,也许语言讯号是一种干扰,对吧。那我觉得是看你要的是什么,我很明确的知道我要的是什么,所以我觉得
【张小珺】我需要Language让人可以跟这个物理世界沟通,我需要Video、Audio去描述,去从这个物理世界的变化,就是去学会这个物理本质,比较action,因为我希望他最后是可以复刻过来去改变这个世界。对,所有模态融合到一起,这些模态是相互benefit的,还是相互制约的?在过去一年,甚至超过一年之间,我们都一直在研究把这些模态的融合。
【张小珺】那我们从各个不同的研究里面得到一些线索,在Cosmos系列把它接在一起。比如说在Cosmos-Pi的那篇Paper里面,我们就发觉把Video跟action合在一起,是帮助action的。对,就是当你在直接predict action的时候,就是当我们在做World Action Model的时候,我们发觉就是除了predict你要做什么action,你也predict接下来take the action之后会产生什么state,就是observation是帮助你做训练或者收敛。所以我们知道predict那个video是帮助action的,就是World Action Model的这套系列。
【张小珺】那声音也可以帮助audio,声音也可以帮助video generation。当你知道一声碰到个点,你就知道接触的时间是那个点,所以知道这个是有相互辅助的。然后一般做video的人都知道,就是从文字到video,这是一个训练量变大的过程。训练量变大,代表说有很多种可能性,很多种可能性的方式是比较难去学习的,就是一种东西可能这样可能那样,这东西就没有固定的,它就不好学。所以在做video或image,大家都会发觉就是当你的那个文字描述非常详尽的时候,这是比较容易产生好的一个video。所以你可以知道,就是文字的详尽描述也可以表征这个video。
【张小珺】那我们做这个Cosmos 3,就是像把之前这些Cosmos Reason、Cosmos Predict、Cosmos Transfer、Cosmos-Pi这些东西合在一起,合在一起本身就有它的好处,整个东西就简化。那这些信号怎么合在一起,让它产生互补的作用,而不是互相抗拒的作用,这是可以经由实验的设计,经由这个data的比例的调整来达到的。所以我们那时候是坚信着,这些信号都是描述同一个世界,这些信号都含有这个视觉怎么运作的资讯,是应该有一种方式让他们合在一起会互相帮助,更多信息帮助你了解背后的运作的原理是什么,所以有这样的belief,然后从这方向出发,这里面有什么secret sauce。
【嘉宾】在互相benefit上,其实做大模型没有什么secret sauce,做严格的实验,假设、实验,看到结果,累积知识,再做下个实验,就一步一步一步往下做,走扎实地做就对了。我不觉得有什么不可告人的秘密,就是你要追求的东西,耐心做实验验证,对了下一步就这样走。
【主持人】因为你们这次采取的是一个双塔的设计,一个塔在处理离散信息,一个塔在处理连续信息,为什么采取这个设计?另外,相对来说离散的信号更好处理,融合进了连续的变量之后,它的处理难度会变高,你们怎么合在一起,并且能够把它scale上去呢?
【嘉宾】有很多个原因。一开始的时候,cosmo reason就是离散的,从vision language model出发,pre-trained transformer path其实是连续的。所以我们知道离散的work for understanding,我们知道连续的work for generation,把它放在一起就是一个现阶段很合理的一个选择。然后再就是,有很多种用cosmo的方法,但常用的是做post-training,就是也许用你的video action的layer来去train generator,或者是你只想用reasoning,就是用你当自己domain的这些understanding data来train。当你有两个塔,这样可以合在一起,可以把过拟合的影响切开的,是帮助客户去使用的。如果我们全部连在一起,那就是generation跟understanding在一起,我现在要换generation的distribution,在换的过程中因为全部都连在一起,你的data也会改变understanding那边的表现。如果你没有两个塔而你是一个的话,understanding那边既然要改变,你的data又没有understanding的data,它同样understanding的部分就流失了,那就不方便客户使用。所以分成两个,是对使用上有一定的帮助的。虽然它相对起来还是不够elegant,因为你还要事先决定它的架构。在整个deep learning就是让data来决定,就是说,而不是你人为去做区分,但是在这个阶段,我觉得这个东西是比较合理、比较适合它的使用。
【嘉宾】讲到这个东西,大家可以猜出来就是下一步目标是更加简单一点。为什么有两个塔?一个塔就够了,但是我们在往一个塔的目标前进的时候,我们要考虑到这些使用者是不是容易用上它。因为我们的目标是帮助大家赢,而不是自己产生一个可以做很多事情的模型。我们相信机器人每个都不太一样,相机的数量、相机的位置,然后自动车每个都不太一样。我们觉得需要克制,然后我们要即使合在一起去追求工程的简约完美,我也要考虑到使用者是不是有办法去利用它,那这是我们必须要研究的课题。
【嘉宾】对,现在有一系列的work像Transfusion,它是可以同时处理这个离散跟连续的,在做next token prediction的时候它是做离散的,在做diffusion是连续的,那是同一个塔,然后这段时间……
【嘉宾】有很多种不同的变异,大家在研究这个大家都关切的问题。这些信号可以用离散表示,也可以用连续表示。然后我是希望也许是不是开发这种架构,全部离散或者全部连续,让事情相对变得更简单一点。但是这个理想也不确定能不能成功,也要做一步一步的实验验证往下走。直接来看离散更容易,还是连续更容易,各有各的好处。离散比较好做训练,然后连续它有它的漂亮的地方,就是在做Infin,他们两个是很不一样的一个Shade。最关键的就是最后客户还是要部署,部署的时候,一些成本的考量都很重要。所以我觉得最后就是会根据什么样的模型最适合部署,我觉得是最容易获得成功。所以有很多方向,要具体的带来考论。
【主持人】有一个研究员问你,因为你现在是把所有的模态都训到一个模型里去,理论上它也可以coding做得很好,也可以让机器人能够运作,然后也能够生成我们现在这种创作者的内容。那它有可能在单一维度,比如说coding上,比coding专门的模型还要强吗?
【嘉宾】我还是喜欢讲这个孙子兵法,讲的备多力分,就是如果你什么都要好的话,就是在训练过程当中,你要博学多闻,你要触碰很多不同的类别,提升你的知识水平。当你确定你只需要用这个单一的application的时候,是不是有些调整,因为你不care其他东西的,有什么东西是你愿意放弃,然后就是做得比较好。因为如果你什么都不愿意放弃的话,你就会大得很辛苦。我觉得策略往往就是关乎着你决定你可以放弃什么东西。
【主持人】这双塔之间会互相的提升吗?
【嘉宾】我们知道就是,我们在这个paper没有一个实验,就是说当你用更接近physical AI的recognition的话,可以帮助你做更好的physical AI的generation。然后我们也知道就是说,如果你可以把generator的观点传回recognition的话,理论上是可以帮助你的recognition做更好的选择学习。在这个paper里面受限于时间,我们并没有做成完整我们想做的实验,已经很多实验了,但是就是这件事情,这个foundation model开发本身就是一个很好的事。一个决定都是两三个月前就做了,很难快速地去做一些就是调整。我们不把这个3看作是一个终极,就是我们会继续做3.1、3.2,一步一步往下提升。我们想做进去的能力,想做的一些研究,这次没有机会把它给呈现的继续补下去。
【主持人】除了可能会更简单,双塔有可能会变成一个塔,还会有什么在未来模型中大家会看到的一些变化?
【嘉宾】我们很关注的就是这个模型怎么去帮助physical AI的builder。然后这个模型推出去之后,据我所知就是大家都在讨论,然后有些partner。
【嘉宾】一些同学都给了蛮不错的feedback。泛化是一个核心的问题,任何AI的核心的问题。在物理世界的AI里面,我觉得一种我们需要达到的泛化,假设我今天教机器人说,我的衣服我喜欢这样折,然后我喜欢这样放,我就给这个机器人看一两次我怎么做,它是不是就可以快速学会,在现实生活中就快速学会这个东西。然后是不是给这个physical AI读了说明书,它就知道怎么去操作这个仪器,怎么在这个工厂里面做检测。我觉得这些东西很重要的能力是physical AI达到的。当然这些在落地的时候有很多考量,我是想说在这个foundation model是有什么东西是我们能做的,然后可以帮助这些physical AI的developer。所以我们中间的提升可能都是围绕这些,提升这些泛化的能力的角度来去把这些东西加进cosmo模型里面。
【主持人】比如说你们为这个有哪些具体的优化?
【嘉宾】优化是像加速那些,是一定会发生的,我们当然是希望这个模型可以就是越跑越快。然后另外一些优化就是能力的优化,泛化的优化。
【主持人】对,那这个东西就是可能会改一些架构上,或是一些training的objective的改变,或是用一些特殊的curated的data来做这个训练?不是很清楚,是要测试?
【嘉宾】它还是一个实验科学。
【主持人】对,是实验科学。就是我常常觉得AI能力就很像炼金一样,就是试出来的,试出来的,对。然后那个,在试的过程当中,你做详细的实验记录,从里面去理解那个中间的法则,我觉得这是很有趣,这两个东西我觉得很像。然后,我觉得做严格的实验,控制变数,然后得到一些关键的结果,这是模型迭代的重要的一步。
【主持人】也有研究员提出,这个模型的语言表征是不是可以把它的比重加得更大一些?因为他们还是认为LLM是提升智能的关键,你认可吗?
【嘉宾】我觉得在早期的这个Image Generation的研究,包含Google的Imagen里面就提出了,当你的language的understanding越强,你用更大的T5 model,你的image generation能力更强,我是相信的。用更大的language model应该要帮助,我是同意的。毕竟physical AI的应用跟大家常讲的coding或者chat还是不太一样,所以还是需要做一些实验的验证。我想做的事情是了解真正的痛点,然后。
【嘉宾】从这痛点里面去找到合适的方式来把这个模型能力补强,有些大家得到的讯号更好的模型,当你没有资源的限制,当然是不放进去,但比较有挑战的就是当你资源有限的时候你怎么做取舍。这也许对于具身智能来说,智能可能不是那个最关键的变量。你需要你的机器人会解奥数问题吗?你需要你的机器人会解coding的问题吗?我觉得你可能更关注它能不能把你的工厂要组装的东西做好,或家庭的卫生就是把它直接操作把它做好,对吧。
【嘉宾】所以我觉得你要解的问题,似乎是跟这些大语言模型公司、这种agent公司要解的东西是有点不太一样。然后所以既然是不一样的题目,最后这个解这个题目的成本,如果商业化最后成本都是一个重要的考量。在这些条件之下,它的架构真的会跟现有的这些for agent的模型是一样的吗?这是我一直在思考的问题。
【主持人】你想有初步的答案没有?有没有一些直觉?
【嘉宾】过去的,纵观人类的历史,答案就是应该是不一样,对吧。你要做耕田的工具跟你要做仿制的工具是不一样的,所以职责业的不一样,最后就是被多者的利果,是吧。老祖宗的智慧还是蛮管用的。
【主持人】Cosmos你们未来会投入多少卡和资源?
【嘉宾】这个我们一直在,在卡,一直在提升当中。我不知道我这边方不方便讲这个卡的数量,但就是我们希望,我们已经在万级了,然后希望可以再更多更多。
【主持人】这会是英伟达最重要的一个模型的项目吗?
【嘉宾】英伟达有数个模型项目,然后我们主要是把它分成两类,一个叫agentic ai,就是要做这个coding、chat,然后去agentic这种digital intention的这一套,这些客户的需求。在这里面我们有这个NIM foundation的model。
【嘉宾】就是他们这个团队最近release这个Nemo,Nemo属于Omniverse,得到蛮不错的效果。那在Physical AI这边主要就是Cosmos这个模型,Cosmos是一个base model,是一个foundation model。那NVIDIA也很关注自动车,也很关注机器人,然后也关注工厂。对我们而言,这些都是Physical AI的运用。那在自动车上面,我们就叫做OpenDrive的effort,它呢是在Cosmos上面做的specialization,就是我们做自动车所需要做的这些优化。那GR00T呢,是在Cosmos上面做对机器人相关的用法,然后还包含这些humanoid,呃,仿真的这些东西。我是把这些做自动车、内部做自动车、做机器人之间看成是我的客户,然后也希望帮助他们成功。然后在Physical AI这边就是以Cosmos为核心,来去辅助这些主要的downstream的开发者可以获得成功。所以主要是两个,你说是不是最重要呢,这两个都很重要。Digital AI这个,怎么用agent,怎么做coding很重要;那Physical AI也很重要,很难讲谁比较重要。对,但现在打得最火热的就是这些agent AI的东西,那Physical AI是下一步。
【主持人】Physical AI在你们看来会是一个多大的市场?
【嘉宾】这个应该是一个巨大的市场。我不确定,估这个市值不是我的专业,我也不方便代表公司讲多大,但是随着人口的老化,随着制造业的自主的需求,然后还有各式各样的应用,我们觉得这将是一个巨大的市场。
【主持人】因为世界模型现在缺乏有效的评测方法,对,你们有一些好的探索吗?
【嘉宾】世界模型,跟大语言模型一样,大家都在追求更好的评估检测的方法。然后一般来讲,模型的评测有三步,第一步呢就是benchmark,就是有一些固定的data set。
【嘉宾】你去上面两侧,看它的quality。然后第二种是arena style,就是A跟B比,看谁比较好。那第三种呢,就是跟着真正有这个痛点的人去解这个问题。那我觉得这三个都很重要,在physical AI里面第三个特别重要,因为每个就coding agent,大家都在解coding的问题,digital use case的问题。但physical AI每个要解的问题不太一样。所以呃,我觉得更加强调就是跟这个客户怎么样去评估一个模型真正有用还是没有用。嗯,那这不是一件容易的事情。这个是给模型发展指引方向的重要一步。我觉得在未来的发展当中,这一步会越来越重要。
【主持人】数据也是一个难点,你们这是怎么怎么做的?
【嘉宾】数据是一个难点,尤其是在physical AI更是困难。因为physical AI每个形体都不太一样,然后收集数据你没有那个physical的setup就没有去收集这个数据。然后因为大家都更加的困难,因为我们是我们要服务各个physical AI的这个开发者,每个的机器人都不一样。所以我们能做就找最容易共通的,觉得就是physical AI data主要有两种。一种是navigation的data,从A到B。另外一种是manipulation的data,怎么用那个手或是tool去操作,完成特定目标。那navigation的data比较容易做,就是你camera怎么动、车怎么动、机械臂怎么动,这些都可以收集。那机器人A跟B即使他们很不一样,但它动起来就是在空间中位移,有时候可能加一些旋转,所以是比较相同的。那操作这边就比较复杂。我们发现一个趋势就是大家越来越追求接近人手这种机器手臂,然后论点就是说这世界人类的世界是建出来给人类用的,所以大部分的工具都是适合人手去操作的。那整个AI呢,需要大量的数据,然后如果你的数据越好取得
【嘉宾】你就能更快得到突破。所以大部分的收集数据者是人,人就是手,所以两个环境,两个条件,就是人手适合收集数据,然后这世界是大部分建给人手的,所以就今天看到大家往人手的方向前进。那所以我们在做Cosmos 3的时候,也就是特地把这个Ego-centric的data给加进去,包含了人眼怎么看这个东西,从第一人称,然后还有人手怎么去操作这个物件。因为我们的目标不是去做出一个机器人,我们目标是帮助大家可以做出很好的机器人,所以我们要找最容易可以互通的东西,然后我觉得Ego-centric的data是非常重要的。在刚才说的那些现在的限制和局限之下。
【主持人】英伟达有显著的一些优势吗?
【嘉宾】在英伟达获得GPU运算的成本比较便宜,毕竟我们生产GPU嘛。然后再就是我们在Physical AI这边已经深耕更多年了,我们有这个Omniverse、这个Triple,然后也有这种Isaac Simulator。所以我觉得这些东西合在一起,我们提供更多的工具来满足各式各样Physical AI开发者所需要的需求。还有这点是,我们是真心想帮助其他家公司成功的,因为我们很清楚自己能提供的服务在哪里,比较不会有这种一直就是……我觉得客户往往比较愿意跟我们合作,因为我们不会说跟你做一模一样的东西,然后帮你做,免了,对,这不是我们的目标。
【主持人】对。这个模型让你非常满意的一点是什么?然后让你有点遗憾的可能是什么?
【嘉宾】满意的一点就是,我当初跟大家讲说,可以把过去的所有模型合在一起,还会比之前全部的模型都要好,这件事情发生了,我们现在的模型比过去单独独立的模型效果都比较好。那时候很多人不相信,那我觉得很开心。然后第二个就是,这个是我们第一次把整个团队原本是建造数个模型,现在合在一起建一个模型。这样把这么大的一个组织,大家凝聚在一起去建这个模型,我本身也很骄傲。
【嘉宾】这件事情可以顺利地发生。遗憾的是什么?我觉得我们的模型,就是因为时间的限制,其实我觉得模型还可以继续提升,但是因为时间限制,我们没有让它完全收敛,就必须要退出了。然后还有很多想要改的地方,在之前都没有时间改。所以就是觉得这几方面,毕竟就是想要追求更好的结果,但时间有限。那好处就是我们会继续做3.1、3.2,会把之前没做到的东西再把它补进去。
【主持人】嗯,你有想过像老黄说的做到97代或是什么样子吗?
【嘉宾】那时候听到97代,我的理解就是我们有决心一路把它做下去,把它做好。嗯,然后这是一个很大的commitment,因为这个做的模型是很耗费资源的。然后呃,它展现出它的决心就是往下走,我理解的信心就是这个东西会一直往下走。那世界模型最后就是接近这个世界,对,接近这个世界,接近这个世界。透过那个模型,你可以去呃学习你想在真实世界里面学习呃的东西。好,那我觉得就是往那方向走。那其实最接近的就是你有能力,所以是可以做出一个黑客帝国的矩阵。然后我觉得就是最终的样子。那我也不决定是不是需要到97代,你看我们如果呃就是每半年一代的话,还要40几年,对吧?40几年,对。然后我觉得现在AI发展的速度极快,嗯,也许不需要到40几年。
【主持人】因为你们团队又有做呃数字世界的模型,也有做physical AI的模型,你觉得选择两种模型,这差别是什么?差别大吗?
【嘉宾】这个目前的状态是这样,就是在Nemo车那边,他们用一个叫做那个hybrid,hybrid architecture,嗯,就是某些成分是传统的transformer,但某些成分是这种mamba style的,这种接近RNN的这种架构。那这样的架构有它的好处,因为这种RNN的运算比在inference的运算是比这种transformer便宜的。然后agent有一堆token。
【嘉宾】要产生。嗯,有时候你要token,要agent做很久的事情,所以这个是运算成本的需求。那Fysical这边,我们的架构就不拆除这个路线,我们还是走比较传统的transformer,但是我们走到这个metro transformer,然后把这个action加进去。所以这两边的模型的发展就是渐渐有点不太一样。但我们两个团队之间紧密合作,你可以在Cosmos的这个paper里面发掘,很多作者是从Nimo来的。好,然后我们就是跟他们合作,吸取他们的经验,一起去建一些模型。对。
【主持人】在未来这两个模型有可能统一成一个更大的模型吗?
【嘉宾】这都是有可能,就是,我们的决策很简单,怎么样可以帮助客户最好,我们就这么做。对,我们是很low ego的。
【主持人】刚才你也提到,就是Cosmos是一个非常大的团队。嗯,你觉得驱动这么大的一个团队一起工作,难点是什么?我印象中论文里有290多人,不到300人对吧?
【嘉宾】对,就是这个团队非常的大,然后,我是这样看的,这是一个组织架构的难题。你希望所有人目标一致,但你又希望所有人可以自主做决定。当全部人的目标一致,但每个人都不能做决定的时候,进展会很缓慢,因为只有少部分的决策者可以做决定。那这些决策者,假设只有我能做决定,只有我能决定这个data的比例怎么调,只有我能决定这架构怎么做,那我们这个模型就不会成功,因为我的知识有限,然后我的时间有限。然后,我们需要的就是每个人都可以做出对这个组织、对这个模型发展重要的决定。
【嘉宾】那第二个事情就是,如果大家都可以做决定,但大家目标不一致,我就是想把Action做好,我完全不管Video怎么样,然后我就是想Understanding做好,完全不管其他的,这样就会发散,然后可能就会产生不同的架构,然后可能就进一步有赛马的行为。那我觉得跑这么大的一个团队,重要就是让大家的目标一致,但每个人又可以做出决定。然后这在组织架构上面,我花了很多心思去设计一些团队运作的合作方式,让资讯透明化,那每个人都有足够的知情去做出对组织正确的决定。那当然我们也提供了容错的空间,因为当一个人害怕他决定错误的时候,他是不会做决定的。所以你要让他们可以做决定,但也要接受有些决定会错误,但是错误的时候要能快速修正。这些都是需要一些时间跟一些训练,才能让整个团队可以朝着方向前进。
【主持人】怎么让两百多个人……
【嘉宾】都同时做决定这个好难,大家都清楚整个关键,整个project之后要达到目标是什么,你要一直去把未来给划清楚,跟每个人讲。在Cosmos3 paper出来之前或做完之前,我就跟主要的几个例子,还有各大部分的团队都已经讲过,说我们做出来的模型会是这样子。那是不是完全这样子呢?可能90%像是,10%不像是。但是当大家都看到同一个愿景的时候,就比较容易集中。就像你是一个篮球选手,你在罚球之前,你都会想象球空心落网,就先把那个目标给盯出来,大家再朝着方向前进。那当然每个人扮演的角色不一样,然后但大家看到同一个big picture的时候,就比较容易在他的岗位上做出对这个团队正确的决定。
【主持人】你设计了什么样的管理方法,让大家的信息能更透明,能更好的协作,有什么样的管理的技巧?
【嘉宾】多用点心思,要觉得这个怎么样讲大家会懂,嗯,注重沟通,注重沟通。
【主持人】不开例会这样的会议吗?
【嘉宾】我是一个呃就是讲究团结合作,嗯,所以我们的会很多,但是呃不是每周一次。每周可能十次有吧,每周应该超过十次,超过十次。
【主持人】所有人还是多少人?
【嘉宾】跟主要的leader的,每个比如说我们做video的,就是定期开会,一周两三次吧,嗯,然后做understanding也是定期,就是一周两三次,然后还有各个团队也是两三次。就是呃就是会蛮多的,然后会议上可以做一些沟通。好,那当然会议大家会觉得就是开会呃有时候很没有效率。尽量做一件事情就是让每个会议都更加高效,然后让每个人都能参与,嗯,那这都是需要一些一些训练。好,让这个团队这样。那永远不会最高效,你可以你可以大家都不开会,各做各的,嗯,那不见得会成功,嗯,你可以一直开会什么都不做,只是假装,也不会成功,你就要选一个均衡。
【嘉宾】在不同的时间点会有不同的一种调配方式,那这个东西都是必定会成,就是最好。你看硅谷现在大家说OpenAI的,而且文化是自下而上,Anthropic是自上而下,你们属于哪一种?
【嘉宾】我们都有,一个都会走向极端嘛,天下分久必合,合久必分,就是东西就是物极必反。就是我觉得都是要掌握这个,就是在那时间点了解什么是对这个团队最正确的事情,而不是意味着选择一个方向、一个模式的操作。
【主持人】嗯。我理解Cosmos的爆发的时间点和Physical AI和机器人爆发可能会有,是是正相关的,对吗?你觉得这个市场会在什么时候引来一个所谓的ChatGPT moment?大家都在追求这个Physical AI的ChatGPT moment。
【嘉宾】ChatGPT moment?什么叫ChatGPT moment?跟GPT moment有什么不一样?GPT moment是跟我们讲说东西可以scale,scale之后模型能力会更强。ChatGPT moment是让大家清楚看到了这样的一个scaling,这样一个好的模型对人的生活会产生什么样的变化,大家发觉这是一个有智能体、可以跟他沟通、可以问一个知识广博的朋友。那什么叫Physical AI的ChatGPT moment?Physical AI应该是指说大家看到一个就是以AI为主的,enabled Physical AI的应用,让大家清楚看到说这东西是真的有用。
【嘉宾】那这东西什么时候会发生?这是很难去预测,然后但我看到是整个领域对这个Physical AI的兴趣越来越大,有越多资金、越来越多越来越多的有智者创立公司,想去解决这个问题。Physical AI可以利用在Digital AI上面的成功,所以我觉得各项条件都逐渐在收敛当中。
【主持人】嗯。
【嘉宾】我是希望尽快看到ChatGPT moment,尤其今年、尤其明年我不知道,但是我觉得它必然会发生。
【主持人】你觉得人形机器人会在这个赛道里面成为主流吗?
【嘉宾】我觉得人形机器人它的优势就是可以利用大量的这个人的数据来获得,就是,呃,就是学习。
【嘉宾】的素材然后来提升这些效果。但人形机器人它本身,越像人有腿啊、有手啊,相对的复杂度也比较高一点。然后很多人都来做轮型的,只有上半身是人,下半身是一种移动平台,那这样的平台可以解决掉很多问题。那你说这样的是人形机器人吗?我觉得也是吧,就是半身像人,对吧?也不是全人形。那全人形的某些人性也更接近人性,有些特性不需要太接近人性。那我觉得人形机器人终究会是一个重要的关键,但是多像人形这件事情,大家都在尝试当中。我觉得最终可能就是全人形最适合各式各样的操作,因为人类的环境就是设计给全人形的。但最后关键还是营运成本到底怎样,经济效率最高。那这就超乎我的专长,我其实不知道。我的目标是帮助满足这些各式各样的组织,我也不需要做选择,我就是听进他们的声音,看我们的模型怎么做可以更加帮助他们。
【主持人】Dwight Tan捷达老师,他有一个预测,他是觉得2035年到2036年可能是人形机器人成为主流的一个拐点,是吧?
【嘉宾】OK,我希望早一点,但我不确定。
【主持人】你觉得世界模型……这世界模型并不是新的啊,这早就有世界模型。
【嘉宾】嗯,那我觉得世界模型会一直在做,就是性能的提升。那我们在大语言模型上面看到的模型越来越好,对不对?那我觉得在世界模型上也会看到越来越好。我们这次在Cosmos 3也做出了一个比较不一样的世界模型,这种模型的模型。所以我觉得还是有一些变化,然后我会需要……
【主持人】需要一点时间去让大家吸收,笑一下。因为毕竟这东西不是模型出来直接可以使用,是必须要看怎么调配,可以在这个机器人场景落地,那我觉得是需要点时间。
【嘉宾】那我觉得这会继续变化,对,会一直进步,会一直变化。因为你说你要为机器人构建一个黑客帝国嘛,那黑客帝国讲的本身,为了机器的活体电池,然后活在一个虚拟世界matrix中,然后一个觉醒的人试图挣脱这个系统的束缚,然后来终结这个循环。那你现在为机器人打造这个matrix,如果有一天机器人要觉醒了,想要挣脱这个虚拟世界怎么办?
【主持人】我用黑客帝国的地方是帮大家具象,就是有一个世界模型这么快去加速学习。很多人担心,就是AI当它能力太强的时候,会take over the world,对,就会把我们给eliminate。
【嘉宾】嗯,那我觉得这个社会是人建立的,这些科技是人在背后操作,我觉得只要大家是有共识,我觉得就是这件事情是不会发生。然后再就是,我这就比较哲学一点了,我觉得think and suffering是一种驱动人去进步的一个重要关键。不是很确定这些silicon做成的intelligence是不是有同样的think and suffering,然后我心里是产生存疑的状态。那我当然知道就是我们希望这个科技可以大幅度地改善人类的生活,那我们也需要做出这些相对应的guardrail,来确保他不会去影响这个正常世界的发展。
【主持人】说到世界模型,其他做世界模型的团队会把你当作竞争对手,因为大家觉得你也是做世界模型的,但是你一直在说我不是你的竞争对手,你有什么想对他们说的吗?
【嘉宾】世界模型这个工具,对,然后工具是解决问题,有好多种不同问题要解。
【嘉宾】最终要解的问题,只有世界模型是不够的,对吧。如果说我们要去服务整个Visualize Ecosystem,我们要建置世界模型让大家的模型可以用,然后Visualize的问题本身又特别的难,有好多其他问题要解。如果你可以跟我们一起合作,利用我们做的东西,那你可以走得更快更远,这不是很好的一件事情吗?对不对。让我们都是采开源的状态,如果说你用我们做的东西做出比我们更好的模型,那这模型也是开源的让大家可以用,那我们也是帮助整个Visualize Ecosystem,所以你就比我们好,我们也觉得这是一件好事,对吧。我觉得搭伙集团结合作去解掉困难的问题,是一件很值得去做的事情。但彼此间就是互相底触,然后越来越往上爬,那也是很重要的一环。
【嘉宾】对,他们肯定会说,哦,英伟达又下来卖我卡了。对,那你需要做运算嘛,那我们这个,现在这个英伟达的生态在这里,有很多东西可以让你去利用的,why not,对吧。你要做一个生意都是要做投资的,最重要的是你的护城河是多少,而不是抱怨。Cloud company他买了大量的GPU,但他赚了更多的钱,嗯哼,对吧。
【主持人】你们内部会讨论什么是下一个CUDA吗?有可能是Cosmos吗?过去的软体是建议逻辑,然后CUDA是帮助把这些application所需要逻辑转换成GPU的运算。未来的软体是AI为这核心的,那AI是必往top of other AI,然后做的Nimo床跟这个Cosmos都可能是未来的CUDA。因为外部会对CUDA有非常多的复盘。但作为你的视角,你觉得CUDA是怎么做成功的?还需要具备哪些要素?像比如说现在Cosmos他具备了哪些?
【主持人】不具备的是哪些?它是一个可复制的路径吗?
【嘉宾】我不确定这是不是一个可复制的路径。我觉得CUDA当初提出的时候,是一个很简单也很冒险的想法。在大家都不确定accelerated computing会不会成为主流的时候,我们公司就做出了这样勇敢的投资。我们做的大模型都得益于CUDA,然后可以往下走。我不会把Cosmos或Nemotron跟CUDA同等对待,因为我觉得现在的整个发展已经相对复杂很多,整个产业是很多个不同的stack合在一起的。我觉得合在一起可能才是新的CUDA,而不会说单一的这个模型就是一个CUDA。对,你还需要做serving,你还是要去做这些infrastructure,有很多东西要合在一起。
【主持人】那CUDA你们觉得是哪些要素共同促成了它的成功?
【嘉宾】CUDA一开始的时候就是在寻找application。一开始是scientific computing,然后后来在deep learning出来之后,找到CUDA最重要的application,然后往下走。那CUDA还是一直在提供各式各样不同的application。我觉得复制CUDA是一个很好的想法,但我不觉得你按照原来的路线就会走一样的路。我觉得这个环境是不一样的。对,我就是要adaptive,要看清楚在那个时间点可以做出哪些重要的贡献。
【主持人】所以你们不会拿着这个锤子去找钉子对吧?拿着我要做出下一个CUDA。
【嘉宾】对。就是当年是一个非常成功的决定,然后我来做今天的决定。就像老黄常讲的,他的认识非常first principle,他是觉得什么合理,然后再往那方向走,而不是拿着锤子去找钉子。
【主持人】因为你刚好加入英伟达10年了,这10年你变化大吗?你在英伟达的这个股票涨了多少倍了?
【嘉宾】哈哈哈,对,那个,这一切都是没有预期到的。这段时间里面,我们见证到一个从没有人把AI跟英伟达连接在一起,变到一个全世界都把英伟达跟AI连接在一起。
【嘉宾】我父母亲不知道什么叫英伟达,到全世界都叫什么叫英伟达,这个时间是很巨大的变化。嗯,那中间的历程呃也不是那么容易。公司你从股价来看就起起伏伏。我记得那一年呃就是TPU刚出来的时候,公司股价掉了一大截,对,然后有些同学们在那时就对公司的呃未来产生了呃就是不同的想法,就例子啊。但后来呃每年在MLPerf里面都有几百TPU,然后产生出更好的那个性价比。那后来就是只有我们参赛了,这东西都很难去预测这些变化的,实在是很大。那我觉得就是在这长期间,我更加理解到什么叫就是慢慢经营,慢慢去经营,然后就是到一个你相信的目标,非常first principle啊,一步一步往下走。你就看着老黄带着整个公司这么大的一个团队,然后就是一步一步走向今天那个呃成绩,嗯。
【主持人】有荣焉啊,就是大掌柜这样。你当时加入的时候,没有想到这一切对吧?你当时还有其他的offer,但没去。
【嘉宾】对,对,那不可预期的。我我当初加入的原因就是因为我想要有GPU,可以为这个学术研究,是很简单的一个原因。我某方面来讲我也是非常first principle,我觉得GPU是啊这个做科研重要的工具,我要去一个GPU众多的地方,那不如去一个生产GPU的地方。
【主持人】另外一个offer是谁啊?当时。
【嘉宾】我说的offer啊。对,其中有一个投资公司啊,他跟我讲说不管我去哪里,不管对方给我多少钱,我都给你四倍,然后希望你可以加入他们的啊这我们的公司,可以一起去研究怎么去啊用deep能力来做投资。嗯,那我本身对这个东西并不是很感兴趣,我还是想做科研,然后去还是选择了NVIDIA。
【张小珺】当时英伟达可能是更不知名的,那一格是吗?
【嘉宾】是啊,对。你看16年的老黄和现在老黄,变化大不大?头发都白了,我觉得他承担的压力大了很多。但他还是就是关心员工,然后很仔细地去阅读公司的全员的前五名邮件,然后去找到一些信号来帮助整个公司往前进步。有很大的变化,公司的规模很大的变化。我们都加入的时候,公司可能不到2万人吧,然后现在已经两倍以上,可能更多。那时候GPU都还是桌机,现在都是数据中心。然后那时候没有实体AI,现在实体AI都成为了一个重点,对,变化是很大的。
【张小珺】你在过程中有见证,因为黄仁勋哪些Hardware and software没有,全程常常在嘴边讲?
【嘉宾】他说当然不是真的。他每次都讲说,他每天都觉得公司只剩下30天的现金流,30天后就要破产,然后现在还这么说。他每天都这样讲,每次开会都是这样提醒自己,下呼高管吗?就是要求自己做出对公司最正确的决定。然后有一年疫情的时候,整个经济状况不好,那个时间点很多公司就开始裁员。我记得那次公司大会的时候,我们就决定要裁什么?我们要裁的就是差旅,员工就不用去出差了,全部都是线上,这样就省下一笔钱。然后我们研究哪些工具可以不要,比如说在硅谷,很多公司都用Slack来做通联,我们来考虑是不是就不要Slack,反正我们有邮件。然后我们有两三个协作套件,比如有时候用微软,有时候用谷歌,是不是可以取消一个,没省钱。你可以看到公司就是在一些困难的时期,做出一些相对不平凡的决定。有些公司会把裁员来降低人事开销,英伟达想的是什么可以节省掉一些不必要的开销,照顾员工一起度过困难的时期。
【张小珺】为什么英伟达一直坚持不裁员,他真的没有裁过员工吗?
【嘉宾】我在英伟达的时间里,就是我没有听到任何裁员的消息。
【张小珺】也没有末尾淘汰对吧?
【嘉宾】我们没有所谓的末尾淘汰,我们只有给绩效评估。当然就是有些人会因为对绩效不满而离开,有些人是真的有其他因素就离开,但我们不会因为我们改变了产品的方向,或者是因为这段时间内你就是绩效不好而让你走。我们觉得人跟人之间的信任很重要。当一个员工对这个公司有认同感、有安全感,他愿意讲出一些可能在一般担心被淘汰的地方不愿意讲的事情。当没有所谓的末尾淘汰的时候,大家也不会真的这么担心被淘汰而抢出头。那在一个全部都抢出头的地方……
【主持人】反而不容易促成團結合作。我覺得這樣的一個管理模式會促成一種公司文化,是跟那些會做末尾淘汰的公司文化是蠻不一樣的。他的優點和缺點是什麼呢?
【嘉賓】我覺得就是公司員工想敢講真話,願意團結合作。缺點就是當一項科技就是逐漸變得成熟的時候,這些員工需要一點時間學習新的東西做轉型,那重新學習新的東西是需要多一點時間的。那如果你直接lay off再hire新的一批人,那你可能可以直接hire得到一些已經會這些東西的人,所以這些經由轉型做起來是會比較慢一點。但是你得到就是員工的信任,然後也可以團結合作的員工。
【主持人】組織效率怎麼提升呢?這對你們來說是個問題嗎?
【嘉賓】就是大家只要充滿熱情,然後覺得自己做東西是很有意義的,然後整個效率就會提升。每個人都有選擇,那都會想做自己有成就的事情,那如果公司可以提供這個環境,讓大家可以去發揮的話,那效率就會提升,就讓每個人可以做出他們最喜歡最擅長的事情。但同時這些事情對公司又是有極大的利益的,只要能抓到這點我覺得就是一個很好的狀態。
【主持人】平常去不裁員有很多好處,但是大部分公司都不是這麼做的對吧?
【嘉賓】是。
【主持人】這是為什麼?然後以及老黃為什麼從一開始就覺得不應該裁員?
【嘉賓】我覺得NVIDIA是一個想長久經營下去的公司。然後我覺得就是這麼多年,老黃在這個矽谷這麼多年,看到這麼多風風雨雨,他選擇的東西一定有他的道理。就是我覺得不是一個隨機的選擇,是一個深思熟慮後覺得這東西是他想要的企業文化,他想要的公司的運作模式。
【主持人】是不是意味著當新技術來的時候,因為打破會是最快的那個,但是它是依賴於你早十年或是早五年的提前佈局,這樣他對快就要求不高,NVIDIA就是頭滿他鬆嘛,然後看得遠,你看CUDA就是這樣一個案例,佈局的十年。所以就是你要有很強的眼光,然後長期投資。你們也不賽馬對嗎?
【嘉賓】我們不喜歡賽馬。因為我們通常都是這樣做,就是你take the mission,我們相信你,但我們一起給你很高的bar,希望你完成。就是用老黃話講就是,一直讓你接受pain and suffering,push you to greatness,相信你,然後給你考驗,然後不斷的磨練你,讓你一步一步往下成長,這是我們喜歡的模式。
【主持人】你在英偉達大家受過最慘烈的suffering是哪個階段?做這些大模型?
【嘉賓】這幾年都是這麼辛苦的在往下走。我剛剛跟你講那些東西,很多都是從錯誤中學習,很多東西,就是一開始也沒有理解到這些東西最重要的東西。那為了把東西做好,然後當發現做不對的時候,要怎麼慢慢把東西給改進。我覺得這一段就是自從GPT起來之後,整個AI的從業人員,大家都感受到莫名的壓力。然後這段時間裡面,就是這個迭代的速度,大家都飽受壓力。那我覺得都是pain and suffering,尤其是當你每天揮灑這些GPU資源,揮灑這些年輕人的時間,然後做出成果沒有達到你最喜歡的結果,我覺得這東西無形上都是一個壓力。
【主持人】你的生活狀態發生變化了嗎?在過去幾年。
【嘉賓】高效,高效,早起一些完解。我大概是4點到5點起來。我這麼早,早上起來的時候,運動啊那些就是時間比較連續。一到公司之後就一直開會,大概10點到公司,大概9點到10點左右。因為整個產業的迭代速度,所以生活步調都變快,還是要學東西還是很多,但是處理的事情又變更多,然後讓自己更加高效。
【主持人】你幾點睡?
【嘉賓】我大概在10點左右,10點左右。4點5點起,不是每天都一定,但基本上是我的常態。
【主持人】因為英偉達的書也好,或者老黃的專輯也好,都講了很多他的管理方式,能不能從更一線的視角來講一講,就是英偉達的一些不一樣的管理方式。我們剛剛可能涉及到一個是不裁員,第二就是top 5,員工就是要跟很多人,就是講這個他做的事情,最重要的五件事情。
【嘉宾】這件事情讓你看清楚,就是各種公司的大小訊號,可以看到很多兩個團隊在做一模一樣的東西,那個TOP5自然就會顯現出來。NVIDIA是一個相對很透明的一個組織架構,蘋果可能是反例,就是我們追求的資訊透明。當然這也是一個很不一樣的考量。那些老黃專輯有些是比較機密訊息,但很多都是你可以在……因為大家工作的時候就可以感受到,他認識很多員工。我們常常講Mission is the boss,然後因為有時候像是一個有機體,沒有那麼強的框架。當我們公司今天要走向這個方向的時候,在各種不同組織的團隊,但有相對的技能就會自動align,就往那個框架傾斜,就是像一個活的組織,不是一個固定框架。你說你在這個裡面就不能插手的東西,沒有關係,你在這公司哪裡都沒關係。但是你要往這個方向前進的時候,你的這個團隊能夠產生貢獻的,就全部人就align,就變成一個新的方向往這邊走。Cosmo就是這樣子一個案例,就是很多人他可能不屬於這個團隊,但是他都可以來支持這個團隊的工作。
【嘉宾】對。Mission is the boss,而不是你的boss是你的boss。Mission is the boss,這幾個是最具有特色的,就是這幾個讓整個公司就是很活。你看,我剛剛講的Mission is the boss,就不是一個很硬的框架,是個有機體。那這個top-down讓公司各個地方的微小訊號都可以傳到決策中心,對吧。那不願意讓就是不行宜,rail off員工,就是講究轉型、講究culture,讓員工對這個公司產生強強信任,然後可以彼此互相合作。我覺得這幾個都是英偉達很獨特的地方。
【主持人】嗯。一群S級的人一起工作,和一群A plus或A級的人一起工作,哪個可能取得的成功更大呀?你覺得大家在追求就是一加一大於二,對,然後是不是大家可以團結合作產生更大的效應,是不是很重要一件事情?
【嘉宾】是,是很重要一件事情。然後當然,人多的時候就有一個溝通成本,然後溝通成本就是負面的,你等於就是要人跟人合作給產生正相關,但是要降低這個溝通成本。那一群很聰明的人一起合作,啊,當然大家都很聰明,很快就理解,然後手腳又快。但是如果人跟人之間無法信任的話,也很難達到一加一大於二。大家都防備著對方,不願意把最好的一面呃展現出來,或者是就要展現出我就是陪你聰明,那這樣子也不見得是一個好的狀態。那我覺得反正就是,呃,就像打遊戲一樣,你不要整個團隊全部都是弓箭手,可能要有些人是負責防禦,有些人是會補血的,各項不同的屬性合在一起,就是這樣多元,是一個比較好的狀態。
【主持人】嗯。你看你今天說了很多,你沒有競爭對手,然後你不和任何人競爭,都是客戶,然後大家都是合作夥伴,這種裸機結構的狀態。
【主持人】是在英伟达发生的变化吗?这真的是一种魄力,还是只是一种隐藏?这是跟老黄学的吗?这是什么时侯学的?
【嘉宾】对,我受到影响非常深。我觉得是一种confidence,是一种自信,是觉得我们做出来的东西是可以帮助到大家。那我的目标是帮助大家做好,但我对我自己做东西我要求很高,我希望它变好,但我的目标并不是击败对手。我的目标是那个做出好成绩,提出更好的foundation让大家可以动得更快。
【嘉宾】如果你是一个研究员,你毕业的方法就是让你的论文在顶级的会议上被接受,然后reviewer都会question你的东西是不是state of the art。那你要state of the art,代表说你要击败所有的人,所以研究员都有这种心态,就是我的东西要比你强。所以寻着这个轨迹,我也就是一开始就是一个highly competitive的individual,就是我东西要做比你好。那这个对于我要求当然好,就是希望东西越来越好,但久了之后就是,你知道就是,你总是state of the art一段时间,就下一个出去吧,对不对?就是这东西是一直不断进步,今天站的位置也不一样。就是成为这个管理者之后,希望就是培养新一代的人才帮他们成长,然后站在这个NVIDIA这个Ecosystem的角色,也希望这个公司是逐渐感受到这个好处。有时候看到我这些合作伙伴跟我讲说,用你的模型之后,我解这个效率提升了很多,然后我就很开心。我觉得我的、我的付出、整个团队的辛苦付出获得的一些回馈,受到这种肯定也是很好的一件事情,不见得是要击败其他才能产生贡献。你不需要击败你的对手,我不喜欢把他们当成是对手,喜欢把他们当成是伙伴。
【主持人】你看因为大家,包括你,然后包括Jason,他出来竟然会说take care of artists,就不管是员工还是外部的合作伙伴,这种take care是一种真实的吗?就是他真实是这么想的吗?
【嘉宾】因为一开始的时候,我们就是生产这个design house,然后最后我们也没有什么consumer product,都是靠着其他家公司帮我们做GPU卡,我们就是一直有这个习惯,就是要跟着整个ecosystem一起成长。大家一起赚钱,总不能说钱只有我们赚嘛,这些帮忙做这个显卡……
【嘉宾】刺不起这些,呃,都要一起能那个往下走,嗯。因为早期的这个显卡都是来做游戏,我们也不做游戏,对,我们就是一直开发这些好的library帮助的游戏公司做游戏。我们刚开始走向deep learning的时候,那时候好几个框架,比如说PyTorch啊,TensorFlow啊,还有一些MXNet这些东西,我们全部都支持,对。然后后来我本来有这个框架,PyTorch我们是支持那个框架,那CUDA出来之后,我们支持CUDA,对。就是我觉得是真心的,就是,呃,就是想帮助这些建在我们这个GPU平台上面的客户能更加成功。他们更加成功代表他们可以服务更多的客户,那他们就有大量的机会会使用我们的GPU,是一种真的是功利一起走向成功的路线。那我觉得是这样,也是他经营了这么多年吧,这个公司放在这么一个好的位置,让帮助别人也可以获得获利,这我觉得是不容易。
【主持人】嗯,你近距离观察过老黄很多年,如果只用几个词来形容他,你会怎么形容?
【嘉宾】我们叫他六边形战士,就是,不管是,我们有时候开会,他可以走到很深去研究这个register,这个computer architecture的register,这个非常细的细节。同时间又可以长到想到,可以就可以教大家怎么做marketing,怎么做这些非常high-level的东西。然后,在处理这个不管是产品定价,然后跟客户的关系,他面面俱到。然后,就是,他是极大的热情,他给了他所有的东西帮助他的公司成功,这是一种很令人佩服的一个,呃,操作,各个方面都可以产生贡献,然后各方面都尽力做到最好,他是一个很厉害的一个人。
【主持人】他对您鼓励比较多还是批评比较多?
【嘉宾】一般来说,鼓励批评都有。当我还没有完全理解他,要怎么去跑这公司的时候,批评是比较多的。但批评总是在的,鼓励总是在的,希望你可以变好。他的目标就是challenge everybody do business,经由这些磨炼让你更加理解,就是怎么样做才能做出不平凡的事情。这很好经历的,你愿意花时间去challenge别人,这世界。
【主持人】不容易的事情。所以投入別人,你自己心裡要產生很大的負擔,對吧?而且你人生就這麼多時間,你可以不管,你可以也許還真才真正打擾你要的東西。但是他願意花時間去投入別人,讓大家不斷地進步,這是很不容易的一件事情。他對你,讓你印象最深的一句話是什麼呢?
【嘉宾】我覺得有一次我們在一個會上,我們在比較兩個 solutions,兩個東西。然後我是做其中一個東西的人,另外一個是其他人做的東西。然後我記得那時候我講了一句話說,我覺得他們用的 setting 是一個不公平的 setting,所以導致這個,所以我們在這方面表現就沒有達到我們的預期,落後這個競品。那他那時候給我一句話說,Are you a crybaby? 只是實際上沒有什麼是公平的。你在寫論文的時候常常講說,我的 setting 就是跟你 setting 不一樣,所以不能同時比較。但你的目標如果是要解決一個問題,那當然是做這個要解決的問題所需要的條件,沒有這條件,就相當的拿到。
【嘉宾】那時候那句話讓我印象很深,可能就是我更加嚴格要求自己,就是找理由是沒有用的,就是這個就應該 give everything you have。然後我以前也聽過這句話,西點軍校有些著名的書也是講的,就是沒有理由,no excuse。但他跟我講,讓我的印象就更加深,可能也因為他是一個著名的人物。我覺得這句話對我的影響也蠻大,我完全不帶著理由。
【主持人】如果你當你作為一個研究員,想成為 number one,和英偉達的本身的業務,因為他不想成為強勁的競爭對手,如果發生衝突的話,你會選擇哪一個?
【嘉宾】我覺得就是科學的發展本身就是 incremental 的,就是一直在進步,一直在進步,一直在進步。你隨時隨地都可以提出 improvement,就只要往上再走一步。然後我覺得就是 be the absolute number one。什麼叫 number one?這很難去定義什麼叫 number one,然後我比較喜歡看就是一個 Frontier 的模型吧。但 Frontier 的模型做出來那時間是 number one,很有成就感,但之後就會有其他的模型可以做上去。我是希望就是你具備的就是做 number one 模型的能力,但是就是做出對這個社會影響最大、最有貢獻的事情。因為你可以做出 number one 的模型,但你就是只給少部分人用,然後或者是就等於讓權力過度集中在少部分的手裡。
【嘉宾】然后产生一些不平衡的状态,我觉得不见得是一件对的事情。那我是希望就是具备number one的能力,但是做出对这个世界贡献最大的事情。具备number one的能力,但是做出对这个世界贡献最大的事情,是啊。所以最重要的是后面那个贡献,对吗?不是那个能力。对,人们就走一遭嘛,对吧。然后你留下来的就是影响,这要活得久,我的久机会大一些嘛,就是希望能产生一些,做些贡献,然后就证明自己,就是没有白来走一遭,大概就这样子。
【主持人】你还有什么在研究生涯上觉得遗憾的吗?你还特别想得到什么?
【嘉宾】我觉得Physics Club还没有成功嘛,对,还没有。还没有到那个时间点,就是谈论这些。我觉得我很开心,那时候十年前我在讲,Dibnene会取代Computer Graphics,成为一个最重要的这种影像生存的模式。这件事情发生了,我觉得还满开心的,这事情真的发生了。那我觉得这种世界模型,会是推动Physics Club成功的基础,然后这是我下一个重大目标,我希望这个东西也能成功。
【嘉宾】你要比就是,你有一个Best Paper Award,你就会想我要拿两个,然后我就照理一下,拿十几个,你总是拿不完嘛,对不对?比论文数,总是有更多的论文;那你比采取人数,总是有更多的采取人数;你比钱,总是有人更有钱,对不对。那重点是,我觉得你对自己的东西是不是很骄傲。我觉得过去有很多东西我觉得我做不够好,但目前有些东西我觉得我做得不错,那我接受。然后我觉得就是在我的能力范围内,我觉得我做出了我自己满意的东西。
【嘉宾】我觉得这个不,外部的很多衡量指标,现在慢慢都变得没有那么重要了,对吧。年轻的时候都觉得它们很重要,为什么这个人的Best Paper比我多,对,然后讲席比我多。那现在觉得就是,现在这个不在于,就是我重心这件事转移,帮助别人。也许我现在care的是帮助人够不够多,你最近一年帮助了谁?这些使用Physical Eye的、使用Cosmode的user,我觉得我都默默之中。
【嘉宾】替他们提出了帮助,然后当然还有自己的团队,还有一些就是尤其跟我交换过的人,我觉得或多或少我对他们生命都产生了一些影响。
【主持人】你也经常来中国吗?
【嘉宾】是。
【主持人】你怎么看中国的这一批模型的发展?
【嘉宾】非常的 Impressive,Very Impressive。这些从 DeepSeek 开始,千问、豆包,就我都把它全部加一次,MiniMax、Grok,然后 Kimi 这些,Mimo,对。然后元宝,就是这些智谱,对,都做得很好。那还有一件事情就是在美国尤其是 Frontier Lab 现在的状态,就是他们很少去招收实习生,很多那个 Know How,很多这些科研的结果,都只有在他们自己本身内部的实验室有。在中国这边我看到就是他们像这些公司都招收很多实习生,对,然后帮助把这些就是 Know How 传递出去。然后我觉得人类整个就是知识扩增,就是 Diffusion,就是,对,我觉得是一件好事。看到这些快速发展,我觉得,我觉得很 Impressive。然后还注意到这些 Diffusion,大家对 AI 都充满了热情,就是愿意去尝试,我觉得这都是我看到的一些现象。
【主持人】谢谢你跟我说,王慧文已经被 LLM 催眠了,你怎么看到这句话?
【嘉宾】我不觉得是纯粹被 LLM 催眠。不能否认的就是现在在 AI 里面最领先的公司,就是模型上最领先的公司,不管是 OpenAI 还有 Anthropic,都是从大语言模型出发的。那这模型也确切,我现在已经不知道,没有 Coding Agent 我要怎么过下去,我也不知道。就是这些实在太方便了,我就产生很巨大的变化,我觉得,也不是一件坏事。就是 LLM 真的产生了很大的用处,然后帮助提升我们的生活,我觉得很自然而然的就是大家会,会想,就是这东西既然都已经在这里了,然后下一步是什么。我觉得人自然会想要做哪件事情。我知道领域里面有些人是把学术变成信仰,但我觉得大部分人都还是从求知求真的角度出发,当一个东西得到充分理解之后,大家会找到新的东西来进行做突破。你很难想象一个人就,这么聪明的人,一辈子就只做 LLM。我觉得自然而然会发生,我并不觉得有这种催眠的事情。就是对于那些人而言,对现在的时间而言,也许做 LLM 是一件很正确的事情。
【主持人】昨天 CoreWeave 上市,然后马上 OpenAI 和 Anthropic 上市,今年这些大模型公司的上市会对行业发生什么样的影响吗?2026年会是剧变的一年,这边上市,大家都看到新闻了,就是会产生很多富翁,对吧。
【嘉宾】然后我知道究竟在那房价在快速飙涨,早期相信 DeepNative,早期相信这个 Space Mission 这些人,就是这些等于是对他们的远见,对他们的勇气,对他们的决心这一个认同,我觉得都很合理。这些公司真的对世界产生巨大的贡献,我觉得很完全值得。但这个,我觉得科技不会停在这里,然后陆陆续续都会有新的事情发生。100年前强盛的公司跟现在强盛的公司是完全不一样,50年前不一样,20年前不一样。对,我觉得这个社会只要组织架构还是一个好的良性的状态,就会不断有创新发生。
【主持人】就模型这场竞赛的终局可能是什么样?短短几年已经发生这么大的变化,再往远看呢?
【嘉宾】我讲这就很 controversial。我觉得模型的能力慢慢就会统一,对,靠模型自己不会是区分,一定要靠一些其他的东西注资在一起。那领先的模型有更充裕的时间去找到这个区分的方式,然后强大的这个公司也可以加大自己强大的 ecosystem 去做出一些变化。对,然后我不会觉得像 Software 刚出来的时候,会写 Software 公司很少,现在大家都回写 Software,然后每家 Software 都有一个自己的区分方式,那些活下来的 Software 公司都有自己的区分方式。然后我觉得没有理由模型会是不一样,我觉得会是一样。
【主持人】所以没有必要神化模型或者模型公司是吗?
【嘉宾】我把它当成编程,就是一个 Black Box。这么多人不同常识,最后就是一个一套学问,然后很多人都会编程,对吧?关键是你要把它干嘛,完全要看干嘛。那有些人解读比较深一点,然后有些人就是需要多一点时间,这都是我的预测。我是觉得这些东西慢慢就会 diffuse。现在假设一个新公司说我要训练一个模型,它还有很大概率赶上来,就是它可能比前面的公司落后两三年的时间。像 Kimi、我是 MiMo 这些 effort 都是算比较晚期出来了,Kimi 还行,MiMo 比较晚,对,还是有机会的。我是觉得就是会有一段时间大家会觉得算力不够,然后我觉得算力慢慢就会起来,都有办法去参加进程。我觉得这件事上有抱负、有决心、有办法去挪动资源去建一个大模型团队的人很多。还会有更多什么?我觉得如果说大模型是一个绝对的区分,那当然就会更多,但如果不是绝对的区分,应该会很多人就是想到对他们必须更有利的方式,我就是一种自然的平衡状态。
【主持人】自然的平衡状态。端侧模型你觉得会多久之后爆发吗?
【嘉宾】这东西跟 Physical AI 会很相近,刚刚也讲的,就是我觉得资金渐渐投入,然后科技迭代很快,也许这段时间我说不准,但我觉得希望它快速爆发。
【主持人】对于今年和明年的模型竞赛,你有哪些预测?
【嘉宾】在 Physical AI 上是很难的,创作还是很快。我还是坚信对我的模型能力,是帮助这些物理世界模型强化泛化的一个重要关键。那怎么落地?
【嘉宾】用什么样的Modality,这些事情大家都还在探索当中。确实GPT Moment for Physical AI is coming,这是我可能可以做的预测。那大语言、Coding模型这些东西,我自己本身在Follow,但我自己不做,我也很难去讲。我是用得很开心,但是我也很难讲接下来会怎么样。
【主持人】刚才你说了就是中国的这些模型公司,那中国的机器人公司你应该也见到很多,你觉得美国有什么不一样吗?
【嘉宾】两边,美国在做本体的公司很少,就Tesla跟Figure AI,然后这种好多家公司在做这个本体。做本体,它可以控制的东西更多,可以控制模型跟软硬体的整合的超度空间更大。然后我觉得因为中国强大的制造业,让产生一个很优势的条件,可以让这些公司做一些在美国不容易做到的事情。我觉得这些都是很值得去关注,这样的垂直整合会产生什么样的一个突破。
【主持人】对,我觉得还蛮有趣的。你觉得美国现在会不会有一点,就是不那么重视硬件,可能是错的,也很难说。但是就是在这种,如果说这种软硬体整合是一个机器人的一个趋势,那没有硬件当然是处于被动状态。
【嘉宾】有点难讲,好多东西要考虑,包含金融模式。中国明显就是有这个条件,可以让大家做快速的硬件,叠加软硬体整合。
【主持人】Cheating Moment在Figure AI,你觉得有可能在哪里爆发?看到一个应用,是大家很明显知道,就是产生巨大的经济价值,然后也许在那个时间点,那个应用并没有产生经济价值,当GPT刚出来的时候是赔钱的,对吧。但是就是大家看到的这个趋势,然后我觉得就会发生。
【嘉宾】那我个人觉得这种,就是简单的人示范一下怎么要的操作这个机器人,就可以就地学会这种东西,我觉得这是一个,如果这东西出现,我看到这样的一个,这样的一个产品,我就觉得说,要,那就去进行GPT Moment for Figure AI。
【主持人】所以核心是泛化,我觉得是泛化。
【嘉宾】对,AI的核心问题就是解泛化的问题。
【主持人】对于泛化来说,现在最重要的一个问题是什么?如果只说一个。
【嘉宾】泛化的问题,在Figure AI里面就是,怎样从这个有限的信号里面,学到需要的操作,然后应用在一个没有看过的一个场景里面。这个是Figure AI里面要解的一个主要的泛化问题。Observation对Action这个,这个配合的泛化,让你看到一些,你看到这个Action跟Observation是完成的事情,怎么样快速泛化到一个新的Observation,那类似的Action,对。
【主持人】我在想就是如果,它在Cosmos这套系统里学习了,大家走向受限世界的时候,它还是会有Sim-to-Real Gap对不对,怎么解决这个问题呢?
【嘉宾】这也是一个泛化的问题,就是Sim-to-Real Gap通常是,我们Cosmos想帮助Figure AI Builder是透过三个方式,之前有讲的就是Better Data、Better Starting Points跟Better Environment。那我觉得Better Environment这些东西是还没发生,是大家都希望能做出这个矩阵,但还没发生,就有陆陆续续有些Starting Points,我们看到一些规格都很不错。那现在比较管用的,可能就是Better Data跟Better Starting Points。你拿一个懂这个,比较懂这世界Physical什么的,去预测Physical,就是懂Physical可以去,不能说真的懂Physical。
【嘉賓】但抓到那個模式,可以去不一定這樣發生的事情,這東西也許可以幫你產生更好的、做出更好的Party。那這東西,因為它本身的Prior是比較適合繁華的,那它也許就可以幫你建出一個更容易繁華的一個Party Model。我覺得這個是我看到可能短期內Cosmos Model可以對Physical AI Builder的一個貢獻。
【主持人】如果五年後我再來採訪你,你希望Cosmos發展到什麼階段?
【嘉賓】我希望五年後,如果我們再有這樣的一個採訪,我們可以清楚地講出來,究竟Moments是什麼時候發生的。對,然後是在哪裡發生。我希望可以這個事情是可以明確地講出來,今年幾月幾日,那時候就有一個具體的時間了。對對對。
【主持人】在人工智能的歷史上,你希望別人怎麼來記錄你?
【嘉賓】就是不要講我吧,我覺得就是講Cosmos吧。然後希望Cosmos可能是一個重要的推手,然後幫助這些幾個重要的Physical AI Builder達到這個確實比例的Moments,我覺得這個可能是我會很開心的一件事情。
【主持人】嗯,我還有一些快問快答。全球範圍內一個你最喜歡的食物?
【嘉賓】牛肉麵。
【主持人】全球範圍內一個你最喜歡的地點?
【嘉賓】我喜歡灣區,天氣實在太舒服了。
【主持人】你有什麼喜歡的音樂、書、電影或者遊戲嗎?
【嘉賓】書蠻多的。然後音樂我不怎麼聽,然後遊戲我已經不怎麼打。我上次打遊戲可能都是20幾年前的事情了。
【主持人】能分享一本真正改變你或者影響過你的書?
【嘉賓】權神推薦的書,它是講Positioning的一件事情,然後我忘記這個書名叫什麼。很有趣的一個心理學的書,然後讓你更加理解問題的本質是什麼。年輕的時候讀了很多不同的書。
【主持人】對,我特別喜歡金庸小說,那是其中一環。金庸小說有幫助到你後面的科研或者是解管理嗎?
【嘉賓】倒是沒有,就是裡面的這些可以體會這個金庸的各式各樣的幻想,然後很美的一些意境。那當然是我推向了學中國武術的道路,然後從中國武術裡面得到一些歷練,我覺得那都是蠻不錯的一些過程。
【主持人】你對於年輕的研究員你會有什麼建議?
【嘉賓】就是不要緊張。我現在看到年輕的研究員都往往覺得就是會不會明年這個AI就結束了,就AI自訓練了。然後不要緊張,對自己有信心,然後冷靜下來,看清楚什麼地方是值得你投入精力,不要被這些大家的這個宣傳覺得好像自己越走越窄。
【主持人】現在研究員進入Physical AI是一個好時機?
【嘉賓】好時機。
【主持人】是一個好時機是一個紅海嗎?
【嘉賓】這是一個好時機,就是各種機會,然後還有很多地方。我當然做Physical AI我比較懂,但這些AI的進步讓我們可以做出更好的這些material跟更好的藥,這些生物方面的這突破。我覺得在各行各業裡面都可以漸漸看到這個AI的影響,我覺得很多地方都可以去投入。
【主持人】我們工作室叫語言即世界工作室,當你第一次聽到這個名字的時候你在想什麼?
【嘉賓】用語言來描述這世界上發生有趣的事。
【主持人】你覺得是大模型競爭不是零和遊戲,還是世界模型競爭不是零和遊戲,還是說對於你來說不是零和遊戲?
【嘉賓】對別人可能是,我不清楚。你如果大家想解的東西一模一樣,那就是零和遊戲,對嗎?所以模型競爭不應該是零和遊戲。
【主持人】對,因為這世界上要被解的問題這麼多。
【主持人】對,然後可以提供價值的東西這麼多,也跟喜歡東西又不太一樣。對。我有個問題,你看起來一直是由於遊戲。你有過那種特別high ego的時候嗎?年輕的時候。
【嘉賓】對,就是我總覺得我的算法最好,然後我寫的paper最漂亮,總是會這麼覺得。算法重要,你需要很好的數據,很好的infrastructure,讓你可以做快速的算法迭代。因為即使你有兩種可能,你總是一開始的算法很好,ok,那很好。但是即使你一開始的算法不好,你有很好的data,也很好的infrastructure,你可以迭代。然後迭代只要你遵循著這個很嚴格紀律,然後這種控制實驗,反正你算法就越變越好。所以我反而覺得迭代速度是重要的,那迭代速度就是要靠強大的infrastructure來支持。data很重要,因為如果一個問題可以用data解,你就用data解就好,不用開發算法,因為data簡單多了。對,然後所以不喜歡浪費力氣。這個問題只要是data能解,就收集data,就照data,然後真正不能解的,再用算法來解。
【主持人】是每一個公司都需要訓一個自己的大模型嗎?你覺得沒有必要是嗎?
【嘉賓】你如果是commodity,你需要建自己的電廠嗎?你每家公司要建自己的電廠嗎?ok,就是看合不合乎經濟效應,對吧。在早期你要做汽車工廠的時候,當電廠不充裕的時候,你蓋個電廠,你可能可以確保你工廠是24小時運行的。但現在這時代你可能不需要了,對吧。
【主持人】你可能跟太多AI的開發者聊,他們每個人都是覺得我的AI模型是最好。
【嘉賓】我覺得這東西在歷史上從來沒發生過。然後我不覺得,因為人跟人相處沒那麼容易的。你看當初Dario Amodei跟Sam Altman就是合不來,對吧,他就走了。然後你最近在NShop裡面,每個人都是一模一樣。我不覺得。
【主持人】都是堅信的。會不會哪天就是你生了A,不生了B,然後B就覺得說,對吧,然後他會不會就帶一群人走,去做個類似的東西?
【嘉賓】對,然後沒有,但數據大家都有,算力找你買。你只要有錢還是買得到,對吧。所以大家都能做,你有決心,然後你有資源,你是可以做的,所以有沒有那個必要。
【主持人】Cosmos對你們來說是一場不能輸的戰爭嗎?如果說有其他公司也做開源模型的話。
【嘉賓】那就不是,那就不是。對,什麼叫戰爭呢?就是我沒有打算把別人殺死,我必須要按這個賽道,就是你們都得長到我的生態上面。NVIDIA要繼續成長,Physical AI是一個重大的市場。現在家家戶都沒有機器人,但如果有機器人的話,我家可能會買兩三個,那每個機器人都需要算力,那等於整個世界,對,需要算力,對算力的需求會大幅的成長。這個事情如果發生的話,對NVIDIA是巨大好處的。我們的心態不是說想把別人殺死,我們的心態是我們要怎麼去造市場,你懂我意思嗎?Cosmos就是造市場,造出了Physical AI的市場,我們想的是怎麼造出下一個大的市場。
【主持人】那你说是不能输的战场吗?
【嘉宾】我觉得也不是,也不是,因为是全新的东西,对,我们没有跟任何人竞争是吧。
【主持人】对。
【嘉宾】就是供力嘛,带着大家一起把那个市场建出来,然后你卖这个机器人赚钱,你做这个卡森买券赚钱,那这个东西会需要一些算力。
【主持人】有赚钱。
【嘉宾】那当然会有公司买AMD的晶片,他也会赚钱,那整个市场就起来,原本是Nothing。
【主持人】老黄会分享类似的观点吗?
【嘉宾】对,经常说什么造市场,而不是存量竞争。对,你读他的书就会发现,他讲说我们就要做这种Zero Billion Dollar Business。什么叫Zero Billion Dollar Business?就是现在不是个Business,但以后成功后会变Billion。如果现在已经有人在做,可能就不值得做。
【主持人】这是一种拥抱风险还是一种抵抗风险?所以还是一个D-Risk吗?
【嘉宾】这是一个D-Risk。我们做事原本是很Risky的,全部就是CUDA那时候是很Risky的一件事情,等于是在做赔本买卖,对吧。我们因为做CUDA,我们整个GPU的价格都比别人高,同样的Flops我们都是比别人高,因为我们要支援这个Programmability。你不这么做,你做这件事情很Risky,你不做这件事情更加Risky。
【主持人】你不做这件事情的话,别人做了的话,对于你们来说就……
【嘉宾】对,非常地有风险。不做这件事情的话,就是你的东西就渐渐变Commodity。
【主持人】你从老黄身上学到什么没有?
【嘉宾】我都尽量很用心在学习,他怎么去跑其他东西,然后从里面去应用在跑Cosmo。
【主持人】为什么其他公司都说CEO不应该是最努力的人,但你们公司CEO是最努力的人?
【嘉宾】对,是,这我也不懂,但它It works, I cannot... 对吧,时间没有绝对。
【主持人】他现在的驱动力是什么呀?
【嘉宾】驱动力就是take your families,做AI真的是很有趣的一件事情,你尤其是站在他角度里面,看到他的贡献改变世界,我觉得是很有成就感的一件事情。
【主持人】不愧是教主。
【嘉宾】是的。