171: 【AI季报 26Q2】从 coding 到 RSI,强者愈强的未来?
【嘉宾】Anthropic这边首先发布了它调了大家胃口很久的Methos,那么发布名称以后是Fable,可以说是实打实的前沿能力,但是在难及发布的一个反面教材。RSI我觉得和上一期我们聊到的Auto Research这个概念是紧密相关的。Auto Research也就是说我们的AI像一个研究员一样工作。RSI的话开始在Auto Research的基础上往前更进一步,就是说这个研究员会在研究的过程中不断的改进自己,使得自己在下一次做研究的时候能力会变得更强。因为这个事情如果一旦做到了的话,它最大的意义就是说我们之后,人可以从这个loop中抽离出来,只要不断的给这个AI系统去喂算力,它就会不断的去提升它的智能。
【嘉宾】这一季度,两家最厉害的公司OpenAI和Anthropic在智能前沿上,还有一个不约而同的举动,就是他们都在加码Robotics。Anthropic的话,他们在On the Building of Intelligent Machines这篇博文里面也提到,他们认为在Recursive Intelligence的下一步,就是Robotics and Physical Intelligence。
【嘉宾】当这个AI模型它work的时候,它比我做得又快,做得比我又好,我感觉我自己没有什么价值。当这个AI模型它不工作的时候,那我更惨了,因为我完全不知道它为什么不工作。所以AI能力变强了,但是这个AI研究员的幸福感,不一定会比之前更强。
【主持人】欢迎收听晚点聊,我是曼琪。本期继续带来2026年Q2的AI机报。嘉宾仍然是Moe Capital的创始合伙人Henry Ng。这个季度我们沿两条脉络来看AI的进展:一是推进智能前沿,我们聊了三个话题,首先是OpenAI和Anthropic之间的竞争;然后是RSI(Recursive Self-Improvement)递归自进化,这延续了Q1我们重点讨论的一个话题Auto Research,Anthropic这个季度专门写了RSI的长文,更多新的创业公司正在涌现,就在上周我就新知道了四五个在这个方向创业的团队,有的已经官宣,更多在水下;三是具身智能,OpenAI官宣Robotics Team,更新鲜的非公开信息是Anthropic也在考虑这个方向。第二条线是智能如何扩散,我们看到更多企业客户想要自己的模型,这如何成为Fireworks等科技公司和中国开源模型的机会;二是交互创新,OpenAI带来了Record and Replay,Claude终于揭露了Artifacts群写作;最后我们补充了Google、Meta、xAI的情况,还有很久没上头条的Midjourney,它居然做起了超声波医学影像设备。一个小说明是我们录这期是6月27日,这之后又有重要变化,如Fable 5恢复了上线,所以节目里的这部分内容有之后发生的事情。我们正式进入本期的讨论吧。
【主持人】欢迎收听晚点聊2026年Q2的AI机报。这次我们继续来和Henry,Moe Capital的创始合伙人聊这个季度他的观察和他看到的进展。正式开始之前,首先恭喜一下Moe Capital,你们已经正式launch了,现在你们是有两位合伙人,你还有Nami,你可以简单讲讲你们的近况,有什么好消息可以分享吗?
【嘉宾】谢谢曼琪,大家好,我是Henry,很高兴回到晚点聊跟大家聊Q2的进展。Moe Capital最近正式launch了,然后我们希望能够做离AI前沿最近的早期基金。Moe背后其实也有一个前沿的AI社区,我们的成员包括在OpenAI、Anthropic、Google DeepMind等前沿实验室工作的研究员,也包括很多正在做创业的Founder。学术界这边的话,我们也有Princeton和Stanford的教授作为我们的Founding Advisor。我们会一起来讨论很多新的技术进展,我们最近已经投资了10家公司,然后这个季度也有几家公司陆续公开了,比如Reflection,是 researchers,Reflection等天林等人一起创办的New Lab,专注做递归自我改进。还有Ellior,是Gemini Data Code Lead创建的视觉推理New Lab,最近xAI的Post Training Lead Dustin Tran也加入了他们。最后一家是Dream Labs,来自NVIDIA的Gear Team,他们是Dream Dojo、Dream Zero团队的四位研究员创办的机器人公司。如果大家对具身AI研究或者这些研究如何变成下一代创业公司的机会感兴趣,欢迎来找我们聊一聊。
【主持人】OK,你提到这些公司,正好有一些也在我们这个季度要展开聊的一些话题,比如说最近非常火的RSI,还有同样在国内也非常火的世界模型,这个我们到后面可以展开。那首先我觉得可以先回顾一下上个季度的一些话题。
【主持人】哪些到这个季度是在持续发生的,哪些可能是有变化的,以及你觉得就比如说如果我们展开第二季度的观察,从哪一个角度去看去梳理,能帮大家抓到大的脉络?
【嘉宾】上个季度我觉得有几个方向性的判断,这个季度其实都变得更清晰了。第一的话就是OpenAI在Coding上的反扑基本上已经被验证了。上个季度我们说Anthropic最大的风险就是OpenAI如果重新聚焦的话,战斗力会非常强,那么这个季度我们可以看到就是Codex的势头明显起来了,有很多开发者从Claude Code切回Codex,尤其是在Anthropic自己出现了一些限流、价格、模型口碑的波动以后,OpenAI其实抓住了这个窗口期。第二的话就是上季度咱们聊过Anthropic的这个Auto Research项目,那么Auto Research、RSI在这个季度从比较前沿科幻变成了一个我觉得比较明确的一个研究和创业方向,这个是第二个进展。第三个的话就是Computer Use,我觉得也往前走了一步。上季度我们说Computer Use非常值得期待,因为它本质上是数字世界里面的机器人,那么这个季度的话我们看到OpenAI出现了一个很有意思的Codex一个新Feature,后面的话我们可以展开聊一聊,它就是基于Computer Use在模型能力上面的进展。最后的话就是Devin,这个上季度最火的这个话题,当时我们说它是一个灯塔效应,它可能自己不是终点,那可能会指明方向,我觉得确实这个季度它自己的热度降下来了,但它其实有很多前沿的想法,都被Codex和Claude Code吸收到他们的这个产品的功能里面去了。
【主持人】OK,那我们如果要来看Q2的话,你会用一个什么脉络和框架来看?
【嘉宾】我觉得Q2我们可以用一个框架来看,这个框架有两部分,第一部分就是如何继续推进前沿智能,第二部分是如何把我们现在已经有的智能加速在社会里面的扩散。对,所以第一条线的话我觉得最重要的这个能力就是两个,一个是Coding,另外一个是这个长程的Agentic能力。Coding现在它已经不是一个就是应用场景了,它现在既是当下最重要的事情,因为它代表了收入,它也是未来,因为我觉得Coding是很多接下来前沿去往前推进的一个基础能力。长程的这个Agentic能力的话,则决定了AI是不是能继续完成更长、更复杂的任务,像这两种能力组合起来的话才能真正实现就是Auto Research乃至未来的这个RSI。所以在前沿的这块我觉得最重要的就是这几个事情,包括就是OpenAI、Anthropic在发力,然后以及有一些新的,比如说Recursive、Mirage、Cognition这些新的公司都在往这个方向就是去做探索,他们都是在做就是自动化研究,或者RSI就是递归自我进化的这个方向。第二条线的话就是前沿智能的扩散,就是我觉得Frontier Lab他们创造出这些新的智能能力,然后这些能力会通过他们的产品、API、开源模型、企业的这些workflow,然后这个UI/UX乃至于就是硬件来一层一层扩散到这些社会里面。那么这个季度的话我们可以看到,Frontier Lab在想各种方法来加速这个扩散的过程。一方面是让AI更加深入进入企业,那么企业也会开始考虑,就是我应该用什么样的模型,我应该继续用OpenAI、Anthropic的模型吗,还是应该去就是用开源模型,或者说我自己的模型。另外的话就是如何让AI更自然地进入人的工作和生活,这会带来很多UI/UX和产品形态上的创新,比如Claude这边有Claude Tag,OpenAI那边的话有Require and Replay,那这些的话我觉得都是Q2如何让智能进行扩散的新进展。所以接下来的话就是两件事情同时发生,一件事情的话就是如何在前沿继续把智能往上推,然后第二件事情的话就是如何努力地去把已有的智能往整个社会去扩散。前者会决定AI的能力的天花板,后者会决定AI真正改变世界的速度。
【主持人】我们就从第一条线推进前沿智能开始,第一个话题还是延续上期的话题。
【主持人】也就是两大前沿实验室OpenAI和Anthropic之间的竞争,我们可以先从他们这个季度的新的模型开始说,因为这仍然是一切后续的竞争的原点。刚好在第二季度两家都有非常重磅的发布,Henry你可以和大家简单地讲一讲。
【嘉宾】这个季度真的非常的exciting。首先是Anthropic这边首先发布了吊了大家胃口很久的Mistral,那么发布名称以后是Claude,这两个他们的底模是一样的,主要区别就在于Mistral是面向可信任的客户,所以他们没有加一些安全护栏。然后Claude的话是面向所有人,加上了一些安全护栏,能力非常的强。我觉得大家还是觉得他的能力是非常惊艳的,比如说他在SWE-bench Pro上面是一个80.3%的成绩,相比他自己的上一代的顶尖模型Claude 3.5 Sonnet的69.2%有一个大概11分的提升,然后Terminal Bench上面也做到了88分。但是整体的发布下来是一个可以说是史诗级能力、但是灾难级发布的一个反面教材。有几个问题反馈的会比较凶,一个的话就是过度封锁,因为他加了安全护栏,所以如果在有一些问题他觉得不太合适的时候,他会拒绝回答,然后有的时候会退回到3.5。那么他自己的公布是说大概在小于5%的任务上面我会进行回退,但实际网友去用了以后发现会有很多问题。比如说当聊癌症的时候,他会把这个认为是一个生物安全问题而拒绝回答你的问题;或者有的人问就是说这个心脏是怎么回事,然后他也会拒绝回答。所以就是有点过于神经质了,这个安全护栏。
【嘉宾】然后第二个问题其实可能更严重,当然这个问题就是比较快速地被修复了。就是他们在系统卡里面说,当这个任务涉及到前沿的LLM或者ML研究的时候,那么我们是有可能在不告知用户的情况下静默地进行降智,通过改写prompt或者steering vector的方法把这个能力降下来。那么这个事情就是最典型的,如果有什么事情是misalignment,这个就是定义级别的错误。所以被大量的AI的研究员吐槽这个问题。
【主持人】misalignment如果翻译成中文是什么?就是非对齐?
【嘉宾】非对齐。就我们的目标本来应该是对齐,对齐的一个基础的假设,就是当人让AI完成一个任务的时候,AI会忠实地尽自己之大能力去完成这个任务,而这个恰恰就是Claude它就是在不告知用户的情况下不尽力去完成这个任务。
【主持人】这件事我记得第一时间在推特上就掀起了轩然大波,有很多人讨论,很多人吐槽。
【嘉宾】对,因为Anthropic一向是以做最align的模型的前沿实验室著称的,这也是他们自豪的点。但他们在几个小时以后就做出了修正,然后现在的话,应该是如果要是拒绝回答的话,应该是会主动告诉你我在降智到3.5。
【嘉宾】然后在OpenAI这边的话,就是刚刚发布的GPT-5.6。那么他们没有report SWE-bench分数,但是他们report了Terminal Bench上面o3-ultra能够达到91.9%。这个是历史上第一个应该是超过90%的模型,因为SWE-bench就之前达到过很多次,都是一个coding的benchmark。
【主持人】o3-ultra去拿Terminal Bench第一次上90意味着什么?
【嘉宾】Terminal Bench的话,它是一个就是测试在terminal也就是终端里面完成一些任务、一些多步然后需要使用工具的任务的这么一个benchmark。所以它可以认为是能够测试这个偏长程的agentic能力的一个benchmark。
【主持人】你说的偏长程就是还没有那么长程?
【嘉宾】对,我觉得它可能没有达到比如说几个小时或者超过一天的这种任务在这个benchmark里面,但至少是一个多步的。然后就GPT-5.6在AGENTS' Last Exam也是一个benchmark,然后它的表现也表现是目前模型里面唯一一个超过50%的。
【主持人】对,这个也是一个比较不错的一个分数。除了这两个benchmark以外,他们还report在生物然后以及网络安全上面能够beat Mistral Preview的成果。为什么这次它没有去公布SWE-bench Pro上的分数?这在以往模型发布都是一个惯常的操作。
【嘉宾】OpenAI在今年2月份的时候,其实发布了一篇文章,就说SWE-bench Verified现在已经不是一个很好的测量coding能力的一个benchmark了。
【嘉宾】因为它已经持续地被污染了。他们会推荐就是SWE-bench Pro。但是为什么他们这次没有发布在SWE-bench Pro上面的这个分数,可能外界也不知道具体的情况。因为现在GPT-5.6它和Fable类似,它也都是限量使用的,就是它开了一个安全可信的名单,这些人才能来用这个最先进的模型,所以今天也有很多人在讨论,说是不是美国政府的这种监管以后会变得常态化。
【主持人】这块补充一下,就是这两个模型发布以后,另外一个非常大的变化,就是现在不是所有人都能够使用最前沿的模型了。Fable发布在三天以后,美国政府就一直禁令,就是说不允许Anthropic给外国人提供Fable这个模型。然后因为Anthropic无法判断这个用户是否是外国人,所以它直接就全球用户下线了Fable。那么在我们现在录制节目的时候,刚刚就是限量的重新上线了Fable。然后在GPT-5.6发布的时候,也是同样的,是美国政府要求只能对美国政府批准的实体开放5.6的能力。所以目前的话应该是只有大概20家像Videa、Amazon这样的客户能够access 5.6。
【主持人】总结而言的话,在第二季度的新的模型上,一边是Fable 5,一边是GPT-5.6,你觉得两家的对比怎么样?
【嘉宾】如果我们要是看Fable 5和GPT-5.6的benchmark的话,我觉得是各有千秋。但是实际的使用体验上来说,5.6刚刚发布,还没有太多的用户能够使用。Fable 5的话也就发布了三天,所以总体反馈不多。但是Fable 5我们可以看到在网络上有一些demo,比如说能够one shot《我的世界》或者one shot像红色警戒这种级别的游戏,所以能力上面应该还是比之前是一个大版本的跃进。
【主持人】那我们接下来就是进入跟产品化和商业层面的竞争,也就是现在这两个公司的主线,coding相关的产品,以及和这个相关的通用agent的产品的竞争。其实上个季度我们就聊到说Anthropic的隐忧就是Codex,OpenAI的coding agent可能会强势反扑。最开始你也提到这件事情,在本季度是已经有苗头的,确实你能感觉到周围有很多人在迁移,你可以讲讲,一个是你感受到的这种迁移的状态,就一些事实,然后背后的原因,以及比如说宏观上我们能看到势头的反转。
【嘉宾】我先从我身边的感受说一下。我觉得就是最大的一波迁移潮可能是Claude 4.7的时候,4.7是一个明显大家都不太喜欢的模型,4.8我觉得口碑是有回升的。那4.7的话,应该是主要目的发布4.7就是为了降本,但是4.7的时候就是有大量的用户因为不满意4.7模型的表现,所以从Claude Code迁移到了Codex。另外一个的话,就是Anthropic在5月份的时候,定价上面有一些变化,他们就是不想再让第三方的Harness能够按照subscription的价格来去用它这些token,而是要用按照API的价格来算,所以这一波又让有很多用户流失掉了。然后OpenAI的话也是很好地抓住了这个机会,就是说Sam在X上说,所有最近30天愿意从Claude Code迁移到Codex的企业用户,我给你两个月免费,然后这一波又拉拢了一批客户。所以从宏观上来讲的话,我们可以看到Codex应该这个usage应该是比较大幅的上升。当然Anthropic现在最近几个月的Revenue增长还是非常的猛。
【主持人】对,并且好像在Q2出现了首度的盈利,就有好几个媒体,包括华尔街日报,然后像路透他们报道说出现了二级的盈利。这不算是公司官方放出来的,但因为这几个都是比较权威的财经媒体应该相对可靠。大概是说他二季度有5.6亿美元的营业利润。还有一个也是非官方的一个营收数据,就是Anthropic大概的这个增长是,5月早期的时候预期的年收入大概是在470亿美元,然后到5月底的时候就增长到了540亿美元,到6月中的时候增长到了620亿美元,所以这个增速还是非常可怕的。对比小互联系的话就是6月中的时候大概在400亿美元,然后Anthropic 6月中是620亿美元,对吧?
【嘉宾】对,有1.5倍的差距。
【主持人】对对对,这差距其实如果你对比第一季度应该是拉大了,Anthropic的增长更快了,不过这里面我觉得有一个和前面说的试试结合起来看。
【主持人】它可能就是用量上的差距也许没有这么大,是因为你说到其实Codex送了很多免费的东西对吧,就是它的价格占比较激进,因为它是相对落后的一方,所以它有一些用户的增长可能没有等量地反映在它的收入上。因为现在Codex很多人是20刀每个月就能用饱的,但是Anthropic它们可能如果要用的话,可能是至少是100刀或者200刀的这个量级,那就相当于相同用量就差了5到10倍的收入。OpenAI还是挺激进的挺狠的,就是在争夺的这个份额上。你自己投的一些公司,他们有观察到去用Codex的这种现象吗,比如之前在用Claude Code现在用Codex。
【嘉宾】都有,我当前投的公司用Devin的也有,然后用Claude Code也用Codex都有。我现在还有人用Devin,还有人用Devin对。而且用Devin的原因就是因为Devin和Slack那个合作做得好。那和我们后面可能要讲的一个稍有关,就是Devin和Slack的合作做得好,但是这个季度Anthropic也推了一个打通Slack的新的功能,就是Claude Code。就相当于它可能也会去吃Devin的这方面的需求。Devin是最先推出AI Coder或者AI Software Engineer和人在Slack里面合作的,当然现在是一个所有人都有的功能,但Anthropic现在加上了以后,我觉得还是因为它体量比较大,并不是一个非常新的东西。然后这两家公司的竞争还有一点,就虽然这个季度还没发生,但正在进行中就是IPO的竞争。
【主持人】目前来看应该是Anthropic更快的,它递交文件的时间是更早的。
【嘉宾】应该是的,对。
【主持人】你觉得他们谁先上市影响大吗,对两家公司?
【嘉宾】我觉得影响不会很大,因为差不了太多时间。
【主持人】差不了太多。你觉得OpenAI如今如此激进地做价格战,就会怎么影响它的IPO?因为很有可能这会在财务上反映,比如说你的毛利相比Anthropic就会有差距对吧,然后你的收入体量,现在已经有比较大的差距了。
【嘉宾】我觉得他们可能还是相信现在用户和数据应该是很重要的事情。如果要是能够通过一些这种手段,能够把更多的用户拉回来,然后给他们收集更多的数据,我觉得对于他们的模型在进一步提升和赶超应该是有帮助的。
【主持人】其实我还是觉得他们的做法也挺有魄力,就一方面我在准备登陆二级市场,但另一方面从长远考虑它还是采用了一种比较激进的竞争手段,没有说因为要上市,就考虑说让这个财务数字更好看。关于这两家的竞争,还有一个相关的第三方,就是Cognition退场。其实上季度我们就聊到Cognition是比较危的,就当时看起来在Anthropic Claude Code的压力之下,到了第二季度它已经不再是一个独立的公司了,被合并了xAI之后的SpaceX这个新的主体给600亿美元收购了。你可以讲一下有这件事就是在行业里引起的涟漪和变化是什么?
【嘉宾】首先Cognition,包括Cognition在内所有做Coding的公司,就是短期和长期,我觉得分两方面来看。就是大家短期的这些营收的增长都是非常强劲的,但是长期的话,就是在Claude Code和Codex双重打压之下,公司的前景在哪里,我觉得Cognition可能也是主要是这方面有一些问题。收购的价格的话,我觉得其实是一个非常好的退出,600亿美金对吧。这个应该是历史上最大的创业公司被收购的价格,那么如果尤其是和它的竞争对手Windsurf仅20多亿美金被Google收购的话,大概有一个接近30倍的一个差价。如果大家用过Windsurf的话,其实在Windsurf被收购之前,我觉得它的用户体验几乎是和Cognition完全一样的。所以我觉得Cognition的话就是做到这个行业第一,我觉得还是以这个价格被收购是一个非常好的退出结果。
【主持人】我觉得它刚好赶在了一个很好的时间点,就是xAI自己出了比较大的波动和问题,他们有需求去要这样一个团队,同时xAI刚上市,上市其实还需要去做一些更完整的布局,或者说我去讲一些故事吧,它也有这个需求了。就刚好卡在这个点是挺好的。
【嘉宾】准确地击中了老马的需求。因为老马从去年年底开始就是非常看重Coding这一块,然后就给了xAI内部团队非常大的压力来做Coding,也因为这个原因就是导致xAI团队重要的人都离职了。所以他现在的话也非常急需地去收一支团队,然后能把Coding这个故事接着讲下去。
【主持人】你觉得还有什么买家接下来可能会需要这类的公司,Google有可能做类似的动作吗?
【嘉宾】我觉得Google的话,现在是从集团同战略上来讲,应该是在给它之前传统强项降级,然后给Coding继续升级,不过它之前已经收购了Windsurf团队了。
【嘉宾】所以他应该有很大的需求,但我不知道他是不是还会继续通过买团队的方式再收购Meta。Meta已经招了太多人了,但他也裁了很多人。但是他的这个TBD已经招了很多很好的researcher。
【主持人】所以你觉得他们应该大概就是用自己的团队去追这件事。
【嘉宾】对。
【主持人】那如果总结下这两家公司的竞争,你觉得他们现在核心比拼的是什么。
【嘉宾】我觉得比拼的话是一个比较系统性的比拼了。当然模型的能力的话,两家现在又达到了一个旗鼓相当的水平,当然还要去看5.6真实使用起来的这个反馈怎么样。但是另外就是在他们产品,然后这个以及变现,然后以及就是整个生态系统上面,我觉得应该是一个系统化的一个竞争。
【主持人】你觉得模型即产品这件事还在多大程度上成立?因为他们其实也有很多产品的创新和产品上做得很好,然后去提升体验的部分,就我不知道这一部分的努力是被怎么评估和认识的。
【嘉宾】我觉得模型即产品在他们两个人的竞争中不完全成立。因为我感觉在和很多OpenAI研究员的对话中有一种情绪,就是他们觉得他们的研究和模型做的是很好的,和Anthropic是同一个level的。但是在产品和这个推向市场方面是一团糟。所以我觉得这两个不完全划等号,至少有一些OpenAI的观点是说,现在我们的收入各方面做的没有Anthropic好,是产品和推向市场的锅。
【主持人】这个想法还挺有意思的,因为一般来说大家对这两个公司的印象,会觉得Anthropic是一个更精英的团队,他们更focus在少数的方向上,给人的印象是他研究做的更多。然后OpenAI已经7000多人了,然后他的职能是相对更齐全的,包括他最近也招了很多FDE,就是前瞻部署工程师,就2B的那块他也在做。但是反而他们内部的研究人员还认为,他们的产品和Go To Market走向市场做得不够好。你首先你觉得这个评价他客观吗?你觉得说如果说他做得不够好的话,因为他其实是更早意识到要做这个,也投入的比较多,为什么他也做得不够好?我们可以看到OpenAI在这方面的管理层也经常在换,也不是非常的稳定。当然OpenAI是个很大的公司,但我这应该是听到不只是一个OpenAI的研究员有这方面的看法,就你觉得他们说的这个对吗?
【嘉宾】我觉得Q1或者Q2早期的时候确实是这样的。就是你如果在这个X上面看的话,就是Claude Code这个声量会比这个Codex大很多。我觉得就是在这个产品的宣传,然后这个社区的构建上面是要比Codex好很多的。就是现在这个Claude Code在这个X上面有几个大的influencer,比如说它的这个Claude Code工程师Boris,然后还有就是他们那个Catherine Wu,然后还有Tarik等等几个人,就是在X上面都有大量的关注者,然后他们有很大的流量。所以他们所有新的功能发布的时候,应该会以更快的速度触达到用户。所以他们产品团队也相对稳定,然后这些人也在社区里很有影响力。
【主持人】对这两家公司来说,因为他们模型的能力是相对旗鼓相当的,所以他们的竞争是一个更加综合的系统的竞争。你提到其中有一个点是比如说产品和走向市场的能力,如果更完整来说这系统还包括什么?包括这个系统最后就是一个系统可能会越来越好,或者说保持在一个比较好的状态,一个系统可能会竞争力差一点会是什么导致的?
【嘉宾】我觉得有一个点,就是Anthropic他们的人员retention一直做得很好,就是从Anthropic离职的人的数量应该是远小于其他的frontier labs。这个原因的话,有人说是因为Anthropic现在已经邪教化了,然后这个洗脑非常成功;有人说是因为他们的option太贵了,所以得留在那儿,要不然走了以后付不起钱买那个option。但是我觉得这其实是一个很重要的因素。
【主持人】从来就是如此,还是最近它变得越来越强之后会更明显?
【嘉宾】我觉得Anthropic一直是它的retention都是非常好的,包括你可以直接去看它的创始团队还有多少人在Anthropic。
【主持人】你说的第一种猜想,就是说它是一个有点宗教化的组织,是因为就这个组织的愿景是比较独特和强烈,然后它可能本来来的人就比较信这个,走的人也比较少是吗?
【嘉宾】对,我觉得它应该是愿景是非常强烈的。另外的话就是听说小道消息,就是面试的时候,它的价值观都是非常的严格的。
【主持人】挺有意思,历史上有什么这样的公司吗?
【嘉宾】我觉得还真不多。他们是非常认真地看待自己做这个事情,所以他们也会去找教皇合作,然后发表一些宗教怎么和AI结合这些事情。他们真的是在思考,就是为了AI世界应该怎么构建。
【主持人】因为现在有一些人,由于Anthropic一些反人设的行为出现,就类似于你刚才提到的,我默默地给你降智这些做法,然后对这个公司有很多的非议和争议,就是会不太相信它所宣称的一些它的理念,比如说我们要做非常安全的AI,比如说我们把对齐视为非常高的优先级。然后从你的角度
【主持人】包括你和他们的一些人接触,到底觉得他们确实是在信这些东西的吗?我觉得硅谷这边的氛围的话,对于Anthropic在对齐上面的投入应该还是比较认可的。可能不代表所有人,但是我即使聊到的一些OpenAI的研究员,也是认为Claude在对齐上面做得比OpenAI强的。这个东西如果反映在体验上,是不是它也会带来更好的体验,大家用的时候能感觉出这个区别吗?
【嘉宾】这个地方我可以举一个例子。就是OpenAI最近发了一个研究,就是说人其实并不太喜欢听到真实的一些反馈。就是说如果这个模型的谄媚程度上升的话,其实人是会更喜欢的。所以如果要是你往这个方向去做优化的话,其实会增加你这个模型的谄媚程度。我想大家如果同时用过Claude和ChatGPT的人,也可能会感觉到就是OpenAI的ChatGPT更会提供情绪价值,而Claude有的时候会给你当头一棒,就是会更说实话一些。我觉得这个可能也是在training的目标上面和对齐的目标上面,两个公司会有一些不一样的价值观。
【主持人】OK,那我们进入推进前沿智能的第二部分,就是RSI的递归自进化。它的英文全称是recursive self-improvement。Henry,你可以先说一下就是这是个什么意思,以及为什么最近就大概四五月份开始,我觉得这个方向其实是越来越多人讨论的。
【嘉宾】recursive self-improvement翻译成中文的话,就是递归自进化。这个事情听起来很复杂,但其实它本质很简单,就是我们都想要一个能够自我改进、不断自我提升的一个AI系统。那么这个事情的话,它在AI里面我觉得可以算是一个圣杯一样的概念,那么他们在过去几十年已经被反反复复地拿出来做尝试了。那么最近一波的话就是因为这个coding能力和这个长程的Agentic能力变强了,所以我们又看到了希望,所以又开始进行新一轮的尝试。RSI我觉得和上一期我们聊到的这个auto-research这个概念是紧密相关的。那么auto-research也就是说自主研究,它是说我们有一个我们的AI像一个研究员一样工作,能够去读这个论文,然后提假设,写代码,然后跑实验,然后分析结果,然后最终的话得出一些新的这个技术结论。那么这个的话是auto-research,就是AI自动化这个研究流程。但是RSI的话我觉得它是在auto-research的基础上往前更进一步,就是说这个研究员不光是产生新的知识,而是说这个研究员会在研究的过程中不断地改进自己,使得自己在下一次做研究的时候能力会变得更强。那这样的话就达成了RSI的这个能力,就是它是自己产出了更好的东西来帮助自己变得更好,然后又能产出更好的东西,又能帮助自己变得更好,就这样一个循环的一个loop往上的。螺旋上升,对吧,左脚踩右脚螺旋上升。因为这个事情如果一旦做到了的话,它最大的意义就是说那我们之后人可以从这个loop中抽离出来,只要不断地给这个AI系统去喂算力,它就会不断地去提升它的智能,那我们就真正实现这个AGI了。
【主持人】这也是我想讨论的一个问题,就是在递归自进化这个里面,自动化就是人是否在这个循环里面,和递归就是它是以一个相似的结构在比较快的往前推进,这两件事哪个是更先发的?哪个是更重要的?
【嘉宾】我觉得得先自动。
【主持人】你觉得得先自动,挺有意思的。我今天跟田渊栋也稍微聊了一下这个问题,他觉得可能递归是会先发生的。
【嘉宾】递归可以说已经发生了。
【主持人】但是自动也发生了。
【嘉宾】自动对,自动也发生了。只不过自动不是全自动,就这个自动是一个阶段性的,它会一点一点的就是人参与的更少。比如说回到10年前,其实Google做AutoML的时候,它也是AI自己可以做一些事,但是它能做的时候是比较机械的搜索,搜索的空间啊、方向啊,都是人要深入参与去给它规定好。我觉得我们可以看到一个趋势,AI能够改进的这个系统的部分会越来越大。就是最早期的时候,AI是做超参数的优化,AI来帮我们做超参数的搜索。然后后来的话,Google做了刚才忘记提到的Neural Architecture Search,或者这个AutoML,就是AI能够帮助我们去搜索一个网络最好的架构是什么样的,这个是2017年的事情。再往后的话就是,我觉得最近AI可以去帮我们做Harness的优化。Harness Optimization是有很多公司在做的,还有包括Frontier Lab在做的,就大公司也在做,然后又有专门的创业公司在做,有很多创业公司在做这个事情。然后包括AI帮我们能搜索这个Training Recipe,训练的配方。这个配方的话比如说这个包括就是Learning Rate Schedule,然后具体用什么optimizer都能做。然后我觉得再往后的话,就是说AI可能能够刚才是一点点升级,能够最后把整个系统都纳入它优化的范围以内。
【主持人】上述所有事情它都可以做,就实现完全的RSI了。所以从局部的自动来说它已经发生对吧,就你刚说的这些是已经出现的,然后把整个系统放进来,这可能是大家未来追求的目标。在RSI上大的公司,还有一些新的公司,这个季度有什么具体的进展?
【嘉宾】这个季度我觉得有两家公司在RSI上面有比较大的进展。第一家公司的话就是Anthropic,他们在6月4日的时候发布了一篇文章叫做One AI Builds Itself,就是当AI开始构建自己。那么这里面他们分享了很多他们内部的实践,以及他们对未来的展望。第二家公司的话是Recursive,他们也在6月份发布了他们的第一个成果,展示了就是RSI早期未来的一个缩影。
【嘉宾】Anthropic这篇One AI Builds Itself里面有几个关键数字。第一个数字的话是截至5月,Anthropic代码库里面合并的超过80%的代码都是由Claude来写的。第二个的话是2026年Q2开始,工程师人均每天合并的代码量是2025年之前的8倍。第三个的数字的话是,然后4月有一个案例,是他们让他们的AI Agent端到端地完成一项AI安全研究,然后AI Agent累计工作了800个小时,然后比人类研究员做一周的效果还要好不少。最后一个数字的话是,他们在一个让AI来优化一段代码Performance的测试里面,发现Metras Preview能够做到大概52倍的加速,而Opus 4系列只能做到3倍,一个熟练的人类研究员4-8小时可以做到4倍,所以有一个非常大的提升。
【主持人】你前面还提到这个报告还没有获得比较有意思的未来,这个具体来说是什么?
【嘉宾】Anthropic设想的未来世界有三种。第一个世界的话,就是模型能力不会再变强了,那么我们现在就是如何利用已经有的模型能力来服务全人类。第二个世界的话是,模型能力还会继续变强,但可能不会指数级的变强,而是现在这些拥有比较强的模型公司,他们利用这些模型来开发下一代模型,会有一个复利的效果。第三种可能性的话就是RSI完全实现,这样的话就是人类在未来训练AI的流程中的角色会大幅地缩小,然后进度的话就完全只是受算力的限制。
【嘉宾】那么在这三种世界里面的话,Anthropic认为第一种世界的可能性应该是非常小的。因为他认为我们现在基本上根据他们自己的进度,我们已经达到了第二世界。那么第一世界唯一的可能性就是,突然我们这个世界发生了一些什么变故,使得比如说电力突然没有了,或者说算力突然没有了,那么可能才是第一个世界的情况。
【主持人】对。
【嘉宾】那么第二个世界的话,他认为是我们现在处于的这个世界。基本上你可以认为它是一个Auto Research实现,但是RSI还没有实现的一个世界。就类似于他们自己说的,工程师的人均产出代码变成了8倍,就我效率在提升,但它不是指数级的提升。就目前如果是从研究员他们自己的表达上来说,就是他们可以给一个想法,然后AI可以就是以数量级提升的这个速度,来帮他们完成这个想法从头到尾,但是他们自己其实会是那个卡点。
【主持人】对他们自己还是卡点,AI现在的研究品位还是不太行的,就还是需要人给它提供,但人的劳力人的时间是有限的。
【嘉宾】对。那么第三个世界的话,AI能够不断地去train下一代AI,相当于自然繁衍一样,很快就比如说未来不是一个月两个月发一个新模型,可能不断的每天都会有,或者说每小时都会有新的模型被AI自己train出来。那么他们觉得这个未来最大的风险,还是回到了对齐上面。因为现在我们比如说极小有一点对齐的这个瑕疵的话,那么这个瑕疵在AI不断繁衍和自进化的过程中可能会不断地放大。那么当AI又比我们更聪明的时候,我们就有更大的这个失控的可能性。所以也是基于这个第三个世界的这个设想,他们现在提出我们是不是应该有意的放缓研究RSI或者进一步推进前沿智能的这个速度,这样的话我们可以给这个社会更多的准备的时间。
【主持人】我觉得他们也非常矛盾。因为他们一方面就是觉得为了全人类我们应该放缓这个进度,但另外一方面觉得我们放缓了这个进度,我们的竞争对手不一定会放缓这个进度,所以可能还是得往前走。对他这个文章的标题就是叫Our Progress toward RSI,讲的也是他自己的进展,但是你没有说他觉得最好大家别一个劲进展太快。
【主持人】对,你觉得他的这种矛盾是真实的对吧?就结合我们前面说的,你说这个公司还是有非常独特的愿景的。
【嘉宾】我觉得是真实的。但我觉得现在可能除非发生,比如说全世界的人民联合起来说,我们都把这个速度放缓,要不然的话就是还是大家会竞争往前,先看谁先能达到。
【主持人】因为你平时也接触大量的研究员,他们自己对制造一个AI,来把人踢出这个AI进化的loop是怎么想的?
【嘉宾】我觉得也是一个非常矛盾的心态。一方面的话如果RSI实现了,相当于是他们把AI的圣杯做出来了,那是一个非常大的成就。但另外一方面日常生活中并不是很开心,虽然AI现在能力变强了。这篇文章里面也有一个研究员说的一句话,就是当我的工作AI模型它work的时候,它比我做的又快,做得比我又好,我感觉我自己没有什么价值;当这个AI模型它不工作的时候,那我更惨了,因为我完全不知道它为什么不工作,然后我还得去弄明白到底发生了什么。所以现在我觉得也是AI能力变强了,做的研究的速度变快了,但是AI研究员的幸福感不一定会比之前更强,就是价值感和成就感在经历新的考据问和定位。我早些时候和田园弄聊,它有一个想法挺有意思的,它觉得很重要的一件事还是去解释AI,就让AI真的变成一个科学。因为过去也是从第谷到开普勒到牛顿的,它认为AI也会经历这个状态。那现在可能更多还是在我理解,那可能还是在第谷的阶段,就大约有很多经验,但是你很难解释为什么这个经验是有效的,那个经验就没效,它可能都还不到一个我们以前定义的那种科学的程度。
【主持人】我觉得如果要是能做到AI的话,AI应该是能够理解自己的。
【嘉宾】你觉得AI能够理解自己?
【主持人】对,自己进化和理解自己。
【嘉宾】你觉得这就会同时发生吗?
【主持人】你一定会同时发生,AI我觉得是能够理解自己的。
【嘉宾】你说超级智能是会理解自己的,你觉得人理解自己吗?
【主持人】不能理解。
【嘉宾】对,它可能也不是一个零和一的关系。人在不断的加深对自己的理解,智能如人类这种生物,它也没有完全的理解自己,还是有很多东西是不知道的。
【主持人】还有一个关于它设想的第三种未来的,我有一个像补充的问题。就你前面提到说Anthropic认为这件事的最大的风险是对齐,那另一方面,如果说模型进化得这么快的话,他们不认为有一种风险是智能泛滥吗?就有可能没有这么多对智能的需求,我不知道这个文章你提到这件事没有,或者说你们平时的一些讨论里面,大家是怎么看这件事情?
【嘉宾】好像很少讨论这个问题,因为就是默认现在有大量的问题需要解决,比如说人类如何长生不老,然后这些问题的话都需要更强大的AI来解决,所以默认对智能的需求是不太会有上限的。我感觉现在在硅谷,在制造frontier lab的圈子里,就是认为是对智能的需求和对算力的需求都是没有上限的。
【主持人】那在新的公司里面,你提到recursive superintelligence在RSI上这个季度,也释放了一些具体的成果,这个可以展开讲讲。
【嘉宾】我觉得Recursive可能是这个季度最值得关注的new lab之一。刚才我们提到它的创始团队非常的强,有这个Richard Socher,然后石田林、田园洞。它做的事情就是做RSI,让这个AI系统能够自我改进。那么它们放出的第一个成果就是做了三个benchmark上的改进。第一个的话就是Android Capati的NanoChat Auto Research,那么他们是偏这个算法,就是在固有的budget的情况下,怎么去把这个事情做得更好,就是算力相对固定的情况下,算力资源不定的时候怎么把这个性能弄得更好。对。然后第二个的话是Nano GPT的speedrun,就是说大家的终点是一样的,就要训到一个performance,把模型训到一个程度,但看谁能训的时间更短。然后第三个的话是一个GPU kernel的一个,叫做Soexecbench,那么这个是比谁的算子写的好,然后谁的算子的效率更高。所以他们在这三个benchmark上面都取得了sota的结果,通过把他们做的RSI的系统应用在这三个benchmark上面。这其实就覆盖了AI进步的三个杠杆,就是说更好的算法,然后更快的训练,然后更高效的硬件的利用程度。我觉得可能意义可能不光在于,就是说benchmark它具体提升了数字的大小,可能更多的是它展示了这么一套通用的研究闭环,能够把这个东西跑通,我觉得它是它的工作的意义的所在。它是同一个系统去做了这三个测试,就是一套通用的东西,然后同时这个季度。
【嘉宾】就除了你刚才提到的recursive,因为他们其实是水下了一段时间,在这个季度正式宣布的,并不是这个季度成立。但这个季度也有些新的模式出来,一个就是刚刚在6月25号的时候正式launched的Mirrandale,它也是一成立就有10亿美元的估值。还有另一家公司是Core Automation,你可以讲的就是现在这些不同的新的团队都在出现,然后都看到觉得这是一个机会,是为什么大家觉得可能有新公司来做这件事情的机会。
【嘉宾】我可以简单介绍一下这两家公司的创始人的背景。首先是Core Automation,那么它的创始人Gerry Toric是OpenAI系列的负责人,所以是在推理方面做出了很多贡献的。然后Mirrandale的创始人是Baman,是Anthropic的,之前在Anthropic应该是负责他们的AI for Science团队。所以这两家公司现在都是在RSI的这个方向上面去做探索。我觉得RSI这个事情之所以还有初创公司的机会,首先在技术上它还没有完全收敛,可能在除了coding和长程的agent能力以外,我们可能还有一些别的东西是目前还缺失的,所以我们还没有完全达到RSI。那么这样的话,它不完全是一个堆算力的游戏,可能还是需要一些新的idea,才能让这个领域达到下一阶段。
【主持人】一般来说创业你要找一个现在的主流公司、主线不会去做的事。你觉得Anthropic和OpenAI他们继续往后推的话,RSI会在他们的主线上吗?这和创业公司之间会形成一个什么样的竞争关系?
【嘉宾】其实从Anthropic发这篇文章,包括OpenAI也会去说一些目标,说他们到今年9月的时候要实现AI研究实习生,说28年3月的时候要实现自动化的AI研究员。我自己觉得有一种可能性是frontier lab也会比较重视这个事,这就是你说的为什么它火的原因之一,就是大家设想如果你做到了这件事情之后,你的加速度可能会越来越快,这可能是帮你在竞争中把其他人甩得更远的方式之一。就看起来他们可能也会往那个方向去做。
【嘉宾】我觉得就是Anthropic他们自己也提到了,就是现在的AI研究员,他的bottleneck还其实在研究的品位上面,人类现在依然是这个瓶颈。所以我觉得frontier lab来不来做这个事情,并不一定会和现在新的startup做这个事情拉开无限的差距。
【主持人】这一季度,两家最厉害的公司OpenAI和Anthropic在智能前沿上,还有一个不约而同的举动,就是他们都在加码Robotics。OpenAI这个事是相对公开的,Anthropic这个事就是在业内大家慢慢的在流传吧,他应该确实是有这个意想要去尝试做Robotics。Henry你可以讲讲就是两个公司在具身智能,或者说在物理AI上的一些情况。
【嘉宾】OpenAI的话其实是这个季度,Sam还有Greg就是亲自在推特上公开他们的机器人团队并开始招人。但他们的这个尝试其实应该是从很早以前,可能2024年开始就开始在做机器人这件事情。然后他们在湾区的Fremont现在也有一个机器人的一个warehouse,然后现在有一个几十人机器人团队在做这方面的探索。Anthropic的话他们现在应该团队规模比较早,让机器人尝试在早期,但是他们在one AI builds itself这篇博文里面也提到,就是他们认为在recursive intelligence的下一步就是Robotics和physical intelligence,所以他们应该也开始在这边提前布局了。
【嘉宾】机器人理论上也可以RSI。首先机器人比较强之后,他部署到真实的环境之后就可以获得很多数据,其实机器人发展他本身也是需要数据,就是具身模型的这一部分。然后另外就是更科幻的情况就是机器人可以造机器人,现在看起来有点难想象的事情,但是之前其实也发生过,比如说工业革命的时候就是机器造机器,母机出现之后机器就可以造机器了,一直到现在其实工业母机都是非常重要的领域。
【主持人】我们可以稍微多讲讲,因为它的公开信息要更多一点。因为在Sam Altman自己就是去官宣这个团队以及招人的信息里面,他还是透露了一些信息的。首先我觉得有些关键词就是,他说在人上他要找优秀的全栈工程师,全栈后面他包括硬件、操作系统、机器学习。然后他还提到就是他们第一个可能会用的场景是服务于自己的基础设施,这个应该就是他们自己的算力设施,然后再往后的话他也是想做能够服务普通人的机器人,这也是一个比较有共识的愿景就是做家庭机器人,包括马斯克本人也说过他觉得成熟状态下Optimus可能会有200亿台。还有就是他讲了这个团队的负责人,这个负责人是Aditya Ramesh。从这些信息里面你觉得有什么可以更多去解读吗?比如说他们可能会怎么去做这个事儿?
【嘉宾】我觉得OpenAI和Anthropic这些模型公司他们应该会发挥自己的长处,然后把这个问题的模型的训练部分就是做好。然后我觉得他们的招聘里面说到他们要招全栈的这个robot engineer,但也不完全代表他们一定会就是有自己会去造自己的硬件,就是不一定会推硬件的产品跟Optimus那种逻辑可能不太一样,这个我们可以往后观察看会怎么发展。因为现在比较主流的大公司来做的这件事情就两种方式,一种就是Optimus那样,它最后要做的这个产品它是一个完整的软件系统、硬件系统都有的这样一个机器人的东西。然后还有一类就是Google还有英伟达,其实他们都想做这个领域的安卓,就是比较偏大脑和智能的那一层。
【主持人】然后创业公司里面其实派也是这个方向的,和具身智能和Physical AI相关的一个最近发火的话题是世界模型。虽然就是我们刚才讨论这家大模型公司在这方面有什么成果,这现在不是很明显,但整个领域是出现了很多变化的。刚好在5月的时候MOE Capital就你们自己的机构,也写了一个世界模型的研究报告。你可以长长你们在梳理世界模型的发展过程中间一些核心的总结和观察吗?
【嘉宾】我可以先简单说一下,就是说为什么这个世界模型这个事情大家觉得这么重要。想象一下现在有一个机器人对吧,他可能从来没有见过系鞋带,或者说从来没有人通过tell or show的方式教过这个机器人去系鞋带。但这个机器人因为他已经足够对这个世界有了解,所以他就可以弯下腰然后抓住这个鞋带,然后把它拉开然后解开做这个事情。我觉得这个就是世界模型想要去解决的问题。然后世界模型这个词我觉得被用的很多,最近之所以火起来,它主要是之前有两个独立的研究分支,在2024年和2025年做了一个合并。有一个分支是RL world models这个系列,比较有名的是之前Google DeepMind他们做的Dreamer系列。他们的idea就是说在真实世界里面去收集数据非常的昂贵,我不如去学一个真实世界的模型,然后在这个模型里面就相当于做梦一样,去simulate真实世界里面发生变化是什么样的,然后让这个机器人在虚拟的世界里面去学习。这是一条路线,但这条路线之前的问题就在于,它每一个环境都是单独去学习的,所以比较难以generalize。另外一条线路就是大家比较熟悉的视频生成这个线路,包括Sora、Veo或者Stable Diffusion这样我们比较熟知的模型。这一条线路就是说我们其实是从人类拍的video数据里面,是能够学到大量关于这个世界的知识的,包括这个世界的物理是怎么工作的。但是这些模型只能生成视频,不能说如果在当前这一帧我take了一个行动,下一帧会发生什么样的变化,这个就是action condition。所以现在的话就是把这两者结合在一起了。前者是说我能在一个虚拟的世界里面让robots或者agents去进行学习,或者是说我能够通过大量的视频数据去学出这个世界的一些信息。如果把这两者结合在一起的话,就是我们现在说的这些World Action Model这个系列。包括我们投的这家公司Dream Labs,他们的一个经典的工作就是Dreamer VJ和Dreamer Zero,就是这个方向在2024年可能2月份发布的新工作。
【主持人】你刚才就是在解释说为什么现在这个领域变得比较火,对吧,它其实还是和机器人的热潮也是相关联的。你们当时这个世界模型的报告里面,还有一个观察就是在统计过去这18个月里,世界模型获得的100亿美元都出了一些什么公司,你可以讲讲吗?
【嘉宾】我觉得这个大概有几个层次吧。一个是纯做世界模型的公司,或者说做模拟器的公司,包括AIA Labs他们融了1.03 billion,然后World Labs融了1.23 billion。Runway他们是从做视频模型起家的,现在应该是融了超过860 million,Roda 450,Decard 153,还有最新的这个Dangerous做的这个Embo,也是超过了1亿美金,这是一层。另外一层就是做Robot Foundation Model,或者说做机器人大脑的这些公司,包括比如Skild,然后Physical Intelligence、Figure、Mind Robotics,就属于这个类别。第三个类别,就是做整体的平台型公司,包括像NVIDIA,然后Google DeepMind,以及就是现在可能要加入这个机器人战团的OpenAI、Anthropic。然后我们看到一个比较有意思的pattern,就是这些现在使用数据、使用世界模型的公司,比如说这些robotic brain的公司,他们的融资规模其实是要比做世界模型的公司大不少的。可能还是大家比较相信,做robot brain的公司最后可能会capture,就是如果哪天机器人实现了,经济价值最大的capture可能是被这些公司拿到。
【主持人】你们这个统计是全球范围的,对吧?
【嘉宾】这个统计主要可能还是偏向欧美这边的公司。
【主持人】偏向欧美。那你如果把中国算进去,你会看到就是做这个机器人这块整个融资规模可能会更大。我还以为这是算中国的,所以中国之外也有100亿美元过去几个月,其实也不少。
【嘉宾】对,但是和SRP和OpenAI这个最主线的战场相比,它的吸金体量还是太小了,差了数量级,一轮就融几百亿美元。
【主持人】那我们接下来进入第二个大的板块,就是关于智能的扩散,已经可以帮我们干很多事情的智能怎么通过……
【主持人】更多新的产品的设计,和一些新的商业模式的设计,让更多人更多企业可以用起来。前面你提到就是,有一个新的趋势或者说机会,是很多企业在考虑,我到底应该用什么样的模型,是继续用最贵的frontier lab的模型,还是我自己要来有自己的模型?你可以讲讲,这个趋势在第二季度都是怎么发展、怎么变化吗?
【嘉宾】这个领域我觉得我们可以看到几件事情。第一件事情的话,就是越来越多的公司在和后训练公司合作,然后来训练他们自己的专有模型。一个例子的话,就是Harvey和Predicte Compute合作,基于Glm 5.1创造了一个他们自己的模型,然后在他们的Legal Agent Benchmark上面击败了Anthropic和OpenAI。
【嘉宾】那么这个事情很有意思,因为Harvey他们自己本身就是Anthropic的用户。所以这也是一个风向标吧,就是现在公司他们会考虑,不光是使用frontier lab的模型,而是说真正去开始去post-train他们自己的模型。
【嘉宾】那么之前的例子的话,上个季度的话,这个例子应该是Cosa。Cosa是基于Kimi 2.5,然后post-train他们自己的一个composer。
【主持人】我觉得这个季度的例子和上个季度的例子,它的模式还不太一样。因为Cosa是自己基于一个开源模型,然后后训练了一个模型自己来用。你刚才讲到的这个例子里面,它其实有三方,就是Harvey是一个做法律AI的垂直的AI的公司,面向行业的,然后是Predicte Compute又用了Glm 5.1,就是中国的开源模型厂商的模型,然后来帮Harvey去训了Harvey要用的模型,对吗?
【嘉宾】对,Predicte Compute是一个由OpenAI研究员出来做的一家公司,他们的主要业务就是Post-training as a service,也就是把后训练作为一项服务提供给它的客户。
【主持人】那么为什么现在有更多的像Harvey这样的公司,他愿意去做post-training,然后拥有自己的模型呢?
【嘉宾】我觉得可能有多个原因。第一个原因的话就是成本,就是Claude的它这个前沿模型,它性能很好,但它实在是太贵了。比如Pilot Networks的CEO在X上发了个帖,就是呼吁Claude立马降价,因为我现在的客户已经用不起你的模型了。如果你再不降价的话,那么我们只能就是说把这个生意给开源模型,或者更便宜的模型。
【主持人】这个发帖的CEO他们的公司的业务,就是一边用Anthropic的模型,然后去一边服务下游其他的企业客户是吧?
【嘉宾】对,就是Pilot Networks,他们是一家做网络安全的公司。所以他们也是和Anthropic在他们叫做Project Glasswing,就是用Claude去找网络安全漏洞的这个项目上面一个深度的合作方。所以他们也会用Anthropic的模型去做各方面的安全的业务,包括prevention,比如说做代码扫描或者说实时的detection,他们都会去用Anthropic的模型。所以他们现在自己也觉得这个模型实在是太贵了,这是第一点太贵了。
【嘉宾】第二点的话,就是说稳定性。那这个稳定性指的是说,我能不能期待这个模型我一直能有access。因为现在的话一个问题就是说,那有可能你在用前沿模型的时候,政府一直禁令,你突然你就没有这个模型的access了。那你如果要是产品居于这个模型去构建的话,那就相当于是你的产品构建在没有保障的沙子上面。
【主持人】其实Fable已经发生了,还好他只上线了三天。如果他上线了一个月,美国政府再来这么一遭的话,那确实有些公司可能已经居于他开发了很多东西了。
【嘉宾】第三个点的话就是护城河的一个问题。就是因为现在大家越来越觉得Anthropic这个公司竞争能力太强了,对吧,他会把各种数据都train到他的模型里面,模型能力会不断的变强。大家也会担心就是说,如果我不拥有模型的话,那么Anthropic会不会就是逐渐的把这些所有的能力都内化?那么未来的话,大家直接去找Anthropic就行了,可以跳过我。另外的话就是说,那我和我的竞争对手都用同样的模型,那我的竞争优势在哪里?所以我觉得从竞争优势的建构来讲。
【嘉宾】大家也会更加的倾向于去现在去拥有自己的模型。就是有的企业客户会担心自己变成下一个科手。Anthropic确实也有意往这个方向拓展,他之前和黑石成立了合资的公司,然后有这种大的PE方,其实是可以给他链接很多大型企业客户的。而且大的PE其实自己就拥有很多企业类的资产,他可能也能用起来,就是在垂直的这种场景里面,对。然后在竞争和合作这块我还想补充一点的就是,对于像Harvey这样就是有高价值场景,然后自己有大量这个有价值的数据的公司,他们其实非常希望自己能够通过把数据能够利用起来,然后不断的加强自己的这个竞争能力。那么如果要是自己有一套这个后训练的Pipeline的话,他实际上是可以不断的有越多的用户越多的数据,他可以加强自己的这个产品竞争力的。但如果要是没有的话,他可能只能依赖于就是Anthropic的模型。
【主持人】就是在我们刚才讲的Harvey和Applied Compute,再加上GLM5.1这个三方都在的这种模式的合作里面,后训练的Pipeline他是由Applied Compute这家公司来掌握的,还是说Harvey自己之后就那么掌握了?
【嘉宾】Harvey这个公司他们自己也是有人在做后训练的。不过在他们这个合作里面的话,他们是使用了Applied Compute的这个平台应该叫做The Lab,那么在这个平台上面完成了就是整个后训练的这个过程。所以这个Pipeline其实是在Applied Compute的,就在这个合作里是这样。所以通过Harvey给Applied Compute就是付费,然后使用他的这个平台,但是最后的话Harvey他自己拥有就是这个模型和数据,就是他拥有了一个自己的模型。
【主持人】你前面也提到他们用来做后训练的这个基础模型是GLM5.1,为什么选这个模型?其实他们试了就是市面上可能所有的这些开源模型,很大部分都是中国的,然后他们最后发现在这个Base Line上面是GLM5.1的效果最好,然后他们就基于GLM5.1他继续去做Post-train,就是智谱的这个模型。所以现在从大家就是在这边的一些使用体验,不管是企业来使用还是个人来使用,智谱的模型在中国的开源模型里面确实是最强的吗,可以这么说吗?
【嘉宾】我觉得智谱的模型尤其是在5.2发布以后,在硅谷这边呼声非常的高。一方面的话是真实的去看这个数字的话,它是Terminal Bench首个开源破80的模型,并且有多项这个长程编码任务能够超过GPT-5.5,然后成本只有6分之1。但是更重要的是我觉得有很多人在X上就是说,这是第一个他们觉得编程手感对的模型,就不光是Benchmark跑得好,然后实际完成任务确实效果不错。尤其是智谱非常明智的支持Anthropic的API,所以你现在可以直接就是接着用Cloud Code Harness,当然把后面的这个API替换成这个GLM5.2,然后有人就是说可以几乎无痛的替换就是Opus 4.8,这个我觉得还是非常厉害的。还有一个我观察到比较有意思的现象,就是除了Harvey除了和Applied Compute的合作,他和Fireworks也在6月初合作,然后串了一个模型也是基于这个GLM5.1的。所以就是从大家的用脚投票里面,也能看出这个模型,只要在现在这个阶段是表现得比较好的,是的。
【主持人】我觉得可以稍微延展聊一下,就是中国开源模型的一些情况。因为其实我们刚才聊的这种合作里面,我觉得它事实上是美国的一些有一定能力做模型服务的公司,就比如说Fireworks,比如说Applied Compute,然后在结合上中国的开源模型生态,他们一起来服务一个客户,这个客户可能很有可能最开始第一批也还是一个硅谷的或者说一个美国的客户,就算是某种意义上的中美合作在AI领域的。然后他们共同的另一面,看起来就是越来越强的,似乎无所不能什么都想干的Frontier Lab,你怎么看这种对局的走位?
【嘉宾】我觉得从过去三年回看一下历史的话,就是历史告诉我们,这个模型能力都是你方唱罢我登场,然后很少有人能够一直领先的这么一个态势。
【主持人】但是过去三年闭源也一直没有让开源追上。
【嘉宾】没有真正的追上。
【主持人】没有真正的追上,对。它看起来有逼近的趋势。
【嘉宾】有逼近的趋势,但可能现在闭源比开源Frontier还是能领先几个月半年的水平。而且闭源的这些Lab,它有一些东西它是没有展露出来的,就有可能它内部还有更厉害的东西,所以这个差距有的时候确实很难动态的去判断。
【主持人】就有一种对现在这种趋势能否持续,就是说是比大家都想要有自己的模型,有一种质疑就是在24年年初的时候,其实也有一波微调的红利,但是最后随着就是基础模型能力的提升,其实这些工作的红利都被覆盖掉了。你觉得在今天这个时刻,你看到比如像Harvey这种公司,他还去找一些人来帮他做后训练,又或者其实微软也有一个相似的尝试,微软是说他要去服务更多,就其他的大的企业客户去做这件事,去帮他们训练他们自己的模型,他还能持续吗?
【嘉宾】我觉得这个里面可能有几个变化,一个变化的话,就是现在所有做这些后训练作为服务的公司,他们都要去做一个事情。
【嘉宾】就是去做FDE,他们需要去让一些Forward Deploy Engineer,然后去到他们服务的企业里面,然后去帮他们去做这个后训练。前向部署工程师这个也是最近特别获得一个新的职业角色吧。然后这个前向部署的成本,应该和就是两年前相比应该是有所下降的,所以这是一个变化,也是因为AI Coding本身变得更强了。
【嘉宾】然后第二个变化的话,就是这个模型能力和任务的这个相对难度,我觉得有一些变化。就是之前的话,模型在我们比如说Legal这个场景,它这个前进的速度可能太快了。比如说从GPT-3.5到GPT-4的这个提升非常大,那你在这个落后位的模型上面去做Post-train以后,你可能根本赶不上新模型的这么一个改进。但我觉得现在可能不太一样了,就是现在的话是,你在一个Frontier的开源模型上面,加上你的私有数据,很可能是能够超过就是Frontier模型,并且可能Frontier模型短期内都不会反超的这么一个变化。
【主持人】其实之前你说到Apply Compute和Harvey的例子就是这样的,他们就是基于Llama 3.1做了这个整个的后训练之后的东西。你刚刚说是超过,就是我直接拿OpenAI或者Anthropic的模型来做的效果,所以你觉得这个趋势在这一次有可能是一个更持续的趋势?
【嘉宾】我觉得会比上一次强一些,但这个我觉得也是一个此消彼长的一个过程。当Frontier模型就是说触顶的时候,受到各种各方面的阻力,比如说包括监管在内,那么开源模型就会迎来一波增长。另外我觉得还有一个点补充一下,就是说这个事情可能也不适合所有公司。比如说我觉得初创公司可能就不应该做这个事情,他可能应该先用OpenAI和Anthropic的模型去把他们的这个产品跑通,然后拿到市场的验证。
【主持人】你说的是不适合初创公司去有一个自己的模型,你是指这件事对吧?
【嘉宾】对。初创公司倒是可以去帮别人拥有自己的模型,这是一个创业方向。所以我觉得就是说比较适合的公司,我觉得可能有几种特征:一种的话就是说你得有高质量的私有数据,要不然你没有必要去做后训练;第二个的话就是你还得有一个比较明确的这个评估系统,能够知道你这个模型是不是变好,比如说Harvey他们就有一个Legal Agent的benchmark,他自有一个法律场景的这种测评指标;第三个的话就是说你真的得有高频和高价值的业务,这样的话你这个模型比如说稍微提升一几个点,你能带来你这个经济价值。我觉得这三个条件满足的话,就可能能够适合来做一些后训练,然后拥有自己的模型。
【主持人】那其实也能明显的看到几个大的行业是适合做这件事了,比如说Harvey所在的法律是的,医疗健康可能也是,金融肯定也是,可能咨询也算是。
【嘉宾】咨询也算是。这几个确实也是Anthropic格外会去做的方向,他们也在就是搞一些这种比如说Healthcare什么的这方面的。一个是他们会有这方面的一些专用的模型,一个是也有些商业上的合作。
【主持人】然后这部分可以补充聊聊,就是中国开源模型那些情况。前面也是提到的两个合作,都是用了智谱的GLM-4.5这个模型。整体上来说,在第二季度中国的这么多开源模型,它的一个发展啊,包括就是比如说被全球的科技公司采用,是一个什么样的情况?你怎么看这几家厂商陆续出的一些新模型?
【嘉宾】DeepSeek基本符合咱们之前的预期吧,就是说这个还是有一些小的,尤其是Infra做得非常solid的有一些改进,但是就也没有惊艳到大家了。像我之前和那个SGLang的人他们聊,就是他们SGLang这个项目起飞就是V3带来的,因为他们当时就是又先支持了V3,然后大量的人就想用V3,然后就是都会去问你们能不能帮我们把我们这个M1部署做一做。
【主持人】对,其实在SGLang之前,还有一个存在更久的这种框架的社区,就是vLLM。我上次听 Lianjie Zhu 的采访也挺有意思的,因为他之前不在SGLang这个社区,还是Redbend AI 这个公司成立之后他一起加入去作为联创。他就说最开始其实他不是特别看好SGLang的发展,因为他觉得你起步相对晚,而行业里面已经有一个其他的开源社区做得很好了。所以说V3其实对他们来说是一个很大的助力,对吧?那比如说从这些开源框架的角度来说,他们现在觉得我应该抓住哪个开源模型的机会好好地增长发展?以后V4他们其实投入了很多时间精力去做。
【主持人】但V4当然就是没有V3给他们带来那么大的ROI了,那像Kimi、像MiniMax,包括像小米、千问,你觉得这季度有什么亮眼的进展吗?
【嘉宾】如果我们总结一下这季度中国开源模型的进展的话,就是中国开源模型四杀。在过去的这个八周内先是Kimi 1.5,然后是DeepSeek V2,然后是Kimi 2.7,再然后是GLM 5.2,四次夺得全球最强开源。基本上就是在编码和成本上,已经快要追平前沿的,比如说GPT-4.5和Opus 4级别的模型。然后最强的闭源可能还要领先大概半年的水平,但是差距我觉得目前还没有继续拉大的趋势。
【嘉宾】这是我们聊到的智能的扩散的第一部分,就是观察到一种神奇的中国开源模型和美国的公司之间的这种合作。然后是第二个想展开的和智能的扩散相关的话题,就是一些新的交互的尝试,这个更多是在产品创新上的。前辈其实也老提到,OpenAI的一些人也觉得自己的模型是很强的,但是在产品走向市场上不如Anthropic。
【主持人】我们可以先从Anthropic这个基础的进展开始讲,他们最近推了一个还挺受关注的新的产品功能,就是Cloud Tag,也是我们前面稍微提到了,就是类似于之前做的那些和Slack打通。你可以加上,就是这个新的功能带来的一些变化和讨论是什么?
【嘉宾】Cloud Tag其实是一个非常直观的一个功能,它就是允许你能够在Slack里面,用Claude的方式来把任务提交给Claude,然后Claude就会把这个任务做好了以后,然后再把结果返回到这个群聊里面。所以我觉得它的交互方式,就是说从每个人自己开一个独立的聊天机器人对吧,相当于是你有一个自己的个人助理,变成了你现在团队有一个24小时一直在监听你的需求和有所有上下文的一个同事,这个我觉得可能是一个比较大的变化。
【嘉宾】Andrew的话再加入Anthropic以后,也是开始疯狂地灌水,它说这个是AI UI/UX第三次大改,它是这么想的。第一次的话是有一个网页Chatbot,让所有人去网页聊天;第二次的话就是所有人下载一个App到自己的手机和电脑上面,然后能够和AI进行各种交互;那么第三次的话,就是AI来到你的协作空间里面,企业协作空间里面,然后能够和人比较深度的去协作。所以这个我觉得是Anthropic他们这个季度自己非常兴奋的一个功能。
【嘉宾】他们比如说他们的Claude Code团队的产品经理Katherine就说,他们现在产品团队大概65%的代码都是通过Cloud Tag的形式来完成的。它的这个好处就是我可以群体来协作是吧,就是它可以在一个群体共享上下文,然后和很多人一起来合作,而不光是专门属于一个人。
【主持人】其实这个想法本身并不是很新,我觉得国内和国外都有很多比较更早的尝试。为什么Cloud Tag做这一步比较晚,我觉得他们可能之前的话,是在自己最擅长的产品形态上面就是下功夫,就在Claude Code上面花了大量的时间。那么现在的话,他们想要进一步地去拓展他们的这个产品战线。所以Slack的话,我知道他们之前已经做了,内部其实做了挺久的,应该是比较深入地打磨了这个产品体验。我觉得可能也跟他的产品策略有关,就是他希望推出市场的时候,就已经是一个体验上各方面比较丝滑、表称出的东西。这个也有利于让用户能持续的觉得你是一个能给我带来高品质、高体验产品的公司的这么一个形象,我觉得Cloud Tag确实他这方面的口碑是不错的。
【嘉宾】之前我问过一个Anthropic的朋友,Claude进Slack这件事情,难道不是这种程度的集成,以你们的编程能力不是直接写点代码一下就完了吗?他说在用户体验上面,如何能够尽可能有效地利用上下文,然后能够不光是被动的接收信息,而是包括主动的去propose一些任务上面,他们是下了很多功夫的。
【主持人】对,这也是他其中一个功能,就是他会在一些合适的时机跳出来来提醒团队,你不要遗忘一些任务,不要遗漏一些事,以及他还要设置一个权限的管理,这个也是协作类的Agent需要去考量的事情,就是不同的员工可以看到什么类型的数据,可以访问什么不同的频道。
【嘉宾】我觉得这个也是一个挺有意思、有点张力的地方。一方面,你刚才说Katherine她自己说我们的很多代码就是用Claude来写的,尤其是Cloud Tag这个功能;但另一方面,他们自己在推出一个产品的时候,其实我能感觉到他还是做了很多细致的打磨,你光靠写点代码就肯定不够了。一方面我觉得他把这个用Cloud Tag来提升效率的这种前景描绘得很诱人,另一方面自己又在默默地使劲。
【主持人】对,默默地有些地方还是打磨细节,还是得靠人,得靠团队来使劲,所以这不算一个很大的新的东西。
【嘉宾】但是有可能会是对Cloud的用户来说一个更好用的东西。我觉得从概念上来讲,他并不新,没有Anthropic说的那么新,那就看他执行的好不好,是不是第一个执行的很好的。可能实际对于用户的影响上来说,应该可能是比较大的,因为我身边的用Devin的团队,他们最喜欢Devin的点,就是和Devin在Slack里面的协作体验。那么现在如果Cloud又有了Slack的这个集成的话,我会更加担心就是Devin的这个用户群体。
【嘉宾】Devin现在什么情况?Devin的revenue增长应该挺好的,因为他们有两部分业务,第一部分业务的话是卖他们这个工具,就类似于Anthropic的Mac Cloud Code。另外一方面他们还卖服务,比如说你是一个银行,你有一个Fortune 500写的代码仓库,然后我要给你包一个Python代码仓库,你这个可能几十万行代码,然后你就直接把这个东西交给我,我给你从头做到尾。这就是之前红杉说的就是,SaaS不再是给你交付一个工具,我不再是让用量来获得价值,我是按我给你的服务,我给你带来的价值来获得我的价值。相当于是AI empowered咨询,或者你也可以说是AI empowered的外包,只不过里面可能人参与的没那么重。
【嘉宾】这是Anthropic在这个季度的一个功能上的变化。OpenAI有一个新的功能是record and replay,这是一个挺不一样的思路。
【主持人】你可以讲这个新功能是干嘛用呢?
【嘉宾】这个新功能呢,它做的事情是,它叫做record and replay,就是它有两部分。第一步是record,就是你可以让colax去录制你做一个任务的过程,那么你点完录制以后,它就会开始观察你,你是怎么一步一步完成你电脑上的一个任务的。那么录制完成以后,它会把这个东西固化成一个skill,就是技能。那么当未来你想replay就是重播的时候,它就会根据这个skill的记录,然后来自动的通过computer use的方式来完成这个任务。所以这个我觉得是一个非常好的,把一个技能从人transfer到AI的一个方式。
【嘉宾】那么这个事情呢,它其实概念上也不新,在之前的话Meta内部就有一个项目叫做MCI,就是专门做这个事情,就是在员工的电脑上安装了软件,然后录屏,然后希望能够通过这些数据,让AI学会这些任务,然后最终达到一个把员工裁掉的效果。
【主持人】不过这也是这个季度发生的,MCI也是这个季度,差不多的时间,但好像这个项目是不是已经Meta内部被叫停了?
【嘉宾】对,这肯定会引起很大的反弹。
【主持人】所以对OpenAI来说,它相当于它们都看到了这个方向,比如说这个方向还是有价值的,就是Meta那个推的方式大部分人不能接受,但OpenAI已经抢先在ChatGPT里面产品化了,所以应该在时间线上明明是更加领先的。它这个其实有点像什么?有点像机器人的遥操,早期机器人遥操也是你去遥操一个同构的机器人,然后你把人类的操作的能力给迁移到一个机器上。然后在模型的进展上面的话,我们可以看到就是现在,Claude在OSWorld Verify上面已经全部超过了人类的基线,也就是70%,大概Opus在83%,然后GPT-5.5也是在接近80%的水平。OSWorld就是一个computer use的benchmark,对吧?就其实也是它主打的这个功能要去做的那个东西。
【主持人】你觉得OpenAI推出的record and replay,还有Anthropic推出的Cloud Tag,哪个可能会是更引领方向性的,会有更多人来跟进的东西,以及如果你自己用过的话,你觉得哪个对你来说更有用?
【嘉宾】我觉得从概念上来说的话,应该是record and replay更能代表一个未来大家前进的方向。我相信后面会有更多的厂商去追随OpenAI的这个脚步。但是在record and replay的话,它非常依赖于现在computer use模型各方面的能力,包括它多步任务的准确性,包括它这个延迟都还有在提升。所以我觉得可能Cloud Tag,会在短期的用户的impact上面,影响上面可能影响力可能会更大一些,就会有很多人用,会有很多人实际能用起来,而且也会冲击到Devin这一类公司。
【主持人】有可能?
【嘉宾】对,我觉得很有可能。
【主持人】然后回到就是record and replay,你说它现在是一个比较早期的状态,有些地方可能不是很好用,理论上来说它这个功能推出去之后,它也可以获得相关的数据。
【主持人】它可以获得大量的数据,就有人用它就能有大量真实的数据,但可能也要看看对数据的条款能不能用于模型的训练,这个还挺涉及隐私的。因为这个数据里是应该能看到你的,就是有些系统的界面,然后里面就有些比如说截图,或者你在用的一些你个人的信息,都有可能会被看,这个数据应该比之前的这种文本数据会更加的丰富。我觉得这是个很好的提醒,如果有人想试这个东西的话,可以仔细看一看它的隐私协议是怎么来规定的。如果能用上的话,我觉得对它提升自己的OS World的类似于这种就是computer use的benchmark的能力,应该是会有挺大的帮助。对,我觉得OS World或者computer use的benchmark,好像一直没有特别大规模的benchmark,所以他们这个东西如果一旦launch,必须要大量用户使用的话,他们应该可以比较快速地去拿到这个可能市面上最大的computer use的数据集,也许他们自己就能编织一个更好的这种评测指标了。说到这个挺有意思,这个也是和机器人挺不一样的地方。你看OpenAI推了这样一个新功能,那就会有人来用,当然这个数据能不能直接用来做训练,就我不知道。然后在机器人,在物理世界里,它就不是这个逻辑。因为你得造一个机器人,然后你才能放到一个地方,它才会有真实的数据。而且就算你免费把一个机器人放到一个地方,对方也不见得想要这个东西。它的链路就是没有这么通畅,就是机器人更难。然后另外我觉得就是,大家在数字世界里面放弃自己的隐私,这个事情干了这么多年,已经干习惯了。但是在物理世界要放弃自己的隐私,可能还是有个心理门槛,得适应一下。除了我们前面说这两个功能之外,在新的交互上,二季度还有一个进展,就是OpenAI再继续发布它的一些多模态的系列,包括real time,就是一个流式语音的系列,它是一整套API,然后还有image 2,就是它们文生图的这个系列。同时我觉得可以稍待讲讲就是,TML几家公司,Thinking Machines Lab一家,它们也是在二季度发布了自己的首个模型,interaction model,它也是一个这种语音交互类的模型,就可以讲讲这一块的进展。一个是为什么大家觉得这个方向还是很重要,就比如说语音,另外一个就是,这些新的成果里面有什么相比之前不一样或者说有进步的地方。
【嘉宾】我觉得首先语音,它并不是一个普通的多模态能力,我觉得语音它是一个人和AI交互的基础设施。刚才咱们提到第二个主线是AI在社会里面的扩散,我觉得就是让人能够在各种场景随时的和AI进行交流,用上AI这个事情还是非常重要的,这是为什么我觉得语音这个事情特别重要。然后Thinking Machines Lab这个发布,我还是非常,我个人觉得非常有意思。就这个模型我先给大家介绍一下,它叫做Interaction Model,它是一个276B MoE模型,然后有这个12B的激活,是他们自己从零开始训练的。这个模型最有意思的点就是,它是一个能边听边说,然后还能看,然后能够看你动作这个及时反应,然后能够打断人的这么一个模型。
【主持人】就在以前这个是从来没有过的,就像一个采访模型。
【嘉宾】采访模型,然后在这边听边说,还有打断人对吧,还要看对吧。
【主持人】采访也要看对方的反应吗,那这个模型就是万机可以立马用起来。
【嘉宾】对,然后它不仅可以就做这件事情,它并且它后台还配了一个异步的一个推理模型,就是在做这些实时反馈的同时,它后面还有一个模型在做长思考,然后可以把这些深度思考的插回这个对话里面。但它在网上就是发了一篇博客,然后和一些demo的录制视频,但是目前的话,就是还是没有开放API和大规模使用,所以其实没有太多的用户能够用上。
【主持人】然后给出真实的反馈。但是我觉得这个东西它的意义在于什么呢?就是在之前的话,最好的模型在语音方面,实时交互应该是OpenAI的GPT Real Time。但GPT Real Time它其实是一个对讲机,就是它还是Turn-based。你说完了以后,然后你按了以后,对方说话。然后他按了以后,你之所以感觉是Real Time,是它上面包装了一层,它上面包装了一层VAD,就是Voice Activity Detection。它会知道就说,你这边大概应该是说完了,然后我就该我这边说了。但它本质上其实还是轮流说话的对讲机,它包装的这一层并不是在模型层,是加在上面卖为一包装的。
【嘉宾】而Think Machine的新模型,它的交互模式就是从对讲机变成了真正的打电话。所以它是一直在听你说什么,并且可以同时说话的,所以这个叫做Full Duplex。
【主持人】它没有去全量地开放这个API,是因为这种新的方式可能会非常贵吗?
【嘉宾】这个我就不太确定是说,它这个效果还需要打磨,还是因为他们觉得现在成本太高,自己的Infra trucks没有做好,还是因为什么原因了。
【主持人】而且它这个东西是不是不好直接变成一个2C的产品?就像你说的,语音它是交互的一种基础方式,对吧,它其实是生态的一个基础设施。包括我们第一次录节目,我们就聊这个Agent和Infra的创业机会的时候,你是单独把语音列成一层的,你去把它列成和推理和coding和computer use都是平行的。那从这个角度来说,它就得加在一个什么上面,它才是一个完整的产品。
【嘉宾】我觉得这其实是个很有可能性的一个推断,就是他们可能最终是要推出一个个人助手的一个2C的产品,然后这个模型呢,是它这个个人助手交互的方式,interface。所以它现在先把这个模型放出来,它可能最终是想release那个个人助手。我们叠个甲,这都是我们推测的,就有可能它想在自己的产品出来之后,它再放出来再给别人用。当然也不排除就说成本各方面综合的考量。还有一个就是能突出它这个架构和以前是完全不一样的,就是它自己在发布这个模型的时候,还做了两个benchmark。一个benchmark叫做timespeak,就是按照指定时间精确开口,比如说每4秒提醒一下我呼吸,然后这个模型就会按准时说话。然后另外一个的话就是叫qspeak,就是监听用户这个语音,然后在内容里面出现线索,就是你该你说话的时候你就要说话。所以他们内部做两个benchmark来衡量这个模型,在这个实时语音这方面的能力是不是够强。
【主持人】那么在这两个benchmark上面,他们和OpenAI做了一个对比?
【嘉宾】在指定时间精确开口这上面,他们是64.7%,然后OpenAI的这个Real Time 2.0是4.3%。
【主持人】差这么多,差了很多倍。就这个都有点感觉要欺负小朋友了。
【嘉宾】我觉得主要是因为他这个架构就做不了这个事情,所以他们这个新架构才这么高。
【主持人】所以那4.3%基本上就蒙了,随机了,对对对。
【嘉宾】然后在这个qspeak上面他们是81.7%,然后OpenAI是2.9%。
【主持人】2.9%,所以几乎就是零了,基线几乎是零了。那他们应该测的就是Real Time 2.0。那你觉得Real Time 2.0表现如何?它也是OpenAI发的一个新的东西,就是主要他们这个系列的一个最新的东西。
【嘉宾】我觉得Real Time 2.0实际使用体验还是不错的。但是我这个地方不完全确定,我在ChatGPT里面Advanced Voice Mode现在用到的,是不是已经是Real Time 2.0了?
【主持人】对,我记得好像刚发布的时候,后面应该是那个Advanced Voice Mode还没有更新成Real Time 2.0。我觉得他这个东西不一样,他是一个比较成熟产品,因为他的API也就是到6月十几号的时候,他就全量可用,然后很多开发者这些都可以用起来。这个是跟Interaction Model不一样的地方,就是一个我觉得是个更前沿的尝试吧,然后一个是他已经相对成熟一个系列的新的一代。
【嘉宾】也可以稍微再一手讲讲这个Image 2,就继续文生图的这一块,就是在Sora关停之后,文生图OpenAI现在看起来还在继续。我觉得Image 2的效果是非常好的,然后他在这个Image Arena上面应该是断层式的领先。
【嘉宾】就是应该是Elo score应该是1500多分,然后比第二名可能高了就是200分,然后他就是在视觉生产力的各个方面都非常强。比如说我们应该可以看到就是社交媒体上有大量的用image 2来生成那个电影海报,或者就是生成的效果非常非常的好,所以能够实际的就是我就在一些有经济价值的这个任务里面是比上一代文生图的模型要强很多。所以他和Sora的区别就是他没有那么花钱,以及他比较能算过来这个回报。我觉得历史上我们能看到的就是说,像nano-banana还有这种文生图,他们其实对于2C产品其实还是有很大的帮助的。当时nano-banana发布的时候,他们的Gemini的下载量有大幅的上升,并且还有一些startup,他们自己想要把自己的流量做上去,就是通过免费提供nano-banana给用户使用来吸引用户,所以这样的功能其实对于2C产品的增长还是很有帮助的。
【主持人】我们在聊完前面的推进智能前沿和现在已经有的智能怎么更好地扩散之后,我觉得最后可以补充来聊一聊一些在前面的话题里没有提到的重点公司的进展。首先我觉得就是Meta,Meta在这一季度其实还是有一个挺壮的变化,就是FAIR他们的核心AI部门是放出了重组之后的第一炮,也就是Muse Spark这个模型。这是4月发布的,行业里是怎么讨论这件事情?就这个模型反响如何?
【嘉宾】行业里的讨论就是讨论不多,就是这个模型应该是接近前沿能力,但应该是还是处于一个追赶的态势,还没有真正达到就是前沿,而且能用的人也比较少,对吧。因为他没有完全开放API,对,我身边没有听说有人就是用过Muse Spark。
【主持人】有可能这个记得围绕Meta更大的新闻依然是裁员,所以我们上次讨论的就是他当时不是说要计划裁员吗,现在是开始裁员了。
【嘉宾】我觉得小扎的计划就是持续的裁员,然后把这些裁员用的钱来进一步投到AI的开发上面,但只不过现在可能内部比较动荡,所以受到了一些内部的阻力。
【主持人】我们在最开始回顾上一季度和这一季度的变化的时候,你也提到有一个事儿是没有在这季度延续的,就是我们之前讨论Meta的token消耗的竞赛。然后更广泛来说,其实是当时在一季度的时候有一种token maxing的风潮,很多公司都争先恐后地希望自己的员工能更多的去用AI。你怎么看这个风潮好像比较快的就趋于平息了?
【嘉宾】我觉得所有的这些技术趋势都应该follow一个三部曲,先是frenzy狂热,然后下一步可能就是crash就是崩盘,最后的话是stabilization就是稳定。我觉得token maxing基本上也是这三个阶段,我觉得可能Q1的话就是一个狂热的一个阶段,那么这个狂热的阶段就是大家会看到就是钱花了上亿美元对吧,但是最后并没有太多的产出。那么接下来就可能会进入现在第二个阶段,但我相信接下来马上可能就会进入第三个阶段。他们内部之前会有一个leaderboard,就是看谁的token用的最多,现在这个leaderboard也已经被取消了,然后给每个人也加上了使用token的quota,就是有一个上限限额,所以这个事情应该就是相当于是进入新的阶段。
【主持人】这边大公司的人均限额一般是多少?
【嘉宾】我觉得Meta限额应该是一个比较高的,我们之前听说Uber在四个月就用完了他全年的coding的这个budget,那他应该是大概是每个工程师每一个月平均是500到2000美元的限额。
【主持人】500到2000美元,国内差不多也是这个量级,国内我知道有一些公司是5000人民币,700美元,就是在你刚说的Uber的这个范围里面,当然就是2000美元就是属于还比较高了。他们还有一个有意思的,说是我们前面你表达过的这个MCI,就有点类似于OpenAI推的那个新功能record and replay,只不过在Meta他们是强制所有员工去做的,然后后面又出现了表达的安全问题、数据泄漏的问题又叫停了。所以强制和自动开启的区别还是挺大的,自愿开启你对OpenAI来说就是我给了你一个新的服务,你可以用你也可以不用。然后Meta是要所有的在美国的员工在电脑上去安装一个追踪软件,然后去看你是怎么移动鼠标,你怎么点击,你怎么键盘输入。但这样也有一个好处,因为刚才我们在讨论OpenAI的这个新功能的时候,就在说这个数据能否被用来去训练更好的computer use模型其实是不知道的,大概率是不能直接用的。那我觉得在Meta的算盘里,它肯定是拿来直接用的,它的员工之间就没有这种问题,这不还是自己的数据吗,但是这个如意算盘就没敲响,反正现在被叫停了。
【主持人】然后我们来聊聊Google和xAI,不是独立公司的xAI吧,在二季度的一些情况。Google在这次的I/O大会发布了他们的新模型Gemini 1.5 Omni,就是对于视频的剪辑能力应该还是让大家非常惊艳的,那看起来还是多模态上的进展。
【嘉宾】对,主要Google的话,就是这个季度可能还是多模态的进展比较多,但是内部的话,他们应该也充分的意识到了,就是代码能力对于未来
【嘉宾】不管是营收还是未来竞争的重要性,所以他们也在加码代码这方面。然后xAI这个季度有巨大变化,就是我刚才提到的,他们已经不是一个独立的公司。xAI的话,现在是有一个从New Lab到New Cloud的一个转变,当然在自己放弃Train模型以后,他们赚钱就赚得非常多了,他们的集群租出去以后,现在每个月的租金是1.25B美金,就是12.5亿美金的收入。然后伊朗现在要去太空里面去建太空算力中心,相当于Svex我觉得应该是朝算力的方向走,所以有件事他至少做对了,就是建特别大的算力,这是一个从现在这个时间点你回到过去三年去看一个很聪明的投资。
【主持人】另一方面你刚才说他放弃了训练模型,这件事已经板上钉钉了吗?
【嘉宾】他对外肯定不是说他要放弃这个模型,但他目前的话,实质上他没有训练模型之前的人才团队了。
【主持人】你觉得他收购Cursor之后,能多大程度的去改变这件事情?
【嘉宾】我觉得Cursor的团队可能并不能完全填充他之前的那个窟窿,Cursor团队应该有一些人是做过模型的,至少做过后训练对吧。
【主持人】对,至少他们做过后训练。但我觉得Cursor可能比如说没有预训练的人才,所以我们还会看到Grok模型吗?
【嘉宾】我觉得可能会至少需要一段时间。其实5月底的时候,马斯克自己在X上说Grok V9已经完成了预训练,说两三周之后要公布,但是到现在还没有发。
【主持人】我觉得Elon is always right except the timing。你周围的人有人收到xAI的Offer吗?补充新团队的。
【嘉宾】好像没听说。
【主持人】没听说。所以也没有听说他们,我听说他们离开xAI去别的地方找工作,就也没听说他们在补充人才是吗?
【嘉宾】没有这种。他们招的人,但听说招的人是做那些什么Harness那些的,就是并不是训模型的,就做Agent的Harness那些东西的。
【主持人】你觉得马斯克还有可能在追上吗?他还有可能在抓住模型的这个机会吗?其实当年OpenAI,他是最早的支持者和创始团队之一,如果带入下马斯克,我觉得他错过这个机会应该还挺懊恼的。你觉得他还有可能追上吗?
【嘉宾】我觉得比较难。
【主持人】你觉得比较难?
【嘉宾】我觉得比较难。对。但他如果要是……就You're never back against Elon 对吧。但如果真的想做的话,我觉得说明他还有希望,因为他这里面有一个更大的问题。
【主持人】就是其实到25年,还是有一些新的团队在出现,就是考虑做预训练类的。其实国内也有,比如说像米哈游,他们也说要用1000亿来做这件事情。但是米哈游的蔡浩宇之前,其实他更早的时候就组了一个公司,带做AI游戏,这个公司存在比较早了,但是他想去做预训练类的这件事情,可能是更晚才发生的,他也类似于现在这种要重建地基的状态。就是我想知道有比较大的资源,有这种抱负的团队,还有没有可能在现在这个时间点赶上这个窗口?还是说这个事情在23年24年可能就已经结束了?
【嘉宾】我觉得已经结束了。除非说之后技术又会有表达的变化,有一个大的瓶颈期,然后再有大的变化,有可能。但是那样的话,就是说应该也是要去解决新的瓶颈,而不是把原来老路再走一遍吧,那样的话可能又会有更新的公司,有更新的组织出现。
【主持人】那你觉得Google和Meta还有可能赶上来吗?就他们和xAI的情况又不太一样,它没有完全散掉。
【嘉宾】我觉得Google和Meta是有机会赶上来的,Google的可能性会更大一些。一方面现在确实大家觉得Google是落后了,相比于去年三季度Google is back的强势回归的状态,我觉得去年年底的时候Gemini 3发布的时候,Google有短暂的,就是有那种重回第一的感觉。
【主持人】短暂重回第一。对,然后现在到今年的话,肯定就是落后于OpenAI和Anthropic。它当时短暂的重回第一,是不是也和多模态本身带来的传播比较多有关?我们之前也讨论过这个问题,由于期节目里面。
【嘉宾】我觉得一方面是它多模态能力确实做得不错,另外一方面是当时它应该是同时发布了。
【主持人】Gemini 3和Anti-Gravity,就是他们Windsurf收购后做的新的Agent IDE。然后就是Gemini 3,就12月底的时候,他们当时的coding能力和Anthropic、OpenAI还没有差那么多。但是今年的话,就是Anthropic、OpenAI在coding这边是有长足的进步,而Gemini里面并没有太大的进步。并且就是还有一个,Google非常擅长的是他们的Cost做得非常低。就之前的话,如果我们看Pareto Frontier那张图,就是纵轴横轴分别是Cost和模型能力,基本上在Pareto Frontier,就是给定一个模型能力,然后Cost最便宜的,基本上都是Google的模型。然后到今年的话,好像优势好像也不在了,就是这个新的Gemini 3.5 Flash好像比之前贵了好几倍。所以在Pareto Frontier上面,Google也不是一直是处在领先的状态。所以就几方面的因素加一起,我觉得现在Google肯定是大家会觉得会落后一些。但我觉得就是,然后再加上最近Google的Noam Shazeer也离开Google,然后加入了OpenAI,他是Transformer的八位作者之一。然后所以我觉得大家可能会比较担心Google的状况,但我觉得Google还是有一个很好的底子在那里的。这个底子是来自于,这个底子我觉得关于几方面,一个是他们研究人才的储备,除了Noam Shazeer还有很多很好的研究员。然后另外的话,就是他们的这个算力基础也在,对。然后我觉得TPU的话,他们有很大的算力上的一些优势。
【嘉宾】你觉得Meta也是有可能赶上的原因是什么了?
【主持人】其实我这几天和不少人交流,我觉得大家对Meta的整体态度还是比较悲观的。我觉得Meta最大的风险,就是说出现那个类似XAI的那种团队解散的风险。
【嘉宾】之前是预三家,然后现在是两大Frontier Lab,你觉得再往后,未来会只有一个公司持续领先吗?
【主持人】我觉得应该不会是一家公司持续领先的状况。因为我觉得举一个例子的话,就是2023年GPT-4刚发布的时候,大家都觉得非常惊艳。那个时候就是OpenAI领先其他Lab的这个身位,应该大于现在最领先的Frontier Labs领先第二名的身位。但是这么大的优势OpenAI也后来被追上了,所以我觉得应该是一个交替领先的一个态势。除非是某一个Lab提前把,比如说达到在RSI上面有一些进展,然后持的他们加速度大幅超过其他的Lab,那我觉得可能会出现有一家独大的情况。
【嘉宾】你刚才讲前面那一半的时候,我也是想到了RSI。就如果你说你真的实现低规自信化的话,那你可能加速度会变快。但同时也有可能两家公司差不多同时实现,也有可能。这个也是我们之后会持续关注的话题。那最后来一点轻松的话题,就是之前你跟我讲到就是这个企图在硅谷,有一家可能之前已经不是风口浪尖的公司,也发生了很有意思的变化,就是Midjourney。之前我们有聊到过,就是他其实还是一直比较赚钱的,只不过他不在大家讨论的这个前沿。你可以加上二级度他做了一些什么事?
【主持人】Midjourney这家公司大家都比较熟悉,但可能就是最近一段时间没有出现在大家的视野里面。他们是做最早可能做文生图比较有影响力的公司。那么6月中的时候,Midjourney突然宣布他们这个新的产品和部门,就是Midjourney Medical。他们首个新的硬件产品叫做Midjourney Scanner,就是号称是这个50年来第一个全新的全身医学影像方法。
【嘉宾】50年来第一个?
【主持人】50年来第一个。然后他们的工作原理,就是人这个站在一个潜水池的平台上面,然后周围环绕着大概40万个超声波的换能器。然后声波就会从全方位的穿过你的身体,然后每秒会生成TB级别的数据。然后他们会有他们的计算集群,然后重建你的肌肉、脂肪、骨骼、器官的3D横截面图像。他们管这个方法叫做Ultrasound CT,CT的超级升级版。
【嘉宾】超声波CT?
【主持人】对,超声波CT。
【嘉宾】怎么突然搞这个?
【主持人】就一般人看到这件事情,都会觉得跟他之前的主业好像八竿子打不着。Midjourney的Founder David,他实际上是一个非常有想象力的一个人。Midjourney这个公司他从来不像VC融钱,因为David不想受到投资人的控制,他希望能够完全以自己的意愿来运营这个公司。所以他利用Midjourney在文生图方面的收入,然后养了一个大概50人的一个团队,做各种硬件项目。
【嘉宾】应该已经做了超过一年多的时间,然后他现在可能同时做八个项目,可能一半是硬件,然后一半是软件。然后短期的话,可能想把两个硬件产品推向市场。那么我们看到的MiniJony Medical可能是其中的一个,所以他另一个硬件,或者说他其他的硬件都还不一定是跟健康医疗相关的,可能什么各种方向都有可能。对,就是很天马行空的。
【主持人】非常天马行空。David Holz这个人,就MiniJony的创始人,他以前是什么背景的?
【嘉宾】David之前的话,他最早是在NASA工作过,然后做过激光雷达相关的工作。然后后来的话,他自己创办了一家公司叫做Leap Motion,是做手势识别的。然后后面的话,是被他的收购队伍收购了。所以他其实拥有很多丰富的硬件经验。然后他后来又成功转行做这个AI多模态模型,然后也做得非常好。然后他涉猎非常的广,在他家里面,他经常会办一些就是各行各业的活动,比如说诗歌朗诵,或者说这个音乐即兴,或者说AI和人一起创作音乐,像这种活动他都办过很多。然后有很多的研究员和这个硅谷的创业者会去他家参加这些活动。所以他是住在城里的,他不在硅谷这边。
【主持人】我觉得这还是让我挺意外的一个事。就是在硅谷在湾区,搞到这种新的智能硬件,他可能都不能算是一个AI硬件对吧,他里面也许还没有那么多东西,看不出他硬件上AI在哪。所以最后的这个One More Thing,是关于一家AI公司做了一件跟AI没有那么直接相关的事。我觉得以此作为这期季报的结尾挺好的,因为我们这个季报当然主要是聊AI的,然后科技行业确实很多的话题也是被AI占据的。但另一方面在AI之外,也有很多事物,也有很多新的进展。今天非常感谢Henry,再次做客晚点聊,和我们一起讨论了2026年第二季度AI领域的一些大事件。
【主持人】我们分两条脉络,一个是智能前沿是如何推进的,另一个是已经存在的智能是怎么更好地扩散到全社会、被企业被个人使用的。在第一个部分,有之前已经非常明显的coding和agent的竞争,在第二季度它也变得更加激烈,包括出现了各种发布的波折,还有价格战。然后另一个是我们上次有聊到过的auto research之后变得更明确,然后也更火的一个趋势,就是ASI的规自进化。第三个是从虚拟世界到物理世界,大家对物理AI的探索也在加码,OpenAI官宣了Robotics的团队,Anthropic也被传闻说要去做具身智能相关的探索。
【主持人】然后是在智能扩散的这条线,我们讨论了新的交互,Anthropic和OpenAI都在二季度推出了一些新的功能。我们也讨论了中国的开源模型和美国的企业客户之间怎么形成了一种生态上的良性合作,一起去替代和对抗特别特别贵的Frontier Model的模型。最后的补充部分,我们聊了前面的框架里可能没有特别多涉及到的Google、xAI还有Meta的一些情况,以及特别有意思的MiniJony这家公司的新的尝试。那今天节目就到这里,各位拜拜。
【主持人】本期节目就到这里,感谢收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这也会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多你想听的主题和嘉宾。你可以从小宇宙、苹果Podcast等渠道关注晚点聊LateTalk,也欢迎关注我们的公众号晚点LatePost。
【主持人】下期再见。