163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
主持人:欢迎收听晚点聊,我是曼琪。这是一期非常硬核的节目。我邀请了两位一线AI从业者和我一起解读DeepSeek V4的技术报告。一位是模型架构背景的刘逸峰,UCLA在读博士;一位是Infra背景的赵晨阳,他加入了开源推理框架SGLang核心团队,并成立了商用公司Redix Arc。如果一句话概括,DeepSeek V4是继续在R1的测试时扩展范式下,用一系列组合创新和工程优化,让百万上下文从理论进入了实用性阶段。下面我们正式进入节目。
晚点团队(赵晨阳):大家好,我和逸峰是本科和博士同学,我姓赵,叫赵晨阳。我在美国硅谷这边参与创建了Redix Arc公司,担任工程师,同时在SGLang这个开源推理框架和生态项目里面做开发。我们这个项目大概部署在全球超过四十万张卡,算是这一代开源引擎当中规模很大的一个。我自己此前做强化学习系统很多,也亲眼见证了DeepSeek R1在RLHF领域带来了巨大的变革,可以说某种意义上让这个领域得到了前所未有的重视。上上周DeepSeek新一代模型V4发版,这也是我们今天要讨论的重点内容。我们团队做了相当多的工程优化,成功在DeepSeek V4发布的当天,就把推理和强化学习两条路径都跑通了。这个待会儿聊到Infra的部分我会展开讲一下,今天的播客会由我和逸峰同学一块来分享。
主持人:因为正好逸峰的背景和之前的经验比较偏算法和架构这块,晨阳比较偏Infra这块,这两方面V4都有一些核心的改进,两位的视角非常互补。那么正式来聊V4的进展之前,有几个我比较关心的问题。一个是V4发布之后,你们作为一线的AI从业者,自己上手使用的体验是怎样的?
晚点团队(赵晨阳):作为用户使用端的角度,我也在LMSYS Arena上面把DeepSeek V4和其他模型进行对比。我感觉无论是数学推理、代码编写,还是让它follow一个agent的指令执行,都要比V3要好得多,尤其是幻觉比V3要少得多。能力上我觉得跟Claude系列还是比较接近的,当然在代码层面,可恶的是还是比其他模型要好得多。体感上我觉得跟Kimi K2这些开源模型还是比较接近的。
主持人:你说和Kimi最近发的模型的感觉是接近的,那就可以说中国这些第一梯队的开源模型其实用起来体感都差不了太多?
晚点团队(赵晨阳):对,但是代码方面,跟国外的Claude系列来说,它会有一定的差距。
主持人:晨阳你可以说说你用V4的感受,因为这次你在SGLang的创业团队Redix Arc,你们也做了第一天的Infra适配,在做这个适配的过程中你有什么比较有意思的发现吗?
晚点团队(赵晨阳):这个很好玩,从工程角度来说,大概从DeepSeek V3开始我们有一个感受,DeepSeek每年的发布都会为开源社区的研究和Infra基本上注入一年的强大活力。比如去年DeepSeek提出large EP等等这些架构,我们前前后后扎扎实实做了有一年的时间,才能把这些细节都在开源领域实现。今年我预感也不会例外,因为今年他们这个报告上的Infra细节非常扎实。DeepSeek V4依旧是Infra的巨鲸,这次的架构变化也非常大。从DeepSeek V2到DeepSeek V3,我们觉得Infra的变化比较渐进,整体上是把MLA和DeepSeek MoE这两套架构给scale up;然后到了DeepSeek V4,注意力本身又有新的巨大改变,SWA搭配着双压缩策略,难度也非常之大。
晚点团队:我们在这个过程当中,也得为我们先前有的前缀缓存,还有投机采样的这些方法,做非常多的优化。最终我们拿到的效果也是很不错的,在各家评测上处于领先地位。因为正好逸峰你这几天也去参加ICLR嘛,然后很多研究员也聚在一起,又赶上V4发布,就是在这个会场大家有些什么讨论吗?
晚点团队:刚好就是说DeepSeek在那个会议期间发布了,然后大家讨论比较感兴趣的一个点是,DeepSeek放弃了V3的MLA架构。之前的话DeepSeek提出了MLA架构,然后Kimi的K2系列,还有某些系列之类的前沿开源模型,依然是采用的MLA架构。今年的ICLR会场上有一些基于MLA架构的改进或者雕花的工作,比如说并行的MLA之类的这些改进,然后大家就会讨论,这些继续在MLA的范式上进行升华或者雕花的研究到底还有没有意义。另一方面也在思考,未来模型架构还有什么值得改进的方向。因为相当于是几个月之前大家都认为,比较先进的开源模型的架构都逐渐收敛了,比如说都收敛到MLA,然后在MLA技术之上再进行一些小的改进。那DeepSeek它又放弃了MLA架构,回到了传统的MQA架构,这说明模型架构本身其实还是有非常大的改进空间的。
晚点团队:MLA是V2的时候他们提的,如果要解释一下的话,MLA和MQA的简单区别是什么?
晚点团队:MQA其实跟最原始的那个Multi-Head Attention差不多。MLA跟之前的架构完全不一样,它是将KV进行低秩压缩,这样的话只需要存储压缩过后的那个KV,然后在inference的时候再把它scale上去,这样就相当于能够节省KV Cache。所以在比较核心的注意力机制这块,V4相比于V3又有一个显著的改进。V4相比V3的话,相当于引入了token-wise的这样一些改进,这样一个非常大尺度的压缩。我猜测可能是由于底层实现的原因,如果把这些压缩合并到MLA上,可能实现起来就相当复杂了,可能就是因为这一点,MLA这种比较复杂的架构被放弃了。
晚点团队:这次其实这个技术报告里有一个消失的东西,就是训练成本。我是指相比于V3,因为V3的时候是直接提了说最后一次的训练成本是557万美元。这次报告里面,包括他们自己的官方博客里都没有特别明确地讲这个数字,两位怎么看这个变化?
晚点团队:我觉得首先作为一个严谨的成熟公司,DeepSeek内部对成本的核算一定算得非常清楚。我觉得他们不选择主动公开本身是一个信号,就是他们不再是一个需要靠成本高低来定义自己的团队,转而希望用模型本身的能力来代表他们发声。最终模型的最后那一次训练成本,只是所有成本的冰山一角。当时的训练成本写的557万美元,应该是最后一次的成本,但是有大量的钱花在前期探索,还有对比验证的实验成本,以及人力和数据成本,这些才是最终成本的主要部分。因此我觉得再公布成本的意义其实不算特别大,研发成本肯定是最后一次训练成本的几十倍。
晚点团队:就是你们怎么看这个V4……
晚点团队:它是没有上多模态能力的。我认为 DeepSeek 可能一方面更专注于文本处理能力,毕竟如果一个模型想要处理多种能力的话,难度还是比较大的。另一方面,对于国产芯片的适配,包括本身它的结构已经很复杂了,如果再融入多模态的这样一个结构来说,算法其实很难写。
为什么 V4 训练了这么长时间?而且它确实也 delay 了自己的预期,大概在春节的时候,他们本来有计划想争取在春节前发布,后来应该算是晚了两个多月吧。这个具体的发布计划我们外界是很难知晓的,我可以从算法角度去做一些推测。
DeepSeek 这次引入了四个互相耦合的新 feature:MLA、MoE 作为一个新的用法,还有 FP4 训练。像我之前提到过,MLA 和一个功能的单独上线都需要极大规模的 debug,四个叠加,这就是一个组合爆炸问题。特别是 MoE 在如此大规模上的稳定性,还有把 FP4 做 forward-backward 的生产级别的稳定,其实在公开层面都是极为前沿的尝试。
我一直非常喜欢 DeepSeek,他们在发布的时候引用了一句话,叫"率道而行,端然震极",这个非常有意思。我前面就在读《道德经》了,道德经里面有一句话,我觉得可以用来讲讲他们这个状态,叫做"为而不恃,功成弗居",创造万物却不占为己有,功业有成却不会自我夸耀,我觉得他们一直都是一个非常值得学习的团队。
我补充一点,这次 DeepSeek 一个亮点是原生支持国产芯片,在 DeepSeek 之前的研究其实很少提到这一点。没有提到可能是因为国产芯片底层算子或者接口量比较大,很多时候需要从零开始编写,如果他们之前尝试过这样的编写的话,可能也会进一步增加研发时间。
其实我看这个报告原文,只有一个地方提到了国产芯片,就是在 Infra 讲备份方案的时候,提到说"我们在华为昇腾上做了技术验证",这就是你说的原生支持国产芯片,这个是做推理,对吧?
晚点团队:是的。训练是否用了,其实不知道,外界有很多推测而已。对,他并没有写,外界推测大部分人还是认为他用的是英伟达的芯片。
可以补充说一下,刚才提到"率道而行,端然正极"这句话,他们引用的是后两句,在原文里前面还有两句话,是说不要去沉溺于追捧,也不要去恐惧大家对你的质疑。这可能确实是,从去年下半年大家一直期待他发,到现在真的发,中间这段时间,这个团队会面临的一些内外压力。
晚点团队:这个高中的时候,《小二零》嘛,都讲这个,"举顺欲之柔,不加劝;举顺非之柔,不加劝",这是非常极高的境界。我可能补充的是,在DeepSeek做的这些名单里面,我们可以看到,他的离职人员其实不是特别多,是5%的一个比例。相比于其他公司的流动率来说,DeepSeek的流动率是相当低的。我认为,不由于欲,不仅仅是整个公司的一个信仰之一,而且公司研发人员他们自己,也是不由于欲,专心做好自己的事情。
晚点团队:我觉得,R1的时候,它有一个非常大的舆论反响,因为它有一个很好表达的变化,就是它用开源的方式,走通了当时的一种新的范式,就是测试时的扩展(test time scaling)。也就是2024年9月的时候,OpenAI发布O1的时候,大家看到的这样一种新的范式。那是不是可以说,V3从整体的大思路上,它不是一个范式的变化,它更多是你刚才说的,很多工程的创新组合在一起,又能给它完成得很好的这样一个进展?
晚点团队:我觉得"范式变化"这个词在AI圈子被用得有点信息过载了。范式这个东西,应该被定义成一种十年一遇、甚至更加稀疏的东西,比如说牛顿、爱因斯坦这种人,可以称之为有科学范式的变化,对吧。回到AI上,我们觉得可能是Transformers、scaling law、然后RLHF或Constitutional AI,然后test time scaling,这算是范式。可以想象,R1在当年,一年前,R1的范式,就是它在开源侧走通了long-scale reasoning,然后V3自己……
晚点团队:DeepSeek也非常坦诚地承认,说其实也是follow了R1开创的范式,并且V4的定位也算是在这个范式下面解决了一些更艰难的问题。所以回过头来,我觉得每隔半年要说我们就要为这个AI找个新的范式,只能说是AI的发展远远不成熟。我更想要讨论的一个问题是,我们沿着现在这个范式继续优化,还有多少空间可以做,还有什么新的应用可能会诞生。我们做这一切,是因为它的上限在那里。我的判断就是说,这个有非常非常大的空间可以做,而且每一步都会很艰难。像V4这种系统级别耦合的工作,我还是觉得会是接下来一两年的主战场。我们会想尽很多办法,把这些所谓的one million token拆分成非常多的细散优化,然后结合起来让整体能跑。这些事情很工程,而且商业价值也非常巨大。
我补充一点,与其从方法的角度去解释这个范式变化,不如说范式变化可以解释成提出一个新的模型能力的领域。比如说之前的长上下文能力,像Kimi就是用长上下文能力,包括现在的agent能力、幻觉能力这些,我觉得提出这些新的能力领域,才是目前大语言模型需要不断去做的事情。就是我们现在不是说能不能做到,而是说我们不知道我们还有哪些需要做的。从这一点上来说,V4带给我的震撼,远远没有像R1,甚至像Kimi最开始那个模型提出长上下文这种范式时那么大。关键的是,要去找……
晚点团队:要解决哪些问题、要做什么,不光是能不能做到。只要提出了一个能力的领域,我觉得也就半年到一年的时间,基本上这个能力就会被现在的模型给刷爆。那你现在有看到可能还没有那么被关注、但之后可能会很有潜力的方向吗?比如说 AI 自己的意识——目前 AI 还是人类的一个工具,但是 AI 是不是能够有自己的意识、自主行为能力,是怎么样的?
晚点团队:其实我觉得有个重要的能力,是减少推理的量。我的观点就是说,很多东西是不需要 over-reasoning 的。这也是我对于现在这些模型的一个看法——尽管大家认为解决 One Million Token 是一个非常重要的事情,但你关心的其实是:它现在已经在做的一些事,其实可以用更高的效率做到。对,就是我认为现在这个 Agent 场景,上下文需要消耗过大,我们怎么更高效地去利用上下文。我觉得现在大家对于上下文的铺张浪费,已经被 inference 给惯坏了。现在大家可能觉得 One Million Token 是一个非常自然的事情,但是我始终认为,inference 固然可以支持让 One Million Token 跑得更快,但是我们可能——或者说现在我们去用 Claude Code、去用 OpenAI 的产品,可以看看它吞吐的 Token 量,是一个非常恐怖的数量。那回到这个话题,我们下面可以展开来讲。
主持人:我们详细讨论一下 DeepSeek V3 的效果,以及你们刚才提到的很多新的东西,它具体是怎么起作用的。我们可以先来看一下性能,按照惯例,每次发新模型大家也都会去更新一些 benchmark。这一次 DeepSeek V3 的 benchmark 有什么表现?
晚点团队:DeepSeek V3 的 benchmark 里面有一段我很喜欢,就是它们做了一段类似 Arena 一样的对比测试。我可以简单介绍一下,这些 benchmark 大概有这么几种逻辑。一种就是,比如说我要测你一个问题的正确性,可能就是给一个 question,然后你给我一个 answer,我拿这个 answer 去和正确答案做比较,然后按照评分规则给它一个分数。但因为语言模型的评估非常主观,所以我们可以利用主观盲测来评估。就是同样发一个问题给两个你不知道名字的模型,A 模型给一个答案,B 模型给一个答案,你自己来选 A 模型好还是 B 模型好。有时候大家用 ChatGPT 会发现 ChatGPT 居然真的会干这个事情,就是它在同一个问题下生成了两个回答,然后让你自己选 A 好还是 B 好。这个就叫做 Arena,或者叫竞技场。我们看到 DeepSeek V3……
晚点团队:在它们的 Technical Report 里面也讲了一下,它们自己有做一个类似的 online 实验,就是在公司里面有不同的工程师面临不同的任务,他们可以自行去选择用什么样的模型来完成他们的任务,并且给这些模型反馈。所以最后 overall,它们对比了很多模型,类似 Claude 4.5、4.6,OpenAI 的 GPT 5.5 等等,坦诚地发布了说 V4 的分数大概是在 Claude 4.5 左右,然后 Claude 4.6 还有 GPT 5.5 还是有差距。然后它们有 9% 的工程师说不会将 V4 Pro 作为首选模型。我觉得这是一个非常坦诚的做法。然后这种内部采用意愿的数据,我个人认为非常重要,就是先前晚点大概两篇前的报道也说过,这是一个非常有趣的角度。我觉得这个还有一个非常有意思的问题,就是说这个世界上只有少数几家公司在编程上面是有数据飞轮的,就是任何一家公司如果想要在 coding 上面做出领先模型,都需要建立自己的编程数据飞轮,而被大量使用是获取这种数据的最佳方式。这个事情是全球的同行都需要仔细思考的问题。
晚点团队:首先解释一下数据飞轮的问题。中国主要是以开源模型为主,然后美国是以闭源模型为主。开源模型就意味着,很多时候用户使用会自己部署在自己的机器上,于是模型研发方是拿不到这些数据的。这会不会导致中国这种开源模型拿不到很多实际使用的数据?
我觉得不是的。因为首先,这些开源模型,当它上了个人——个人是不可能有一台 H200,或者像 B200,或者说像国内的 910B 这样规模的显卡的,对吧,成本实在非常高。所以反过来说,就是大部分的用户,哪怕这模型开源,其实也是 host 在第三方的云上,然后通过 API 的方式大家来调用。所以事实上无论如何都是走 API,在第三方有这个 trace。所以事实上这些 trace,如果大家愿意,用开源模型的话肯定会拿到的。不过很遗憾的是,国内也是大量地在用美国的这些服务。
OK,然后第二个问题,就是刚才也提到了这个 Arena。目前来说,Arena 上 DeepSeek V3 Pro 它的排名大概是在 23 左右,然后比 Claude 3.5 Max 和 Gemini 2.5,包括像 GPT-4.1,都要略逊不少。然后包括另一个……
晚点团队:第三方机构 Artificial Analysis 的 Intelligence Index 显示,DeepSeek V4 大概在 52 左右。我个人感觉,选择某款模型是需要有一定的 AI 信仰的,我愿意为了我的信仰去选择。我觉得刷榜很难受,刷榜不是目的。
这里有一个很有趣的分享:我一直用 Claude Code,有一天我们公司的 Claude 因为账单的原因被下线了,那天我去用了 Codex,我的结论是,离开了 Claude,这个世界完全没有下雨。所以我其实也很强烈地相信,这些模型在我的 use case 里已经很难 differentiate 出来了。在一个极其微小的空间里去排一个先后,其实很难。但是我觉得非常可以预见的是,现在我们国内有非常非常多优秀的顶尖模型,处于智能的最前线。
主持人:所以你刚才说,那天从 Claude 换成 Codex,你也并没有觉得差多少?
晚点团队:是的,这个技术迭代非常快。另一方面,从商业上来说,这个竞争也是激烈得不可思议。我今天也在跟人讨论这个问题,因为现在在硅谷的话,Anthropic 看起来势头非常猛,对吧,有盖过 OpenAI 的……
晚点团队:Claude Code,你要一直保持现在这种领先的话,因为它官方还是和自己的模型绑定在一起的,就是你背后要接的是 Claude 的模型。那如果说你要一直保持这个优势的话,你就需要这个模型一直在这个产品它需要的能力——比如说 Coding,也包括这种交互,或者 Agent 的框架上——你一直要是最好的,要一直在第一梯队。但这个事儿,能不能一直这样持续呢?
其实 GPT-4.5 发了之后,我也看了那些讨论,有的人觉得又上了一个台阶。包括我认识的一些公司的 C-level 高管,他们也在考虑说,要把背后接的模型从 Claude 换成 GPT,就是突然地——从公司的角度,它可能也会比较快有变化。我觉得这个我们都可以之后再观察。
那回到 V4 的话,刚才提到一些现象,一方面就是说,他们可能在一些 Arena 上的排名是落后于同期发的一些中国其他模型的;同时从使用上,其实大家也不是很能明显地感受到它这个区别。这是性能方面。然后我觉得大家比较关心的就是效率,效率上也是这次大家讨论比较多、觉得他们做得比较好的——就是相比于 V3,他们的单 token 的……
晚点团队:推理的FLOPs只有V3的27%,然后KV cache缓存占用只有V3的10%。这个效率提升的程度是一个什么水平?你可以讲讲这个可能和Infra的关系。
晚点团队:首先,DeepSeek V3的时候,当时DeepSeek团队有说过一件事情,即便V3把价格杀得给市场来了重重的一刀,即便到了这种程度上,他们都还是有利可图。包括最近DeepSeek又发了一次大的降价,我们不确定他们现在能不能还是取一个有margin的状态,但是我还是觉得这是一件非常不可思议的工程成就。就你说那篇文章,是他们在25年2月搞了一个开源周,前面五天连发了五个Infra的开源成果,然后周六的时候发了一篇文章,讲了自己的推理成本。这个我印象不深了,但是我相信美股的股民印象会很深。
OK,回到这个问题上来说,他们提到了这么几个数字,类似于FLOPs仅占V3的27%。其实有一个比较重要的问题就是说,我们这个讨论是压缩和吸收带来的效率提升,但得有一个前提,就是说上下文越长,这个效率优势才会越显著。如果你的实际测试……
晚点团队:在场景之后几千token的情况下,V4相对于V3.2的FLOPs节省,根本不会这么极致。包括很早的时候,就有一些第三方机构去评测DeepSeek V4的推理速度,可能拿着一个几千token的输入去测,这其实不太能反映出V4的架构优势。所以核心的takeaway就是说,上下文越长,这个效率带来的优势会越显著。如果你就是几k token,这个其实没有什么很明显的提升。不过换句话来说,几k token到现在,是一个连system prompt都塞不下的状态,所以基本上我能感受到,在大家市场上这些编程场景都会有比较好的提升。那是不是在agent上,它的提升也会很明显?因为其实agent要处理的上下文应该是挺长的,如果是个多步骤的复杂任务的话。
嗯,是的,是的。这个就是说,现在这些动辄接近百万token的这些agent会很有收益。当然,有一个问题是什么,它是在相同token数量的情况下,它的FLOPs和KV cache降低了,但是其实它的消耗量比之前要大不少。如果说考虑这一点的话,其实它的整体的效率提升,并不是特别明显。
晚点团队:当然,还是比之前总和加起来会有一定的效率提升。你说的这个点戳到了,跟之前陈阳说的那个点一样,就是你觉得接下来一个要解决的问题,是同样的 token 数量,应该解决更多的问题,而不是把推理链一直搞得很长。
首先,它可能在训练的时候,目标还是倾向于——只要完成这个任务,我得到的奖励越大,而不是说完成这个任务需要多少 token。还有的话,就是它的一些结构,比如像 token-wise 的注意力压缩,把它的信息压缩得比较狠,也会导致需要更多 token 去补足这些缺失的信息,或者一些推理的过程。
我之前在小红书发过一篇文章,我说会有一种拿着高压水枪浇花的美感,这本身是一件非常奇怪的事情。而且模型忠实地反映了它受到训练时是什么样子的——可以想见,在它的训练当中,有部分数据肯定是解决同一个问题比之前长了,所以导致这些进入到了一个非常不好的循环里面,让解决一个问题所需要的 token 越来越长。
这个问题,类似 Kimi 1.5 的报告里面有讲过,它们有一个叫做长度惩罚,就是会对这个……
晚点团队:解决同一个问题,用了更长回复的回答做一个惩罚。我相信这种技术肯定一直都是在用的,但是哪怕有这种技术,我们也看到这个东西在不可逆地增长,所以可能背后体现在我们一些训练上面,还是有很多值得思考的地方。
接下来就可以聊聊,你们刚才提到了很多这种我们在一起运转的,以及给整个业界带来哪些启发。这个其实我们可以跟着它的技术报告来看,这个报告的脉络也非常清楚,就前面的引言,它自己也解释了它认为这是一个什么样的进展——是在测试时间这个范式里面继续去优化它的效率。后面它就是在讲模型架构的设计,这是第二部分,然后第三部分是 Infra,然后第四部分是预训练的过程。
我们可以深说一下,就是 V4 架构上的一些整体思路是什么。V4 整体上保留了 MLA、MoE 和 MTP 这两个主线策略,然后在四个方面上做的改进是比较值得关注的:注意力上更加混合,吸收了更多设计;然后用了 MLA 的残差;然后在优化器上面选择 shift 到了 Muon 上面;然后 Infra 上面有两个关键词,一个是用了流水线并行,然后另一个是做了 FP4。然后这四个事情共同来说,它就让先前的 MLA 从一个理论可行变成一个成本可接受的方案。我觉得这次的计划比例,就是这一波模型里面……
晚点团队:V4 Pro的总参数是1.6T,然后激活参数大概是50B左右,49B,所以这个激活比例大概是3%。之前Kimi K2.6应该是比这个比例要稍微高一点的,然后他们应该再次往下探了这个极限。这个比例的下降其实反映出来大家一个很明确的工程信念:总参数越大,模型的知识容量会越高;然后激活参数越小,我们的推理成本会下降。MoE的核心价值就是把这两个量解耦,然后V4又把这种解耦推到了一个更加极端的位置。
当然,激活比例并不是越低就越好,这个比例太低可能会带来训练不充分、路由抖动这些问题。DeepSeek V3的这个博客也讨论过,它说辅助负载均衡损失是不是应该被纳入到训练损失里面。我个人觉得,他们把3%的激活比例能够稳定训练到这种程度,再次印证了这个工程的极致水准。
对,我补充说一下,就是你刚说那个激活参数占总参数的比例,现在同期的这些模型里面,MiniMax M2.7是4.3%,GLM 5.1是5.3%,Kimi K2.6也表示是3.2%,DeepSeek V4 Pro——
晚点团队:它是最低的,刚刚3%多一点。我觉得听众朋友来听,这个感情上是在雕花一样。但是我可以说,这个东西它的难度是随着这个数量在指数上升的。从4%到3%,是远远更强的跨越。我并不是说其他的团队可能做不到这个样子,但是他们的技术选型可能想要走得更极致。很多团队的很多选择,比起比较稳扎稳打的方案,这些并没有对错,我只是惊叹于这个事情还是能够继续往极限走。
我倒是想说,30几比1,将近40比1这样一个稀数比,对于算法和底层算法开发提出了相当高的要求。就相当于是,它40比1的话,有大量用于计算的Expert,就需要保证各个Expert之间训练成绩的平衡,以及Token路由的平衡。一方面是说它需要各个专家都能够几乎差不多地训练,另一方面来说,抵达各个专家然后再合并起来。除此之外,另外一个创新就是说……
主持人:它在前几层的MoE,用了哈希路由的形式,而不是用一般MoE的路由方式来进行Token在各个专家之间的分配。从算法层面上,它避免了前几层专家路由高度集中在少数几个专家上的问题。
不仅如此,像MuP、混合精度这些有大量实践积累的feature,还有像MLA,以及一些特定的infra方面的东西,是这次最新纳入实践的。但是,V4之前提出了很多技术,nGram是其中少数没有被应用到V4模型上的技术之一。一方面,我们自己在实验中发现nGram本身对能力的提升非常有限,相当于它需要增加非常大的参数量,但能力提升其实很有限。而且nGram对于infra来说也是比较大的挑战。
晚点团队:你可以介绍一下nGram是什么?这个是25年下半年的时候,DeepSeek单独发了一篇论文来讲这个,包括MLA也是那个时候单独发了一篇论文。MLA用到了V4里面,nGram没有用到V4里面。
主持人:对,nGram相比一般的Transformer,相当于是把两个Token或者多个Token合起来,作为一个新的Token进行编码,然后再输入到对应的层数里面。一般的input embedding只是针对单个Token进行编码,但是nGram是对连续的多个Token——
主持人:几个token,它会有一个全新的编码,理论上可以提高像大海捞针这种能力。但是实际上来说,这个NSA(Native Sparse Attention)它的体验效果非常有限。NSA强调了信号加强的这样一个作用,至少在短期之内应该不会采用这个方案。
那我们可以按照前两个你说的,合起来工程层面的这四个点,我们可以展开说一说。一个是注意力的变化,它现在用了一个混合了CSA和SCA的这样一个新的注意力机制。其实我们之前2025年到现在的好几期节目里,都专门讨论了这个注意力机制的变化。然后DeepSeek一直走的都是这个稀疏注意力的改进,你们可以简单地分享一下,就这次的改进具体有哪些提升,包括你们看到的它背后可能是一个什么样的思路,可能给大家的启发是什么。
晚点团队:一个是他们的注意力是怎么用的,以及这个稀疏注意力嘛,然后有可能有个对等的名词叫做稠密注意力,这个就是一个非常容易掐架的话题了。简单来说,DeepSeek V4的注意力是每一层都在跑一个滑动窗口注意力,我们叫做sliding window attention,然后还有一个长距注意力,可能是CSA或者SCA。CSA是一个路线,在序列维度会做一个4比1的压缩,然后再做一个top-k的选取;SCA可能是一个更激进的方法,做这个128分之1的压缩,然后保持一个稠密注意力。然后他们这个正好合一层……
晚点团队:选择CSA还是MHA,是一个预定义的混合方案。因此同一个上下文,从不同的层来看,有的是吸收层,有的是稠密层。吸收层会来锁定这些关键的token,然后稠密层……我个人认为,对于工程团队来说,我们在实现这个混合方案上面会有很多的挑战。我们最后把这个复杂问题集中,需要处理的是前缀缓存的一致性。我们开发了一套缓存架构,称之为Shadow Redux,这套设计就是为了应对这个问题。然后我们做了三个独立的KV Cache池,给SWA、C4、C128这三种压缩状态。同时我们还要注意在Prefill、Decode、Speculative Decode这三个阶段都保持同步。可以听出来,这些问题的复杂性相比V3阶段又上了一个台阶,而且这也不是MLA时代需要解决的问题。
之前我可能听到过,应该也是晚点的播客吧,采访了松林,他讲DeepSeek内部是比较看好稀疏注意力,而不是线性注意力的。我是比较认为,稀疏在工程上面是更容易控制的方案,然后和现在的KV Cache、Prefix Cache的技术设施都有比较好的亲和性。然后线性注意力的话,我目前没有听到有非常强大的模型,就是在现在这个规模的frontier模型,能够验证这套方案的。
晚点团队:对,我补充一点,就是,我看来的话……
晚点团队:线性注意力能够很好地提高模型推理速度,因此它其实被广泛用在像 Mamba 3.5 这种、苏林提出的 GatedDeltaNet 这类结构中。它在隐藏状态更新的过程中,每一步 token 的信息都会不断地被压缩,因此在需要长程注意力的任务上,比如推理、数学推导这些任务,它相较于非线性注意力,上限可能就比较低。因此在更大的模型,像 DeepSeek V4、Gemma 5.1 这些模型当中,目前来说还是采用的 Full Attention 这样一个结构。
一个非常直观的例子就是,比如第 1 个 token 到第 1024 个 token,若是线性注意力,它需要压缩 1023 次;但如果是 128 窗口的 Sliding Window Attention,它只需要跳 8 次,这两个 token 就能几乎无损地进行信息交流。所以说,要冲上限的模型,它肯定是更倾向于 Full Attention 的。Full Attention 对训练 Infra 的性能要求较高,滑动注意力实现相对简单,短程注意力能力比较强,因此我觉得在未来一段时间的话……
主持人:晚点团队
这种线性注意力的模型可能会越来越多。之前其实 Kimi 有可能考虑过,就是在接下来比较大的模型上用线性注意力的结构,就是混合了线性注意力的结构。但单纯用全线性的,是因为线性注意力还是有一个信息压缩的问题,必须得用全注意力来进行兜底。
其实上次又和杨植麟聊,那一期播客的时候,刚好赶上 MiniMax,他又换成全注意力了。他之前有一个版本,就是 MiniMax 2.0,用的是一个他们叫 Lightning Attention 的结构,就是一种混合了线性注意力的注意力。但在 2.1,他又改回全注意力了。
我还有点印象,因为 MiniMax 2.0 的支持是我做的。MiniMax 的 M1 应该是一个线性注意力模型,但是 MR 开头的模型都是全注意力的。当时我还和他们做算法的同事交流过,就是为什么会 switch back。我们在我们 LMC's org 的 blog 上面也讲过,我们称之叫做"No Free Lunch",欢迎大家可以去读一读当时的这个 blog。
然后退回来说,我们最近有一个新的工作,是在 vLLM 上面支持的一个 KV cache offload 的工作。展开来说,我们针对线性注意力设计了一套特定的 KV cache 卸载策略,我们能够把线性注意力的 KV cache 预卸载到……
晚点团队:在 host memory 上面,然后在长序列、长期上面,能够把吞吐量做到5倍以上。然后类似于 V4 这种,把成本降低到这个27%、10%的这种模型,要在生产环境上跑出商业价值,我个人认为,我们这个 shadow relics 还有 KV cache 这一套底层给同时推进,非常非常有前景。这也是我们团队一直在做的事情。
那接下来可以聊一下,就是它架构里的另外——你说的那四个变化里的另外两个,一个是 MHA,还有一个是在这么大的规模上用了 Muon 的优化器。我们可以先从 Muon 开始聊吧,因为这个可能业界讨论的时间会比较多,包括刚才也提到说 Kimi 其实也用了。这个优化器的开发者,就是那个 Korey Jordan,他也是因为这个成果,在24年12月就被招入了 OpenAI。他本来是一个个人开发者。今年在好几个场合上,包括在 GDC 上,杨植麟也是一直在讲 Kimi 他们对 Muon 的一个优化,那个版本叫 Moonlight。
那 Efo,你可以先讲讲优化器它在模型训练里本来是起一个什么作用的,为什么现在有一个趋势,就是好像大家都用 Muon 比较多了?
晚点团队:就是优化器的话,就是模型训练的原理,就是用梯度下降或者类似的方式,然后让模型的参数去趋向于它定义的 loss 最小的那些地方嘛。最开始是大家都在用 AdamW 进行训练,它这个本质上就是说,融合了动量以及它的更新量的归一化这两个技术。动量能够……
晚点团队:让那个,就是它的更新更加 smooth,归一化的是让它每一步比较统一,它就能够进一步地稳定训练。但是呢,AdamW 它是对于每一个元素进行的更新,它不涉及到整个矩阵的更新。Muon 的提出,就是为了解决 AdamW 只针对单个参数进行更新的问题,它相当于是对于二维的参数,比如像线性层,本质上是矩阵乘法,提出了效率更加高的一个优化,能够捕捉……以前那个方法的问题是,它忽略了元素之间的联系,就会导致有些元素已经训练好了,比如同样一个矩阵里面,有些元素可能已经训练到收敛了,但有些元素还没训练到收敛,需要训练时间更长。Muon 把整个矩阵看作一个整体去进行优化,使得整个矩阵各个元素之间步调一致,它就优化更快。但是呢,它最初提出的时候,是对于每一个不同的模组,比如像线性层、input embedding,去特意地去调它的 learning rate,对于使用者来说就不是特别友好。但到 25 年初的时候,Kimi 提的 Muon Light,在一个优化器里,就是更简洁的 Muon。
晚点团队:使得 muon 它能够和 Adam W 进行结合,就是因为在一维的参数上,它并不是矩阵,它没有矩阵这个概念,于是呢就还是用 Adam W,包括现在也是一样的。但是呢,muon 和 Adam W 的 learning rate,在 Kosson Jordan 提出来的时候,是并不知道它们两个比例的。而 Muon Light 一个重要的贡献,就是说把这个比例的系数基本上给它确定了,就是 0.2。然后这个 V4 就进一步改进了,就是 0.18,然后使得这个——就是说我只需要调一个 learning rate 就可以——运用才能从一个理论上的创新转变为实际上的大规模应用。
晚点团队:所以 Kimi 做了 Muon Light 这个改进之后,可以说业界也是广泛地使用了,是吗?
晚点团队:对,就像那个,我全局只需要调一个参数就够了。但是呢,比较特别的是,V4 它没有使用 Muon Light 提出的 0.2,它用了更精确的 0.18。诶,其实这是一个相当大的问题,就是说在推理侧,这是一个不少人关心的问题——推理本来就不涉及到这个参数更新,然后在训练侧已经需要做到,然后整个链条动起来,会是一个……
晚点团队:非常庞大的功臣。要从 NVIDIA 的 Megatron,或者是 Megatron Bridge 这一层还要改,然后一层一层往下传。当然,我说的是针对开源而言。对于闭源的这些训练,他们的运用就另当别论了。
晚点团队:对,就是相当于,运用(Muon)的话,因为它是矩阵层面的这样一个优化,它设计了大量的矩阵惩罚。如果说模型的某个矩阵比较大,那它会需要设计大量的拆分,可能会需要分布式的训练。这个是 AdamW 是没有的。因为 AdamW 就是每个元素单独更新,元素可以无限拆分,这个是 Muon 特有的这样一个算法的问题。所以在训练的过程中,设计了大量的拆分、合并这些操作。
晚点团队:然后还有一个,就是说预训练和后训练的优化器基本上得保持一致。就是说预训练用 AdamW,后训练也得用 AdamW;预训练用 Muon,后训练也得用 Muon。Post training 它比预训练的结构上更加复杂,又导致了如果后训练要用 Muon 的话,它可能会涉及到更多结构上的修改,因为它可能在一个机器上装不下。
晚点团队:现在开源的模型,就近期更新,是不是都用上 Muon 了呢?大部分模型应该都改到 Muon 了,但是应该还是有一部分用 AdamW。前文好像没有特别提及它的模型的优化器是什么。现在还没有改的,是因为觉得 AdamW 有它的好处,还是说还没来得及改?
晚点团队:就我认为,可能大部分还是没来得及改吧?尤其是像后训练链,它的 infra 其实是很难改的。如果说后训练链没改成功的话,就导致了预训练链也只能用 AdamW 先将就着用。
晚点团队:那我可以把这个东西作为一个判断模型团队自己的 infra 能力强弱的标志之一吗?
晚点团队:也可以这么说,这个挺有意思的。所以你觉得这基本上就是一个确定的趋势了,可能之后就变成行业的主流了,只不过在一个过渡阶段,有的人用了,有的人还没用?
晚点团队:是的。但是需要注意的一点是,即便是用了 Muon 的模型,它在像输入的 embedding 和输出 embedding 这种模块来说,还是得用 AdamW。
其实这个可以简单纠正一下,就刚才提到 AdamW 可能不太需要做切分,这个东西不一定。因为它跟你的模型体量相关,就是说你的模型都上 training 了,不可能在任何一个 node 是 single host 下来的。所以 Muon 和 AdamW 肯定是要做非常复杂的并行策略的,而且 Muon 只会比 AdamW 还复杂。
可以简单想想看 MuOn 和 AdamW 的区别,就是说 AdamW 是同时会维护 momentum 和 moment(也就是动量和速度)两个 state,然后这些都是我们先前用的 AdamW 里 element-wise 的算子。所以它用来做切分相对简单一点,就是你的 ZeRO stage 怎么切,你的 FSDP 这东西怎么做、怎么做 partial,然后你的 TP 怎么对齐。
晚点团队:相对而言会简单一些。然后 Muon 的话,它把这个二阶的 momentum 砍掉了,所以 optimizer state 就从两倍降到了一倍,这个肯定能够节省相当大量的显存。不过代价就是说,它在 momentum 上面跑完一轮,经过牛顿数值迭代之后,还要做正交化,然后这就不是一个逐元素的过程了。相当于以前是可能一个一个元素去做 update,现在已经变成一个更为复杂的矩阵计算,我们叫做一个 Gram(正交化)。所以为了做这个 Gram,它是得拿到一个完整的二维权重的。所以说,如果你之前你的这些参数被切得很碎,比如说被 TP 或者被 FSDP 给切碎了,那么你还得把它聚合回来,再来计算。所以这里涉及到很多分布式的原语。
然后这一些讨论,最终得到的效果就是说,我们可以看 Kimi 在 K2 里面——Kimi 我印象中,他们老老实实就只在 data parallelism 这个层面去做 Muon 的切分,他们不会去在张量并行上面去做切分。然后以及刚才一封系列提到了,这个 embedding layer、norm,还有 bias,这些其实还是走的 AdamW。所以 optimizer state 现在到了一个非常混杂的一个状态,然后它的调度逻辑、它的这些给 states 做的 checkpoint,还有做的这些——就是我们叫做 checkpoint resume——都有远超以前的复杂度。然后 Muon 可能……
晚点团队:它不是那么一个简单的换掉,就是你可以想象,我们用了大量的人力、大量的复杂度,去置换出来了一个当量的显存和吞吐效率。然后这笔账值不值得,取决于每一个团队的工程水平,也取决于你有多少显卡、你训练模型的规模有多大。但是有一个观点比较对,其实检验一个团队工程优化上限的很好试金石。这个我非常认可。这个专业名字听起来非常头疼,但事实上,当我也报出这么多名词的时候,这里提到的每一个名词,都可能是一个 engineering decade 的复杂度,或者说得直白一点,每一个名词都对应着一篇论文。
那这是优化器的这部分。然后关于 MHC 的话,就简单来说,这是一个什么改进,这个东西解决什么问题的?对,就是 MHC,是之前基于自己的 hybrid connection 这样一个工作。它是扩展了层与层之间的激活宽度。以前的传统门控,它像是层与层之间假设每一层之间只有局部的激活宽度,而 hybrid connection 的话,就是我在局部之上再加了一个 channel 维,就是现在有 channel 乘以局部这么大一个激活宽度,现在就是局部乘以 C 的激活宽度,大了 C 倍。这样的话,就能够更好地让模型的能力进一步提升。
晚点团队:对,它的scale更大了,它的模型的推理等能力就会有显著的提升。但是呢,普通的hybrid attention,它的数学原理就导致了它的梯度回传不太稳定,训练不太稳定。所以说,之前就是直接提出来之后,其实社区的反响不是特别大。要不然,它加入了这个scale的算法,就是相当于它限制了整个scale是1,横纵都是1,就相当于控制了正向和反向传播,它不至于爆炸或消失。这个改进呢,我认为一方面需要对于前人hybrid attention这样的细致分析,然后另一方面呢,就是说它可能是基于一些内部指标,训练到这个大小还发现一些现象,然后从现象去倒推我怎么样去解决这样一个问题。所以,这算DeepSeek一个比较独特的判断也好,或者说它的选择也好,就是他们选择去改进这个事儿,本身在当时可能也不是很多人在做。在现在所有的、到这个规模、一万亿左右的这种模型里面,是不是也只有DeepSeek用了这个东西,这并不算一个特别主流的做法。
晚点团队:MHA带来的模型,比如说哪些方面的提升?直观的看法就是推理能力相当于有了大幅度增长。就是说,我不必等着那个信息从第一层慢慢慢慢地传到最后一层,而是说我的车道变换了,推理能力有大幅的提升。这个是当时DeepSeek在MHA这个单独的论文里面,他们专门做了控制变量的这种,也没有精确地去比较它的具体能力,它只去比较它的一些benchmark。
另外一个我想补充一点,就是说MHA它是从增加信息的宽度去进行增加层与层之间信息的互动。然后最近我也注意到,就是attention residual,它像DenseNet,它层与层之间直接就是说跨层进行互相连接,它不需要在这一层挨着这样连接,而是说第一层也可以直接去影响最后一层的信息。我认为这两个虽然说那个方法完全不一样,但是呢都是异曲同工的,想到了需要去在layer-wise去进行信息流的这样一个改进。
那这两种方法的区别和它未来的——
晚点团队:上线之后你怎么看?一个是DPSK(DeepSeek)这个做法,另一方面是你说的KiMi,也是最近KiMi提的 Attention Residuals 这个。
晚点团队:我认为,对于我们资源比较有限来说,MHC 它实现起来,infra 相较于 Attention Residuals 还是相对比较简单的。对于我来说的话,可能就是更加倾向于去搞 MHC 相关。就包括我们1月份提出的 Deep Delta Learning,就是类似的 Hybrid Connection,只增加极少的计算量,效果上就是达到了非常好的 performance。Attention Residuals 的话,它对 infra 的要求更高。但是呢,因为它对于层与层之间关系有一个更加精确的描述,所以说我认为它的上限会比 Hybrid Connection 这一系列研究的上限会更高。
晚点团队:MHC 这个事儿,因为它可能也是在训练过程中去做适配,或者说去做一些变化,会有影响吗?其实影响是很多的,就是从推理的角度来说,MHC 把残差的简单 add 变成一个需要经过 sink hole 规划的,然后还要给……
晚点团队:加一个 mixing,这个操作会复杂许多。这也给我们带来了直接的挑战,是先前的算子需要针对 MLA 单独写新的 kernel。包括我们最近也 release 了用 Triton 去给 MLA 写的 splitwise kernel。这个东西在小 batch 解码情况下,能够显著提高 GPU 的利用率。我们不太需要在乎这个具体的 kernel 是什么东西,但是为了新的算法定制新的 kernel 这件事情,在 V3 以前其实做得没有那么频繁。然后这个时代我们也做得更多,惊喜的是,现在我们有了更多更好的工具,类似于 Triton,能够更高效地支持为新算法写新 kernel。
晚点团队:好,那到现在其实我们盘点了你说的那四个一起来的新东西里面的前三个:有新的注意力机制,有那个优化器的一些改进,还有 MLA,就是 DeepSeek 比较独特的做法。然后第四个就是 Triton 和 FP8,这个你可以展开说一说,你对这个应该更了解。
晚点团队:这两个词……这都是付出了无数英语工程师的心血。好,简单先介绍一下 Triton。
晚点团队:我喜欢叫这个工程师叫"Tailan",因为"Tailan"听起来像是那种拳击大师的名字。
好,这么理解。大家可以想,英伟达工程师解决的问题,应该叫做:给定同样的计算路径的情况下,怎么让一个计算更快。然后写 kernel,大概就是说,我们底层有非常多的这种"块",这些块会结合一些硬件特性。虽然我们做的矩阵计算都是同一块,但是经过不同的块,它拿到的效率是不一样的。举个简单例子,比如说我给一个 4096 乘 4096 的矩阵做一些计算,你可以把它按照 128×128 的来拆,然后不同的硬件由于它的显存带宽之类不一样,所以有的硬件可能喜欢 128,有的硬件可能喜欢 256。总之,kernel 大概就是干了这么一个事,就是让这些底层的矩阵计算变得越来越快。当然还有很多很多不同种的 kernel。
写 kernel 是依赖于很多语言的,这种语言我们称之为 DSL,就是 domain specific language。这里面我们一般拿三种来做个对比。我们一般称英伟达的为 CUDA。英伟达是一家伟大的硬件公司,然后在硬件上面一层的软件,就是在 kernel 这一层,也是做得非常非常优秀。CUDA 毫无疑问是性能最高的,但是开发维护成本也最高的。
晚点团队:用一套语言。然后 kernel 的门槛虽然还是很高,但它比手写 kernel 的门槛低了很多。坏处就是它牺牲了很多表达能力以及极端性能,同一个 kernel,你用 Triton 写出来,比起用 CUDA 写出来,CUDA 的效率会高不少。
然后 Titan 的话走的算是一条中间路线,就是它比 Triton 更底层一些,表达力也更强,又比手写 CUDA 的开发效率更高。Titan 也是国内发展起来的一个优秀的开源项目。在 DeepSeek V4 的报告里面提到了 Titan 的几个优势,我可以简单解读一下:就是把一些 kernel 的启动开销压缩到了微秒级别,以及它为位级可重现提供了很多提升。这个位级可重现,类似于我同样一个 prompt 给 DeepSeek V4,如果我用 Titan 的话,它两次 forward 推理出来的结果可能是更容易重现的,这对于推理工程师去 debug 是很有帮助的。
可以科普一下 Triton、Titan 和 CUDA 的区别。我个人来看的话,Titan 的长期价值在于为新算法快速开发高性能 kernel 这些事情大大降低了编写成本。这个在 DeepSeek 提 MHA 的时候他们就写了,他们已经为 MHA 写了一版 Titan 的混合精度的 kernel。然后 Titan 现在非常流行,我们团队的话也是针对推理场景的 small batch size decoding,做了一个 split-K 的 Titan 版的……
主持人:Titan现在已经被前沿的lab当做算法的末日选择之机了,这也是可能最近一年半发生的事情。
晚点团队:你说的这个前沿AI Lab,不是就所有的美国的,也都算上全球的前沿AI Lab。对,大家对于这块的投入其实是很大的。因为很早以前,大家觉得做编译器这一层是非常非常苦的,但是现在大家也看到这一层的优势、这一层的重要性。
主持人:我觉得这个还挺感慨的,因为这是北大杨植麟老师那边发起的一个开源项目,但是后面肯定有很多社区的人一起来贡献和维护。然后他又是你刚说的DSL这个比较底层的语言。其实在五年前的时候,那会儿我刚来晚点,有一个采访,就是去采访昇腾的负责人,然后他就提到说,他们以前在华为做昇腾的时候,他们想去招那种会做编译器语言的人,在国内就非常非常难找,就找不到。因为他们那个做得很早嘛,差不多可能十年前吧,他们就有在想做这个事情。
晚点团队:对,这个我可以说,做编译器一直是一个非常伟大扎实的事业,真的非常的苦,而且它并不是一个那么容易出名的事情。因为这件事情做起来很扎实,然后它离商业层面很远。所以我觉得它越来越受到关注。然后我前面也提到,这个Triton和CUDA,然后可以这么说……
晚点团队:严格来说,在我看来,Triton和CUDA是DSL。CUDA太全面了,以至于它不算很specific。然后Triton和CUDA做事的抽象,我个人理解都很不错。
所以简单来说,Triton和CUDA之间的关系,未来长期会是怎么样?是说它帮助CUDA这个生态更丰富、更完善,还是说它也有可能和其他的国产芯片或者其他芯片结合,一起来和英伟达形成一种竞争?
Hard to say,我觉得这是一个复杂的关系。就类似各个模型厂商之间彼此会发技术报告,然后大家可能会彼此学习,但是也有些竞争。我感觉,就是像Triton相比CUDA,也有类似于C++相比汇编,或者Python相比C一样,就是不同的层级而已。CUDA还是要更底层一些,对吧?就是CUDA直接跟硬件打交道,很多硬件厂商也会主动去支持这些DSL,包括Triton。
晚点团队:中国这个生态圈,也有非常非常多的硬件厂商一块跟着起来的。你们怎么看?就是,DeepSeek用了非常多的,当然你也说到这是一个全球各家 lab 都在做的事情。然后可以说,他们在这个上面投入的是额外要多一些的。因为我看 V3 的论文就有提到了,我觉得这个比其他人更多,但我不确信,因为其他公司披露出来的内部技术实现是相对有限的。
晚点团队:嗯,这是一个关键词。然后另一个关键词,你前面提到 FP4。我们其实先前提到过,DeepSeek 的 V3 是第一个把 FP8 做到一个很大量级的工作,到了 V4,又把 FP4 给做出来了。我好像想,难道还要继续往下走?然后,我们可以对比一下 FP4、FP8,当然还有 BF16,这些词只看最后一位——4、8、16——它代表的是浮点数的存储位宽。比如说 BF16 就是用 16 位来存储一个浮点数,然后 FP4 就是同样的一个数字我只用四位来表达。然后直观来说,这些会得到很大的缓解……
晚点团队:除此之外,FP8精度加速到FP4,也给我们的显存容量和数据读取带来很大的提升。其实,除了算力之外,还有两个很关键的词——显存容量和数据读取带宽,也是大模型训练的一个显著瓶颈。从FP8的精度加速到FP4,显存和带宽需求近似于是砍半的,这显然可以带来很明显的提速。以前,业界是很少有人在超大规模训练中直接使用FP4的,首先FP4的表示范围是非常狭窄的,很容易在训练过程当中出现精度溢出或者梯度异常。所以,DeepSeek为了解决FP4的训练问题,无论是预训练还是后训练,都用了非常多工程上的巧思。
这里我可以挑一个我自己最熟悉的东西来讲,叫做QAT,就是他们在做后训练的时候,做了所谓的量化感知训练(Quantization Aware Training)。它是一种"训练时模拟量化、推理时真实量化"的方案。我们可以理解,这个后训练过程是一个两阶段的循环:一个阶段是采样,就是模型拿到了系统给的输入,然后开始生成回复,进行采样;之后把采样得到的东西进行打分,再把这些打分拿去训练。所以分为采样阶段和训练阶段,采样阶段就是我们常说的rollout。然后我们可以分开来讲,在训练阶段的话,我们会做一个叫做……
晚点团队:模拟量化的操作是这样的:训练时,我们在优化时维持 FP32 的主权重,然后在计算前先将其压缩到 FP8 的范围,再反量化回 FP8 进行计算。这个地方就是我们说的伪量化——它进行了一步快速的量化再反量化回来,这个过程中间没有进行任何真正的前向计算,它只是做这么一个 flipping 的操作,让量化误差在这一步能够得到体现。做了这一步伪量化之后,我们再用 blockwise 的 scale point 去把离群点给兜住,这样模型虽然没有在训练阶段真正受到量化影响,但是它已经适应了这个低精度的损失。
然后回到推理阶段,我们会进行真实的 FP4 量化。到了这一步,我们会把前面量化得到的 FP4 权重拿去真正做推理,FP4 的权重真正斩断了显存瓶颈,让物理提速得到真正的实现。更值得欣喜的是,推理阶段的 FP4 采样和我们之后的模型部署是一致的,因为看现在 NVIDIA 发布的那个 Blackwell,它也是 FP4 的。所以训练过程中的权重就是拿来发布的权重。比如说我们拿 FP8 训练好了之后得到一个 FP8 的权重,再把它量化成 FP4,这样其实还是会有精度损失的。所以通过这种训练端的伪量化、推理时真实量化的方案,可以有效减少这种损失。
晚点团队:其实强化学习的效率得到了很大的提升。我们可以举一个更有意思的例子——强化学习中,我们经常认为在越大的模型和越长的序列下,采样的开销是越重的,采样可能会占到70%以上的时间。在采样的时候,带宽和显存读取的压力非常大,而量化其实对采样速度有很好的提升。这个方向做得非常具体。总之,我可以归纳为:这套训练时伪量化、采样时真实量化的方案,在DeepSeek的论文当中也有很强的体现。
作为业内同行,之前Kimi的KR其实也有用这套方案。我们团队的R1团队去年就啃了这块硬骨头,我们做了两个工作:一个叫做FP8的全流程强化学习,就是训练的时候用FP8,推理的时候也用FP8;还有一个是Int4的QAT。Int4和FP4其实不太一样,但可以想到,这也是一些比较激进的压缩方案。基本上这个行业里面大家还是趟过同一条河的,这是难得可贵的。
实事求是地讲,在开源领域,我们团队的量化RL做得还是很靠前的,不过我们……
主持人:其实相比 DeepSeek,还是有一些差距。我们的 Int4 量化感知训练,在采样上还是做的 W4A16,就是说权重是 4 位,但激活值是 16 位。然后 DeepSeek 做到了更极限的 W4A4,所谓的权重是 4 位,但激活值是 8 位。在极致性能上面,他们当然走得更远,这也会是我们要继续攻坚的方向。
主持人:我有一个问题是,如果 DeepSeek 自己把推理框架给开源了,它和别的开源推理框架的关系是什么?
晚点团队:OK,这其实是一个关于开源推理框架的问题。我觉得开源推理框架的一个重点是,重口要调——比如说,我们同样一套框架,可能要支持 DeepSeek 的模型,可能有 MiniMax 的模型、Kimi 的模型,我们要在这么多模型中间都支持上。这种整合性是非常非常重要的,这可能是开源推理引擎和 DeepSeek 自己的推理引擎的重大区别。
主持人:那这样来说,作为一个开源框架,它最终给开发者,或者说给用户的价值是什么?
晚点团队:我觉得最大的价值就是——
晚点团队:本地部署的推理引擎,对于很多公司是有直接需求的。开源推理引擎的性能提升,也会反过来铺垫闭源的推理引擎。训练上其实也是一样的,开源很多时候未必能做得比闭源领先。我觉得推理上面,闭源和开源其实差距并不大,但是训练上面,开源还是要领先不少的。
我觉得开源有个很大的意义,也是通过开源的方式让整个领域变得更加透明。我可以再分享一下,很长一段时间,闭源的训练引擎是比开源的训练强大很多的。然后以前 RL 也是一个负担非常非常重的事情,比如说一个模型可能二月份上线,可能到了五六月份才会有开源的 RL 框架能够把它的 RL 跑起来。
这点上来说我也比较欣喜,其实也做到了在发布当天就支持 RL 的全流程。逻辑上来说,RL 和推理是很相关的,推理是做不带参数回传的 forward,我们做的就是采样,采样完了再做参数回传。我还是觉得非常高兴,能够在如此巨大的 MoE 模型上面同时做好推理、同时做好 RL。然后我们在 FP8 的移植性上也做到了极致,我也可以预见,FP8 已经像是正式走出了硬件厂商的 PPT,在开源语言模型世界里面真正跑了起来。
主持人:超级模型的工业标准。那像FP8的,目前来说,是不是在这么大的模型上,GoodBC可用了?就开源的可以看到技术细节的模型里面,其实这个,那个GPT也是。但是大家的技术选择不管是否一致,只能说FP8是一个全世界一起努力的方向。但至于说闭源模型是怎样的,外界就不太清楚了。
晚点团队:另外一个用FP8,是因为黄仁勋想推这个吧,对,他们推动的方向之一,然后Blackwell卡也是支持FP8的。
主持人:对。然后前面就是讲了这四个新的东西嘛。然后在这个报告的最后一部分,其实他们自己是讲了训练的过程,包括预训练的过程,包括后训练和测评。这个部分,觉得比较有意思的亮点吗?
晚点团队:一个比较有亮点的,就是它的Pipeline Training里面,相当于是先分裂专家,然后最后再进行那个Unpooled Distillation。在最近一段时间,Unpooled Distillation又开始被大家研究,但是具体怎么做,其实各家还是有很大区别的。DeepSeek的做法,在DeepSeek V3和R1上,它其实有一点实践,就是把强的模型,比如像R1蒸馏出来的小模型上。但V4的蒸馏呢,就相当于是它先训练一些小的专家,然后把这些小的专家的……
晚点团队:学习了技能之后,给它增大起来,就是结合它的参数量,就相当于是在训练过程中,专家越多,它容量越大。但是那个专家越多,它的显存,就是它的参数量,要求也比较大。我们先让这些专家先学好,然后再把这些专家的一些精华给它提炼出来,能够显著地提高最终模型的能力。
这个义峰其实讲了一个很有意思的点,就是他们做的这个叫多专家训练,本质上这是要解决一个所谓的多目标优化问题。可以想象,同时优化的目标的个数越多,是智力上限的体现。一个模型能够同时操控的系统,它的参数越大,证明它的能力越强。
刚才义峰讲,这个联合训练就像是在一个多目标的优化里面找一个最优点。但是实际的工程里面,这个最优点是很难同时找到的,因为这个梯度的走向很复杂,冲突很严重。所以说,像刚才义峰提到的,如果你一味地去 push coding 的能力,可能你的数学就不好了;你把数学修好了,你可能对指令的遵循就变差了。所以现在的做法其实是所谓的先分裂再蒸馏,就是在各个目标上都去找局部的最优解,然后我们再让一个统一的学生模型去同时学习多个目标。
晚点团队:教室模型的数据分布,有点像是我们在高中的时候,数学实验课讲过一个叫差值的东西。我们把一个在复杂的 loss surface 上面的联合优化问题,换成一个在已经收敛的基础上做的事情,这在工程上听上去是一个更稳定、可控的事情。
先前来说,这个在业界我们也有过很多类似的尝试。早年领先的某开源模型也有过所谓的专家聚合阶段,但他们的公开细节比较少。Qwen 的话,你一直都是开源领域的原神,Qwen 就说过他们有这个专家聚合阶段,叫做模型 spawn 这种技术。我觉得大概是从有 GPT-2 的时候就有人在做这些事情。硅谷这边的话,前年的 Mistral 模型,我认为大规模也会有相同的思路,但是因为商业原因,大量的披露非常有限。开源这个生态,是这一波中国实验室给整个 AI 领域的实质贡献。
测评的部分其实我们前面聊过了,你们有什么还有补充的吗?
晚点团队:我本科毕业的时候,有位非常知名的研究者说过一件事,他觉得我们不能去优化我们不能评测的东西。如果我们不能给我们想要优化的目标一个分数……
晚点团队:我们根本就不知道我们的优化对不对。We cannot optimize what we cannot evaluate。所以,经常大家会讲一个词叫 benchmark,也会讲个词叫 evaluation。我其实觉得,我们最好把这东西叫做 evaluation,而不是 benchmark。因为 benchmark 指的是一个个具体的任务,但是 benchmark 经常会过时的,可能一个 benchmark 发布一年两年,它就 saturated 了,所以大家都说它是一个 fishing problem。但是 evaluation 这个事情永远都是存在的,而且它一直都是一个非常重要的事情。
我最近也有一个很大的感觉,就是 evaluation 越来越难做,因为我们的场景越来越复杂。这个具体的意思是,经常 Claude Code 更新了之后,就会有人批评说这个版本怎么更新,然后某某方面变差了。我是非常好奇,对于 Claude Code 这样的工具,大家是怎么去评估一个 feature 要不要更新的。
举个例子,就是我们作为这个行业,大家就有万千种想法,然后每一个算法听着都有那么一些道理。但是从资源上来讲,你是不可能把所有的想法都做了,然后说这个东西就变好了。对,你加的东西越多,可能这个东西就越变差,有个词叫做 less is more。你这个东西加进去,真的有没有变好?所以 evaluation 就是做这个量化,尽量地避开凭感觉走,否则……
晚点团队:所以 take away 就是,我觉得这一版 DeepSeek 的 benchmark 评测,一如既往做得很扎实。而且我从来坚定地认为,我们要做好 evaluation,而且 evaluation 只能做得越来越好才行。否则我们这个行业会变成一种——就像早些年修炼气功的感觉,非常荒诞。因为从科学教育的角度来讲,这个东西有没有客观的标准?那些奇怪的功法,真的能够给社会带来正向的价值,还是说只是挑出几个例子说"这个人的病好了"?对,我现在就是觉得,不做好 evaluation,我们这个行业就会陷入这种自欺欺人的恶性循环。
从这点上来看,DeepSeek 这次 evaluation 的鲁棒性,在 V4 的报告里面有所提到,而且我觉得这也是 V4 能不能进入第一梯队的真正问题所在。
所以 overall take away 就是:benchmarking 会过时,任何一个 benchmark 都有被刷满的那一天,所以 evaluation 一直需要保持一种公正的追求,否则我们这个行业是没法推动整个领域积极向上发展的。对,我觉得这件事确实越来越难了,包括最近更新之后……
主持人:很多人认为还是要用4.6。确实,现在有个词叫做vibe checking,或者叫vibe benchmarking,就是说我已经感觉不出来模型的好坏了,我只能根据我有限期的对话说,哎,以前这个任务4.5能做,为什么你4.7就做不好。我们已经进入了benchmark的可信危机——这模型乍一看,benchmark全都是90多分,但是实际差异大家都说很大。所以说,一锋,你有什么要补充的吗?
晚点团队:我觉得benchmark就相当于在某一个具体任务上得到一个能力,但是我认为更重要的还是去发现和提出新的能力。比如说agentic的能力,比如像长上下文注意力的能力,demand比具体某个benchmark的重要程度更高。因为一旦你提出这个benchmark的话,我觉得刷满也就是半年到一年的时间,在这方面应该也没有提出什么新的领域能力,对吧,这个是没有提的。
主持人:是的。所以说我觉得还是不是那么特别……念正经的一点之一吗?我觉得一个非常有意思的点是,我们发现这几代模型它居然没有做degradation,就是先前做好过的任务,它再也没有退步过。今年上半年其实还是很值得关注的。当然我觉得一方面的,另一个代价……
主持人:就是到了一种理论发掘的地步。OK,我想起来,讲benchmark里面,他们提到那个多轮的工具调用,还有这个多轮人格一致性。我们去年,就是DeepSeek V3发的时候,当时我自己有篇paper,我们当时也是去年年底,前几天,应该也在巴西开会,但我没有去。这篇paper也是讲这个——评估一个语言模型,在GitHub上面去面对挑剔的reviewer,去提一个PR,然后把它merge,这个能力。这个其实相对于以前,就是什么打数学竞赛,还有这个解决比如说修一个单个issue,上SWE-bench这种修单个issue,还是区别很大的。这个可能跟现在的Cursor、Claude这种idea很像——比如说你让它去完成一个工程,你要交付了之后,你得希望把它merge进去,对吧,然后在merge之前你还得和你的reviewer做很多来回battle。所以我感受中就是,至少我自己,这些年今年这个benchmark它已经被刷满了,无所谓,至少首先这个ICML,我们拿到很好的分数,也cite了这篇paper。然后另一个方面,我是非常欣喜地看到,这几年这个能力就能被刷满,那我们明年是不是可以期待更劲爆的东西。OK,最近我自己比较关注的benchmark叫做CloudBench,就是这个名字,就是open cloud这个……
主持人:它就是评估在这种开放云(open cloud)应用场景下面,用户的满意度都是什么样子。比较希望到了明年,这种类似的benchmark——个人非严肃编程助手的benchmark——也能被发布出来。那我们肯定会有新的挑战,全新的应用人群能到来。
主持人:对,接下来正好我们可以讨论一下,就是行业正在发生的一些更广泛的变化。因为最近的模型更新还是非常密集的,从三月底到现在,包括前面提到的 Gemini 2.5、Gemini 5.1,你们觉得这些所有的模型里面,可以总结出大家有哪些在努力的共性方向?
晚点团队:我觉得的话,就开源模型来说,它的方法和 architecture 实际上还是在某种程度上趋同的。就是它的基座,也就是 MHA,但是它会对一些其他的 architecture 的 feature 有所借鉴。基座基本上就是这样。然后之前的话,可能就是 AdamW,甚至还会有一些其他的 msgrad 这些优化器,但现在大家都陆续转向 Muon 优化器,或者说在 Muon 优化器技术上去进行微调。
晚点团队:Agent的能力,我觉得这一波,不管是开源模型,转化可能的方向,都是给这些Agent去提供token,从而真正能够实现一个引力,而不是仅仅靠之前的会员服务引力。这其实是一个很有意思的商业问题,就是你说要把它做成一个订阅制,还是要做成一个token by token的计费方式。我现在其实心里是vote for订阅制,我觉得订阅制是一个更好的商业模式,然后你完全可以,实际上大部分用户不会用到订阅的顶格,所以做订阅制其实反而是一件更赚钱的事情。
晚点团队:对,当然现在很多公司要抛弃订阅制,转向按token计费,可能订阅制也扛不住——如果订阅价格定高了,没有用户愿意订;订阅价格定低了,公司其实是亏的。这是一个普遍的商业问题,我不觉得现在哪家公司给出了一个很好的结论。就是我觉得Claude Code这么成功,但作为商业产品究竟盈利如何,我们且看。如果它今年底要IPO的话,那你应该能看到财务数据。现在很多做视频生成的产品,就是偏AIGC应用的这些产品……
晚点团队:比较类似于陈阳说的两种结合。如果你用完买这个额度之后,你就要额外再买,然后影视从业者因为他们有刚需去用这个东西,视频生成类的产品的客单价还真的挺高的,比我想象中高很多。我其实在商业上面非常喜欢他们视频这样的一个生态。但是坏消息是,视频生成模型开源的和闭源的差距确实很大。因为我发现好像没有什么人愿意开源视频生成模型,有可能这正好说明了它还真的挺赚钱的。就到目前为止,已经开源的然后大家认为比较先进的一个,应该也是——称问,呃,是阿里那边开源的,就是通义万象。
嗯,是的。我最近做这个语音模型也做得比较多,就是我们做这个语音生成的模型嘛。可以想象,就比如说现在开源的语音生成模型,相比Gemini、相比OpenAI GPT-4o那个时代的模型,还是有不少差距的。我的一个结论就是,视频模型它的用户需求特别大,相比语音模型来说,所以视频模型可能更倾向于……
主持人:我的感觉就是,关注度和舆论全部被 coding、被通用的这种 agent 吸引走了,因为这方面的竞争非常焦灼,而且都是最大的公司在竞争。但另一方面,视频确实可能是一个跟创业友好的、在一个相对独立的空间里存在的方向,这是相同的部分。那你们观察到各家的差异是什么呢?包括中美之间会有什么这种分化的趋势吗?
晚点团队:首先我们可以讨论一下国内比较有代表性的这几家开源模型。我觉得开源里面 DeepSeek 和 Kimi 的取向比较接近,他们做的工程和创新性比较极限,大的 MoE、低的激活、长上下文,还有一些 aggressive cost 优化。然后千问,还有 MiniMax,我觉得在 RL 训练端以及长上下文落地方面都有非常扎实的积累,大家的发力点不太一样。Person to person,我觉得这几家公司的人都非常有希望。所以这里可能漏掉了小米,当然小米大家可以看到,昨天这个模型 V1.5 的 Pro 在 Arena 上面的分数也是比 V4 要高的。现在竞争非常激烈,看到这种百花齐放的局面,我至少还是非常开心的。坏处就是这些开源的模型也给了我们——开源的推理引擎也有很多工作量,就是我们的工作量很大。
主持人:你为什么没有提到……
晚点团队:关于月之暗面(Kimi)的话,在多模态上面其实他们发力是很早的。我觉得现在多模态是一个发力的状态,所以就像刚才易峰也提到了,多模态要不要做原生多模态,这些事情是非常值得研究的。然后关于混元的话,我和易峰的学长,他回去看了混元长帅发的,可能是300B的那个模型。当然现在肯定不是在一个万亿参数以上这个模型的牌桌上面,但是在300B这个规模,我觉得做的也非常扎实。现在是3.0的preview,如果走到3.0,他可能上了桌,他可能又进了微信端,那这个格局会很有意思。我觉得也不久之后应该就会看到。
美国模型总体来说更多追求开辟一个新的领域,比如像多模态融合,就是谷歌团队提出的,然后包括像Agent能力,它的性能跨时代的提高,就像最近很火的那个Gemini 1.5/2,比之前的模型有跨时代的提高。还有一点就是中国模型更加注重性价比,美国模型大家都知道非常贵,而中国模型是在同样的能力下,收费比美国模型小一个数量级。我觉得这跟中国充足的技术人员储备有很大关系。
主持人:倩阳,你有什么要补充的吗?比如你观察到的中美模型进化的这种差别。
晚点团队:我在美国的话,我之前在Amazon的AI Lab工作,我也和一些团队在做Long Horizon Agent,只有一个词——精叹。包括OpenAI,包括这个Claude Code,这两个产品,我心里是非常admired的。Claude这一代模型,就从4.5之后,在多模态agentic coding上面的表现,相比于先前真的进步了非常非常多,可以想象这个RLHF,或者RLEF……
晚点团队:这一套我们先前 alignment 的方法论,算了几年积累之后,加上高质量人类反馈数据,已经在美国这边形成优势。中国团队这边的话,我觉得强项是架构创新的密度,还有令人咋舌的工程完成度。DeepSeek V4 一个报告里面,一口气把混合吸收注意力、MLA、MoE、FP4、Multi-Token Prediction 这么多东西全部都换掉并且跑通,这种决心和执行力是相当罕见的。
晚点团队:我觉得这个中美的路径风格上有所不同,但整个行业还是在螺旋上升的。美国的模型没有做得那么极致效率,就大家没有在追求这个——你觉得这不是个选择的问题,是实现的问题?
晚点团队:对,而且美国这边算力比较多嘛。它不需要这么极致效率,因为极致效率会牺牲一定上限。大家的选择是:我就去冲性能,反正我这么贵也有人买,我就先做到那些之前模型可能做不到的事,然后再想降成本的问题。
晚点团队:是的,因为理论上你性能能冲上去之后,降成本这个事我觉得会相对确定一点,当然你也需要更多资源支撑。这里面有一定的路径依赖。就是可能很多人批评说中美现在是在搞太空竞赛,我觉得很遗憾的是,只有中美能搞这场太空竞赛,没有任何其他国家能够玩得起这一波军备竞赛。
晚点团队:你们觉得,再过一两年来看的话,DeepSeek V4 最可能被记住的是什么成果,或者说是它的——
主持人:什么思路和想法?可能为数不多能被记住的,是 token-wise 的这种极致压缩。从算法上面来说,因为之前大家在 KV cache 上,更多是做单个 token 里面的降维之类的,比方说 MLA 就是先降维再升维,都是涉及单个 token 的这种压缩。然后 token-wise 的压缩的话,应该是 DeepSeek 首先被应用到这种工业级别的模型上。然后其他的话,就是算法上面没有什么特别让我非常惊艳的地方。
晚点团队:我和一方的观点是大体类似,就是长上下文、极致低激活比例,然后还有低单 token 推理成本,这个组合,无论是 architecture-wise 还是 infra-wise,可能都是 DeepSeek 留下的持久遗产。然后具体的某一个技术,比如说 MHA 或者很多注意力机制,会不会按照现在的形式被沿用下去,可能都像 MLA 一样,那是可能那个阶段的最优解,但是可能过了之后,它可能会被更优的方案替代。当然硬件肯定会反过来推动这些替代。我觉得 DeepSeek V4 率先验证的这种整体配方,还是会成为后世许多开源大模型的默认选项。在这个意义上面,DeepSeek 一直是开源领域无形的参考级别。
主持人:然后最后一个问题,就是想问一下两位接下来的一些行动,就比如说你们选择的一些研究方向,然后或者是……
晚点团队:已经创业了嘛,你肯定有很多拒绝去干的事,有哪些可能是因为,比如说 DeepSeek V4,又或者是其他最近发的这些模型,会有一些影响和改变呢?
晚点团队:对我来说的话,因为我现在也没在公司实习,如果说有机会去公司实习,我可能会比较想做 CSA、HSA 这种 token-wise 的压缩、这种长文本。但在实验室里面的话,长文本是很难实验的,倾向于去进一步研究 hyper-connection 相关的研究,包括像 Kimi 的 attention recital 这种。就像那样,我感觉这又是另一步,就是说之前是从 ResNet 到 DenseNet 这样一步,我觉得对于 Transformer 来说,它可能也会有一个相同的这样一个趋势,就是提高层与层之间的信息流动。然后就是说,DeepSeek V4 它采用的是不同的操弹数,那么没有问它自己还能不能去进一步改进,或者说没有问它的操弹数如何去设定,到底是 Kadir Jordon 提出的五步运动的数字更好,还是 DeepSeek V4
晚点团队:采用的十步运动的数字更好,这个还是非常值得去进一步探索。就算我刚才提到的,我们有一个——我在大概去年这个时候的一个工作,讲那个多轮的 agent 去给 GitHub 提交 PR 这个事情。这算是我之前的一个 research 方向,就是研究这种 coding 下面的这种真实、长期上的 coding 表现嘛。我可能最近不需要做一个 research,但是我稍微用起来,因为现在我自己维护开源的工具,那我有没有什么 go-to standard 能够迁移到我自己的工作里面来——我看到什么 PR 我知道这玩意靠谱,我看到什么 PR 适当地就把它避掉,这个是我需要去研究的,从研究里面提炼出来,拿到我的工作里面来。
然后还有一点是,我最近做语音模型做得比较多,我觉得语音模型上面其实它的工程优化相比语言模型差了非常多,然后包括很多事情其实可以在语音模型上面重现一次,我觉得都是可行的。还是做到了很优秀的 PD 分离,还有 MTP,这些工作——我会认为 PD 分离可能未必要在语音模型上实现,但是 MTP 对语音还是挺关键的。就像是现在可能你打开手机跟豆包对话,你会觉得豆包吐出第一个语音的……
晚点团队:速度还是很快的。很遗憾,在开源方面,我们做的没有这么优秀,所以我觉得这里还是有很大的 gap,我们可以去努力的。
OK,那今天晚点分享了你们在看到 DeepSeek V4 发布之后,包括最近这么密集的这么多模型更新之后,观察到的一些变化。尤其是我们非常详细地展开了 DeepSeek 这一次一下子推出来的四个新东西,然后在 1.6T 这么大的模型上都实现了。就包括它新的注意力机制,这个改变了 V2 到 V3 的 MLA 主流的做法,而现在 Kimi 和 GPT 的模型还是用的 MLA 的架构。然后第二个就是 MoE 的优化,而且 DeepSeek 也在之前比较主流的版本上做了一些改进。然后第三个是 MuP,这是 DeepSeek 提出来的一个让训练更稳定的方法。然后最后是在 Infra 层面的 DualPipe,还有 FP4 的使用。那今天的节目就到这里,各位拜拜。
(本段为片尾套话,已按规则删除,无有效对话内容输出。)