E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
【主持人】大家好,欢迎回到硅谷101,我是泓君。硅谷前沿AI实验室的商业模式大家应该都不陌生,把智能封装成API,再按Token出售给用户。但现在,多家中国实验室正在用开放权重模型挑战这套模式。7月27日,月之暗面正式发布了Kimi K3的完整模型权重。在此之前,K3的横空出世以及它在多项测试上展现出的竞争力,都已经说明了一件事:开源模型正在逼近甚至超过最强的闭源模型。这意味着企业未来可能都不再需要完全依赖OpenAI或者Anthropic,也可以部署定制和掌控自己的模型。K3的发布也在硅谷引发了一场更大的讨论。过去几周,包括英伟达在内的数十家科技公司和机构签署公开声明,呼吁美国支持开放权重模型和更开放的AI生态。但与此同时,也有批评者提出质疑:能力如此强大的模型是否应该开放?它会不会带来新的安全风险?中国模型的快速进步又在多大程度上涉及蒸馏?所以在这期播客里面,我们邀请到了两位身处这场变化中心的嘉宾:前Hugging Face亚太开源生态负责人王铁镇,以及Tinyfish联合创始人Kai Yan。我们一起讨论了中国开放模型为什么能在这么短的时间里逼近前沿,最近争议很大的蒸馏到底是什么,又能解释多少模型能力呢?当开放模型持续压低Token价格,它将如何冲击闭源实验室的商业模式,又会怎样改变整个Agent应用的生态?那其实我们录制这期节目的时间是北京时间7月28日的上午,昨天月之暗面发布了Kimi K3的完整模型权重。其实K3从7月16号API上线以来,在硅谷的热度可以说是居高不下,而且也成为了硅谷最近讨论开源模型的时候最重要的案例之一。那我想先请两位从你们的观察来回答一下这个比较大的问题吧,你们觉得K3真正让硅谷感到意外的是什么?要不先从Kai开始,因为你们公司是Base在硅谷的。
【嘉宾】其实如果我们稍微take a tiny step back,整个这个时间轴其实有几个部分的。最早的当然是从DeepSeek那个时候开始,但接下来呢,最近的两个我认为应该还是回到了GLM,就是Zhipu AI他们的这样的一个发布会下。过去的几个月里,整个AI对硅谷带来的影响变化是极其大也极其快的。在年初的时候,那个时候所有人在讨论的问题就说我们要赶快用AI,但是很快呢,当时是Uber包括其他几个公司,大家就开始晒了账单,所以账单已经没有办法再支撑了,就是一个月花了一年的预算等等。在这样的一个环境背景下,Zhipu AI以及中国的这些模型开始引起了新的讨论,包括当时的Cursor来用了中国模型等等的这些事情。因为K3作为一个open source的一个model,它的能力其实达到了一个在很多人看来很新的一个高度。那在一个cost、sovereignty等等讨论情况下,这样的一个新的群体的开源模型到底会走到什么一个程度,以及它对所有的闭源模型会带来一个什么样的冲击?它已经超出了说是一个讨论,而是更多大家在看在使用的情况下,具体应该怎么样地做调整。
【主持人】对,铁镇有什么要补充的吗?
【嘉宾】对,我特别同意Kai的说法。我觉得K3的发布并不是一蹴而就,它实际上是有一个漫长的铺垫的过程。从去年年初的DeepSeek V1那个时候第一次带火了开源版的MoE架构,让大家知道推演模型是怎么做的,那个时候就非常有意思。因为我记得当时纳斯达克跌得也很厉害,那个时候大家就在想,中国模型、开源模型已经非常接近闭源的检验模型。不管是从硬件生态、整个AI的估值体系,还有模型公司的生态,大家都有一个反思。结果我发现过了一年,大家发现是一个狼来了的故事。因为过去一年的开源和闭源模型的性能的分化实际上是非常大的。闭源模型可能能做到月更,开源模型可能是季更。在性能上不管是Opus 4.6、Opus 4.7、Opus 4.8,其实都是远远领先于开源模型。但是最近几个月发生了一些变化,包括Kai刚才说的GLM 4.5.2,我也是重度在使用,我已经用GLM 4.5.2往前取代了Opus 4.8的一些功能。但是大家觉得可能还好,因为美国模型又出下一代了,只要闭源模型领先于开源模型,超过一个时代,那没有太多可以担心的,大家还是要用最好的闭源模型。所以这是一个时间点,然后大家就在说,OK,GLM 4.5.2挺好的,但是我们不担心。直到过了一段时间,大家发现K3出来了,K3不是说跟Opus拼击的一个问题,但是基本上已经追上Frontier,甚至在某些场景上要比Frontier做得还好。那闭源模型瞬间就发现自己没有一个护城河。因为开源模型跟自己又是回到DeepSeek V1的那个时代,跟自己又是平齐的一个时候,所以大家又很panic,然后又很担心说,那我们整个AI估值的泡沫怎么办?然后我们整个场景是不是还可以按照过去的模式继续运转下去?大家还是要用闭源模型。
【嘉宾】也有可能为了我们要完全转向一个急于开源模型的生态,所以美国内部就会有很多讨论。那他们关注的点实际上有两个,第一个是GPT-4在讲自己非常不安全,所以我们要限制这个GPT-4模型的,实际上更多是之前的Mistral。如果有一个开源模型,它的能力已经接近GPT-4,是不是它也是不安全,然后你又把这么一个不安全的模型给开源出来,那你冒着什么心态?然后另外一个话题就是说,美国人就会在想说,你为什么能够在这么短时间内,好像就在这几个月连续取得这么多的突破,你一定是在蒸馏我的模型。GPT-4和Kimi K2实际用户能用上的发布,中间间隔大概15天左右,这也是一个非常有意
思的话题,就是Kimi K2到底有没有在蒸馏GPT-4。我个人倾向于是没有的,因为你十多天连模型发布的准备都来不及,何谈说收集到足够多的语料,然后并且蒸馏GPT-4。所以Kimi K2这个时候发布,像DeepSeek V1当年一样,有这非常非常多的话题,然后大家也对Kimi这个公司非常有兴趣,包括杨植麟之前的一些观点非常有兴趣,所以我这些加强就是Kimi K2之所以这次在硅谷取得这么大关注的一个原因。当然很快后面中国模型像MiniMax,像通义千问都要发20B到30B的这个模型,甚至智谱可能也会有一些动作,所以后面我们可能会看到更多除了Kimi K2之外其他中国模型在硅谷引起的非常多的拷问,所以我们就拭目以待,这个行业是变化非常快,然后也非常非常有意思。
【主持人】对,我觉得你提到两个非常关键的问题,就是我们这一期节目也想深入探讨:第一个就是一个能力如此强大的模型,它去开源到底安不安全;第二个就是关于蒸馏的指控的这样一些问题。因为你们都提到了硅谷对于中国开源这件事情,整个时间线上的一个变化,然后对此的态度一个变化,我想再梳理一下这个时间线。所以说在GLM之前,硅谷对于部署中国开源模型的态度是怎么样?就是从企业的角度来说,有没有因为成本的考虑,在某一个时刻选择我就从这个Anthropic的模型换成中国开源的模型,这个大概是在一个什么时间点发生的?
【嘉宾】这肯定要分行业嘛,比如说有些行业,它就是一个非常敏感的行业,那就by nature,它不可以使用其他国家模型的,从美国来说,当然这个东西也适用在其他一些地方,比如说欧洲的一些国家,包括日本等等的地方。但除此之外,AI的变化是极其快,其实很多时候大家第一个反应应该是在讨论说我们怎么样来使用模型,其实很多的时候应该考虑的是我怎么样用到最好的模型。Cost的这个问题,只有在上着一盒大量级之后才会变成一个更显出的问题。就算从硅谷来说,成了一个大规模上量级的使用,是因为Coding整个这一块所带来的一个巨大的变化嘛。Coding之前,其实大家大多数的一个消费场景是RAG,但其实这个RAG的对Token的消耗量往往无法跟相当于Coding一开放之后所生产力所带来的改变。所以大家最大的一个调整是Coding之后,其实是从去年大概九月份之前,然后把Anthropic开始比较大规
模的推动之后才开始的。那在六个月时间里,Coding从一个大家赶快去需要,到突然意识到说我花了太多钱了,那就包括从我们这样一个公司来说,才五十多个人,一个月其实整个消费也是大概是六万左右的美金,那其实是一个很高很高的Cost,不要提那种更大的公司,更大的企业最后会面临很多挑战的。而这种转向几乎就是在一个月之内发生的,而智谱当时的推动,因为不是开源,它虽然没有改变事情本身,但它从价格上当时对很多人来说说,原来模型可以这么便宜又这么好,其实很多就开始更多的去看,有时候通义千问等等的这种一个开源模型所带来的进展了。而这回Kimi的话,相当于在大家这样一个焦虑的时间点上,更高地推动了一步。
【嘉宾】其实都在很短的时间里发生的。但整个AI行业有点像是天上一日人间一年这样的一种感觉,进展得非常快。对。所以其实K3相当于是再次加深了大家的这个印象,就是现在的开源模型的能力已经可以做到和闭源模型能力一样强了。所以在这种情况之下,企业才会去做这样一个成本的判断。就像你刚刚说的,今年的前几个月,大家主要是在Token Maximizing,去最大化这个Token的使用量。现在可能是一个Token Optimization,优化的状态。对。
【主持人】其实这个东西我倒感觉不是说是开源模型就跟闭源的达到一样强。第一点是整个成本,另外一个主要的问题就是所有权。如果模型一切都是取决于对方是否开放了,这就是Fable今天早一点,Anthropic的这个事情,其实对大家印象很大的,说突然有一天美国商务部说这个不可以用了,那就一夜之间这都不可以用了。那之前你做的部署,之前什么时候可能都没有了,那这种情况怎么办?很多时候大家就会发现说那我可能不需要用最好的模型。前一段埃森哲做了一个内部的调研,埃森哲作为世界上最大的咨询公司之一,他们又是专门做AI相关的,其实他们的员工使用模型做的最多的事就是生成PDF,那这个东西其实你不需要用最新模型去做的。
【嘉宾】对,成本上我是这样想的。为什么开源模型的推理成本一般会比闭源模型要便宜,还有几个结构性的原因。第一个,如果你看闭源模型成本拆开看的话,那它一部分是实际买硬件去做推理的固定的成本,另一部分是说它要为这个模型付一个premium,因为你这是一个闭源的这个模型,他卖API的时候肯定是带了闭源模型本身的一个成本。但如果我们去看开源模型推理的一个成本的结构体系,比如说Fireworks,比如说Together AI,其实只有一个硬件的成本和他自己为推理服务所赚的钱,他并没有为模型额外地付钱。这现在的情况未来可能会变化,所以从结构上来讲,它应该是会比闭源模型要低的。第二个也要看到,中国开源模型实际上一直都在卷一个东西叫scaling efficiency。在你去做scaling的时候是不是能够同时把成本降下来。那K3的那个报告里面有一个图,那它横轴是说你的flops,然后纵轴是说达到同样的模型的能力,比如说用这个模型训练的时候这个loss来衡量,还有两个曲线,然后一个是K3,一个是K2。我们看到说,虽然K3比K2大了一倍甚至还多,但是实际上它的scaling efficiency也是扩大了2.5倍。也就是说K3通过一个模型架构上的演进,达到了模型更大且模型更efficient的这么一个效果。那这个也是导致成本能够快速降低的一个原因。这里面起到作用最大的可能就是它用的KDA和其他的一些优化的技术这一方面,比如说KDA或者是2WKV,或者是其他的一些linear attention技术,是国内每家厂都在研究的。但是我们很少看到海外的闭源厂比如说2WKV或者TRIPT去讲说它用了什么样的支撑技术。其实linear attention整个这个领域目前最火的、能让大模型更便宜的技术的这个领域,主要都是由华人的research主导。所以这个是可能开源模型另一个方面的优势,因为它出生在一个算力受限的国家,所以它天然第一天就很关注这个模型训练和推理的时候是不是都可以变得非常高效,这也就导致说为什么开源模型的成本会低。第三个原因就是说,国内的开源模型实际上现在没有足够的算力去scale到那么大的一个规模。网上有传言说Fable这个模型可能它的本体有8到10T那么大,但是K3的话它实际上只有3T不到。也就是说3T的模型。
【嘉宾】可以跟10T左右的模型达到同样的效果。单看这个尺寸的话,其实我们也能想象,推理成本身也是有一个巨大的差别的。开源模型可以以更小的模型做出更多的事情,所以它会比闭源模型更便宜。我觉得这个特别有意思。因为其实我本来有一个关于算力的问题,因为从DeepSeek开始大家就是在说,中国的整个模型是算力受限导致创新倒逼的这样一个叙事。那现在听起来其实Kimi的思路也还是一样的。但是虽然这个模型结构的演进会带来很多的方便,但是在工程适配上确实带来了很多的挑战,这需要很多额外的工作,才能够把零到一上的这个极限实际在工程上做出来。所以还是要给中国优秀的工程师和专家们打卡。
【主持人】是的,既然我们聊到了Kimi的能力还有训练这个方面,我们就来解决一下蒸馏这个争议吧。因为你们之前都提到了Anthropic对于包括月之暗面在内的三家公司,DeepSeek、月之暗面和MiniMax,三家公司在今年2月提出的蒸馏的指控。包括最近Kimi把K2放出来之后,其实美国的政府也有所介入,提出了针对中国开源模型是否要限制的这样的一系列问题,并且在讨论相应的政策。这个网络上也有很多的讨论。我觉得咱们先做一个科普吧,就是蒸馏到底指的是什么?因为我觉得其实Anthropic它说的蒸馏和我们在说AI训练当中蒸馏的这个过程,其实之间还是有一些细微的区分的。田政耀表先帮我们解释一下。
【嘉宾】对,蒸馏实际上是一个现在被用烂的一个词,然后很多不同层面的蒸馏的这个词语都混在一起。从纯技术的角度,蒸馏是一个非常中性的词。蒸馏就是说我现在有一个大的模型,然后我现在另外有一个小的模型,我怎么样让这个小的模型学会大的模型的一个能力。它可能有很多种方法,最传统的话,就是说我们看一下大的模型推理之后,它输出的这个logits。就正常我们用比如说闭源模型,你是看不到这个logits。它logits就是说每一个位置上每一个token它的输出的一个概率,然后让小模型去学这个概率的分布。比如说你用闭源模型,你能拿到的就是它最后sample,就是它采样出来的哪一个词,你是没有办法反推回来它的分布的。所以用经典的我们聊的蒸馏的这个技术的词汇,你是没有办法做到比如说我们拿一个开源模型,然后让它去学会GPT的这种事情。所以本身我们说这个蒸馏实际上是中性用的。现在大家谈的蒸馏更多的是说,利用闭源模型生成出的文本来学习,然后让这个开源模型拥有闭源模型的一个能力。那这个事情其实就非常controversial,就是说起来就非常有意思。闭源模型可以拿所有人类的数据去学习,然后学完的东西在被闭源模型输出之后,不能被别人用来做下一个模型,这不是很可笑吗?相当于是闭源模型练了一个宝典,然后他就把所有的语料都扔掉,不告诉你说他是在哪学的,也不给你讲说他学到的这个东西是什么,不允许开源模型拿他的这个输出去训练。或者换一个例子,有人读了一本书,然后他拿这个书的内容去写了一些自己的创作,跟所有别的人说你不能读我写的这个东西。实际上就是一个非常非常有意思的点,就是版权法是不是能保护闭源模型的输出,不能够被其他模型拿去做训练。那在这个点上开源模型实际上非常地开放。R1出来的时候,他直接说我们支持所有人去蒸馏我的开源的这个模型,我甚至官方推出了一些数据集和模型,然后让大家可以去蒸馏。蒸馏有很多好处,比如说大家实际需要的是非常小的一个,比如说3B的模型,那你可以把DeepSeek某一个方面的能力给蒸馏进去。而且DeepSeek是直接给你开放logits,所以你想要去做传统意义上的蒸馏,你是完全没有问题的。Kimi也是一样,就是他其实在license里面并没有明确的限制,说你不能把这个开源模型的输出用作提高其他的跟他竞争的这个模型。另外一个层面,抛开这个就有很多人说蒸馏是什么呢?当我用这个开源模型的时候,这个开源模型会自己说我是Claude。你问这个开源模型你是谁,你不要加这个system prompt,他就会说我是Anthropic。
【嘉宾】我是Tesh。BT然后很多人说你一定是在蒸馏这个闭源模型,实际上这是一个数据污染的问题。在Opus 4.7的时候,我记得如果你把system prompt拿掉,然后你用中文去问他说你是谁的时候,他会说自己是千问,其实也就是一个数据污染的问题。因为各种模型的输出已经在互联网上大量的存在了,所以这些模型在预训练的时候会学到各种不同的身份,导致它的意识有点错乱。那解决办法就是你在system prompt里面很明确的跟他说你是谁,也针对性的做一些微调和训练。但是这个问题肯定是没有办法完全得到解决的,总会有一些情况下这个模型会对自己是谁的认知有一个错误。我并不觉得说它是一个蒸馏的问题。说回来Kimi3有没有蒸馏了这个事情,那我为什么相信它并没有蒸馏,是因为蒸馏是一个训练的过程,它是你在训练的时候去学习另外一个模型的表现,你学的这个过程实际上是非常漫长的。就是一个经典的模型训练可能需要三个月,那它绝对不可能在比如说十多天就积累到足够多的语料然后去学习。
然后另外一点,为什么开源模型其实很难从闭源模型蒸馏,是因为闭源模型不给你暴露它的思维链。就闭源模型蒸馏开源模型是非常容易的,因为开源模型已经把所有的思维链全都暴露出来,所以闭源模型想要去追完全没有问题。但是开源模型如果它们真的在蒸馏,并且想蒸馏这个闭源模型的话,实际上是很难很难的,它又不给你暴露权重,又不给你暴露思维链,它只给你暴露最终的结果。如果说我们看到一个人做事情的结果,我们就能学会它内心怎么想的话,那我们两个互相学习也太容易了。包括我们再去向某些人学习的时候,我们需要打开它的内心,知道它内心是怎么想的,我们只看它的结果实际上是很难学会它的行为。所以闭源模型不暴露它的思维链,就导致闭源模型非常难被蒸馏,那我们也很难通过闭源模型来提高开源模型的一些能力。
【主持人】比如说我们从这些前线实验室,Anthropic和OpenAI的角度来看,它们对于蒸馏的担心,你觉得是出自什么样的证据也好,或者他们的经验也好呢,我们怎么样去理解他们最近的这些指控呢?
【嘉宾】我觉得抛出蒸馏这个概念的人其实不见得是技术圈的人。每个公司肯定都是有不同背景的人,那大家竞争或者是怎么样,它肯定是有一些方向和战略,不见得说是技术圈的一个蒸馏的指控。可能更多的是一个比如说商业目的,或者是给大家一些预先的植入,就说其实开源模型没有那么好了,它都是蒸馏闭源模型蒸出来的,或者是怎么样。你也很难抓到一个具体的事实去说你确实是在蒸馏。其实我觉得这些蒸馏这个名号,其实也做了很多很夸张的事情,比如说他们曾经把GitHub账号被质疑是在蒸馏数据的这个账号给关掉。那其实本质上就说明,他们实际上在看所有用户的数据,他们才知道他觉得谁在蒸馏。所以我觉得整个这个事情其实就有点像是所谓的这种国家安全自我强化的一个预言,那你总要有一个靶子,然后你就照着这个靶子去打,说不定能够指桑骂槐或者打兔子,然后找到一些什么东西。如果能出一些社会影响力当然好,如果出不了那也就这样,对吧?技术圈其实一直对大家的蒸馏的这个说法也有很多质疑,但是也就这样。蒸馏本身是一个中性词,但现在蒸馏已经变成了一个贬义词。但事实上蒸馏本身首先它是一个很标准的一个技术,所有的公司包括OpenAI、Google、Anthropic大家其实都在用大模型蒸馏各种小模型,这都是已经存在的。
第二个误解就是把模型能力完全归结于蒸馏,就模型只要是比较好了,它就全都是因为蒸馏,但事实上不是的。如果这么简单的话,那所有人就随便就训练出来一个模型了。那这里面它的强化学习、数据工程、架构的各种创新,包括最开始DeepSeek所做的很多东西,这是一个非常复杂的问题。蒸馏可以让你很快的去达到一个及格线,而像Kimi3它其实已经远远超过及格线了。
【嘉宾】因为蒸馏它能省的,一个是比如说是算力,第二个在数据标注上,其实可以省不少的一块东西的。当然还有时间,它的迭代什么各种周期也可以变得更快,以及很大的一个挑战就是对齐。但是从本质上,它无法实现超越或者是达到一个上限的。所以目前很多时候关于蒸馏的讨论,它其实会落在法律和商业的伦理层面,而不是一个技术层面的讨论了。因为几种情况被认为越界的话,它不是一个技术的越界,而是比如说它违反了模型的主条款。第二点可能就是规模化或者系统化的,用对方的API去提取大量的训练信号。第三个可能就是涉及到这个模型的权重,商业机密直接窃取了。关于Kimi是不是蒸馏吗,或者说中国的开源这些模型,大家是不是蒸馏这个情况吗?我认为就是因为这是一个非常抽象的概念,它又被简化为一个抄袭,所以其实好多的主张是混合到一起了,我们应该把它给拆开来看。第一个,有没有中国的一些实验室,可能是不是系统性的,没有经过授权,调用了比如说包括Claude在内的这类的frontier models,他们的API去提取训练信号?很多证据其实围绕在这里的,比如说账号的大规模的自动化请求、各种调用,这个是可以被检测系统所抓到的。但第二层的很多的一些指控,比如K3是靠蒸馏Llama 5拿到的什么的,这个是证据非常薄弱的。时间上来看,Llama 5的话,它是去月初吧,1号还有2号刚开始的,中间其实很短的。要在两周的时间把一个前沿模型换成另外一个训练数据整个跑,这个其实是极其困难的一个事情。第三点呢,蒸馏这件事情本身,让这些开源模型包括Kimi K3在内所做的成就吧,是不是就不make sense了?这个我认为是一个错误的观点。因为蒸馏就是一个比较久的一个技术,模型输出本身,它很多时候不受传统版权法保护。从这个角度的话,它其实还做了很多东西的,它本身的话还是实现了很多技术上包括各方面的一些推动和革命的。就算可能有一些这个lab再去蒸馏,其实开源模型的成功,实际上可能有10个理由,包括刚才我们说的模型架构,包括Infra上的一些工作,包括一些中文数据的一些工作等等,其实可能都是非常重要的点。如果说美国的这些前沿的这个lab,只关注蒸馏一点的话,其实它们有点只见树木不见森林,可能会完全忽略掉中国模型在其他方面的先进性。这是因为这是一道法律或者是商业上的一个伦理道德的很多东西,所以这个其实很难做出一个具体的说是不是这样的一个判断。但是我感觉目前所有的证据,应该倾向于指向的是可能会存在一些没有授权的大规模的数据抓取行为,但并不代表说能得到的结论说Kimi K3包括其他在内,他们的核心能力来自于蒸馏,尤其是蒸馏Llama。这两个是不同的事情。
【主持人】是的,我觉得这里两位都回答了两个核心问题,一个是到底有没有蒸馏,第二个是蒸馏够不够成这个模型的核心能力,我觉得是非常好的总结。其实我想再从Kimi K3的角度来看一下这件事情。其实铁镇你提到了Kimi K3的这样一个商业授权模式,我觉得也是这次技术报告放出之后特别有意思的一个点。Kimi它使用的是一个单独的Kimi K3 License,它规定的如果一家公司,它卖的是模型,并且公司以及它的关联方在连续12个月内的总收入超过2000万美元,或者说这个公司它在把K3和它的衍生模型用于商业服务之前,需要和月之暗面另外签署一个协议嘛。而且这个Model as a Service,就是对于这类模型公司的定义,不包括嵌入具体产品功能的中端应用,其他的就是内部使用、月之暗面官方产品和其他的合作伙伴也不包括在内嘛。
【主持人】这样一个商业授权协议,体现出了Kimi商业化上的一个什么样的趋势吧?然后以及我们之前有没有看到过这样的协议?我们能不能稍微和别的中国的开源厂商做一下对比,比如说我理解通义的商业模式可能是回到他们的云服务,这个能不能跟我们解释一下哪家厂商有什么不同?
【嘉宾】第一个我觉得赚钱的开源模型才是好的开源模型,这个事情可以有几个佐证。第一个,比如说之前我们看文生图模型领域的Stable Diffusion,它后面是有Stability这个公司研发的。它这个模型一直没有办法赚到足够多的钱,所以就渐渐销声匿迹。第二个就是千问,千问可能也是因为开源做得很好,但是商业化做得不好。所以我一直觉得,能够赚钱的开源模型才是可持续的开源模型,才是可以让我们一直享受下一代开源模型的真正的一个模型。
【嘉宾】第二个,就是这个license赚钱这个事情,其实Kimi不是第一个提出来的。当年的开源模型的祖师Meta,他们当时在license里面也有一个限制。当时大家不是特别清楚具体它这些东西要怎么执行。那Kimi这一次,就把具体执行的这个内容都给写得很清楚,也是比较可操作的。我觉得这实际上是一个license法律或者是商务层面的一个进步。
【嘉宾】第三个就是,它现在把这个东西写清楚之后,很多专门做模型推理和云厂商,实际上没有办法去take free ride。因为之前很多开源的一些数据库的项目,现在最担心的就是云厂商没有出工、没有出力,然后拿这个开源项目部署在自己的云上就可以卖钱了。所以这个free ride的这个事情,实际上是开源社区一直想要避免的。那之前在开源软件时代,大家都想出了很多办法,比如说可以有两个license,或者说专门有一个license排除对云厂商和一些专门做线上业务的人的排除。那我觉得Kimi也是延续了这个精神,包括MaaS厂,包括这些云厂,他们需要在自己通过开源模型赚到的钱里面给Kimi做一些分成,我觉得这也是非常合理的。
【嘉宾】可能是一个反常识的观点,就是云厂和MaaS厂实际上应该是非常欢迎Kimi找他来收钱的。因为只要你来收钱,就说明你跟Kimi有一个官方的认证关系。大家如果去看Kimi的官方的一些发布,它实际上是有一套vendor verification的流程的,就是你只有过了这个流程,你卖出来的token才能被证明说是好的token,包括准确性、包括性能都是有保障的。如果你连这个vendor verification都没有过,你都没有给Kimi付钱,你都不是Kimi的官方合作伙伴,那大家可能也不愿意去采购你的token,从marketing的角度说。
【嘉宾】那另外一点就是,其实这些MaaS厂和云厂,包括一些小的专门卖推理的公司,其实它整个的business都建立在它们能拿到不限量的开源模型,并且不停地用开源模型做推理卖给它的客户这个点上。所以他们也非常希望开源模型的生态是一波接一波持续不断的。他也希望这些开源模型公司是能够赚到钱的,不然如果有一天大家都不开源,那这些比如说拿很多融资的专门做推理的厂,或者是买了很多卡然后想要自己做推理的nebula,它的整个business logic就不成立了。所以说现在有一个能够让大家整个生态持续发展的方式,大家应该都是非常欢迎的。我相信这个应该不是第一个尝试这方面license的公司,Kimi之前MiniMax其实也做过一些尝试,后面我们应该也能看到更多的企业做更多不同的尝试。
【嘉宾】通义的商业模式肯定是绑定了阿里云,但这只是过去的一个状态。如果说Kimi的license转变是很成功,大家也都愿意付这个钱,并且建立更紧密的整个生态的一个连接的话,那我相信其他家去复制这个模式,也不是一个不可能的事情。其实这个逻辑本身是不新的,比如说从早年的MongoDB、Elastic,其实大家都做得差不多。因为那会云厂商大家很多时候做白嫖,所以整个这个逻辑,MIT、Apache都是在了解到这个问题的情况下出现的。
【嘉宾】包括Llama其实也是这样的,它的整个逻辑也是针对当时非常大的Microsoft、Amazon等等AWS这样的东西来设计的。所以其实Kimi的整个设计应该是两块,第一块就是一个云厂商,因为其实你可以想象,像现在非常火的Together AI、Fireworks,大家核心都是靠这些开源模型来赚很多钱,这是一个中间商的差价。第二部分其实就是终端应用方,那就是涉及到了比如Cursor之类的,当它是一个终端的时候,那你的这个情况应该怎么样,这个其实已经是一个非常细化的事情了。
【嘉宾】那这个其实就回到和闭源模型或者闭源整个Frontier Labs在打仗的这样一个场景里来看。比如说Mistral,它现在核心的应该是靠开源的这样一个逻辑去补量,去挤压包括分压Anthropic这样的一些生存生态或者生存方式,以及形成一个新的心智上的占领。但是与此同时这个事情也非常新,因为跟过去Cloud都不一样,现在的情况下,它已经没有办法自己去能承担得住这种一代又一代模型迭代的训练成本了。所以如何能保证开源这样一个大的叙事,但同时又不能把自己最好吃的蛋糕交给大家随便去白嫖,这种情况应该怎么打?所以目前来说,这是一个相对妥协的结果。
【嘉宾】但是最难的角度就是落地,就是执行情况。你怎么去知道一家非中国本土的公司,在过去的营收达到比如2000万美金,应该是一个卡点,那怎么去衡量呢?然后很多公司它本来就是AI native公司,你也不知道它赚多少钱。这是打官司到时候,因为现在是自觉的申报,申报这个东西像Cursor这种是容易看到的,那很多公司你怎么去看呢?打官司跨境执法怎么办?这东西从传统的角度都没有去解决的事情,在今天整个AI的行业里怎么去解决呢?其实有很多很多的灰色地带,这个其实是一个非常难理清界定的事情,在我看来。
【主持人】那你们觉得这个有什么过去的案例是值得参考的吗?无论是成功或者失败的例子,还是说现在还是一个太新的东西,我们没有办法去衡量?
【嘉宾】确实收钱这个是一个很难的事情,尤其是license收钱。就是过去大家一直有抨击说,中国的企业尤其是中国的大厂,它根本不看license,我只要偷偷地用,然后你找不到证据没关系。但是实际上我看到这几年情况在快速地好转。包括阿里我知道它也是付了很多license,然后包括一些非常传统的软件,比如说服务器的什么Load Balance什么的,其实在国内也都能收上来钱了。
【嘉宾】其中背后的原因我觉得有几个。第一个就是说,至少这一代程序员,大家还是有比较强的给license付费的意识。第二个呢,其实厂家也发现,带着原厂一起去做一些事情,一起去call marketing,实际上是能给它带来很多好处的。比如说某云厂可能对某功能有一个定制化的需求,它自己不一定能搞得定,或者它就算自己搞定了,它对开源代码的改动是非常有侵入性的,导致开源代码一更新,它这边所有的魔改全都不能工作,所以每次更新都是一个非常非常痛苦的过程。这些云厂通过资助这个开源项目,或者买它的license或者加入基金会等等,它可以跟这些原厂有一个非常紧密的连接。它可以说OK,我需要你帮我把这个功能推进去,下次我更新的时候我就很容易。这种事情多了之后,大家就养成一种意识说,那为什么我们不跟你原厂搞好关系,我要偷偷摸摸,我让原厂还帮我宣传不好吗?
【嘉宾】第三个就是包括一些基金会等等这些机构在国内,比如说通过美国企业的OSPO,就是开源办公室的一些合作,实际上里面很多信息现在是非常透明的。就大家知道谁在用什么,而且这个人员流动也很频繁,尤其是一些非常非常大量的使用,然后你想藏住,实际上是很难很难的。一旦你被发现有明确的证据点之后,法院也是会支持开源一方的,因为这里面已经有些比较好的判例了。
【嘉宾】第四点,我们再回到Kimi的license能不能收上钱,因为我们知道Kimi这个模型实际上是一个非常大的模型,它是一个3T的模型,想要把这个模型在云上面服务好。
【嘉宾】实际上是很难的,虽然我们看到像VLLM、像SGLang都对它做一些社区向的支持,但是真正能够把它大规模跑起来,并且有很高的性价比,然后有很高的使用体验,把它跑起来,其实全球也没有那么多的机构。第一个,你首先要有几百张、几千张、几万张GPU卡,那首先你就是一个要面子的,在这个行业里面靠品牌吃饭的,如果你没有一个很好的branding,GPU甚至不愿意给你卖卡。然后第二个,就是肯定要在这个里面投入相当多的人去做所有的推理优化,你这个事情是藏不住的。然后第三个,所有的API的售卖,其实大部分都是公开的售卖,就是你想要走量达到Kimi的那个量级,你需要自己有一个API,然后放出来让大家买一些token,或者是面向2B的一些场景,大家能够在你的网站上直接看到你在卖Kimi的token。虽然你可以藏一部分销售的量,但是大的量你是藏不住的,所以从终极层面我非常有信心Kimi能把这个钱收回来,肯定是会有一些漏网之鱼,但是应该不影响他们公司的业绩。如果说MaaS的这个路径被Kimi证明成功,实际上这是比Kimi自己去做推理要好得多的一个商业模式,这就是无本万利,你只要把模型做好,大家都直接给你上贡,你连自己买卡或者是怎么样都不太需要。尤其中国企业,可能在买卡上还去面临一些挑战。个人情感上,我也希望说Kimi这条路径能够做通,我觉得这个非常有意思。
【主持人】而且其实这是一个很好的过渡,如果说MaaS这一套模式可以走通的话,它会对闭源实验室的收入模式造成什么样的影响呢?
【嘉宾】我觉得第一波影响应该是估值体系。今年Cohere和Anthropic都要上市,当Cohere和Anthropic上市的时候,大家就会问你这公司到底值多少钱。在开源模型追平闭源之前,大家会觉得闭源模型它的模型本身是一个非常有价值、非常有稀缺性、非常值得溢价、甚至是垄断性的一个东西。我记得前几天看到一个笑话,就是有一个黑客松,在黑客松运行的中间,拆的GPT的服务器断供了,然后就没有人在黑客松去搞东西了,因为大家的智能被断供了,大家都没有办法继续去做这个事情。所以它垄断智能这个事情,实际上是比垄断任何商品威力要恐怖得多的多的多,所以它天然就值得万亿的市值。但是有一天大家发现好像竞争变多了,好像不止这几家可以训练模型,好像很多家都可以训练模型,有了开源模型之后,非常聪明的模型变成了一个流通的商品,甚至是被平面化,变成一个社会的基础服务。那这个时候你再去想OpenAI和Anthropic的价值,可能就要稍微打一个问号。大家就会问说,那你商业化到底能做到什么样的程度?有多少企业愿意在这种开源模型已经遍地开花的情况下,还愿意付钱买你的闭源模型?闭源模型你商业的margin能做到什么样?然后你后面发展的scaling out,我是不是还可以投无限的钱让你去无限扩展?还是说你现在要抓紧去想一想怎么样让你的资本效率更高?所以整个这些东西压下来,这个估值就没有那么容易画得圆,估值体系肯定是会受到一定的压力的。
第二个就是说,如果说未来所有美国的Nebius Cloud都变成Anthropic和OpenAI的竞争对手,因为他们天然就有开源模型,哪怕交一点license,他们还是能赚钱,比数据中心低价卖给Anthropic还是要赚很多钱的。这时候就会发现,OpenAI和Anthropic的业务其实很难再有爆炸性的推进了。因为所有的Nebius Cloud他们之间可以互相卷价格,他可以把token价格压到很低,甚至有的人可能是通过一些资本市场的手段,让数据中心的成本在资本开支里面去amortize,他的token可以卖得很便宜。这样的情况下,OpenAI和Anthropic会不会被动地陷入一种价格战?其实我们已经看到,以前Anthropic和OpenAI他是很高傲的,他说封你号就封你号。
【嘉宾】前几个月前我们就看到是这样,后面ChatGPT为了做一些商业的手段,开始了国内外卖送券的这个模式,不定期的给大家发一些重置券,这就已经开始一些很商业化,可能会损害公司的margin,但是圈更多用户的一个手段。而且我们看到Anthropic最近封号也变得没有那么疯狂,可能最后大家为了业绩,可能对很多号的管理也没有那么严谨了,最后都会反映到他们的财报上面,都会反映到市场的竞争里面。所以我觉得开源模型的普及,实际上是对他们造成了一些困扰的,我觉得这也是为什么他们可能会想要提议说禁用开源模型,或者在法律和市场层面去给潜在的竞争队伍造成一些阻碍的原因。
【主持人】最近有一个背景就是,美国的一大批科技公司还有一些机构签署了这样一份公开信,这份公开信的名字叫做开放权众和美国AI领导力,这个是黄仁勋加入X之后发的第一篇推文,所以也造成了很大的影响。这个应该是在上周五,就是7月24号的时候,应该有25家公司还有个人和机构签署了这份公开信,在几天的发酵之后大概是达到75家。这其中的Anthropic一直没有签这份公开信的,当然今天Dario Amodei刚发表了一篇他自己的文章,然后也解释了就是Anthropic对于开放权众之间事情的一个看法。所以我觉得这个立场其实特别有意思,然后我们就在这个背景之下,去讨论他们的商业利益的关系。所以我觉得也是形成了这样一个冲突,在这个背景之下能不能请段老师也再给我们分析一下Anthropic,现在它的立场是什么样的,这个Dario到底在这波开源模型中受到了什么样的冲击。
【嘉宾】其实这个公开信我自己感觉,因为它整个核心就是关于要不要开源或者应该接受开源,开放的一个生态和一个闭源的生态,它的商业逻辑从根本上其实就是应该是一个对立的。开源模型它每一次的开放肯定都会给专门是卖API这个cost整个的闭源的带来一个巨大的冲击,这是黄仁勋所被指责的一个点。Media随时从芯片和基础设施这个走来看,那肯定是每个人都能自由搭建一个最好,这样的话它可以卖出更多的铲子,因为它并不在乎谁能挖到金子。而对于模型厂商,其实核心就保住自己的护城河,但是双方所互守的东西在这个环境下就会发生两个完全不一样的角度了,整个会走得甚至可能会越来越远,在这个利益上应该是完全不会对齐的了。甚至你会看到从闭源模型的整个体来看,它也发生了很大的变化。一种就是包括我们刚才谈到OpenAI、Anthropic这种主要是靠可以说是卖API来赚钱的这样的公司;另外一种其实是包括Meta,包括阿里这样的公司,Meta和阿里都是有自己的分发和基础架构的,因为阿里其实主要赚的就是云服务,通过开源到闭源,这样可以从云服务的角度来去做更多的业务。而从Meta的角度来说,WhatsApp第一次我发现WhatsApp今天增加了一个收费吧,2.99一个月可以开始收费,就是它是可以靠自己的Instagram各种的APP巨声去实现转移它自己目前受到的开源上的压力。但是这两种情况,是目前为止OpenAI和Anthropic它们都是没有的,因为它们在过去一直主要Focus API的这样一个模式。无论是从基础卖铲子的公司和希望别人用API的公司这个角度来说,以及就闭源公司本身,它也已经开始越来越的分化,它是一个结构层面的变化。
【嘉宾】我非常同意段老师的观点,不管你在商业竞争的每一个层面,其实你都希望跟你同层面竞争的人越少越好,但是你的上游和下游都是越来越多的。那站在NVIDIA的角度,它肯定是不希望这个模型厂是一个处于一个垄断地位的,因为这样他们的议价权就会很强。它希望说自己处于一个垄断地位,但是不管是上游的模型厂,还是下游的NilCloud,都是尽量丰富的一个生态。那么在这种情况下,他们去支持开源,我觉得也是非常可以理解的。而且其实NVIDIA从早期到现在,它一直都是开源非常好的一个支持者,这样早期它之所以能在研究员群体里面建立早期的生态,让深度学习最早的一些故事全都发生在英伟达的这个硬件上,也就是因为它比如说CUDA的生态,它有一个非常好的开发者社群,然后围绕这个CUDA的生态有非常多的开源项目,从最早贾扬清的Caffe到后面Google的TensorFlow。
【嘉宾】到后面的PyTorch都是搭建在NVIDIA硬件上面,一套非常完善的开源软件的体系。这种体系就形成了一个非常强的壁垒。一旦说你已经成为开源的标配,比如说AMD想要进来,那它就要跟所有的这些开源厂商一个一个去聊,说我是不是能够在PyTorch里面做一个集成,我是不是能在比如vLLM这一套里面去做一个集成。后来者其实要花很多很多的功夫,那vLLM作为开源的先行者,实际上在这里面是有不少红利的。相当一部分的所谓的CUDA的护城河,实际上都是围绕在CUDA周围的这些开源生态造成的一个护城河,所以我觉得vLLM来支持这个事情也是非常合理的。
【嘉宾】第三点就是Anthropic其实有点走向邪恶,它实际上是在以安全的名义为用户增加很多的限制。一个最让大家诟病的就是,比如说你在用Claude的时候,如果你不小心触发那个贼敏感的检测器,那它有可能会瞬间给你降智到GPT-4.8。导致一个什么后果呢?就是你想要测试Claude的极限能力,如果你不是Anthropic的员工,你被Filter限制,你是没有办法去做任何事情的。因为随时比如说测出一个不好的成绩,你都要怀疑说,是不是我会降智到GPT的4.8。比如说像我们平时去做一些AI方面的探索,哪怕我就是做一个很简单的推理,如果我不精心构造这个Prompt,我就不要说是骗Claude,我说这东西不是一个AI的东西,很有可能我就是做一个简单的模型的推理,然后Claude就直接告诉我说,你这东西有风险,我不能支持你做这个事情,我就给你限制。
【嘉宾】这个Filter我相信它做的这么敏感,也是有一定的意义,因为我知道Anthropic的理念,光做模型安全的团队都有几百人,它做成这个样子,是到底是故意的还是不故意的,这我不是特别清楚。但我觉得它至少现在的这个产品形态,对于用户造成的烦恼,是远远多于它潜在的安全的考量的。一个让用户如此不爽的公司,能够突然发现自己瞬间有好多强劲对手,然后大家对自己不爽,然后大家都想要支持开源,也不是一个非常难以预料的事情。
【主持人】对,我觉得这个非常有意思。其实中国的模型厂商,它并不是从一开始就是开源的,其实Kimi K1这个模型,Kimi的第一个模型也是一个闭源模型。而且一开始很多的模型提供商都是去做这样一个闭源的商业模式的。通过开源的,我们可以可以看到可能有更强的分发能力,有更多的用户,就算你是把这个名声打出去吧,然后这个开源的好处让很多的模型厂商选择了开源。所以我觉得我们做一个思想实验,就是说如果Kimi有OpenAI那么强的分发能力和那么高的API收入,它还会选择开源吗?我不知道,就是如果你有OpenAI这么多的收入,它是不是还会开源。
【嘉宾】就是我觉得可以做一个类比。Linux早期是作为一个反闭源的生态的一个先行者,但是当这个Linux发展到,现在基本上所有的设备上面都在跑一个Linux的时候,Linux依旧是一个开源的底层的一个东西。所以我更倾向于说,只要我们找到开源生态一个可以持续运转,并且能赚钱,并且能赚大钱的一个商业模式,那没有理由他们不开源。整个这个东西其实在某种程度上也不一定受实验室自己控制了,因为它已经从商业竞争开始变成了一种地缘政治的一个博弈,就在这个框架下,它的Business Logic其实变得是第二位的。
【主持人】其实在这里我还想聊一个公司,我觉得Sakana AI很有意思,它应该是K3发布前的一周前,也发布了Inkling。Inkling是一个开放权重的模型,并且它参考了DeepSeek的架构,因为Murai也是从OpenAI出来的。其实我还蛮想听一下大家的看法就是,Sakana AI为什么会选择开放权重这件事情。
【嘉宾】我的理解是,有一个叫Tinker的脱链的线上的服务。它为了让用户把这个东西用起来,它肯定是要把基础的模型,Tinker训练出的这个模型的一个结构放出来让大家用。这样Tinker每次训练出一个什么东西,它开源的适配已经都完善了,所以我觉得从这个角度来讲,是非常合理去做一些开源的工作,只要说开源的工作不会影响到
【嘉宾】比如说它的一些商业利益或者是什么,我觉得是没有问题的。另外其实美国学界也在反思,说为什么美国的公司做开源做得越来越少。因为像开源模型的这个鼻祖就是Meta,那时候都是美国公司在领导。从DeepSeek出现之后,美国参与开源的比例就大幅下降了。所以当时Thinking Machines这个模型出来的时候,我就记得很多人就讲说,这是一个美国很重要的开源模型等等,可能也有一些这方面的考量。在美国的一些research可能也在想说,为什么我们不能参与到开源的游戏里面,那么我们也可以对社区做一些贡献。Thinking Machines发的这个模型,其实它的架构或者是在它整个的Technical Report里面,都是有一些很不错的有意思的亮点,那也是值得学习的。我觉得其实开源界不怕大家卷起来,不怕大家发很多模型,然后一个比一个好,其实最担心的就是开源界没有人发模型,变一滩死水。只要是有新的开源模型出来,总能给大家一些启示。每个人在做不同的尝试的话,也会让这个领域推进得更快。不管说这些开源模型是哪国出来的,Thinking Machines这个模型,因为我的理解它的整个方向,虽然它是开源,但是它跟Kimi完全不是一套打法。他们整个模型应该就是现在企业都需要一个deploy自己的模型,他们会帮着企业做微调做各种。这一套逻辑的话,现在是美国非常普遍的一套逻辑,因为2B在美国是一个很大的生意,而在中国其实不是一个很好的生意。所以Intelligence,我应该是租借的,还是我应该是变成自己的?那很多的企业现在越来越接受的观点,就是Intelligence should be owned,而不应该是rent,那这就是它的整个的大背景下。
【主持人】我好奇,比如说你们看到的美国企业的场景,大家对比如说用Thinking Machines的这个模型,或者说用中国的开源模型,会有一些技术之外的看法吗?或者说大家主要看的点是什么?
【嘉宾】大家主要在用开源模型,对。我感觉这个东西就还是看具体的应用场景,以及你的Vertical,垂直场景。比如说一些政府端的肯定是不可以,包括一些国家可能也不太方便的,这就是给了包括Thinking Machines这样的一些公司的模型很好的一个切入点。应该有很多大单,但这并没有影响到它的一个deployment,因为开源其实他不拿用户数据,他其实理论上不应该涉及到这个安全问题。但是现在的一个大时代背景,是什么都会涉及到安全,包括你的模型干什么用,你是做coding,还是你要做什么。但是我感觉大多数的美国公司并不是非常在乎这个模型是不是中国的,但是他有没有能力去调教自己的模型,这是另外一回事。
【主持人】那你觉得当开源模型的能力足够强之后,会催生更多提供微调、适配企业需求的服务这样一些公司吗?
【嘉宾】对,这个已经是一个现实了。日本是没有一个自己模型的,它就有一个最开始的Sakana AI,Sakana AI其实没有什么东西出来,所以他们很多时候就是把国外的模型deploy到自己企业里面。那在美国的话这家公司,它从个人的开发者的使用角度来说,已经没有那么多了。Cognition举个例子,其实是一个不是被广大开发者所使用的一个产品,但是并没有意料到它赚了很多钱。从AI的角度来看,企业、政府,很多的这种客单是有很多的。所以我感觉这个是在未来一段时间内的一个现实,因为大家是想使用AI,但是大家并不知道如何部署,或者应该怎么样选择。就像一个市场极其混乱,又没有那么透明,所以就会多了很多的中间商赚差价。很多时候大家就会说
【嘉宾】如果我去找中间商赚差价,把这个钱交给像埃森哲这样的公司去赚,我不如自己去做这个事。这也就为什么说OpenAI也好,Cohere也好,它们都成立了部门,专门就是做deployment。
【主持人】那比如说像OpenRouter这样的公司,是不是也是受到这一波闭源模型的影响,然后最近才活出来的?
【嘉宾】是的,它们其实压力很大的。因为在很长一段时间,市场的叙事是要用最好的模型,而这最好的模型就是闭源的。那你想它们的优势是很少的,就是我为什么需要另外一家厂商去来帮我做这件事呢?而这一波你可以看到在过去几个月的时间里,包括OpenRouter在内,包括另外我们提到的这几家公司,它们的估值和ARR都是翻倍快速增长的。那就是核心利用了中国为主的开源模型这一大批,因为除了中国这一批之外,没有那么多开源模型。这个生态多元,然后生态的分层,实际上对整个行业是一个非常好的事情。我们可以拿比如说IBM的兼容机和苹果的所谓的一体机来对比。如果说在行业的早期,每个人都可以做自己最擅长的事情,比如说做模型的做模型,做推理的做推理,做企业服务的做企业服务。那每个人都可以在自己的位置上做出最高效的一个决策,也可以做出最快的一个迭代,让大家可以卷得更厉害一点。我觉得这个实际上是对行业非常好的一个方法,总比像传统中国互联网企业喜欢从头做到尾什么都自己做,最后靠的不是一个纯市场竞争来打败对手,是很多技术之外的方式,比如说流量扶持或者是封禁一些内容来做到这个效果是好很多的。但最后会演化成什么样子,可能又会回到某一家多大或者是怎么样,也有可能。但是至少我们在当下就可以好好享受现在这种市场充分竞争的一个业态,那不管我们做什么,都是有非常多的机会的。
【主持人】明白。在这种竞争的情况下,对Agent行业还有生态,会造成什么样的冲击吗?正面或者是负面的。
【嘉宾】因为Agent是一个比较宽散的概念,就是我理解你提到的Agent可能主要是关于从工作流上的重要的具体的这些Applications这一层的Agent。我感觉其实已经发生了很大的变化了。我前一段跟一个VC的朋友聊,他说这个估值越高,我们反而会越远离它,就估值很低的Agent,我反而可能不远离它了。因为你的这一层很容易可能就会被吃掉。第二点的闭源模型,包括闭源模型,如果单纯靠API去赚钱这个事情,就是我最好,我要是随便地溢价,我也不在乎客户、什么的这种服务的这样的一个逻辑,肯定是已经被拆解的。他应该是不是比如说开发更好的Harness,他会把工程的整个Agent的这个能力的Vertical的调整,变成一些新的组合,这些事都已经正在发生了,对吧。无论是说Orchestration也好,包括其他的Harness的Layers,包括后来比较火的Loop Engineer什么的,这个模型很快就可以吃进去。所以如果我们讲的是Application这个Level的话,那我感觉这个事情对于整个生态来说,会有很大变化的。因为AI还是很早,它其实也就是最近这几年在整个长河中,它是一个非常短的时间。那如果我们把它放在一个五年的时间来看的话,我并不是很认为说以后会有很多的Agent Application的Companies。但是回到另外一个角度,就是说Agent Infra,Agent当它能实现做很多事情,包括在互联网上的使用。
【主持人】它的逻辑又是一个变化。现在的模型厂商或者大家在做的事,它是做ISP,它都是一个广泛变成一个Commodities,变成一个像水和电一样的一个消费来说的话,那应该还有什么,这是一个我们应该重新来考虑的问题。嗯,是的,田正你觉得呢?
【嘉宾】其实现在我们看到很多Agent Workload和传统的推理,比如说做一个Chatbots或者是做一个简单的Rag,它对模型测的要求是不太一样的。比如说之前可能是短输入长输出,现在可能是非常长的一个输入,然后非常短的一个输出,并且它的每英文对话能够重用的Prefill,就是KV Cache的重用率是非常高的。其实这里面也能做很多新的优化,在这个模型之外,怎么去推理模型,这个事情也可以根据我们当下主要跑的这些任务的特性不同,然后做出很多极致的优化。比如说如果我们能够控制这个Harness,能够控制比如说Claude Code或者是Open Code的这一层,我们可以自己去定义一个跟模型通讯的接口,那它有一个什么好处呢?就是我们可以完全的掌控这个KV Cache的生存周期,那对于很多推理的降本啊、提效或者是做一些调度,都是有非常多的好处的。所以我觉得这个行业就是一个方向,然后又有太多可以做的一个事情的这么一个状态。
包括我们今天看到的Token的成本,用美元折算的单位智能的这个成本,在过去几年可能下降了1000倍。未来几年我们能看得到的,可能在硬件上还能抠出来至少10倍,如果有下一代的硬件或者是有更多ASIC,那可能还会继续再能抠出10倍。还有Workload的本身在软件层面,能给我们打破不同通讯层的交互,然后做一个极致性的优化,那我觉得可能还有10倍。也就是说比如说未来的3年,我们还能看到同样的智能,它的成本又下降了1000倍,那这个对于企业的应用,肯定是一个非常非常好的事情。Token老师一开始在播客之前说,很多企业也都在考虑成本的问题嘛,随着开源模型的普及,随着整个Inference行业极致的优化,其实最终受益的就是每一个有实际业务然后能赚到钱的企业。AI应该是一个服务型行业,应该是支撑他们的发展,而不是说一个抽血机,然后把这些实体行业的钱全都赚到AI公司里面,让大家付很多不必要的成本。所以我觉得未来还是非常非常值得期待。
【主持人】我觉得非常好,是很好落脚点。最后其实就是想回到我们最开始提到的关于安全的问题,因为我们讲了那么多关于开源模型带来的影响嘛,我们整体的方向还是非常正面的。所以我想再回到硅谷的评论人员还有从业者提出的一个批评,就是K3这么强的一个开源模型,它到底应不应该开放权重?它相当于是一个接近Llama时刻的这样一个情况,包括OpenAI的Ilya,还有Dario Amodei在内的人,都认为这种接近前沿能力的模型不应该是开源的。在播客的最后,我们可以回应一下这样一个顾虑吧。
【嘉宾】开源到底安不安全这个事情,其实也有很多的数据,包括对K3,其实有很多新的数据去来验证的。比如说它在ExploitBench这一个蛮权威的一个数据,就网络攻防的测试里面,它其实得分是比较低的,30%几,远远低于整个Frontier Models 75以上这样的一个数据的。当然了,很多人认为是不是一种比如蒸馏能力的限制。但另外一种方面也可能说,它没有把最强的攻击性网络这一部分的能力开放出来,这也是有可能的。它到底是不是一个非常全面公开就带来风险的这个事情,我并不认为说现在是有一个很具体的一个东西来支持这个事情。因为现在有两种讨论,第一个问题是,开源模型本身到底安不安全。
【嘉宾】另外一个才是Kimi3具体有没有理智的安全问题。Kimi3本身我认为肯定是目前没有看到任何可证据的理智的安全问题,但是开源模型的话它肯定会多多少少,就是如果它随着更多的公司来做开源,我们应该相信这个技术会越来越容易被更多的人来去调试,它肯定会带来更多的安全问题的。它的安全问题是相对的,我们是基于现在的互联网的设计,一些互联网的环境来认为它是不安全的。但是整个目前互联网架构还是基于上一代的互联网架构,就我们这互联网核心就是给人使用的嘛。那你说难道Cloudflare这样的一个模式就是对的吗?我也并不认为这就是一个终极问题,因为当所有的信息本身都已经不是人生产了,那为什么我不能让机器随便获取这些信息呢?就不涉及到Intellectual Property了,甚至知道。所以这些东西都是在一个演变的过程中,所以这并不光是开源模型,包括闭源模型它也会涉及到很多安全不安全的一个问题的。而这个判断交给谁呢?我这个东西安不安全,为什么要交给一家商业公司来做决定说这东西它所有行为就是不安全的,这东西怎么去规定呢?现在没有一个很好的答案或者一个机构来去执行了,我也并不认为它很快会有,所以这是一个行业整体的一个问题。
【主持人】对,我觉得刚才Kate老师提到这几点都特别好,然后我们就可以拿最近的一个场景做一个例子。比如说Hugging Face被OpenAI的一个测试的智能体给不小心攻击了,故事也很有意思,就是这个智能体足够聪明,它说我直接去抄答案比我自己去摸索要好得多,要不我就顺便把别人的网站给黑了拿到答案,这样我就可以直接获得高分。这就是一个非常典型的这种安全风险。我们可以去想,假如这个世界没有开源模型,闭源模型可能攻击也就攻击了,模型的攻击是比人类攻击要更难以追踪的,因为产生的数据量太大,人脑已经没有办法去看明白说它攻击的这个模式,并且从里面拿到足够多的线索。所以后面Hugging Face就说,好那我拿模型来分析一下整个攻击的过程,然后尝试复现一下看看它是怎么进来的,能不能找到说到底是谁在攻击我们。然后他就拿闭源模型去做测试,闭源模型告诉他说你做的这个事好像挺不安全的,我不能帮你分析网络安全的这个语料。Hugging Face直接就陷入一个非常不利的境地,因为可能有一个前沿模型在攻击它,但是另外一个前沿模型不会给它任何有用的信息。这时候它只能用开源模型,虽然开源模型可能在模型攻击的层面没有前沿的闭源模型强,但是它实际上可以帮助人类去做很多辅助的分析,因为它没有一个看着很敏感的filter然后决定说你能做什么你不能做什么。我觉得这个才是一个真正的技术评判。为什么我们会把网络安全这么重要的一个话题放心的交给两家最前沿的模型公司来评判?为什么我们能够让他们去又做运动员又做裁判?一方面它可以评价说别人做的事情安不安全,另一方面它可以自己有意或者无意的放开自己的Agent出去攻击别人。所以我觉得这个事情实际上是非常魔幻的,就是有很多人支持闭源公司然后打着安全的旗号,然后说你们都不要做别的什么事情,让我来做,只有我做才是最安全。我觉得这个事情本身就是很不安全的。我甚至最近在看一些网上的AI生成的各种神奇的场景,对,各种短剧,然后YouTube上面也很多,那些短剧其实制作都很精良。然后我就反反复复去想说
【嘉宾】这个事情是不是在我们当下也有一些参照性,我不知道是不是一个不合理的比喻,就比如公司在设计优化的病毒的时候,其实也是打着安全的旗号,再去讲说我们要治愈人类的一切疾病,然后我们最后也知道说它制造出来了什么。所以我觉得这个里面其实还是需要更多社会层面的监管,我们不能相信某一两家公司对自己的一个监管是足够到位的,我们远远不知道说他们一旦发现自己的技术远远超过于时代之后,那他们会不会有一些动力去做一些我们想象不到的事情。回到最开始的这个话题,开源模型到底是安全还是风险,我们需要整个社群有能力去验证说你这个模型到底是安全还是危险的。我们不是说它模型智能程度达到一定程度就一定是危险,这可能是闭源模型尝试告诉我们的一个结论,但实际上并不一定。K3虽然在某些能力上达到了GPT-4的级别,但是在安全的这个场景里面,还是相对安全的。我个人的一个猜想就是,它并没有拿很多定向攻击的非常聪明的预料,就比如说黑别人的预料拿去训练,它没有这方面的预料,模型就算再聪明,它也没有办法误导,原来我可以做一些坏事。那为什么造模型的公司在训练这个模型的时候,不能够对训练数据做一个过滤,而是要过滤用户的行为,我觉得这个思路实际上一定程度上是有问题的。比如说中国的这些开源模型公司,虽然它能够制作一个在某些领域足够聪明的模型,但不代表说这个模型一定就能自己找到怎么样去巧妙地攻击别人的方法。因为攻击和智能,我觉得这两个是完全独立的两个话题。你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑NASA的网站,你可能有一个人没有那么聪明,当然也得是足够聪明,可能是一个比如说18岁的高中生,他就有能力去把NASA的网站给黑了。所以智能和安全这两个事情,本身有一定的相关性,但绝对不是决定性的。我其实建议的是说,比如说社会有一个足够透明的监管机构,那么它不仅要从模型本身对用户最终表现出来的这个行为来评审模型是不是安全,因为就是你在你模型训练完之后,不管你对这个模型的使用施加任何的限制,总会有一些长期导致这个模型超出你的预期做一些什么事情。监管机构更应该做的是看到这个模型用什么样的预料去训练,把一些比如说生物安全或者是网络攻击的预料从这个里面删去,这样导致这个模型就只会比如说在生物领域它去做一些幻觉,我觉得这是一个更稳妥的安全。不管怎么看,没有开源模型是这个时代最不安全的事情。
【主持人】我觉得这讲的特别好,安全与否是一个相对的。我们之前跟一个日本最大的公司,他们的这个Number 2,我们在一起施加的一个沟通中,他就提到了说,当时飞壶他不能用了,这个事情对他们来说是一个巨大的影响。影响不是在于说这飞壶不能用了本身会怎么样,而是对大家来说,原来这个东西是不安全的。也就是说我做完所有的部署之后,突然有一天,你可以随时随地一个新的政策,或者因为各种原因突然就开始封号,或者服务变更,调整了你的访问权限,这个全都会发生变化。而这个是一个,当我们说到安全的时候,其实应该是一起讨论的一个问题。因为闭源的话,整个核心就把东西都交给别人。开源模型说完了就是,你把整个东西都下载到你自己的硬盘上,你不会有这样的一个风险。很多人说开源模型不安全,然后它的所有的问句,其实都可以重复地用在闭源模型上,比如说有人说可以用开源模型去做一些邪恶的事情,其实用更强力、更方便使用的闭源模型,更容易达到一些邪恶的目的,它只要把Filter攻破就可以。
【嘉宾】它使用开源模型的话需要首先,比如说现在部署K3这个模型,首先要搞一堆B300的卡,一个机器还不够,它需要两个机器,这个成本就很高,可能一年光租金就有上百万。它还要在开源模型的基础上,想办法去补齐它和闭源模型的能力的差距。其实所有这些加在一起,它直接用闭源模型,然后尝试去攻破Filter,然后让它去做一些邪恶的事情,要难得多。其实很多我们说开源模型不安全的点,完全可以用在闭源模型上。
【嘉宾】我记得千问在二零二四年离火的时候,有人在Reddit发了一个帖子说,虽然千问很好,但是我不能用,不是说它不想用,因为它是一个技术的人,知道说开源模型其实是没有什么风险,只是说他们公司的法务和他们公司的各种限制,就不允许他们在公司内部去部署开源模型。当然这个人也做了一些解释说,你只要把这个开源模型关在一个机器里面,严格的控制它的输入和输出度,它实际上是比闭源模型要安全很多的。但是有些人就会有很多形而上的想法说,既然是一个中国训练的模型,那这个模型里面会不会有一些后门,比如说它看到某一些输入的时候,它就可以输出一些攻击性的语料,然后就把你公司内部的所有安全的信息给窃走。那我还想说,闭源模型不是在这个方向更不安全吗?因为你连这个模型在什么时候会输出什么样的东西,都完全不了解。但是开源模型其实是一个在更可控、更受限的这个环境下去执行的一个模型,如果你去做的话,是有更好的办法可以保障模型的安全性的。
【嘉宾】最后一点就是说,监管总是担心,如果我用一个闭源模型,那我至少我能够看到谁在用这个闭源的模型,那我可能能比如说抓到用这个模型的人。但开源模型的话,因为大家可以在自己电脑上跑,所以它没有办法做到这个事情。这个我觉得是一个时间的问题,至少在此时此刻,甚至我相信明年也不会发生这样的事情。一个足够强的开源模型,它的权重还是比较大的,它需要在一个比较复杂的推理环境下,才能够正确地去执行。所以现在的抓手可能就是说,谁拥有算力,那他可能去跑开源模型,只有这些有算力的人,才有可能拿开源模型尝试去做一些坏的事情,所以也并不是完全没有抓手。所以仅在这个时候去聊,开源模型一定是不安全,我觉得还是言之过早的。
【主持人】好的,我觉得很特别好。那我们这个播客就到这里结束了,非常非常感谢大家的时间。谢谢。
【嘉宾】谢谢。
【主持人】好了,以上就是我们这期播客的全部内容了。国内的听众可以通过小宇宙、苹果播客、网易云阅读、喜马拉雅、QQ音乐、蜻蜓FM、荔枝FM来关注我们。海外的听众可以通过苹果播客和Spotify,或者在YouTube上搜索硅谷101播客来关注我们。我们部分的文字稿还会收录在硅谷101的微信公众号上。谢谢大家,我们下次再见。