179: 蒸馏风暴:一场无人公开谈论的技术竞赛

【嘉宾】那我可以理解为它就是一个抄答案的过程。它肯定不是我们原初理解的那种抄答案,就是你能直接有个答案就抄过来。因为它还是一个训练的过程,包括这个过程中间你也要防止自己被坑吗?
【主持人】对,我知道有一家模型就是用蒸馏,结果发现它其实蒸出来的是自己的,就自己在蒸自己的,对。所以综合来说就把技术和组织都考虑进来的话,那张一鸣说有可能很难超越,也许是一个真实的情况。张一鸣可能不是最懂技术的,但他大概率是最懂人性的。
【嘉宾】大家好,欢迎收听晚点聊,我是洪浩。那今天又是我们晚点编辑部自己录的一期节目,没有嘉宾,然后我是今天的带班主持。那我们的嘉宾呢,其实是大家每一期都能听到的曼琪。
【主持人】对,今天是我和洪浩一起来聊我们最近做的一个报道,是关于蒸馏这个话题的。然后开头我先叠个甲,就是正常来说这个话题最合适的方式可能是你找到一个一线从业者,他做过这件事情,然后请他来把他聊得比较透。但也就像我们那篇文章开头写的,所有人都会去关注这件事,对,但大家不会公开去谈论,所以其实他不太好找到嘉宾来在节目里去讲这个事情。那我们最后就是我们自己来聊,这个信息可能就是来自于我们最近这一段时间和很多不同公司的一些从业者和研究员所获得的一些关于蒸馏的信息,这确实也是目前行业里非常受关注的一个话题。现在每个人都在谈蒸馏,就如果对于一个可能对于技术并没有那么精通的人来说的话,你觉得你来解释蒸馏,你会怎么去解释这件事情?
【嘉宾】我对技术并没有那么精通,我就尽量用我觉得我理解的方式来解释,典型的为了变强的蒸馏,其他主要讨论是这个吗?我理解它的这个过程简化来描述,就是你先有一堆问题,然后你去问一个很强的模型,比如说你去问GPT-4,你就得到了很多回答,对吧?然后这个提问和回答就会构成一堆这种数据对,然后你再用这些数据去训练你想去提升的学生模型,就是你自己的模型,然后你让学生模型的输出行为去接近你想学的教师模型的输出行为,你让两者的差异越来越小,这是比较典型的蒸馏。当然我刚才那个是一个简化的描述,比如说你中间从那个教师模型那通过提问得到的东西,它其实是含义可能是在变化的。比如说有了推理模型,就是OpenAI o系列这种模型,o1这种模型之后,它不是简单的题目和回答,它中间还会有推理过程,然后包括后面Agent也越来越发达了嘛,所以这个还可以扩展到一个完整的Agent完成一个任务的过程。
【主持人】那我可以理解为它就是一个抄答案的过程,就是比如说我问我这个模型一个问题,然后它可能现在它没有蒸馏之前,它的回答是非常的差的,或者是它可能都不知道怎么回答这个问题。然后我去问GPT-4一个问题,GPT-4它能给我一个非常精妙的一个推理过程以及一个最后的结果,然后我就直接把这个答案告诉我的模型说,以后你遇到这个问题,你就按照GPT-4这样的方式去回答。然后这样的一个问题多了,答案多了,最后我的模型也懂去回答,包括去泛化它可能类似学习GPT-4的推理思考方式,变成了一个很智能的模型。
【嘉宾】就是我觉得它肯定不是我们原初理解的那种抄答案,就是你能直接有个答案就抄过来,因为它还是一个训练的过程。就现在这种蒸馏主要是用在后训练和预训练的,你要用算力,然后你是要有数据,要去放到模型里去训练,就是一个比较高难度的去获得答案的过程。这个里面不是说像抄作业那样,人家写A你就写A,你这个是要有一些方法和技巧和你的智慧和你的劳动在里面的。所以它不是简单的抄作业,结论就这样。
【主持人】就是它虽然也是抄作业,但它是有门槛的抄作业。
【嘉宾】其实可以不用这个类比,因为类比肯定是会丧失一些精度了,但我没有想到一个特别好的类比,就是比如它特别像日常生活中的什么行为。大家还描述过程是我刚才说的那样,就这刚才那个说完,就说像Agent更发展之后,就其实你从教师模型里获得的整个的轨迹数据,它的含义是在变得更复杂了。这个正好是文章里面又特别展开的环节里可以补充一下,就是智能体的轨迹蒸馏。如果就对比到我刚才说的那个经典的过程的话,它现在要获得的东西就是它要从教师模型上榨取的那个数据,它就不再是静态的题目推理过程和答案。它是扩展成了一个智能体,你在一个环境里面,你去完整的做完一个任务的整个过程。
【主持人】我觉得要先跟大家解释一下环境这个概念。环境就是让Agent真正把任务跑起来的一整套条件和系统,就比如说你要让它做一个编程任务,你要给它一个代码库,终端还有必要的工具,比如代码编辑器、编译器还有测试工具,然后再设置任务和单元测试,就是看这个程序跑对了没。然后具体来说,这个更强的教师模型,比如说你用Claude可以干什么,你可以让它来造一些题目,当然一般大家是会先有一些真实的题目,然后再去改写和扩展这些真实的题目,然后你也可以让它来造环境,因为其实长文本模型都有coding的能力嘛,它本身就是可以去构造这种环境系统,然后你也可以让它来造轨迹,这个是比较接近典型的蒸馏的,就是相当于就是你让这个Claude自己在它造的这个环境里面,它去把这个任务做一遍,你会获得它一个完整的做这个任务的过程,其实它也是一堆数据嘛,然后你再让你的这个学生模型,你自己要训的这个模型去行为上接近它做这整个任务的这个过程,但实际上你也可以不做这一步,就如果不做这一步的话,我就是用这个更强的模型来去评估我自己的模型在这个环境里做任务做的怎么样,那如果是这个的话,它可能就不是蒸馏了,我觉得它能描述成说你用了一些最强的模型的数据和输出来帮助你做一个智能体的强化学习。对,那如果总结一下的话,我觉得典型的蒸馏就是你是在让这个学生模型去学这个教师模型的输出,然后让这两个行为越来越接近,就是你用到了对方要么是它推理的轨迹,要么是它完成一个比如智能体任务的这种完整的轨迹。所以有一个误区可以讲一下,就并不是说在训练一个模型的过程中,只要你用到了另一个更强的模型的数据和输出,它就是一个典型的蒸馏,但是你确实是使用了更强的闭源模型的输出,在提升和优化你自己的模型,然后说到这个就正好想到一个问题,其实是这种情况,对Anthropic和OpenAI和Google DeepMind的这些公司来说也是违反了他们的用户协议的。
【主持人】就是他们原本的模型的用户协议里面已经说明了,就是我的模型吐出来的这些内容也好,答案也好,是不能被拿来去做训练的?
【嘉宾】不要更宽泛,是说你不能利用我的服务去提升和优化你自己和我竞争的模型,其实这个是很宽泛的。所以哪怕有些行为它不是蒸馏,在领先的闭源方看来你也是违反用户协议的。
【主持人】这个用户协议有法律效应吗?
【嘉宾】这个我觉得得去询问特别专业的律师,我觉得从朴素的这种想法上来说目前是个灰色地带吧,因为它这个范围其实是很宽泛嘛。
【主持人】因为其实整个蒸馏的历史也没有那么长,对吧?就是我们现在,我不说原理,就是现在大家真正开始做蒸馏这件事情或者大规模做这件事情,从什么时候开始的?你觉得大概是?
【嘉宾】我觉得它表现,其实你从Anthropic这些公司的声明你也能看到嘛,比如说Google今年二月的时候,它发了一个文章,然后那个文章你的原话是说我们观测到去年开始蒸馏等一些其他的这种他们称之为偷取IP的行为变得越来越多。
【主持人】我获得的信息就是从二五年到现在是规模变大了很多。
【嘉宾】二五年什么时候?
【主持人】二五年年初啊。
【嘉宾】DeepSeek出来的。
【主持人】DeepSeek R1发布之后,但我觉得这个关键的时间点还不在R1。它中间有两个比较重要的节点,一个是在二四年九月的时候OpenAI发布了o1这个模型,因为o1是第一个算是开启了推理模型这种范式的一个模型,然后o1是带来了两个比较大的技术上的变化。这个在我们自己写蒸馏的那篇文章里也提到了,一个就是o1它揭示了你在后训练中做大规模的强化学习是可以让模型学到推理策略的。这个推理是reasoning,然后蒸馏本来也主要是用在后训练的。所以在这个阶段你更多的去做蒸馏,你的投入回报是上升了。然后o1还有一个发现,或者说它开启了一种新的方法就是你在测试时时间,就是在模型的推理阶段,这个推理是inference,就是模型使用的阶段,你去给它更多的算力,然后让它去围绕一个问题一步一步的想生成更长的思维链,也能持续提升这个模型的性能。然后有了这个思维链和更多的推理过程之后,就这一部分它也是模型使用阶段的产出,就相当于作为用户理论上你是可以看见的,当然它可以隐藏,但你能通过一些手段去还原。然后这部分东西就变成了更好的来蒸馏的数据的原料。
【主持人】相当于reasoning model出来以后,大家发现有漏洞可以蒸馏。
【嘉宾】这不是漏洞。
【主持人】对,不是漏洞,或者说有方法可以蒸馏了。
【嘉宾】也不是有方法,蒸馏这个方法之前就有。只是说你能蒸的那个原料变得更丰富了。
【主持人】效果更好了。
【嘉宾】你还有了推理过程这一部分。所以就是第一个变化我觉得它提升了蒸馏这个方法的投入回报比。然后o1带来的第二个变化是说有了更多高级的模型可以生成的,可以用于蒸馏的数据。然后蒸馏变得更多的第二个比较重要的时间点,我觉得确实是跟DeepSeek R1当时发布有关。
【主持人】来说就是R1的技术报告那会儿发的时候,就1月份,25年1月份,它还发了6个小的蒸馏模型。然后这6个模型4个是Qwen2.5的底座,然后还有两个是Llama3的底座。6个模型都是把R1当做教师来学。然后它大概就是在这种方式能不能让小模型的能力提升。
【嘉宾】其实这个才是蒸馏最开始的一种比较主流的目的,就是为了压缩的。就是把一个大的模型的能力压到一个尺寸更小的模型里面。然后它的好处就是说大的模型一般来说就比较贵和慢嘛,一个它是可以降低成本,可以提高速度。另外就是有一些场景,比如说在手机上,在汽车上,这些端侧算力更少的地方,包括未来的机器人上,其实需要相对小的模型,因为它对延时对算力的要求都更多。
【主持人】就比如说我现在都能记起来,我第一次在线下采访中间跟人比较长时间讨论蒸馏是个什么情境。是当时去采访毫末的CEO顾维灏,然后他们是做自动驾驶的。其实他当时就讲了很多自动驾驶里面蒸馏的想法。因为在这个场景是很典型的,为什么他需要压缩,就你在云端训的一个模型,对吧,然后你要放到车上,因为车上当时应该是用Orin之类的吧,这些英伟达的芯片,它算力还是相对有限的,相比于云端的算力。所以你就要让它通过蒸馏和剪枝、量化的这些方法变得更小,这样它能在车上延时更低,速度更快,然后它消耗的算力也更少。而且这个对车,对机器人这种场景,延时低这个事是很重要的。所以这是最开始蒸馏的主要目的。
【嘉宾】它其实不是为了做更强的去追赶。
【主持人】对,它不是为了更强,更实用吧。对,它是为了把一个更大的模型能力压到一个更小的模型里面。
【嘉宾】其实像比如说DeepSeek、千问也会做这种对吧?
【主持人】对,千问是做了很多的嘛,因为千问每次一发,其实它的开源的尺寸是非常多的。
【嘉宾】然后后来就是到我们现在看到的蒸馏嘛。我们现在看到蒸馏其实就是为了变强的蒸馏。
【主持人】所以为了变强这个风气是谁带起来的?
【嘉宾】我觉得这个可能你很难追溯到是谁带起来的。我觉得,压缩和变强是一体两面。我把一个大的模型的能力压到一个小的模型的能力里面,我其实也是让这个小的模型的能力再变强。它一开始就有这个潜力,它就有这个空间。
【主持人】今年以来,大家对于蒸馏的讨论是格外的热烈,比去年热烈更多。
【嘉宾】对,那就是从25年之后大家争得多了。包括Anthropic、OpenAI、Google DeepMind什么的,他们都在25年年初开始了,他们其实也有更多的公开的一些文章,包括他们给美国政府的一些公开信里面,它有更多的去提到就是说中国公司在蒸馏他们。
【主持人】我觉得这是一个比较明显的导火索吧,就让大家更多的来讨论蒸馏。还有一个更重要的大的背景,就是最近这段时间,中国的开源模型的表现是明显逼近闭源模型的。比如说K3就是一个里程碑。其实K3在美国是引起了很多讨论和争议的。这个我们在上两期节目,就177期专门聊K3的时候,开头也是聊了这个事情。所以就各种原因累积吧,一个是它规模应该确实变大了。然后另外就是有了更强的开源模型逼近美国的闭源模型之后,本身中美对这个话题都更关注。所以蒸馏被推到了风口浪尖。但其实也有一些公司不蒸馏,对吧?就我们前阵子也报道了。
【嘉宾】那不是你写的,那是你编辑的。
【主持人】对,字节,就是张一鸣非常罕见的一个露出。我们已经很多年没有写过这三个字了。对,然后我们在报道里面其实也有写到嘛,就是张一鸣在SEED的一场内部会上面提到说,他不允许字节去做这个蒸馏。然后包括我们之前其实也了解到,字节很长一段时间都没有去做蒸馏这种行为。
【嘉宾】嗯,严谨的来说了,罕见的有人不蒸馏,并不代表其他人都蒸馏。Anthropic、OpenAI和Google这些,说谁谁谁蒸馏了,他也并没有暂时完整的证据。然后说回你说这个话题,其实关于这个报道,本身我其实有一些想问你的地方,因为就当时我看这个报道的原文,他只是说张一鸣说他反对蒸馏,其实他好像是没有特别多上下文的语境,或者说他反对哪一种蒸馏,还是所有的蒸馏,而且我也不知道他是怎么定义这个事情。
【主持人】对,他其实没有明确的说我到底什么是蒸馏,或者什么样的方式,干蒸馏,是蒸馏,就是各种,他其实没有这样的一个定义。就是全员会本身就没有其他很多语境。
【嘉宾】OK,你刚才问起是说,怎么看他明确表态不蒸馏这个事?
【主持人】是啊,因为字节他其实是一个算力非常多的公司,然后现在整个大模型的竞争又极其激烈,再加上可能我们一直觉得豆包的表现,并没有预期中的好像说字节一定会领先,或者甚至他在很多领域离领先还很远,比如说coding,比如说agent,就是智能体的这个领域,其实离真正的一线还是挺远的。对,他居然主动拒绝使用蒸馏这种方式,为什么?你觉得?
【嘉宾】这个问题我们可以讨论了,因为你对字节比较了解。首先你那个报道里面不是已经写了几个原因吗?我觉得这也都挺有道理的。一个就是张一鸣他认为说,他觉得蒸馏是短期内可以改善模型表现,但本质上是在复制Claude一流的能力。所以你这么继续干下去的话,你最多只能逼近对方你是不能实现超越的。那潜台词就是,豆包的追求的肯定是做到世界第一吧,就是最强的模型,就是他们的抱负和追求。然后第二个原因就是,那篇文章里写到,就是他希望豆包可以从更底层的维度,去构建自己在AGI上的壁垒,就有可能他认为蒸馏不是一个长期壁垒,当然其实大部分从业者也都这么认为的。然后最后一点,这不是个原因的解释,我觉得是一个比较强的表态,就是说即使不蒸馏,意味着豆包会在技术上短暂落后国内的一些竞争对手,但他们也不采用这个捷径,来推进自己的模型能力。我觉得他自己说的是表态说,然后有一些,我觉得可能我不确定他这个权力会像长成怎么样,我觉得他作为一个这么大的公司,而他在全球都有业务嘛,他对合规,对其他国外的公司怎么来看他,我觉得他会有更多的考虑吧。
【主持人】你觉得豆包今天没有办法达到SOTA的核心原因,有没有可能是因为就是他没有蒸馏?
【嘉宾】这个所谓的SOTA是说国内SOTA吧?
【主持人】你觉得吗?
【嘉宾】我觉得有一定的原因吧。
【主持人】因为你接触一些他们自己的人吗?他们自己怎么觉得?
【嘉宾】我觉得不蒸馏是一个挺重要的原因之一吧,但你也不能完全归结到这件事情上面。虽然这是个万金油的回答,但是我觉得他是挺接近事实的。其实据我了解,比如说豆包2.1,应该是用了一些蒸馏的手段,然后那个是六月份发的。我觉得他在这之后,应该是经过一段时间的思考,他是做了一个比较明确的选择。对,他们内部应该是有比较激烈的讨论,最后还是决定不要蒸馏。而且其实你看他这个时间很短,因为2.0到2.1的话,你算他这个开发的时间,我觉得也就是几个月吧。然后在之前有比较长的时间,两三年的时间,豆包应该是确实没有蒸馏的。
【主持人】你觉得张一鸣自己说的不蒸馏的核心理由,就是蒸馏只能逼近,不能超越,这成立吗?
【嘉宾】我觉得是这样的,就是首先是张一鸣自己提到的,如果研究蒸馏这条路,最多只能不断逼近对方很难实现真正超越,这个是有可能的。我之前也问了很多从业者,大部分人认为这件事在技术上是否绝无可能,
【嘉宾】我是只说蒸馏是否学生模型就不能超过教师模型,它可能不是绝无可能的,是有可能的。我觉得是一个研究课题吧。其实蒸馏有很多方法也可以优化,比如说我是不是可以不仅学某一个模型,我学更多的教师模型,我 博采众长,当然有可能你学不好,就是博采众短都有可能,但大体上它是有很多可以去探索的空间的。但大部分人也都认为,就是蒸馏它会有一个隐患或者说代价,就是组织和人的激励吧。如果说一段时间里面,你把很多精力和重心放在蒸馏上,因为蒸馏确实是一个,我觉得相对来说,它比较经济就成本比较低,而且它比较有确定性,这个是更关键的,比较有确定性地去提升你的能力的方式。如果你把重心放在这个相对有确定性的方式上,那组织里一些去做更长期的探索,去走一些更不确定性的路的项目,或者说人,他们可能就得不到足够的资源和认可。我觉得认可也很重要,其实这种顶尖研究员,他还是很需要一个,就是这种更创新的研究能被鼓励,能被看到的环境吧。我觉得有这个组织上的隐患。所以综合来说,就把技术和组织都考虑进来的话,那张一鸣说有可能很难超越,也许是一个真实的情况。
【主持人】其实当时就是你这篇文章发布之后,我自己在朋友圈还有极客,我都写了一个挺长的分享的。我就是在问,我之前就在想的那个问题,就是学生模型是否一定不能超越教师模型,然后我也分享了一些我当时就获得的,这个行业里的一些从业者反馈。然后有一个人在极客上的留言,我觉得就挺有意思的。他就是说张一鸣可能不是最懂技术的,但他大概是最懂人性的,就可能会有这种组织上的代价吧,技术上的另外蒸馏还有一些内在的技术上的一些问题。比如说你有可能会学到教师模型的一些错误,和他的一些什么缺陷表现,总之你的行为会比较接近他嘛,你也可能会学到一些不好的东西。所以他也有一些技术上的问题,那其他公司的人难道就不会意识到这个问题吗?因为我们知道可能国内可能也有几家公司表现出来,他对AGI是有信仰的,我觉得他们应该也能看到蒸馏的一些代价也好,一些负面的影响。
【嘉宾】我觉得取决于你认为这个代价是否是可克服或可接受的吧。就文章里有一个比喻,一个运动员理论上是可以既嗑兴奋剂又勤加训练的,也许真的就有人是这么干的,只是说一般而言,你如果嗑兴奋剂之后,你肯定是会有一些侥幸和惰性的。可能其他人想的是,我可以克制这方面的,我可以减少这方面的问题,或者我不一样,这个我不知道。这个你可能得去问每个公司的,这些决策者他们是怎么想的。还有一种可能,因为蒸馏只是优化模型的方法之一,有可能对一些公司来说,他什么阶段什么方法有用,他就会在这个上面会做投入。那过了一段时间,也许你会发现更有用的方法,其实你就可以去用那些更有用的方法。而且确实在实践中,一个公司他做蒸馏,首先这肯定不代表他后训练的数据全部都是来自于蒸馏的,他肯定也会有别的数据。另外也不代表他不干别的事,他肯定也得做Infra的优化,然后他可能会去有一些算法和架构上的优化等等,他也会去更好地去构造他自己的预训练里的数据集,他还有很多别的手段。
【主持人】其实上次圆桌会的时候也说到,自从张一鸣有这个名称的表态之后,有一些人想从字节离开吗?是是是,确实是这样的。但这个其实也很个体,你说有两三个三四个人离开,好像也不稀奇。然后他们个体的原因,就是认为他们觉得,不应该放弃这种方式是吗?
【嘉宾】因为你的职业生涯是有限的,就是你每一个人的,从个体的角度来讲的话,那我当然是希望,比如说我在字节的这几年时间里面,做出自己的代表作。明白,就是,希望我的职业履历里面,我所在的团队是做过最强的模型的,就比如至少中国最强的模型。对,我最宝贵的这个人生阶段,或者说我的职业阶段,可能就是这几年,然后我一直在里面陪着你好。当然这个是非常,我知道非常个人化的,对,个人化的这种想法。
【主持人】我觉得也合理吧,而且其实你去推测的话,有人会这么想,也可能会有人被张一鸣的这种表态感召,对对对,那如果他不蒸馏的话,从你的角度来看的话,他现在更应该做什么,或者说他的重心应该是什么呢?就是自己怎么去构造、构造这样的数据吗?
【嘉宾】是是是,而且你已经看到他有动作了,也是本周,就智能涌现有一个报道,是说自己从6月开始重做数据团队,然后现在是要成立一个新的和CEPC和Flow平行的一级AI部门,是叫AI数据和安全,就是他把数据应该是就作为一个很强壮的能力给他抽出来,然后成立了一个就级别还挺高的一个大的团队吧,所以我觉得他得自己去获得某种你不依赖于外部的领先的基座模型,不依赖于OpenAI、Anthropic这些公司的数据的能力。
【主持人】我又想问你呢,就他们新成立的这个AI数据安全部门的这个负责人叫王颖雷,Adam王,这个人你之前接触过吗?他是原来在TikTok负责直播的,他跟文家和Alex都汇报过,所以相对跟他们之前都共识合作过。因为我看公开信息就是他之前在TikTok,然后想来负责数据,因为我不太确定这两个事儿之间的相关性。就说到数据这个事儿,其实现在有很多第三方的数据公司也做得很大,所以这个我也很好奇,就是如果我用我第三方的数据公司去做蒸馏,然后我去买他们的数据,那这个算什么呢?因为我也听说一些公司,他可能说自己不蒸馏,可能在题外去做一些操作,来实现蒸馏的这个目的,那比如说我买第三方数据,这个算蒸馏还是不算蒸馏?
【嘉宾】我觉得这有很多操作空间吧,分两个层面来说,就是他在技术上我觉得,如果你是让你自己要调的那个模型,然后你去逼近你获得的一堆更强的模型的这个输出和行为,我觉得技术上他是蒸馏。至于法律上,或者说你是否违反对方用户协议上,这个问题是否能绕开有很多操作空间,包括如果之后美国有更严厉的限制的话,可能也有对方政府的一些限制,这就不单纯是技术问题了,这应该就会涉及到很多不同层次的问题了。
【主持人】我们接下来可以讨论一下更多公司,或者说整个行业的情况,比如说DeepSeek、Kimi、智谱、千问这四个模型里面,从你的角度来看,你认为谁最可疑?
【嘉宾】我就想反问你,为什么是这四个公司?因为这个不就是大家传的比较多的,就这四家。
【主持人】首先这个肯定没法评论,到底谁在蒸馏,谁不在蒸馏。
【嘉宾】其实我们可以看,美国这些公司他们是在点名谁吗?Anthropic在2月的时候,他是点名了三个公司,是DeepSeek、Kimi和MiniMax,然后6月的时候,他又点名了一家公司,是阿里的千问,其实反而智谱是没有谁说,就没有人公开来说,没有美国公司说智谱在蒸馏或者疑似蒸馏,然后OpenAI说DeepSeek有这种疑似蒸馏的行为,对,所以这只是公开信息分享一下。
【主持人】那你怎么看,比如千问前一段时间,就阿里被Anthropic点名以后,整个集团都开始禁用Claude Code?因为6月的时候,Anthropic应该是给美国的国会有一个信里面就提到了,千问疑似吧,跟它进行了很多交互,是有2880万次,而且当时Anthropic说的这是有史以来发现的规模最大的蒸馏攻击。
【嘉宾】我觉得这两个事可能没有直接的必然的联系。首先它可能是一个合规的表态,你本来中国的用户理论上就不能用Claude的模型。然后另外我觉得,他也会要考虑自己的数据安全,也许他不希望让内部的很多对AI的使用就是通过这个模型,他可能想让他们用自己的模型。这我觉得他确实不一定和蒸馏有关。他也是在中美模型进行真的这个大鱼吃小鱼。
【主持人】如果中国所有头部模型都不允许蒸馏了,你觉得现在格局会发生什么样的变化?
【嘉宾】你如果让所有人都不蒸馏,那所有人其实就在这一点上都是一样的,那就还是看你别的能力。我感觉可能没有什么变化,不会有变化,因为你还是得看你别的能力。
【主持人】那你的意思就是说,Kimi还是SOTA,智谱还是能领先,阶跃还是落后?你这个又预设了其他人都在蒸馏,而阶跃没有蒸馏,对吧?然后如果所有人都不蒸馏,阶跃是不是看起来就跟大家差不多了?
【嘉宾】是,这我真的没法判断,而且这个假设肯定也很难实现了。
【主持人】那我们其实有什么迹象可以看出一个模型是不是蒸馏的吗?比如说模型有的时候经常会说,比如说一个非GPT的模型,他在回答的时候有的时候会说自己是GPT,然后或者是说我是OpenAI训练的,那有的人就会把它来当成蒸馏的证据,你觉得这个靠谱吗?
【嘉宾】这个肯定是不靠谱的呀。就你直接问一个模型A,你是谁,他说是B的话,这不能证明A蒸馏了B。其实2024年11月的时候,就有人做过这种研究,当时他们测了27个模型,有中国的有国外的。他设置了一个77个问题,这个研究就是在研究模型的身份混淆的问题。就免不了会出现,比如说GPT-4会说自己是GPT-3,然后Gemini Pro会说自己是百度文心,阶跃的会说自己是GPT。那这个论文的结论是说,你仅凭他们身份混淆,其实很难判断谁使用了谁的训练数据,更不能说明蒸馏。更合适的方式可能是你去看他们的输出分布的时候,接近,就还是看他整个行为是否接近。
【主持人】你的意思,比如说他说话的方式,他的输出的格式,拒绝回答的方式,或者是代码的风格?
【嘉宾】对,但我觉得这个需要很大的量,你不是问他一两次,然后你觉得很像你就能证明什么的。然后另一方面就是,你说你要去判断一个模型是否蒸馏的原因是什么?
【主持人】对,可能这个问题先入为主有一个印象,可能会觉得说,蒸馏是不是一件不好的事情?
【嘉宾】如果作为用户来说的话,这肯定不影响你使用。但确实可能,假如说你是个投资人,或者说你是一个要买二级商股票的人,你是一个想找工作的,我在这几个公司里选一个,那可能取决于你的基础判断吧。就你认为蒸馏这个事长期来说,对一个模型研发团队是不是一件好事?是,然后你去看他蒸馏论美,这个我觉得就对你比较有价值。
【主持人】对,那我们说回蒸馏的方式吧。你觉得蒸馏真正困难的地方在哪里?比如说你是真正的拿到了这个几百万条的Claude回答比较难,还是说我应该知道怎么去向Claude提问比较难?如果我们大家所有公司都可以狠狠地蒸馏,那蒸馏的核心竞争力是什么?
【嘉宾】我觉得可能很难回答哪一个部分更难,可能每个公司不一样。
【嘉宾】看你自己的薄弱环节是什么。就我可以讲一下我知道的,比较有一些难度的环节,这个也是在文章里有展开的。一个就是在最开始嘛,你怎么获得稳定高频地去访问这些模型的账号,然后包括你怎么去做用户运营。就用户他可能是帮你提供一些真实的、高质量的数据的,用户提供数据。
【主持人】对,因为你有些真实数据是从用户运营去筛的。你是说用户的提问吗?
【嘉宾】提问。对,真实的提问可能只是一个种子,然后你可以围绕它再去做扩增和改写。有一种行业里比较常规的做法,就是你建很多中转站,然后你再让一些人来通过这个中转站去用领先的GPT或者Claude的模型。然后最好这些用户是真的能提出这种比较有质量的问题的用户,而且他们真的有这个需求。比如说他可能是一个高校里的理工科的学生,或者是一个研究者,或者是一个高级程序员和开发者。这其实是一个运营的工作,他也有技术的部分。当然中转站你不用自己建,也许你也可以去找一个比较稳定的第三方。包括这个过程中间你也要防止自己被坑嘛。假如说你和一个三方中转站合作对吧,那人家也可以在领先的模型中间掺一些就是可能你不想用的模型。
【主持人】对,我知道有某一家模型就是用中转站,结果发现他其实挣出来的是自己的,就自己在挣自己。
【嘉宾】对,OK,好吧。第二个,整体来说我觉得就是一套数据管线嘛,就包括你怎么去构造题目,其实也是一个构造数据的过程。然后你如果说你有很多这种高质量的用户,在真实的任务、真实的场景下有很多这种真实的提问,你从里面肯定是要筛选的,对吧?那你怎么筛选、过滤,去从这些真实的数据里提取,然后你怎么进一步用模型去扩增和改写这些数据,终究还会涉及到纠错,以及整个就是这个数据的形式和配比。这套数据管线我觉得是会有一些难度,或者说至少它是有些经验Know-how在里面的。以及你整个这个系统,它是否比如说成本比较低了,然后比较稳定了,这个也会影响你大规模这种操作的时候的效果和效率。所以整体来说它是一个,
【主持人】比较复杂的系统工程,就回到你前面说,它是不是蒸馏吗?对,就如果你非要说它是蒸馏的话,那就是一个非常复杂的蒸馏过程,非常复杂,本质上就已经不是蒸馏了,不是你一笔一划对着人家写一遍就对了。我理解了,大概就是这么实现的吧。所以,一家公司如果它真的想隐藏自己的蒸馏行为,你觉得最常见的方法是什么?
【嘉宾】它想隐藏,它是想……
【主持人】对,就是Anthropic和OpenAI。那我不知道,但如果它不用API,而是直接下载一个开源模型,然后在自己的机房生成数据,外部是不是几乎是没有办法去发现的?你就说它去蒸馏一个开源模型,假如说一个开源模型变得很强了,对吧?
【嘉宾】其实最近黄仁勋在一个采访里面也被问了这个问题。现在很强的开源模型是很大的,比如说K3接近2.8T,然后像V4也是1.6T。首先就是你部署一个这种这么大的开源模型,它也需要挺多算力的。然后你如果部署完之后,还持续地用它去跑训练数据,你的电费应该也挺高。就是它会比较容易被监测到,如果说政府或其他人认为这是一种隐患的话,可能政府比较好监测到。
【主持人】那如果我一家公司,同时像Claude、GPT、Gemini甚至是DeepSeek,然后轻问每一个模型,我拿一点点数据来,然后再让自己的模型去筛选、去重写,那我是不是就很难看出我是某一个老师的痕迹?
【嘉宾】有可能,但是这个并不能向被蒸馏的厂商隐藏你的蒸馏行为。因为只要你有一次,比如说大规模高频地去使用他的API……
【主持人】对对对,就你有类似这种异常行为,其实对方就有可能能看见吗?
【嘉宾】他其实不是从结果来发现的,而是从这个过程中发现。
【主持人】对对对,其实那个Anthropic最近他有说嘛,他说他们就是搞了一些更强的反制措施,他说他已经建立了蒸馏流量的分类器和行为指纹系统,他可以发现跨账号协同、重复提问,他不是等其他模型蒸馏了他之后才发现。
【主持人】他从你的表现来看的,但我觉得这是一部分,就是过程中他也能看到,以及他们这一次还讲,他们会加强对教育、研究还有创业公司的这些账号的身份认证。这个我刚才说的,就是你运营的过程中间,比如说你找一些高校学生来用,其实他也是相互应的。
【主持人】然后你比较关心这个问题,是因为你比较关心怎么藏这个事儿,是,你觉得藏了之后的结果是什么了?
【嘉宾】我觉得很直接的一个结果,比如说这样举例,我不知道合不合适,比如说千问也好,Kimi也好,他们现在是没有在美国的实体清单上面的。但我首先没有说他们蒸馏了,假如说我是Kimi,或者是我想去做蒸馏这件事情,我又不想被上美国实体清单,我不想被,你想知道这是否可能,对吧?那我觉得这可能也算是蒸馏的另一种代价吧,你确实会有一些合规的隐患,而且你总是会有一些痕迹的,所以其实蒸馏本身是会受到一些约束的,它也不可能不可能无限的大规模的扩展,包括大家也会考虑成本啊。
【主持人】那我们说说这个蒸馏的好处吧,就是我们刚才也提到嘛,学生能不能超过老师,你觉得呢?
【嘉宾】其实我刚才说了,我觉得技术上是有可能的,或者至少说我接触的从业者认为技术上是有可能的。但是有几种可能方法,比如说你刚才提到的我向不同的老师去学习是蒸馏,其实现在在后训练链去合并不同方向的专家的能力的时候,就是会用到这种多教师的蒸馏。那多教师的蒸馏,这个思路是否也可以用来让模型变强?我这纯粹就是一个抛砖引玉的技术推想啊,但也许会有人去试这个方向。嗯,包括之前有一些研究就是这个文章里有写啊,其实你在一些比较特定的任务上,你是有可能让一个学生模型就在那个具体任务上超过教师模型的。
【嘉宾】然后各方面的能力都更强,所以我觉得它是一个开放式的可以去被研究的问题,就你说学生模型能否超越教师模型啊。嗯,其他的好处比较明显嘛,好处就是一个你可以相对低成本、确定性高的去接近更强性能的模型的方法。
【主持人】那超越老师,意不意味着它这个模型就是一个frontier的模型?
【主持人】就是一个最强的,它可以是最强的模型,但它不一定是创新的模型是吗?你就说靠蒸馏,能不能变成世界第一,对吧?或用世界第一的标准是什么?
【嘉宾】我觉得我们先不用说创新不创新啊,世界第一的标准,那就是按照现在的比如说各种对智能的评测表现最好。
【主持人】对,它表现最好嘛,其实就是回到我刚才说的一个问题嘛,那如果你已经学了最好的教师模型,你还超过了它,那你是有可能变成世界第一,我觉得这是个技术上的能力有关,其实现在就是各领风骚几个月嘛。而且其实你可以观察一个现象啊,就像Anthropic这个公司,它至少今年上半年有几个月,它还是持续领先了,还是最近这段时间,因为有很多新的模型在密集的发布,包括Claude 3,包括Grok,Grok怎么样对,昨天也是刚刚发了。所以最近这一短期的记忆里面,我觉得大家会有这种感觉更急迫吧,就是看起来开源已经非常接近闭源,但首先它现在还没有接近,其实其实在如果你拉到半年的维度,那中间我觉得有几个月的时间,Anthropic还是领先的,Anthropic和OpenAI,所以可能现在这个阶段过了之后,也许对方又会,我就指最强的闭源模型的公司,他们可能又会跳一步,然后其他公司跟上,然后他们又会跳一步。就我们现在看到的实际情况可能是,你通过蒸馏的方式,你暂时是没有办法超过老师的。但换个角度来想,对于所有商业公司来说,可能现在有了蒸馏这样的方式,你的后发者反而其实是有优势的,你可以用更新的这种数据,更强的模型来蒸馏,获得更好的数据,然后你对于领先者的这个差距其实是逐渐缩小的,可能也就短短的几个月,甚至可能时间更短。
【主持人】那听起来其实是合理的,对吧?你就说对他们有什么问题,对吧?对这个开源公司,如果不超越,我也可以接受。
【嘉宾】对,我觉得这个其实就是大家怎么去想更强的这个AGI之后会怎么到来?就比如说有一种假设是这样,像OpenAI和Anthropic,
【主持人】现在都讲很多什么自进化的这种能力。那有可能你自进化到了一定程度之后,人在里面的作用会变小嘛,然后如果你用更多AI来去优化AI,其实你的速度是会非常快,你自动化程度很高,那可能它的加速度会越来越大。那可能会把后面的人,就是,其中一种假设。那在这种假设里面,你率先达到某一种状态还是很重要的。就也许你今天看每一次Anthropic、OpenAI,或者背后的模型领先几个月或者几周吧,那也许再过一段时间,他们到了另一个状态之后,这个时间差就没有这么容易缩短。但这只是一种假设。所以这个东西我觉得也不能满足于说我们现在因为有这种方式,我跟他跟得很紧就OK了。
【主持人】我觉得大家非常依赖于蒸馏,可能也只是阶段性的状态,它也只是一种方法嘛,然后你其实可以组合很多方法吗?那我觉得接下来我们可以聊一个话题啊,就站在普通人的视角,对于蒸馏是有非常多的印象,或者是不管是刻板印象也好,或者是很热门的讨论也好,比如很多人就会觉得蒸馏是一个带有原罪的行为。为什么会觉得有原罪?
【嘉宾】原罪是,原罪是可能就是我们刚刚讲的,就是他用了别人的数据。但其实我理解,我们刚刚聊下来,他就是在灰色地带,对吧?
【主持人】我觉得原罪这个词肯定是有点严重啊,对,我觉得他是个灰色地带吧。
【嘉宾】他肯定是违反了那些闭源模型公司OpenAI、Anthropic的用户协议的,但是违反用户协议,不一定构成法律上的侵权,这个要看其他的法律规定。另外就是,其实我最开始也说了,我觉得他们的用户协议就限制得很宽泛啊。
【主持人】你觉得那我们现在来讨论蒸馏这件事情,你个人是觉得我们应该讨论比如说能不能蒸馏,还是说什么样的蒸馏方式是可以被接受的,你会有一条红线吗?
【嘉宾】我觉得就是有一些明显是违反现在全球比较通行的法律法规做法,肯定是不太能被接受的。比如说你用一些黑客攻击的方式,你直接侵入其他公司或者实体的系统,你通过黑客的方式去破解思维链什么的,这种是不太能被接受的。
【主持人】然后你说到就是怎么去考虑蒸馏这个问题。其实我觉得大部分做模型的人和这些模型公司的人,他肯定不会单独地去考虑蒸馏这个问题,他们考虑的问题是我怎么用各种方法去让模型变得更好,以及我构建更长期的能持续做出更好的模型的能力。他们应该会整体地去考虑这个问题,然后蒸馏是其中的一种用的方法,你用到什么程度、你怎么去用,因为蒸馏有一些不同的操作方式,包括你也可以选择不用,都是不同的选择,对吧。你可以想象他会有一个比如说一个特别大的控制板,其实有很多东西都是可以调整,那蒸馏只是其中的一个选项。我觉得他们会从这个角度去考虑吧。另一个就是,那我们看到OpenAI和Anthropic他们在做预训练,也会弄大量的数据,从实体书来也好,从盗版书、从各种各样的视频网站扒下来也好,去搞这种爬虫也好,他们这种行为跟今天我们所讲的蒸馏有本质的区别吗?
【嘉宾】对,我觉得这涉及到现在讨论中的一种常见的对话展开方式,比如说美国公司说中国公司蒸馏,然后中国公司就会说双标,对,会说你双标。或者说那你之前也是去用了很多这种可能也没有授权你可以来做模型训练的数据,甚至有的数据他根本都没买,对吧。你比如说中国公司去用这些账号,那还是付了钱的。那个他最近有一个15亿美元的集体诉讼的和解,那个具体那个案情就是当年他是在一些盗版图书网站下了很多书的,这个过程他去就直接他就没有给这些书付费,然后是有很多美国的作家集体诉讼告了他这个事情,目前已经达成和解了。就大家会去比这两种行为嘛,我觉得整体上来说那肯定是双标的,只不过这两种行为他也不完全一样啊。怎么不完全一样?首先他的侵权行为我觉得是不一样的,比如说Anthropic那种我直接就搞盗版书,对,那肯定是侵权的,你本来你没付钱买书……
【主持人】你就侵权,你就先不说这个,我买了之后是否来续模型啊?那买了之后,来续模型是否侵权?就我不就好啊。但目前,我们看美国的,就只要你付了钱,就不侵权,是吗?
【嘉宾】是,是。但只是周的这个法院怎么判的?因为美国是案例法,就美国其实他后面的类似的案件,他会去看前面的一些情况是怎么判的。
【主持人】这个倒是有点价值的回旋标啊。那么再想之后,如果说这种方式加州的法院认为他不构成侵权,对,那其他的公司用Anthropic的产出再来提升自己的模型,这是否构成侵权?这个很有意思的话题啊,这个案例挺有意思的。
【嘉宾】是。
【主持人】那我们其实最后可以做一个预测,就是你觉得,三年以后,蒸馏是会像爬虫一样的普遍,几乎无法阻止,还是说可能美国的几家frontier lab最终能够通过所谓的账号体系也好,模型设计也好,甚至是法律手段也好,把它给最终给禁止掉呢?
【嘉宾】首先,我觉得这个行业可能没法看三年之后,三年之后这个太久了,有三十六个月,就不知道AI已经怎样了。然后你说就最终这个蒸馏会被避大幅的压下来,我觉得这个博弈肯定是会进行的,其实就是你有一些手段,然后我再来反制你的手段,我可能又会找一些新的手段。所以蒸馏本身它有很多现实约束,它也不太可能肆无忌惮的蔓延,大家也会考虑成本的,你这多少花钱呢。
【主持人】如果蒸馏越来越容易,那今天就是投入几百亿美元训练这种frontier model的商业模式,会不会有根本性的变化?因为今天其实已经看到,大家对于所谓的斩杀线也讨论得挺热的吗?其实之前177期聊K3的那期也讨论这个话题。
【嘉宾】首先,短期内的市场预期是Anthropic和OpenAI的估值会受一些影响,甚至有人认为就会冲击他们IPO的进程。但我觉得前提是我们现在只看到此时此刻。前面比如说马斯克昨天他在恢复另一个公司的一条推文的时候说,Grok 3会超过现在的所有的模型,但他也补了一句说,Anthropic的下一个模型可能会非常强。
【嘉宾】就有可能比如说过了一个月Anthropic又发了一个很强的东西,那我觉得大家的预期又会改变,闭源模型公司可能他有一些后手是没有展示的。所以我觉得还比较难说是否就真的冲击了投入很多钱去开发一个非常领先的。但是有一件事我觉得也比较明确,就是他是冲击了商业逻辑的。就是像DeepSeek V4包括Grok其实也是一个性价比很高的模型,然后有那张很著名的那个展示性的图,就是在DeepSeek V4还有Grok 4.6的下方和右边,就那个区域里的模型都是被斩杀的。
【嘉宾】就现在确实有一个问题,我觉得就是说可能对很多任务来说,目前这一批最强的模型已经很够用了。比如说他们也是做那种偏生产力的应用,他跟我说可能用户的十个任务里面八个都能被DeepSeek V4 Flash解决,当时Pro还没有正式发,而且Flash就真的非常便宜,速度也比较快。这个我觉得确实会改变很多,就是商业逻辑的,就是他至少会改变很多定价策略。而且这也涉及到一个更大的问题,就是说你的智能的供给和需求之间现在是什么关系?目前看起来其实对很多人的日常的使用来说,可能你的智能过了一个限制后他确实就够用。
【嘉宾】我们上次其实讨论姚顺宇那个播客后面也在讨论这个话题,就说你搞定极客之后,你再往白领这种市场去扩散的时候,对智能的需求并没有那么大。我觉得准确的表述是这样,是说对智能的需求的规模和他的节奏,就是他的速度,一路那么快,其实要打问号。最近我跟一个平时交流了比较多的投资人的朋友,他也是在想这个事情,就想的问题就是我们之前都说给极客做比拼生产力强,万一错了呢。那这个错了的可能性也是在于说,可能对很多白领的工作来说,就现在这模型真的已经够用了。你搞更强的模型,这个叫什么杀鸡用牛刀,可能你没有用武之地。
【嘉宾】你就停弄到,对,我觉得这可能是比争流更大的一个问题,就是你现在智能的、未来是一个怎么样的匹配,规模上、节奏上。其实我自己就是上次我们录那个姚盛宇那期的时候,我对这个问题我当时是从个人感受上来说是相对悲观的。因为我那会儿其实除了用模型做偏deep research的工作,我别的工作做得比较少。但是后来一段时间我用这个ChatGPT codex,就他的工作work那个功能特别多,我感觉他确实能让我干很多以前干不了的事。所以那段时间我又会比较上头,但是你冷却一段时间之后,你仔细想,你是不是每天都要那么高频的去手搓各种工具,这个频率确实会下来一下,就你对更复杂任务的需求确实会下来。所以我觉得这是一个可能在争流之外的,很多人现在已经在想的问题了。
【主持人】是,那我们今天其实讨论了非常多关于争流的这个话题,争流的历史,它可能不是一个非黑即白的一个概念,对吧。然后包括我们字节,为什么不争流?争流的代价是什么?我们字节,哈哈哈,OK,对,不是我们字节,就是说错了,对,这份挺有节目效果。所以我相信大家对于争流会有一个初步的印象和认知吧,嗯,对,那今天节目就到这里。
【主持人】最后补充一点就是,因为我们收集了很多关于争流的信息,我们并不是直接做这件事情的从业者,是。所以这个文章是更多一个抛砖引玉的作用,希望大家在评论区、在留言区能分享更多你知道的,关于争流的一些方法,或者一些你的观察,或者你对这件事情的态度。我们也可以收集更多信息之后,给出一个更完整的2.0版本,那感谢大家今天的收听,拜拜。
【嘉宾】拜拜。
【主持人】本期节目就到这里,感谢收听。如果你对今天聊的话题有观察、好奇或疑问,欢迎在评论区分享想法,这里会成为我们节目的一部分,让整个讨论更完整。你也可以把我们的节目分享给对这个话题感兴趣的朋友,推荐更多,
【主持人】你想听的主题和嘉宾,你可以从小宇宙、苹果Podcast等渠道关注晚点聊LateTalk,也欢迎关注我们的公众号晚点LatePost,下期再见。