Vol.230 产业观察43|AI for Science 如何在制药化学合成落地?
【主持人】大家好,我是峰瑞资本的合伙人李丰,这次我们是产业观察。最近这个行业里,在我们这个方向上,或者在一级市场里,最热的方向之一是AI for Science,就是在中国倡导了AI,或者叫人工智能+。当然大家其实从7月底的中央政治局经济工作会议当中也看到了,推动基础研究的发展这个话题,也被专门提在了政治局经济工作会议的新闻通稿当中进行了突出。这两件事的叠加,就变成了如何把AI用在各种各样的包括生命科学的研究上,进行提高效率,提高转化能力,提高预测和筛选的各种各样的效率。所以今天我们就AI for Science这样的话题,在我们这期的产业观察里,请到了一位我们被投企业的CEO,夏宁。他做的事情呢,正好在AI for Science上,或者在AI for化学合成,或相关合成的这个领域当中已经探索了有几年,也取得了不错的,不管是商业还是工业上,还是研究上的一些成绩和突破。我们先请夏总来给我们做个简单的介绍。
【嘉宾】好的,大家好,我是智化科技的创始人夏宁。简单说就是我是学化学一直读到了有机化学博士,后来在法国博士毕业之后呢,就选择了一个交叉领域。这主要是当时我从小就很喜欢编程,然后在华罗庚金赛获了这个全国的奖,所以当时就想能不能找一个工作,让计算机来解决化学的问题。这个是我认为一定能实现的,我觉得在这个意义上它靠人的双手去做,通量有限,而计算机呢,它从最开始就是可以复制的。从08年就开始创业,到现在也有接近18年的时间,所以在这个领域也是看了各种不同的公司商业模式等等,但是我们一直坚持在AI和化学结合的领域在一直探索,而且现在也自认为吧,取得了一点点成绩。
【主持人】对,我就说其实很有意思,因为我们一直有关注,从2015年我们基金开始就这种我们叫交叉学科,但是交叉学科当中这种计算,或者叫计算机和生物治疗和化学的结合,也一直是我们关注比较多的方向。之前已经出过一些上市公司,像我们投过的晶泰、剂泰等等。这个行业从过去的这10年或者说10年多一点走过来来看,我们有个我们自己的经验积累,就是两个问题。第一个是这个行业比较难找的是凑巧它脚踩两只船,就是我们讲正好它的能力横跨在两个领域,而且在学科方向上是不交叉的两个,比如说计算机和化学。当然第二个问题是脚踩两只船上最后其实哪一只船更重要,这个我们放在第二个话题来讨论。我们先来看看这个脚踩两只船的第一步,就是怎么能够兼具两个行业的能力。我不知道从夏博士你的成长经历来看,怎么能够在那么小的时候把化学和计算机这在小时候都看起来不太相关的两棵树,给连到一块的能力是怎么建设出来的。
【嘉宾】谢谢丰叔,其实当时也是自己的一个兴趣吧。编程是一个非常逻辑性非常强的一个学科,化学当时又需要很多的记忆和对大自然的一种好奇,所以我觉得我正好有两种好奇心都具备。后来在一个机缘巧合,当时两个竞赛都获得了奖,当时要选专业的时候就很犹豫,到底选计算机还是选化学。后来就是招生老师跟我说了一句话,他说计算机是一门技术,化学是一个专业,你要先学一个专业,技术你已经具备了,所以说当时就觉得还是选择化学。后来证明也是正确的,就是所有选计算机的人最后想叫他到化学,其实难度非常的大。
【主持人】那我不知道,你在学化学的时候,计算机这个方面的原来积累的这些素质能力和潜力,怎么能够保持它们不掉下去,或者怎么能够在上学期间持续积累。
【嘉宾】那时候出于兴趣我每天都在写代码,就是白天做实验晚上写代码。
【主持人】都是什么变态的兴趣。那你那个时候写的程序主要都跟什么相关的?
【嘉宾】说实话也跟人工智能相关。当时是多少年前呢?很多年前,那个时候我就开始研究,当时就是兴趣,我觉得人的大脑的思维方式,是不是能用程序来模拟,所以当时做了很多这方面的探索,但是肯定是没有太成功的,成功的话现在可能就做别的了。
【主持人】要成功的话,现在就是第三次成功创业了。那在当时去国外念博士,或者说在国外学习的时候,这两方面能力怎么才能同时进步?这还是说在给博士做研究,或者说做实验的同时,晚上也得有这个变态爱好写这些代码?
【嘉宾】确实是。而且做的跟我的化学研究还不太一样,就纯粹是计算机方面的一些程序。方向类似就是我当时试图在一些领域,做出一些模拟人工智能的一些技术,但是它的应用可能在一些类似于游戏,一些下棋这种上面,就是模拟人的一些判断。
【主持人】所以特别可惜没有做出个RPG?
【嘉宾】对。
【主持人】好,那从在博士毕业的时候,在选择留在国外还是回国的时候,我不知道当时有挣扎,或者说有不同的取舍吗?
【嘉宾】博士毕业的时候,当时国外还是发展的不错,欧洲还没有到现在这个样子,所以当时还是选择在国外继续创业。但是当时就是在找一家创业公司,能用到我的计算机技术和解决化学的问题。当时其实这样的岗位非常的少,所以有幸找到了一家创业公司,它的网页刚刚做出来,公司还没有成立,但是就是在法国的斯特拉斯堡,后来我就去那边跟那个老板聊了一下,觉得非常的契合,他们也是想用数据来解决化学的一些预测的问题。
【主持人】这就是你说的18年前的创业的开始?
【嘉宾】对。
【主持人】我不知道在这个第一段在国外的这个创业经历,持续了多长时间,或者说参与创业公司这个程度?
【嘉宾】我们做了7年的时间。那时候这个领域完全不热,根本没有什么投资人看这个领域。从08年到15年,那时候没有什么资本的助力,全凭个人的理想兴趣,然后再加上我们要从头搭建所有的基础设施,基础设施也没有。所以当时也没有现在的这些底层的各种AI技术,包括数据都没有,所以就是真的是从零开始。
【嘉宾】一点一点想解决这个问题需要什么,我们就找什么,然后研发什么技术。所以那些年可以说把整个这个领域探索了一遍,找到了一些方向,但是都不是现在这种直接可以看得很清晰的一些方向。但那个时候找的方向,从化学和算力的结合来看,也是最后落脚在了用算力加数据来解决化学合成当中的路径探索问题吗?还不是。那时候第一件事我们就先要找数据,因为我们连数据都没有,所以我们做了多种尝试吧。其中一种就是用类似于高通量的实验来产生数据,就是人来做,那时候没有自动化,做个几百个、上千个是可以做到的,后来发现这个数据量还是不够。后来我们还做了从博士论文中去让人来把中间的数据结构化来做这个事情,后来发现成本太高,效率也太低。后来我们还做了电子实验记录本,希望给到高校使用,高校老师能用记录本之后把他的数据共享给我们,这种模式也在跑,但是后来也遇到了一些商业上的困境,比如老师他一般没什么钱,所以就需要融资去一直推进这个方向。
【主持人】那我不知道这个创业公司后来从当时既不受待见,又难做又没有适合的AI模型,当然获取数据也比较困难,最后这种叫多头受阻的情况,这个创业公司最后怎么样了?
【嘉宾】最后被他的母公司收购了。他的母公司现在是法国最大的CRO公司,那时候积累了大量的底层技术,就是我们现在的底层架构,很多时候也是那个时候积累起来的。所以那个时候这件事结束了应该是一五年,然后一五年就回国了。回国了之后,先有一段帮同学,或者帮朋友的这个创业经历,跟朋友一起创业。当时是网化的老板,他把我叫回去,然后当时正好是中国资本非常热的一个时候,所以那个时候就是这种化学品B2B的这种电商平台很火,所以网化当时也融了不少钱。我们就一开始搭建这个平台,包括底层的数据架构,包括它的一些搜索逻辑,这块都是我来负责。后来就在那个时候,我们就想能不能把我之前想做但没做的一个方向,就是这个AI逆合成,能够做起来,所以当时我们全球最早申请了专利,然后开始做了这件事情,当时也是最早把它商业化的。
【主持人】对,在2015年你们成立风锐的时候,那个时候确实叫电商相关的垂直模式是比较热的时候,就包括这些B2B的交易平台,从当时分拆出来。这个时候可以介绍一下,就到今天的这段创业经历,是从做这个化学逆合成的路径探索或者预测,这件事是从哪一年开始的?
【嘉宾】该说从12年还在法国的时候,就已经有这个萌芽的技术了,当时我们就探索了一些底层技术,但是后面没有把这个产品推到商业化,只有回国之后,我们才在解决了数据的问题之后,才开始探索商业化这个事情。
【主持人】那当时那个时候,我们也有幸正好碰见了夏博士,然后参与了这个智化之后的多轮融资。那我不知道,就从2018年年底的时候,成立你自己的这个智化公司开始,现在可以给大家描述一下,今天你在做的智化,到今天为止,这七年多的业务探索之后的今天的样子,提供的产品和服务和模式是什么?
【嘉宾】其实从方向上,我们自始至终从创业开始到现在都是同一个方向,就是用AI或者叫算法数据,来去提供化学的一些模型解决方案,帮助研发的降本增效。只是中间呢,我们在最早期的时候,我们的模式就是一个软件模式,用SaaS的模式提供给客户,后面逐渐演化出了几种不同的模式。首先我们尝试过用这种自动化的解决方案,结合我们的软件去提供整套的解决方案,但是后来遇到了一些困难。
【嘉宾】当然这个就是说,在我们的一些探索中,发现硬件还不够成熟,而且它迭代的速度比软件要慢得多。
【主持人】我稍微打断一下,所以这个硬件的意思是指,整体化学实验的全流程的自动化和数据吗?
【嘉宾】对,对,是的。就是一个是硬件本身的成熟度,第二个就是它的迭代速度,都达不到预期。后来更加选择从软件层面去切,中间我们还做了一些CRO的服务。硬件没有实现大幅的降本能效,做成这个CRO其实就陷入了一个内卷,加上前几年正好是非常内卷的一个市场竞争环境,所以我们那个业务就是也没有继续地当下推进。但是我们现在,从SaaS模式转向智能体模式,这两种模式我觉得是市场越来越大,而且这个客户的认可度越来越高。
【主持人】对。正好这两天有一个跟二级市场有关的事件和新闻,就在前几天,这个药明康德发了他的半年报,应该算是个比较炸裂的半年报,当然股价还突破了几年的新高。因为中国的生物医疗和生物医药相关的行业,经历了20到21年的极高光时刻,因为疫情造成各种各样的研究,所谓叫跟疫情有关的这些治疗诊断等等。那然后22年开始,或者到23年中进入了一个极低的低潮。在整个生物医药,然后它从24年年内开始,从康方开始,正好由中国的生物医疗行业经历了一次,在过去几年极其巨大突飞猛进的变化。就是所有这些医药管线类的研发公司,从那一年开始,爆发性的增长了,叫对外,或者对国际药企的授权研发管线的商业模式,就是license out。但是这个license out,从24年突飞猛进的进展之后,又经历了中间跌宕起伏好几次的,受号称美国生物安全等相关的法律,要禁止或者要阻止中国生物医药企业,跟美国生物医药企业合作这些跌宕起伏。所以说这算是一波三折。但是自从这个药明康德发了这个半年报之后,这算是给了一个非常明确的、巨大的信号,就是中国的生物医药产业链,已经是非常蓬勃的发展了。正好是在7月份说,中国的生物医药企业对外的授权金额,在今年上半年是1100亿美金。那这个数我们其实在我们的宏观漫谈里讲过好几次,就是因为中国在24年才只有30%多的市场份额,就是30出头的全世界授权一年总金额的不到三分之一在中国。然后在2025年就达到了全球总授权金额的一半。那如果今年授权金额还是3000亿的话,那以这个数来看,中国也许今年全年就可以达到最少超过三分之二了,就是也许能接近70%了,这是个难以想象的事情。
然后我们讲到药明康德这件事,还有一个小故事,我不知道当时我们再重新回顾一下。就是在最早接触夏博士和夏博士决心投资夏博士这个时候,他还有一件很出乎意料的事,这可能跟他小时候我们讲的一直保持培养,并且一直非常积极的写代码习惯有关。就是他们当时还在华尔街的时候,做的这个关于化学合成的这套软件,就是预测从A合成到B。因为我是学化学的,这真是个不容易的悲惨经历,就是探索从A化合物合成到B化合物的过程当中,到底用什么样的条件,经过多少中间步骤,然后大概最后可以得到什么样的合成结果,甚至部分意义上什么样的合成产率,有这么个当时的智能的软件,或者叫AI的软件来预测这件事。那时候夏博士还没开始创业,在药明康德最早的时候,对全球征集说谁能,因为药明康德本身原来的主营业务就是做化学合成的CRO,那那个时候对全世界征集说,有什么公司能帮他们做这些化学合成的路径预测。然后若干个公司参选了,这个当时夏博士是以还没有成立公司的个人身份,提供了当时研究出来的化学合成的智能软件,然后好像还得了第一名。我不知道当时你回顾一下,这是怎么个奇怪经历促成了这么一个少见结果。
【嘉宾】对,当时确实也挺巧。就是我们也跟药明的一些高管有一些联系,然后当时我就提出来了,我们有这么一套软件,你们要不要试一试。然后他说好,我们给你约了个时间你来吧。然后去了以后当时我就发现来了很多人,就药明当时一屋子都是他们的高管,还有一些高层。然后我就当场给他们演示,就是各种分子上去跑,然后看结果,结果其实效果还非常好,最早跟他有了商业化合作。所以我觉得就第一看出来产业对这个事情非常的重视。
【主持人】第二个就是说确实当时技术到了第一个临界点,以前这件事根本就没有软件能做好,我们算是最早让他看到了就是说这个事是可以去做的。当然到了今天我们再回头看,已经成为一个很通用的工具的时候,已经也走了大概小六七年的时间。在那个时候,以这样的情况来给药明康德这么个巨无霸提供这种事,并且还有其他一些著名公司的也提供相同产品的竞争,并且那个时候还没有GPT。我猜那时候大家可能你也没用到什么Transformer架构,顶多有点再往前的人工智能的事,就是这些什么卷积、神经网络这些事。我不知道在你回过头来看,在当时的那个场景状况里面,我们先把他的难处放在一边,就当时那个事在那个阶段的产品有多AI?
【嘉宾】其实那个时候他的AI和现在的AI感觉还不一样,就AI已经过了几个层次的变化。最早我们说叫机器学习,到后来有了我们说的这些深度神经网络,Transformer到后面又变成大模型,其实它一直在演变。但实际上通用来看,就是我觉得基于数据去做预测的,本质上都是AI的一种模式。所以那个时候它更偏一种我们说传统的机器学习,外加上很多的我们叫化学信息学,这个其实是一个可能不多人知道的一个概念,就是专门研究化学反应的这些逻辑如何写成算法,我觉得这些其实很重要,但是可能在现阶段被很多人忽略了。
【嘉宾】我们也投了几个精尖团队,这个包括最近这几年最热的这些方向。它其实这里边有一个我们经常会去探索的问题,就到底是个黑盒还是个白盒。其实今天自动驾驶也碰见这个问题,当然有非常端到端的,也有像原来的华为或者现在的华为智驾这样在里面加很多白盒的东西。那我不知道,所谓白盒的概念就是在里面有很多已知的人类的经验信息或者叫规律或者叫公式的总结,那黑盒的概念就是指拿这边数据进,然后中间经过一串算,那边结果出,这是大概黑盒。
【主持人】我不知道从今天来看,在那个时候能够完胜,在药明康德的需求上能够完胜那些著名的包括大公司的模型当中或者叫软件当中,有多少黑盒多少白盒?
【嘉宾】在当时来看,我们当时白盒可能占的比重非常大。这个也是我们现在思考下来,就是在这种严肃的科学软件或者就像自动驾驶一样,它如果是一个黑盒的话,很难建立客户的信任,因为你会不定题地出现幻觉或者出bug,造成的后果就非常的严重,而且不可解释。
【主持人】最大的问题是它不可调教,对,它不能调教,就是你发现问题,但是你不知道问题出在哪,你怎么去改进?对,换个角度来看,就说这里面最大的挑战,黑盒就是所谓不能调教,就是你随便在里面改变,不管是什么东西,层数、参数等等,它导致的结果是,因为你不知道那个黑盒版有多少个版,所以你改了A之后,它里面就会莫名其妙地同时改变了与之相关的BCD,但是你又没办法抑制BCD向不良方向改变。对,而且你也不知道BCD是谁,所以这就是黑盒带来的问题。对。
【主持人】那从今天我们先把中间的过程跳一跳,我们先闹到结尾来看。其实我们看了非常多所谓叫材料和化学相关的,包括今天各种各样方向和行业上的AI for Science的这些公司,大概包括我们投过的。那当然生物其实是比较好一点,生物好一点的原因就是因为有个基因组学,在底下做基础的约束规律。我在23年底的时候跟陈文光老师做的那些博客讲的内容是一样的,就是因为基因组学的信息更像我们的语言,搭建方式和语法的规则约束,但是同时它又含有了非常强的我们叫隐含的逻辑关系,虽然今天没有被完全解出来,在基因组学,就是基因为什么要这么排列的这些顺序上。那化学呢,因为我虽然化学已经离得非常之远了,但是原来我在国内和在国外念的。
【嘉宾】也都还是化学。从今天化学我们先讲第一个问题,就是你觉得它今天的可解释性达到了什么程度,就像我们刚才讲,类比于基因组学所提供的这些信息而已。在我们的系统中,它的可解释性是非常强的。就是所有的大模型或者黑箱模型给出的结论,必须要在我们的白箱模型里得到一个解释,验证约束,这样我能把它的幻觉去掉,同时我能够知道它给出的一些模棱两可的结论,到底是哪个是对的,哪个是错的。就这个我觉得非常重要,在这个科学领域。所以我不知道在结构上,它是先道理上它是融合起来的,还是先经过了一层纯算的黑盒,然后再到更偏有一些叫先验信息和规律约束的白盒,或者叫更偏有你刚才讲的化学信息学约束的,就这个白盒。这两个这个白的和黑的是,他们完全有融合在一起,还是他们相对是在程序上分开的,在逻辑上分开的,有比较强的融合,就两个是同时进行的。
【主持人】OK,回过头来再到这个公司进展的下一步。那从那个时候获得了这个正向的激励之后,当然也包括那时候我们有机会投资了之后,就有了这个公司的开始。那我记得像公司开始的时候,第一个巨大的里程碑,还是因为给一个全世界著名的MNC,就叫跨国大型药企,提供了第一笔金额还不小的软件服务,让他们来采用和使用这件事。我不知道这大概是当时的第一个最重要的milestone。
【嘉宾】确实是。当时也非常感谢姚总,把我们介绍给了他的一个大客户。这个大客户他在做一套AI制药系统,其中有一部分就是这个AI逆合成,这块是完全交给我们来做的。当时也是100多万美金的合作,而且难度其实也不小。就是通过那次合作,我们把我们的产品,真正做到了能够匹配到这些大客户的一个安全性要求,包括它的一个速度,各种质量的要求。所以这个对我们来说,是一个非常重要的一个起点。
【主持人】对,就是正式有了产品的商业化。不光是产品化,还有了商业化,这是其实非常多科学家、创业面临的领导的问题。就尤其在AI for Science,就AI今天用到了Science相关上,就是我们做了个很好用的科研上的结果,但是他到实体工作,就是到真正意义上的工业闭环当中,去应用的时候,有的时候在那个工业闭环里,他会觉得不可用、不好用,或者说有一定的抵触性,用的人正好不对的话。我不知道就说从你们当时最早,在真正意义上,在这个全世界著名药企里,实施这个工程的时候,他碰见了当时刚才我们讲的这些问题,和他是怎么克服这些问题?
【嘉宾】一定有这些问题。就是你的产品一出来,它肯定不是个90分的产品,它可能是一个60分、70分的产品。但是我们确实经历了大量的跟客户的反馈、迭代、优化。这是刚才我提到,为什么白箱这么重要,就是如果你是黑箱,可能客户提了意见,你又改不动,他就绝望了。但是我们确实在不断的改进上,客户看到产品在不断的进步,一直到现在其实还在不停地改进。我还看了一下我们的request list,就是各种客户跟我们提的意见,可能已经上千条,但是每一个都是大量的工作去提升、修正。所以我觉得这个过程其实非常重要,但是现在很多,可能万事投资人还是行业。
【嘉宾】可能会忽略到这一点,他会觉得我只要模型好、技术好,我可以一下变成全球最好。但我觉得很多时候它是靠这种迭代出来的。比如说我们就拿单一客户来举例子的话,在他应用的前三年,比如说从2019年到2021年,我们先把这个医药的低谷部分放一会再讲。那在这几年的过程当中,你发现就对同一个客户而言,他使用这个产品的范围,和使用这个产品的部门或者叫人员,是在固定不变或者相对更少的人用,还是会越来越多的跨部门,或者多层级、多产业链环节在用?这个是越来越多的。因为客户他在应用的过程中,他会产生很多新的idea,他会说这个功能你这样做是不是更好,那个帮我串起来是不是就更好。所以他会不停地跟我们提需求,这个需求有的是帮助我们改进,有的是帮助我们给一些新的启发。这样我们就了解了客户在真实应用的场景原来是这样用的,他和我们自己的想象其实是有差别的。所以我觉得这个也很重要,就是让我们去理解产业真正怎么用,他的需求是在哪,他想怎么用这个产品解决什么样的问题。就是通过这个过程,我们的产品也在不断地去增加模块,我们最开始跟他们做的时候是四个模块,现在已经有九个模块。
【主持人】所以我不知道他在一个创新药研发企业内部用的时候,他用的人是更偏原来指导做化学实验合成的这些人,还是更多的是一些不同类型背景的,或者叫不同环节上的人?
【嘉宾】他有几个环节都会用。首先就是在医药研发领域,他做分子设计的人他就要用。这些人他的合成能力其实偏弱的,他们偏CADD或者叫AIDD,但是他们在设计分子的过程必须要考虑这个分子能不能合成,能不能做出来。如果你做不出来,最后他扔给到药化的同事合成,人家就会说我根本就不想做,我觉得没法做。所以这是他们在这个阶段需要的工具,告诉他这个分子能不能做、好不好做。后面到了药化部门,他就可以用它来快速地设计路线,但是他的需求是快速拿到分子,比如几毫克就够了,但不考虑成本。所以他要的路线和到了后面的比如说临床、工艺放大的路线又不是一回事。到那个时候他需要的路线是成本最低,能放大,这个反应不能说太危险,一放大可能有爆炸的危险那也不行。
【主持人】明白,对。
【嘉宾】这样的话三个环节,可能对同一个产品的使用目的性还不完全一样。
【主持人】不一样。
【嘉宾】而且中间还有各种场景。比如药化的人说我要设计了30个分子,但是我的路线可能不是一个个合成的,我是先合成一个通用的母核,再去接各种步骤,让整体的步骤最少,这是他的需求。到了工艺又反过来了,工艺的人说我就做这一个分子,你不要给我用那种最容易的反应,你要给我找一个最成本最低的反应。这个成本最低的反应可能本身风险就很大,很奇怪,可能是个无催化,甚至可能是一个就是看上去就不太好做的反应,但是他愿意去用,因为能降本。
【主持人】那这个出于被化学专业折磨过、学习过研究生的分上,就整天到晚就探索各种探索不通的合成路线,我来好奇一下。比如说嘉凌网络这二十多年,在我研究生的时候有这个事,那所谓导师经常给的要求,就都是怎么能从A反正他就告诉你从A到B试一下,然后中间不管什么自己查文献、自己蒙条件、自己做组合,自己反正经历各种失败的状况。嘉凌那时候有这个,这能解决多少问题?对一个学生而言,对一个研究生而言。
【嘉宾】我觉得学生的层面上...
【主持人】可能你的所有的工作现在AI都可以做了,就是AI他最先替代的,就是说他把这种初级的我们的这种智力劳动可能现在看起来还是大概率都能替代掉。那这听起来学化学的研究生岂不是跟今天做编程的人一样,就是要被技术进步逐渐替代了,或者说也许可以去做更有创造性的,比如说分子设计的事吗?
【嘉宾】我觉得有一点类似,当然我们更加乐观地看这个事情,就是化学领域的任务可能更多,因为我们有太多的创新的材料要去做,它这个空间足够大,所以说我们的人即使我们干的活比例少了,但是我们还可以做更多的项目。
【主持人】对,这倒是。就相当于每个人的带宽增加了。我们把按时间线先把它捋完,然后于是到了这个2020到21年应该是所有,既包括CADD,就像我们投的晶泰科技这些,当然也包括咱们智化,当然同时也包括整个生物药环节或者叫领域,都来到了当时最高光的时刻,就是融资和资本市场最追捧的时候。当然那个时候智化也获得了比较好的不同资金和资金方的注入和市场的追逐。但那个时候还有另外一个诱惑曾经发生过,就是在那个相对很热的市场年代,这个著名或最大的某CRO公司也给我们发出过其实不止一次的收购邀约,希望把我们这个产品加团队,当时还小,很小十几个二十几个人,整个收入囊中。那当然最后的结果,既然夏博士今天坐在这了,就是显然这个合约最后没有接受。我不知道今天回过头来看,你在看所有的这些2021年的生物药产业融资的高光和当时有的收购邀约,同时放弃了这些收购邀约,我不知道你在回过头来看这段时间你有啥感想,或者说也许是后悔说那时候就还不如卖了?
【嘉宾】那倒没有。其实我个人还是一个偏理想化的一个创业者,就是我觉得这个事情只要它能够往前推进,我觉得就是一种成功。具体在这个行业过程中,它是有周期的,但我觉得这个不影响。就在高光的周期我也会思考,这个到底这些资金是不是真的帮我把这个项目或者这个理想往前推进了,如果没有的话,可能这个资金也没有那么大的作用。或者即使在这个行业低谷的时候,融资环境比较差,但是我觉得我竟然可能还挺快地拿到了钱,这个时候我觉得也是一个好的一个结果。
【主持人】那心态上比较偏相对成熟的创业者,确实经历过高和经历过低这两个阶段,因为高经历了一年半,低经历了比较长,低经历了恨不能三年或者三年半的时间,可能一直要到2024年底生物医药才算稍微好一点。我不知道回过头来看这五年,急速的变化,就是有极高光,有超级长的寒冬,你在自己的公司管理、个人经历、个人心情心性有什么感受和变化?
【嘉宾】对我来说还是更多的是学习和成长,因为我也算是偏科学家创业的这种模式,对管理、对公司治理包括商业化,其实最早都是不是那么擅长的。在这个过程中其实经历了很多,包括我们也有过一些人数的扩张,就做一些我们不太擅长的领域,后来发现最终结果还是说,就是专注在自己最擅长的领域,不要太分散,而且更聚焦。这个我觉得是我学到的比较重要的一点,就是我们核心想做的事情,一定要抓住这件事情的最本质的事情,不要被一些高光低光所影响。有时候那个影响会把人带偏,就是你可能为了一件比如说资本市场很追捧的一件事,你去改变了你的方向,你做了一个可能自己都不认可的事情,我觉得最终结果是不好的,就是长期来看。因为今天的AI肯定是毫无疑问在它的高光时刻,当然AI虽然技术会持续进展,但是肯定也有这个高潮的资本市场退潮的时候。
【主持人】就像你当年的2018年开始,2019年只是慢慢的热,2020年变得很热,就是这个帮整体的生物医疗,也包括当时的CADD,就是跟第一波的AI制药变得很热。你对于今天刚刚开始经历AI创业,就进了一个今天肯定是高光时刻的这些,有科学相关的背景创始人来看,有个什么大概的自己的经验和教训总结?
【嘉宾】我只能提我自己的一个总结,或者叫经验教训,就是坚持自己认为正确的想法,不要完全被资本的观点带着走。因为资本它其实很多时候并不太懂这个行业的真实情况,但是它出于它在外部投资的角度,它认为哪个方向好,哪个它会给出很多的想法建议。但我觉得如果那样的话,很可能到最后,真正我们这种科学出身创业者来说,会代片,这是我个人的观点。
【主持人】那接下来时间就来到了2022年,虽然生物医疗开始进了低潮期,2022年迎来了AI的高潮,起点对吧?就2022年底有了GPT时刻。那在过去的这三年,正好它既经历了生物医疗的低潮,又经历了AI或者叫AI相关技术演进的高潮。那这两件事叠加起来,在2022年或者从2023年开始,对你现在的这个公司产品和公司模式和公司的能力,有什么样的变化和挑战和应对吗?
【嘉宾】其实这是我看到的一个非常大的机会,就是确实GPT出来之后,我相信所有人都发现,就是这个事情在过去几乎不可能想象,但是它现在已经非常接近我们人的逻辑推理能力,甚至在一些领域已经部分超过了人。所以我觉得这个对我们来说是一个非常大的利好,就是说在我们的垂直领域,我们能解决很专业的一些问题,但是在真实的工作场景中,它是有很多泛化的问题。这些泛化的问题随便举个例子,就是这个实验势力,它可能没有某一个反应器,它要做这个反应就做不了。那这件事情它不是个专业的问题,但是如果你要用AI来解决这个问题,几乎不可能,就以我们之前的积累,是不可能解决这类泛化问题的。但现在GPT这类大模型技术的出现,可以很好的解决这类泛化的问题。那这类泛化的问题再加上专业的问题,这几乎就是我们化学加工作的绝大部分内容了。也就是换句话说,确实在这个场景上,我们具备了使用智能体加专业工具,去解决整个工作流程的这种能力。
【主持人】所以从公司的产品架构上,比如说从整个这套计算软件的架构上,在有了AI之后,这个整个的底层的这个计算产品架构的架构有大的迁移或改变或者结构调整吗?
【嘉宾】从垂直领域的算法来说,它不直接受这个影响,但是从最终交付客户的商业模式或者形态上会有一个非常大的变化。就是您可以理解为,之前我们的技术都是作为工具的形式呈现给了化学加,化学加使用工具来解决问题。但是在未来很可能它是通过API的形式接入智能体,然后通过智能体来完成整个工作。
【主持人】换句话来说我可以把它理解为说,某种意义上我不知道我的理解是不是正确,就是等于从任何跟化学合成有关的潜在需求来看,它表述和约束,表述的概念是把我的需求表达出来,约束的概念是我有一些特殊的条件或者工况或者不同的要求,那我把这两件事表达出来的这个过程,可以通过友好的和智能的交互形式面对智能体,然后同时智能体再把这些翻译成我原来就已经积累过很多年,并且有过很多成功经验的这些垂直领域的事情,或者叫垂直领域的这些计算软件,或者叫这些AI软件,来把它翻译成你想要的路径和结果,通过智能体呈现回去给你,大概是这么个理解吗?
【嘉宾】它可能不简单是一个友好的交互。这个智能体它会逐渐熟悉,它有记忆,它可能不断的学习,它最后可能就像你的公司的一个员工一样,你教它几次之后,你不用每次都教它了,你教给它任务就可以,它就去干活了。
【主持人】好,那在这个时候就等于是智能体在跟你的软件系统进行交互了,或者在跟你的计算系统进行交互了。它跟两层都在交互,跟用户层跟实验室的这些整体的一个条件,包括跟我们的这些软件都在交互。
【嘉宾】它如果是对智能体原来的化学逆合成的软件而言,一个预测软件、计算软件而言,它会有一些对软件层的整体调整要求或者变化要求。
【嘉宾】会有一部分,第一就是我们的软件所有功能都是可以以API的形式暴露出来,不需要这种用户界面。第二个就是有一些在这种软件中,原先需要人去做决策、去做选择的过程,我们可以交给智能体去做选择和决策。
【主持人】但如果交给智能体去做选择和决策这件事,会让智能体的使用者觉得它有可能会错过或者是漏掉了一些它能够进入循环的关键节点吗?就是它会有觉得错失的感觉吗?
【嘉宾】我觉得早期一定会有,但是后面随着它交付的质量越来越高,甚至它交付的效率和质量都超过人的时候,人就会不再去开玩这个事情。
【主持人】好,那我们把它回到假定还有的话,我们把它回到同一个当年最早的客户身上。我不知道这个最早的客户,就这个世界大要旗,现在还在持续用这个产品,并且已经进入了智能体这个阶段吗?
【嘉宾】还在持续用,现在我们也在探讨智能体方面的一些合作,所以他们还没有叫完全全面地开始使用这个重新演变出来的智能体。智能体在非常早期,现在我们接触的大陆的MNC都没有在用,但是都在尝试去探索,或者叫都出于对AI的一点点风浓,就是害怕错失的这个情绪,在看怎么才能更全面地用AI。
【主持人】对。好,那我们把AI这件事再翻到技术层面多问一点小问题。所以说今天回过头来看,在整个后端的这个体系和结构里边,这个当时的黑盒和白盒的这个结构和比例有变化吗?
【嘉宾】目前看没有变化,而是白盒越来越多了。
【主持人】白盒越来越多。
【嘉宾】因为现在大原模型出现,它是具有非常强的可解释性。
【主持人】可解释性,对。
【嘉宾】它做的所有结论,它会给你解释为什么做这个决策。
【主持人】OK。我们今天回过头来,比七年以前或者八年以前,我们当然毫无疑问,因为这些客户的拓展、我们自己的能力拓展等等,这些数据来源可能可以比以前丰富。那今天假定抛开模型能力之外,这些白盒部分的进展,在化学合成这个问题上,你觉得有多少是跟模型的转换有关,有多少是跟过去几年的行业积累有关,有多少是跟你们自己和客户提供的数据有关,促成了这个白盒能力的提升?
【嘉宾】这核心的还是这些人在跟客户不断的交互、迭代中我们得到的这些信息。因为在一个严肃的科学场景下,就是如果你不具有可解释性,你的商业推广是非常难的。就是客户他需要知道为什么做这些结论,所以我们的产品如果要做得越来越好,你必须越来越白盒化,因为客户所提出的所有问题,你必须有明确的解释给到他。所以我觉得这可能是一个真正AI落地的一个商业上的一个要求,就是做不到白盒的话,你就很难在商业上进行推广。
【主持人】对。那你觉得这个是个有意思的话题,我们把它稍微也泛化一下,比如说我们今天有看,因为刚才我们讲的中国正好在人工智能加上所谓叫各行各业的基础研究,要求大力开展,所以今天出现了非常多不同类型方向、学科上的AI for Science。那你觉得这些AI for Science探索,或者叫这些公司的方向最终有可能都会碰到或者都会经历相同相似的过程,就刚才描述的这些?
【嘉宾】我只能站在从我们的角度,如果你做的是一个辅助研发的工具,或者是一个技术的话,那他交付的人必须建立信任,这个过程中是需要一个非常强的可解释性的。如果说你直接交付产品,但我觉得中间可能还不能把人的因素拿掉,所以只要有人,我觉得这个可解释性都是有一个必要性在这边的。
【主持人】那你要这么讲,它其实就有一点点像自动驾驶,再往下一步要进一步所碰见的机会和挑战的问题是一样的了。对。那我们回过头来再从不同的角度再来问一下,就是在因为化学这件事,还没有完全的像基因组学上面所建立的生物模型一样,有那么率先突破的预测成功率问题。不管是RF4的级,还是今天大家在网上加其他类型的东西,包括诞生新分子等等,我不知道你觉得化学相关的这些事情,包括化学合成相关的这些事情,如果我们生物做个比较基础的话,你觉得化学大概是今天生物达到了它的百分之多少的程度?
【嘉宾】在结合了今天的AI能力和现有基础数据的情况下,您说的是把化学跟AlphaFold的相比吗?跟AlphaFold的相比,或者跟生物基于基因组学的一些应用?
【主持人】其实主要是AlphaFold,不管是构形,当然今天也出现了预测靶点,预测一些相关的结构构形或者等等。就比如说AlphaFold,不管它的1、2、3怎么迭代的,比如说最后它可以把复杂构形的预测成功率提高得比较多。当然今天大家什么叫多,反正对于叫训练集的描述也是各不一样的,比如说这个是偏好的数据、偏不好的、偏窄的、偏正负样本不均衡的。反正今天比如说从比较随机的百分之二三十,可能提高到了百分之七八十。那我不知道就说你觉得,今天在不是过分刁难和复杂的化学合成的,比如说我们原来在上学的时候,最不幸的就是它要涉及到比如说超过五个以上的条件,或者超过十五步以上的合成,这就过于刁难。当然实际上超过二十步不太可能,也不算太划算。那比如说在一个正常的化学合成的过程里,就是几个条件多步反应,看起来这个能好到什么程度?
【嘉宾】好,我们其实内部也做过一些测评,包括外部也做过一些测评,我们现在的得到的结论大致是这样子。就是现在的化学合成的AI的能力,大致相当于10年工作经验的化学家的水平,基本上能够实现化学家想到的路线合成方案,AI都能够想到。而且AI能够一般平均能想到五到六种不同的策略,这个是超过人的,人一般就是一到两种策略。第二个就是在一些比较难的工艺路线设计上面,现在AI也基本上实现了人能想到的他都能想到。所以这点其实是一个非常大的就是客户的满意,就是客户,因为我们产品之间他都会测试,他会拿在真实的案例测试。就是他可能花了一个月、两个月设计出来路线,结果发现我们这边五分钟就能跑出来,而且还给出了一些其他的他也尝试过,但是可能没有最终选择的路线。就这个能力我觉得是已经达到这个程度了。
【主持人】好,那这个就很像AlphaFold在2016年的感恩节,在辉瑞的测试结果。因为那时候整个波士顿和制药界也没有人相信,就是卷积神经网络能计算出一个原来没有出现过的化学分子的晶体模型。后来辉瑞也是一样的,拿了三个还是四个我忘了从来没有发布过的这个分子的构形,但是他们其中有两个还是三个已经知道了。那他拿这个测试了一下,后来发现确实跟他们预测出来的过程,有限的几个结果里边,跟他们命中的结果是一样的,跟他们已经得到的结果是一样的。你认为大概就是已经到了差不多或者过了这个阶段?
【嘉宾】对,因为化学合成有很多别的用处,因为它在一些材料上也用。当然整个生物医药链条里,尤其面向小分子的生物医药链条里,是更重要的环节了,这是像药明康德这样的公司的起家的地方。
【主持人】我不知道你从整个生物或者叫医药管线整个的研发,我们把大分子先扔一边,把这个跟细胞基因治疗的事儿也先放一边,就跟小分子有关的整个生物医药的链条里,你觉得现在这个化学,就是咱们所做的这部分,就是跟预测包括逆合成也行,路径也行,条件也行,量产也行,就是整个我们所在的位置,在这种小分子相关的生物医药研发全链条里,大概处在一个什么样的位置?结合今天整个行业都多多少少受到了AI的一些影响,不管是AI制药,还是AI材料发现等等。
【嘉宾】它的研发本质上不是简单的分子设计,而是多个DMTA的循环。D就是design设计,M是make,就是合成,然后test测试,然后analyze分析,分析分析之后再改进方案,再重新进入这个循环。一般做一个药,可能要起到8轮这样的循环;做一个材料,也是要可能多轮这种循环。这个循环的,它的每个步骤的效率和速度是不一样的。现在我们在设计阶段,我们可以一天设计成百、上千、甚至几万个分子,都是很轻松的,因为有这些AI工具,或者是在这种CADD的工具等等。但是在合成阶段它会卡住,因为一个化学家在一个月的时间,大概合成三到五个分子,这是行业内普遍的一个效率,就一个人一天做两到三个反应。但是到了后面的测试,效率又变得很高,因为现在有这种高通量的测试,比如说药的话,我可以一下测试几百个分子,对靶点的一个affinity等等;那材料层面,我也可以同时去测试很多的分子,所以这块通量也很大。所以说真正DMTA循环的成倍加速,需要把合成的效率提上去来加速,而其他的环节其实相对来说影响偏弱。这个是我们也是在这个行业做了很多年,从客户这边得到的一个反馈,就是客户它是非常重视在合成这段的效率,因为它整个的研发效率就卡在这一段。所以说我们认为,只有把合成的效率大幅度提高,比如说两倍三倍已经非常了不起,如果你能做到10倍20倍,那你就把整个的新材料研发通量上升了10倍到20倍。
【主持人】我刚才忘了一个跟技术有关的小问题。比如说别人拿你来做测试,就发现说他已经知道的一些比较复杂和有难度的合成路径,你能预测出来。那在这个基础上,从你刚才讲的软件,或者叫这个算法功能上,它能预测出Novel的东西,就是有经验的化学家也想不到,但又可行,并且更优美的合成路径,或者合成方式,这个是可以的?
【嘉宾】但是它基于一个限制前提,就是它不会造新的反应。就是首先我们所有的AI,都是基于已有的数据在做创新,它不会在数据层面上找到一个偏离这些数据的点提供给你,这个是我们看到的。但是这个问题,它在合成领域影响不大,因为我们的合成路线的创新,基本上都是用的是已知的反应,只是这个已知反应可能藏在几十万篇的文献中的某一个角落里。如果你看不到它,你的路线可能说就是一步;你看到它,你的路线可能变成了三步四步。那么AI其实具有这个能力,就是它能够比人接受的知识的量更大,检索的量更大,速度更快,所以它是有能力找到我们平常看不到的反应,但是能把你的整条路线变得非常的优美,或者是成本非常的低,这个是我们已经验证出来的。
【主持人】那我们再换另外一个角度,来考虑今天的事情的意义和价值。就抛开你刚才解释在DMTA的这个循环里,尤其是在刚才讲的生物医药或者材料管线来举例,在整个你所设计的这个药物,或者叫材料,最终要走向商业化的过程当中,它一定要过多次这个DMTA的循环,并且最终是有效率和成本的,这个叫大规模的优化。那我们抛开这个问题来看,就今天,比如说科技创业者做这件事,就像你刚才讲,他需要努力让他的AI做一些白盒化,以至于将来可以调教解释,并且能跟用户交互和部分意义上的定制化。那这是一部分,跟刚才我们讲的创业积累有关的,那另外一部分……
【主持人】假定今天是个非常AI背景的人,这个在我们其实2016到2020年之间,上一轮AI制药的时候就碰见过。因为当时有两类创业者,一类创业者是非常AI的,他们觉得AI用到生物上是一个好的方向,所以他们进来创业。还有另外一类是稍微偏一点bio的,就是他原来在比如说生物制药相关的这个流程和企业,或者叫产业链环节当中,他们正好也具有了AI的这些能力,或者就跟你一样,就从小有这种两个能力的共同积累,然后他们来做了这件事。我不知道从你的角度来看,今天你们做的事情,假定是个很AI背景的人进来做,他碰见最大的可能需要克服的挑战和阶段分别是什么。
【嘉宾】我们确实也和一些纯AI背景的人合作,包括一些高校老师,但是最后发现的最大的问题,就是他对我们行业的问题并不理解,或者他的理解是一个错误的理解。但是他可能又没跟我们说,然后他就在错误的路上一直做,做到最后结果不好了,然后我们跟他讨论说这个结果偏差得太远了。后来可能他就会说是数据的问题。如果他在这种垂直领域不懂这个行业的话,他根本就定义不清楚问题,那如果要去解决就难度更大。更不用说中间一些无法用语言很明确地跟他表达出的事情,他也不知道,这个事情反而对这个模型可能非常的重要。我觉得这是一个非常大的障碍,就我不是说他能力不行,但只是说他如果没有这些行业know-how的话,他根本搭建不起一个就是可信的模型,或者说他根本就没有搞清楚这个问题在哪。
【主持人】所以回到刚才咱们讨论的这个模型结构的问题,或者这个软件层级结构的问题,其实对他来讲,更大的挑战是怎么搭建那个pipeline对吗?从另外一个角度,假定他是很AI背景的人,因为在原来15年前的大数据热潮当中,大家就讲什么Garbage in Garbage out,就是那当然模型肯定有这个问题,就是你容易把它训偏离了。我的理解从你刚才的话里面听出来,就是假定是个很相对更偏AI的人来做这件事,他有可能会潜在碰见的挑战,是当他选择数据源和数据的类型,和数据的有效性和结果的有效性之间做关键判断和分类的时候,可能会因为对行业和需求,和行业特征的不理解,使得他对数据的使用,和对输出结果的分析和分离出现偏离。没错。我不知道你觉得,在过去的这八九年的积累当中,各种类型的数据,比如说今天的AI肯定可以更好的读文献,那各种类型的数据,就是比如说科学文献是一类,真实场景的工业场景的、政府反馈是一类,我知道你们也做一些小的自己在内部的闭环实验,来加快这个数据循环,和对验证过程的闭环的数据积累。那所有的这些数据,你觉得过去现在和未来,他们对模型的效率和能力贡献,大概各自会起多大作用?
【嘉宾】其实这个问题,每个问题它需要的数据不一样,所以我很难说哪类问题它的贡献最大。但如果针对就是逆合成问题来说,我们认为现在可能还是这种大量的公开文献、专利的数据是贡献最大的,因为它主要学到了化学合成的思路,而并不是说我们用高通量实验能解决逆合成的问题,这完全是两个不同的问题。然后就是这种AI背景的人,我觉得他们有一方面可能能力比较强,就是当你的数据量足够大的时候,他能在这种训练的效率上提出一些不错的见解帮助。但这个恰恰是我们在AI for Science领域最缺的,就是我们的数据量不大。
【主持人】对,有道理。就是你会发现没有这种大数据,甚至就是量级到一的数据其实都很少,甚至有些领域只有几百几千个数据。我把你这句话翻译一下,我们今天讲的大模型,最大的来源还是这个积累了四十多年的全世界的公开互联网数据、公开数据、文本数据集来训练。但是今天任何一个科研领域,即使你把全部论文都加上,也比这个最少差很多个量级。
【嘉宾】少得多,对。那所以这就会产生了刚才你所讲的问题。晶泰上毕竟是我们投过的公司,我们稍微了解一些,因为他们自己的公司内部,不是也做了比较多的闭环实验的循环。我们当时曾经问过他们另外一个问题,因为他们三个是学物理的,学量子物理的,他们也不算是典型学化学的。那所以说我问他们,我说你们在你们的闭环实验的过程当中,在模型进步探索里边,这些数据的贡献率大概是什么样?他认为就是正数据和负数据,就是预测了一个过程,最后发现这个过程有问题,这是错误的。他认为正负的贡献,大概都差不多,各能对模型的进步和效率起到一半的作用。我不知道从你的角度会有这种差别吗?因为公开数据及论文上,肯定取得更多的是个方法论,而且是个正确结果,假定他没有编论文或者篡改论文的话。
【嘉宾】我的观点稍微不同,我认为正数据,就是成功的数据在现阶段非常重要。对,失败的数据在未来非常重要。就是现有的我们这一代的智能体也好,或者AI模型也好,你只要能达到人的判断能力,人的水平就已经可以大规模商业化了。在这个过程中,你学习更多的是人的这种正向数据。或者说人如果做了一个实验,这个实验失败了,那大概率说明什么?说明这个人在做实验之前,他不认为这个实验会失败,也就是你达到人的判断水平的时候,你不需要知道这个实验会失败,已经够了。
【主持人】就是我把你这句话翻译一下,是说达到就像你刚才讲的10年工作经验的人的话,他只是在10年工作经验的基础上,有更好的成功率预判,对,你不需要预测出他判断不对的这些东西,对。
【嘉宾】所以在这个阶段还不需要到那个阶段。但是未来,如果你要超过这个实验工作人的认知的时候,你能判断他觉得能行的反应,你说其实不可行,这时候负数据重要。所以但这个是下一步的事情。这种负的数据或者错误的结果的负反馈数据,理论上对那个黑盒更重要。
【主持人】对。
【嘉宾】因为他可以把,虽然不知道为什么会失败,但我知道他大概率会失败的一句话,变成结果呈现出来。但现在问题是我们的这些模型,还没有达到人的水平之前,你可能先不要去解释那些错误的,就是无法解释的这些失败。
【主持人】明白了,好。那我们现在来问一些这个跟今天时髦话题有关的问题了。比如说像你们的今天的应用场景里,需要调后端的这些基座模型或者大模型,或者云端的这些token的使用量。
【嘉宾】现在我们正在做的智能体会用,还有一些这种数据处理的工作也会用。
【主持人】那你的智能体更多的是解决交互的问题,就是理解用户需求的问题,或者叫翻译用户需求的问题?
【嘉宾】不只是这个问题,包括一些专业的问题,就是现在的这个基座大模型,他们在一些科学问题上,也能做到一个六七十分了,已经很不错。
【主持人】那我刚才问这个问题的,有一个潜在含义是,就是用户使用你们的产品和买你们的产品,当然现在也许你可以按照结果来交付,但之前大家肯定是就像你讲的,就是买个软件或者买个SaaS,不管他是买的这个私有版的,还是买个这个公有版的,那这个就会涉及到你后端还有一些,原来你只有个软件本身的维护过程就行,现在你还得假定你跟基座模型有交互,你还得调用token,就是你也还有这个软件的成本。
【嘉宾】不用,因为现在对于这种大的客户,它内部都部署了基座模型,你就用他们内部的模型,对。
【主持人】那我刚才问这个问题的另外一个小的原因,即使不是你消耗,是他消耗,假定我们今天能替代和解决的能力范畴上,是一个化学毕业。
【主持人】不知道本科研究生,如果研究生就像我这样,化学专业毕业的高等教育毕业生,有10年相关工作经验背景。我不知道,就比如说在中国一个化学厂里边这样的人,大概是个什么薪酬水平,两万月薪,两万月薪,好,那就大概是个二三十万,三十万年薪的这个水平。那我刚才问这个年薪的原因,是因为假定我们的替代过程,除了用户的购买成本之外,它假定后端还有个对于基座模型的token消耗成本的话,最终是不是大家也得算算账,说到底我们这个替代过程是省了钱,还是没有省太多钱。我不知道从你现在的客户反馈角度来看,他怎么看这个问题。
【嘉宾】客户非常重视这个事情。对,就他们知道基座模型能做很多工作,但是他如果太贵的话,他不愿意用。所以我们有很大的一个工程性的工作要做,就是帮助客户去省钱,就我不能说就随意地调这个基座模型,我只有在必要的时候调合适的模型,用最小的成本去调。
【主持人】这个是在你的体系或者叫软件或者叫系统内部,就完成了这个叫比较智能调度的问题。
【嘉宾】对的,对,这个是我们来负责完成的。如果你的费用高的话客户也不愿意接受,对。
【主持人】我觉得这个非常重要,因为今天我觉得有一个大部分人还没有特别关注的问题,是今天的AI或者叫人工智能,跟以往的软件和系统有个最大的差别是,它的每一次交互和调用都是有一定成本的。原来的软件和数据库相关的这些交互是几乎成本为0的,那这个跟AI有个非常大的差别。内部我们有一个二级场同事,还简单做了个分析来看这些成本的变化。其实从美国某一个今天号称技术能力、号称最好的model看了一下,它有个简单的判断,是它其实最新的这几个在不同领域应用的这家公司的这几个模型的使用上来看,他们的input就是输入的消耗token占比是显著地高的,当然这个的结果是使得成本会变得更高一些。那所以说,我猜等大家关注这个成本问题之后就像你讲的,这个企业就会非常关注,因为刚才我们讲了,它的后台消耗其实是不一样的,是有成本的,所以最终这个会变成具有一定大范围影响力的问题。所以它很有可能最终AI最容易落到的应用方向,是要替代具有一定价值的场景,而不是普遍意义上的第一阶段的场景。换句话说来讲,它要replace掉的这些人,是有一定代价的。我不知道你从你的角度来看,从你跟客户的交互来看,这样的问题和趋势,会对现在你刚才讲到的努力和用户的需求过程里面。
【嘉宾】我相对乐观的一点是我认为它的价格会不断地下降,对。所以长期来看,可能它最终变得像电力一样的一个很低成本的事情的时候,可能人们就没那么在意了。
【主持人】那是很长期,那是很长期,对。
【嘉宾】但在这个中期的时间,我觉得可能更多依赖于像对这个制整体层面的优化,就是你并不是所有的问题真需要一个这种多少很大参数量的模型,可能你用一个几十B的一个小模型,本地部署都可以解决,对。那所以这类问题,就是说简单的问题,我们就用不花钱的模型或者自己部署的模型解决,然后真正到需要的时候,我们再调这些高级的模型,对。所以本地模型肯定也在这个基础
【主持人】约束出来的一个最少是阶段性的比较大的机会。我不知道从你们的角度,你们最终觉得在你们的下一步里面,假定用户越来越广泛、越来越多,和越来越多的跟智能体交互,它又不一定在这种级别的企业内部,有自己的基座模型调用能力和带宽的话,你们会最终往后看做个小的垂直的小的端侧,或者叫基座模型出来在你这个领域用?
【嘉宾】会有,就是我们内部会有问题分类,就有的问题我觉得小模型可以解决得很好,有的模型就必须要问大模型。是的,最大的模型,所以我们会把最好的、最贵的资源留给那些最核心关键的问题,所以最终减少整体的一个投资消耗。这个是我们工程化必须要做的一点。
【主持人】你们正在做的事情,是原来我们在考虑模型落到应用层面,再往下会发生的现象。就是刚才你讲的,就是大部分的需求会想办法先收敛到一个中小的也许端侧的模型,或者垂直模型来解决,然后少量的复杂的去大的,或者说进行相对少的大的交互。那在今天我们讨论的刚才的这个过程里,你觉得从你的客户的角度,比如将来他们从今天的不管是购买私有化的软件,还是购买SaaS服务,转向购买智能体服务,就是刚才你提到的这样的问题和这样的约束压力,会更多的体现在客户身上,还是体现在你身上?因为它的付费模式可能稍微有一些变化。
【嘉宾】早期其实大家还没有那么重视这个问题,因为还在研发阶段。一旦到了应用阶段,我们肯定是会想这里哪些调用其实不需要调用这个大模型,我们调用一个小模型就可以了。我们会再做工程的优化,相当于这是一个不断降本的过程,直到最后就是优化不了的,我们才用大模型。所以时间我觉得会逐渐给到这个压力和逐渐给到我们这个动力去降本,因为可能客户扣的费是一样的,那我的成本很大一部分就是图算成本。
【主持人】对,是的,这是关键问题。所以这就涉及到另外一个在国外从去年开始广泛讨论的,在国内开始讨论的这个问题,就是SaaS最后会变成什么样。将来的客户类型,你希望它更多的去到智能体,因为这样可以更广泛、更易用和更友好,并且交付的结果和能力更强。那你从过去、现在和将来来看,因为你们不光是SaaS类的,就是你从假定是光是SaaS类的这些用户,用SaaS的一般都是中小客户了。像你们给这些超大型药企,一定不会只给SaaS服务。从SaaS转向Agent的时候,你觉得会经历一些什么样的变化?
【嘉宾】觉得它会在一定时期内是一个Mix的模式。对,就是既有SaaS的模式,又有一些高级的整体功能,是按照这个调用来付费的。它会长期存在Mix,因为客户一定有一些问题,它是不愿意付更多的钱的,它觉得我用SaaS就能解决得很好了,我为什么要付钱。但有一些问题SaaS解决不好,它自己人解决得又贵,所以它才会用智能体模式。对于我的观点就是长期共存这两种模式。
【主持人】门肯,不知道你现在的客户样子和客户基础,国外公司和国内企业上大概各是什么样子?
【嘉宾】从数量上来说,国内会多一些,但是从整体的付费的总金额,国外现在是超过国内的。后面国外我觉得市场会越来越大,会更大。
【主持人】那你不觉得国内会变得越来越大?
【嘉宾】国内也在变大,但整体上毕竟中国还是一个国家,但是生物医药这个行业,其实美国它还是大头。
【嘉宾】对,包括欧洲,包括一些印度的呢?这是我从投资上纯粹好奇一下,就是因为我们曾经画过一张图来解释中国各个产业的变迁问题。我们拿今天的生物医药来简单的做一个类比,大概大家就认为生物医药大概就像比如说一二年之前到08年之间的精密制造。就是在中国的世界手机品牌批量诞生,就是小米、华为、vivo、oppo这些批量诞生之前,因为他们主要在14到17年之前批量诞生。在那之前,中国在产业链上做的环节就像所谓叫果链企业一样,就是把最难或者叫精密制造,除去芯片之外,那些精密制造的部分,包括精密组装等等这些事都放到了中国。这个虽然类比不太妥,但它有一点点像,比如说今天的中国生物医药的管线类企业,大概都开始积极的license out,就把自己的管线权益的国外部分卖出去来获得授权金额。这也是中国授权金额比例猛增,占比升至极高的原因。当然这件事会倒逼这些做医药管线类的企业竭尽全力地去增加它的管线研发的速度、宽度和效率,又要多又要快又要好。我不知道,然后他们就会竭尽全力地想办法能用上促进又多又快又好的方法和工具,这是一个倒逼的过程。最少我们从理论上知道它会再发生,你们作为好的效率工具和好的放大工具和好的成本节约工具,这个来自于这种类型管线研发类的药企或管线研发倒逼CRO所产生的同类需求,这个已经能感受到吗?还是刚刚开始,还是还没开始?
【嘉宾】我觉得已经能感受到一些了。就现在国内的新药研发的速度和效率,其实已经比欧美有一个比较大的优势了。但刚才我说的为什么国外还多一些,就是因为我们现在主要的客户是以这种大型客户为主,就是不得不说,中国的大的需求端这种MNC还比较少。
【主持人】我插一句不好意思,就是MNC,就是我们所说的小米、华为、vivo、oppo,就相当于现在还在升级到精密制造这一段。虽然主要的利润大头或者当时的大家在如果大家还有印象的话,就是在15年,老有人诟病说加上台湾地区,说中国虽然在果链中占比有大概百分之一半,但是中国占有的利润总额,就一台苹果手机的利润总额非常少,还是低单位数。
【嘉宾】对,大概现在医药就有点像这个状况。
【主持人】对,是这个状况。就是它的需求端在国外,但是它供给端在国内,而且供给端的增量确实是非常明显这些年。
【嘉宾】然后从我们的效率供给来看,现在因为需求端也在用,供给端也在用,就是整体上基本上是差不多半斤八两。所以能看到国外也有很强的需求,国内也有很强的需求。但从未来来看,我觉得确实可能国内这边是一个快速增长的过程,所以未来几年,我觉得不排除能像制造业一样,就最后形成一个占了绝大部分的一个叫世界医药工厂的这么一种模式,是有可能出现的。
【主持人】对,有可能。因为这就像中国在14年前工业机器人的需求端变成了全世界最大市场,就等于是在那个时候的精密制造也很卷的时候,大家都比如说都要争取果链的竞争地位的时候,就都要想办和进果链的时候,就只能想办法竭尽全力的增加自己的生产制造效率。
【嘉宾】和生产制造产能的,既要降成本,又要加产能,又要提高效率,所以就导致中国的工业机器人突然一下变成了全球最大的应用市场。
【主持人】没错。但是我还是有一个观察,就是印度增长的也很快。
【嘉宾】你说在原料药层面,还是也包括研发层面?也包括我们来讲,我们的客户在印度今年就增加了30多家客户,就是这个增速其实不比中国慢。
【主持人】所以我从这个角度判断,也许印度它也有这个机会。因为对印度市场不那么了解,所以我就好奇一下,比如说在印度增加的30多个企业,因为原来大家传统意义上认为它是更偏原料生产,因为它没有太多的创新药管制的知识产权问题,那或者更偏仿制药生产。那从你应用的企业来看,他们也偏到了创新药管线的新药研发上,还是有CRO、CDMO也有一些做药?
【嘉宾】但是我不太确信它做的是不是创新药。
【主持人】明白了,对。还有另外一个跟你这个相关的应用话题,就是这个正在蓬勃发展的材料体系。因为材料体系在我们看过的这些AI里面,它比较有一定挑战,当然也有一定机会的,就是它的应用领域在AI层面都比较垂直。金属的相关的材料,或者说多种混合物的金属材料的改性提高,或者甚至加上少量的催化剂的优化等等。就是应用领域一般都比较垂直。我不知道从你的角度来看,因为这也是化学合成的一部分,今天看起来你的这个能力,或者你提供的这个功能,能覆盖到这个部分,以及这个部分的泛化性能变得更好一些吗?
【嘉宾】我们能覆盖到这些有机小分子材料的领域,比如说像光电材料用于这种OLED显示的,还有一些就是新能源电池的一些添加剂,还有一些类似于像光刻胶这种都是有机小分子。就是材料其实分大类的话,它分为有机和无机。当然无机这部分主要像陶瓷、金属等等这些,但是有机的就是也很多。那这类包括一些聚合物,它的聚合前的单体也是有机材料,所以这部分我们是可以用到我们的这个AI技术的。
【主持人】对,好。今天中国的未来科技当中肯定也有生物制造的部分,生物制造的部分多多少少就替代了一些我们叫化工也好,替代了一些有机分子也好,尤其在天然产物和一些医药中间体上,大家用这个酶来合成。就我们也投了一大堆,这个多多少少进入到一部分原来的化学合成的,尤其有机化学合成的这个领域里面,这个我不知道从你角度怎么看这个问题或者这个发展?
【嘉宾】其实生物合成主要指的是这种类似于酶催化,或者是用发酵的方式在活体内进行催化。它本质上还是一个化学反应,它是把A变成了B,只是它的催化剂用的不是我们说的传统的这种小分子催化剂,或者是一些金属配体催化剂,而是一个酶。
【主持人】对,它的特异性更强。可能对一些抑菌值要更高一些,所以在酶催化这个问题上,你们现有的产品能力上它是能覆盖的吗?
【嘉宾】对我们来说在我们这个领域,其实这块是包在我们的数据里面,就是它并不是说我们做合成不能有酶催化。我们推荐的路线可以有酶催化,包括酶的种类都可以给出一些建议。我们的现有产品能力,就是我可以推荐出一条最优路线,这个最优路线可能中间的一步甚至多步是用酶催化来完成的。但是我们的能力不具备的是,这个酶它可能不是一个现存的酶,它需要进行一些定向进化去得到,还是基于已经存在过的所有能找到的正常反应路径,或者正确反应路径之间的不同逻辑和方式上的组合,和优化能产生出来的最优路径,或者最低成本路径。
【主持人】明白了。那我们来展望一下之后的事,因为今天我们讲的就是AI for science,因为各种各样的原因和中国特定的原因,它变得很热很热。但是今天我们看到了有一些大模型公司,国外的一些通用模型公司,也慢慢地拐到了AI for science的应用上来。不知道你往后几年怎么看你自己的发展过程和机会挑战?
【嘉宾】首先是一个机会,就是刚才我讲的大模型的能力的增强,对我们是一个非常互补的一个能力,能让我们把整个流程做出来,所以这个我觉得是行业变革的一个大的机会。那其次呢
【嘉宾】这些做大模型的公司,他们要下场做垂直模型,其实这个事我觉得很难,就是他们很难去陷入到这种企业的具体场景中,去一点点做服务。他们更多的还是做一个通用的模型,当然也有很多人问,通用模型最后能不能把垂直模型直接做了,甚至是达到更好?我觉得这个也非常难。第一,是我们内部做过大量的测试,我们看到的是垂直模型它在一个领域能做到比如说很快地做到50分、60分,但是你再往上做其实非常非常难,基本上达不到一个可用的程度。这个主要原因是它底层的一个数据量,它更多的是一种文本数据,而我们做的这种垂直模型,更像一个多模态的数据。
【主持人】有道理,多模态数据这个角度很有意思,对。
【嘉宾】就是你可能不能用一个通用大模型去生成一个图片,比一个做图片的模型做得更好,我觉得是这个逻辑。第二点来讲,就是说这种通用大模型,他们确实太通用了,他如果要搞一个垂直领域的话,他可能做法还是搭一个小团队,像我们一个创业公司一样去做。但是他这个创业公司所谓的优势其实也没有太多的优势,他也能用这个大模型,我们也能用大模型,所以从这个角度,积累就显得更重要一些,或者说客户的这种场景的理解,包括跟客户这种深度的不断合作,可能就是这部分更重要的了。
【主持人】对,那你觉得挑战可能会有什么?
【嘉宾】我觉得挑战更多的,就是说我们要把我们自己的这个壁垒逐渐地加深,它可能是一个长期的我们说的脏活累活,就是要不断投入资源,不断地把这个地基打得更深。而最后和大模型形成一种相互的合作,就是他们解决他们的问题,我们解决我们的问题,让双方一结合,把整个问题解决得更好,就互相依赖。这个可能是模型应用落地过程当中必然要经历的阶段。
【主持人】今天因为AI for Science你们也变得比较热了,你交流过最近的投资人,他们对你这个不管叫模式,还是企业的壁垒,还是企业的竞争力,还是企业的应用场景范围,所有的这些跟你相关的事情。现在你碰到的这些因为AI for Science对你感兴趣的投资人里面,大家最容易误解,或者说跟你希望要有的方向和定位有差异的,大家最没有理解的部分大概是什么?
【嘉宾】我觉得可能有两点。第一点可能他不太理解,就是他觉得你一定要去做一个创新药或者做一个新材料,你的市场空间才足够大。这点在我看来,它是一个结果,而不是一个原因。就是说我们做合成的,做这块AI的目的是为了提高DMT的研发效率,提高研发效率的目的是在这种新药、新材料研发中,具有一个倍数的效率提升,而产生一个优势,这时候你才能说我去做药、做材料我有巨大的优势。否则如果只是因为我要做一个药、做一个材料的话,那我可能就会陷入到和传统模式没有太大区别的一个效率上去,那这个时候可能就变成讲故事了,但实际上我可能并不是一家真正的AI制药公司。所以这是我和他们理解的第一个不同,就是我认为要先解决工具效率的问题,再去把你最终的目标调整到做完全创新的材料分子或者药物分子。第二点可能就是对一个市场空间的理解,他们看到的是过去我们的工具软件的市场可能没有那么大,但是他们可能不容易去想象,未来这个工具软件结合了大模型之后,智能体之后,是不是能够把整个工作流做完以后,变成一个整体交付结果的一种模式。所以就容易被过去所影响,认为市场空间不够大,这个是我和他的一个意见分歧的第二点。
【主持人】假定从原来的模式转成更智能体的模式的话,这个事会有多多少少的一些所谓的马太效应,就是用的人越多,我就会越好用,并且模型或者叫知识能力、基础层能力就会变得越强,他们所谓叫飞轮效应也行。
【嘉宾】叫正循环也行,或者小小的马太效应也行,会在智能体比原来的软件模式更明显。或者说差不多或者是区别不大,我觉得更明显。之前的那种模式,我们在底层工具的不断的创新,其实在整个效率的影响上没有那么大,对。但是如果你在整个智能体全部用这种AI的模式去做的话,它的效率提升会更明显的体现出它的整体的交付结果的速度,包括成本上面去,所以我觉得用户能体现出来是更明显的。
【主持人】从你今天最希望客户能理解和接受你的程度来看,你觉得今天当然有一部分肯定已经被你转化和教育了,肯定还有一部分因为不够了解,或者说对你知道的程度跟你真正能做到的定位和程度是不一样的,所以他们还对你没有被你转化。对于这部分,所以叫潜在用户,这些用户更应该怎么去理解和接受,你才会使得他们更容易的去判断出适不适合他们?
【嘉宾】这点上我觉得现在大部分客户,其实不管我们接触还是没接触的,它对AI都是一个比较积极的态度,所以从这个角度已经比10年前或者是五六年前已经要好很多了。那么其次就是说,它可能对于现在市场演化领域有很多的这个公司和技术,他们并不知道哪个好哪个不好,所以他们都需要拿来一一去测试。但是从客户的角度,它自己的这种人员改变一种习惯去接受一个新产品,其实都是有一定阻力的。所以我觉得我更希望就是这些客户他们能够从高层有这样的一个认识,就现在的时代其实正在发生一个大的转变,如果说你的效率不去积极的去提升,去接受这种转变的话,很可能在未来的某一个时间点就被整个行业淘汰掉了,就这点我觉得非常重要。
【主持人】所以你是觉得多多少少有点博弈,或者有点囚徒困境在里边,就说大家就变成了不上的人就要落伍,上了的人短期有优势,长期还是持续,就是反正就其他人都上了,对,其实这种模式。
【嘉宾】对。
【主持人】那这算是个AI时代了。你觉得假定这个时候有一个跟你一样背景的人,在最近2026年上半年进来,做跟你一模一样的事。你觉得你做了8年之后回过头来,先不说提建议,你觉得对这样的挑战者和竞争者来看,过去8年主要积累的事情和优势是在什么地方?
【嘉宾】我觉得有几点。第一点就是整个的这种技术体系经过了8年的打磨,这个其实是一个非常漫长和要花大量精力资源做的事情,可能对一个新进入的人来说他要追赶这个时间是省不了的。第二点就是说从客户市场的角度来讲,如果说现在再去创业做这件事情,可能市场已经没有了,就是这些大客户他已经用了我们这样的产品,包括建立了非常好的合作关系,再想替代几乎不可能。这个我们在之前做电子时间记录本的时候就看到过,就是客户已经用了,他做了很多的定制,你再让他改基本上没有这种可能性了。所以我倒觉得这个创业做这块的时机可能已经过去了。
【主持人】这个答案比我的问题还要残酷一些。那然后最后作为这一期节目的收尾,我不知道你觉得还有什么想要跟大家分享的这些建议也好,这些你的思考也好,或者说关于公司的一些说明解释也好。
【嘉宾】我觉得这个AI for Science是一个很好的一个很好的时代和机遇吧,就是还是希望能有更多的资本方愿意投入,当然大家现在观望的其实也很多,因为看不清楚。就是在我们看来AI for Science还在非常早期,它的行业渗透力甚至不到千分之一。但我觉得它的趋势是几乎是必然的,就是我们说到10年之后是不是人还在做这些事情,我觉得大概率可能就做的就很少了,就是主要是AI在做这些事情。这我觉得也是个非常确定的中国机会,因为从各个角度的科学研发效率上来看,这个就多多少少有一点像我们在13年前开始电动车战略一样,就是中国老讲弯道超车,就是这个凑巧那个弯道不是你造出来的弯道,是正好在那个时候出现了一个行业整体转向的机会,只不过是你综合了各种优势,是在这条路上率先跑起来。那今天你看AI for Science,广义上解决各种各样创造和研发效率突破。
【嘉宾】就是把这个数字化工具或者叫AI模型,用在各种各样的垂直领域里面,解决这个突破发现的效率问题。我经常打比方,这就像当时发明的这个显微镜,然后能看见比如说吞噬细胞,然后导致大家在生物医学领域的科学进展,出现了一个广义上快速的大面积突破,大概就有点像这个阶段。这也算是个弯路,如果显微镜算是个弯路的话,那就是个弯路超车。
【主持人】所以我们也非常感谢夏博士跟我们分享的这些,他在具体的AI for Science领域加上商业化,和过去八年创业不同的感受和经历。他也经历了资本市场的高光和资本市场的低潮,现在应该迎来了资本市场,在同一个概念经过模型演化之后的第二轮热潮的早期阶段。我们也希望夏博士的公司和夏博士本人,能够在这个AI for Science的新方向上,取得未来更好的结果和成就。
【嘉宾】谢谢方叔,谢谢大家,谢谢大家。