7月19日,阶跃星辰联合创始人、首席技术官朱亦博在2026世界人工智能大会“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”上发表主旨演讲《AI基础设施与模型能力的融合促生》。
以下为部分发言实录,投资界(ID:pedaily2012)整理:
朱亦博:非常感谢启明创投的邀请,也非常感谢启明创投的支持。阶跃星辰是基础大模型创业公司。我们比较出名的是多模态相关的能力,也做基础语言和Agent,我想分享一下我们进入Agent时代以后在AI模型、基础设施、联合设计方面的体会和经验。
最开始我还是喜欢从经典的图开始,刚才也提到现在AI变化非常快,但是如果一张图或者一个路线能够持续说两年还依然在应验,它是非常有价值的,这是2024年初我们CEO将我们对AI发展路线,当时画的图,我们把AI发展分为三个阶段:
第一阶段,模拟世界阶段,我们把大量预训练数据灌进去,大模型可以像人一样聊天。
第二阶段,探索学习世界,到强化学习阶段也就是2024年下半年到2025年,包括OpenAI O1和DeepSeek R1出来强化学习的范式,其实强化学习有一个经典的例子就是AlphaGo,它强化学习做到最后可以比老师还强,不仅在模仿老师还可以创新出新的东西甚至做得比人还强,可以从学人类说话进化到帮人类办事,能够帮人类办事才能够又发展出现在谈具身智能的能力、智能终端后面会说的能力,当然最基本的帮人写代码的能力。
第三阶段,归纳世界我们预期它会发生,不再只是使用以前人类积累的一些技能排列组合去做,而是能够归纳出新的科学规律,基本进入了AI For Science的阶段,现在我也看到一些初创公司在聊这些事情。
最下面这一行是同期OpenAI影响力在那儿嘛,大家比较常用的AI发展五个阶段,大家可以看到相对是比较Match,从聊天机器人到现在的智能体时代以及后面的创新。
再多说一下我们现在处的时代,用OpenAI现在五个阶段来衡量,现在处在L3智能体时代,标志产品包括去年下半年开始Claude Code和OpenAI的Codex,发现它真的可以替代很多日常编程的工作,再到今年上半年的小龙虾和爱马仕比Coding更通用的Agent出现,这基本上就是智能时代开启以及到现在非常火热的状态,像我们公司的话,HR、法务、财务这类没有任何开发基础的人都人手一个Agent帮助他们做日常的工作,非常有效率。
我们下面是阶跃模型的迭代Step1到Step 3.7 Flash,下一版模型也非常快就要发布了,也有一些成绩,在前面还没有到Reasoning的时候,我们有国内比较早的近万亿参数的模型Step2,那个时候也拿到了一些榜单的第一,但这是DeepSeek爆发之前的事了,到最近我们的Step 3.5 Flash系列是第一款Agent模型,它也取得了非常好的成绩,但这个体现的是在非常受用户欢迎,在整个2026年的3月份它是全球在OpenRouter上调用第一多的模型,排名第一。为什么会这样?我后面会解释模型的原因。我想把现在面临的现状以及谈一谈投资的逻辑。
这张图我发现只要不是第一个发言的,基本上都不是第一个展示的。这是400多倍,这是国家数据局的统计,Token在那儿就不用多说了,右边的是额外画的,看一看我们实际支持Token需要算力吧,我们算力是什么增长速度呢?不足三倍,这也是工信部权威的统计。
我们怎么用三倍的算力支持了一千多倍Token呢?现在还是非常紧张的状态,如果还要支持Token继续翻倍,再加上模型的尺寸也做得越来越大,这对Infra的挑战越来越大,一方面是我们当然也希望半导体行业能够再冲一冲,当然还有就是模型设计和软件设计要能够在单位算力下压榨出更多的智能才能满足我们的需求。
除了刚才说的算力压榨出智能还是一个性价比,但Agent时代又多了一个维度,从性价比又要高智能、又要低成本的两难,进一步变成了不可能三角。只是多了一个速度,右边是我们发表Step 3.5 Flash时在知乎上写的文章,有上千的同行给我点赞,感谢大家的支持,说的道理很简单,过去聊天机器人时代我们模型的推理只需要超过每秒20个Token就够,因为人类阅读速度就这么快,真的到Chatbot上问他一个问题给你几百个字也读不过来。
但现在进入Agent时代之后,比如说我让它做一个编程任务或者其他任务,不会去看模型思考的过程和工作的过程,我要的是模型尽快把最终结果交付给我,能十秒就不要拖到一分钟,这也是为什么Step 3.5 Flash非常受欢迎的原因,就是因为快。所以在模型这一侧和软件这一侧又多了一个速度的维度,而且速度变成之前的了,不像以前说超过20Token就没有什么大差别了。
所以这一边也Show一下,我们3.5、3.7的Flash模型,它不是绝对意义上智能最高的模型,这个基本是OpenAI和Anthropic,但是在Artificial Analysis,就是大家经常会去看的评价榜单上它还有一个维度就是带上速度和成本的维度,就会发现我们基本上是第一或者名列前茅,这是我们在Agent时代在那个时候获得很高的调用量的原因,那个技术都是一直在革新的,速度都会被追上来,智能也要一步一步迭代新的模型,反正业界最大的不变就是变化吧,还会继续地努力。
第二个延续刚才的话题,我是很喜欢拿过去做对照的,左边这张图是我们在去年7月份发的Step3模型,那时候画了最重要的图,右边是延续上一页我搬过来的一张图,这张图它的横纵坐标说明了不同时代的优化目标,上个时代推理时代或者说聊天机器人时代,我在意的是模型的尺寸,横坐标是成本,我希望它性价比好,我通过模型结构设计、软件优化,针对国产芯片的适配,我们体验出来我们是做得不错的。
右边这张图是我们现在3.7优化的目标,纵坐标是智能榜单的分数,横坐标是模型输出的速度,跟其他的Flash相比,如果谈巨大的模型会更慢,当然我们做了很多的技术使得技术领先这么多,它在一些场景会体现出非常大的价值,会受到用户的喜欢。
具体技术说一个例子,大家不一定Follow,但能Get。我们最近发表了一篇叫“投机采样加速模型推理”,投机采样比如说以前模型是一次推理一个Token,投机采样是赌徒嘛,赌10个Token,如果赌对了就赚到了,赌不对我就回到一个Token,但我有赌对的概率,就可能一次触出很多Token,这样平均下来的速度加快了,在这方面DeepSeek几乎是同一天发表,实际上我们早一天,大家英雄所见略同,都看到非常重要的一个技术点,其实做法也蛮相近的,但我们调得更极致一点,实际上我们可以用这种方式包括模型调整和系统调整,我们可以让用户体会到Token输出速度达到9.64倍,DeepSeek达到7倍,都重视这个方向,这对于Agent实际投入使用还是可以给用户提供价值,以至于我们可以单卡输出,给单用户输出上千Token每秒,你可以想象,比30Token每秒以前上一代模型的部署方法,完成Agent task快了30倍,这个就是数量级的差别。
再说一些共识和非共识,我们一直相信多模态和Agent也需要多模态,但现在有人看Coding就可以了,但我还是相信未来超出Coding之后服务更多用户我们需要多模态,因为对人类最高效的沟通方式是视觉输入,对我来说输出最高效的是语音,如果今天不上来Talk,给大家一张纸你们自己读吧,我不说了,那效率高吗?你可以想象现在的Agent跟用户交互就是给你打印一张纸你读吧,就是这样,你要跟它说话得打字,这实际上并不是人类最高效的,所以我们坚持一直做多模态。但我们和前面生数多模态有一点区别,我们主要做视觉的理解和语音的实时对话,这边也是积累比较完整的模型矩阵,也支持下面说的终端战略。
举个例子,比如说我们最近也发布一个语音模型,实际上这个语音模型也没有那么卷,但我们还是和世界最好的水平去比,比如说Gemini,在ASR语音识别方面已经超越 Gemini 3.1Pro,逼近它的大尺寸版本,小尺寸我们都是比较领先的。所以语音方面我们还是积累非常多,在我们展厅可以体验到这个模型,当然它还是Preview,后面还会再提升。
说完这些多模态,有这些多模态的东西我们组织起来就可以支持我们从2024年以来一直在做的战略,我们现在做AI终端和AI硬件这件事情,但这个事情对Infra也有相当大的挑战,举个例子,我先说highlevel的,AI终端我们认为要给用户去好好地体验,还是要端云协同的方案,我不能说只用一个小模型在端上,这个比云上模型还差了一百倍的尺寸,智能差太多,以及隐私也是需要重视的问题,所以纯云纯端不适合,我们相信需要端云协同的方案,才能给用户最好的体验。
这个地方其实还是会给Infra带来一些挑战,一方面模型要全尺寸,云上模型也有,端上的模型也有,但Infra也需要端云协同。举个例子,比如说大家知道前一阵子一些人装了小龙虾也买了一些产品,每个月其实几十块钱付给云上虚拟机,Token可能每个月几十块,你说模型块结果虚拟机几十块,如果端上环境、云环境配合它,像双生一样这样跑,云上也要每个月几十块,这对于手机用户或者对于老百姓不是那么好接受,所以还是有很多Infra优化的部分,细节不说了,我们是有信心把它Cut十倍下来,但这边确实有一些额外的事情要做,也包括说我要训这种端云协同,端上和云上的模型要配合去完成一些任务的话,我也要做强化学习,强化学习要仿真出一堆的手机环境,才能让模型尝试完成端云协同任务把它Reward给训出来,像这种Infra以前也是没有的,也是不成熟的,所以也需要做。当然这边启明创投圈也在我就稍微提一下,我体会蛮好玩的,提供强化学习环境和强化学习LongHorizon Trajectory的数据很多都是国外的创业公司,国外创业公司好多海外朋友来找我,他们创了一个业,说可以给我们提供什么环境做强化学习,什么数据可以让我们提升模型能力,比如Scale.AI蛮成功的,有一个榜样吧。
说完这个我们也在WAIC顺便发布了端云协同嘛,发布了端侧的协同,其实不是一个模型,是一系列模型,是基于我们对于端上硬件的理解,因为我们也服务很多汽车厂商,我们基于这些理解做了一系列我们觉得应该跑在端上最重要的模型,比如说操控你手机屏幕按钮的模型,应该跑在你端上,如果跑在云上大家受不了,包括语音低延迟也是在端上。所以基于我们的理解我们也发布了端的模型,也跑了指标第一。最重要的是未来将放在我们的终端产品上。
这边是总结一下Agent时代Infra需要多做的一些事情,需要长期运行的环境,需要协同有一个记忆Contact Management的工具等等。
最后这几十秒是一个小小的预告片,也感谢大家听我说完这些,谢谢大家。












