7月18日,南方科技大学长聘教授、逐际动力创始人张威在2026世界人工智能大会“智见AI 合创未来”国泰海通人工智能投融资论坛上发表主旨演讲《让AGI触达物理世界》。
以下为部分发言实录,投资界(ID:pedaily2012)整理:
张威:我是逐际动力的创始人张威,今天非常荣幸来到这里跟大家交流。虽然今天是世界人工智能大会,但我发现吸引大家眼球的往往是机器人,是物理AI。因为物理AI确实是AI的一个主要应用。大家也看到眼花缭乱的机器人到处蹦啊跳啊,千篇一律的,大家更关心的问题是它什么时候能从能动的表演,变成真正能用、能解决我们问题的有效工具。我作为一个从业很长时间的前线创业者和科研工作者,最近半年到一年非常兴奋,因为我觉得我们正在经历能力的跃迁。今天跟大家分享一下我在这方面的一些思考和体会。我这人比较实在,希望讲点真话,可能有一些反共识的地方,也仅仅代表我一家之言。
先说说逐际动力。我们成立于2022年,我也是学术创业。我在美国和中国当教授大概有15年时间。我们有几个特点:第一,从Day One开始,我们就非常注重产业落地,所以很早就引入了阿里、京东、招商局创投等一系列产业资本。第二,我们非常注重全球化布局,在中东、欧洲、美国都有一些资本的参与,为全球化发展奠定了基础。虽然公司成立比较近期,但团队在这个行业里已经很长时间了,在人形机器人和具身智能的行业。
刚才几位分享都提到了变化太快了,我也是,虽然作为一个从业者,我往往还是低估了这个速度。所以对于这个行业发展的看法和未来的预测,一定要建立在对行业变革本质的深刻理解上。我分享一下我对这方面理解。我觉得这个行业目前变革的本质有两个关键词:第一个叫起点相似性,第二个是指数增长。我们在一个指数增长的赛道,因为人类对未来预测判断,无论是股市还是什么,都喜欢线性推演,这是我们的本能。举个简单例子,大家体会一下:比尔·盖茨前些日子说,他大概花了几千亿美金,用了三十多年,想解决语言交互的问题也没解决明白。你问他什么时候能解决得更好、彻底解决,他可能会说十年或二十年。在大模型出来以后,技术范式一变,立刻半年就解决了。同时这技术还解决了很多其他问题。我们不能用线性推演去衡量一个指数变革。推动这个指数变革当前最关键的是AI。
数字世界的AI我觉得已经过了起点,刚才大家都聊到了,所有的Token就不用说了,可能大家都一样。公司的员工一天用的Token,有的非常厉害的,可能有将近七八千人民币,非常可怕。这个爆发增长在一年两年前是无法想象的,甚至不用三年前,一年前也很难预判。在指数发展变革中,我们要想到,看到了再去响应就慢了,就晚了,一定要提前一两天看到。所以我们要知道这个趋势。我觉得以人形机器人为代表的具身智能,虽然你现在看到它还笨笨的,干不了啥,但我觉得我们也是在一个指数曲线里。很多人不能用线性思维,我相对乐观,对它的推演也是一个线性的评价。你可能觉得它干不了啥,那可能是悲观的。但我想说,在这个指数赛道里,这些都是不正常的估计。这就是为什么大家突然间Token这些增长之前没有意识到的一个原因。这是一个变革的本质。我们进行这个本质,对这个行业就需要有一些想象力和长期观察。
推动这个指数变革真正发生的核心要素有几个,今天跟大家分享。第一个,这个行业目前还是一个技术突破性驱动的行业,并不是成熟技术的落地,而是颠覆性技术的突破,突破了以后有新的商业机会。然后我想分享一下我们对物理AI现状的一些看法,以及阶段性的技术突破有哪些商业化的机会,商业化路径该怎么做,从基金甚至从政府角度如何推动这个产业的发展。我简短说一下对这几个方面的看法。
首先,说一下对物理AI发展的现状,大家可能多多少少都会看到这方面的技术。以人形机器人为代表,我们先说一个反共识:我觉得机器人是比较好做的,人形机器人是比较好造的。它比光刻机、比飞机都好造多了,甚至比汽车还好造。它的零部件是汽车的十分之一。你天天看到飞机飞,为什么看不到人形机器人在我们生活中使用,只在展厅里待着?缺的不是会制造的人,缺的就是咱们大会的主题——AI。这个AI有个特点,是物理AI,它的数据不是来自互联网,而是来自于物理生活,这给它造成了极大的难度,它是最大、最具挑战的一类AI应用。再一个,如果你考虑到终极形态人形机器人的AI,它就是人形物理AI,又多了一个消息,更难。模仿人的大脑,我再说一个观点:人的大脑其实不难,从概念上来讲是挺简单的。它的任务非常简单:得到指令、得到你的意图,然后得到我周围的观察,然后计算出我要怎么动。这个物理的大脑就干这事儿,就是一个映射。凡是映射,我们都可以通过以前通过规则去分析,现在通过数据,都可以把它构建出来,只是缺数据。这块众说纷纭,各种路线的斗争。但我觉得到现在为止,技术方案很多样,但技术范式已经收敛了,那就是纯数据驱动的。技术范式已经相对收敛了,剩下是工程和细节。
所有我们探索的本质,都是在降低要完成一个任务的数据成本。唯一的目标就是降低数据成本,因为有足够多的数据,大家都可以做任何事,只是数据不够多。所以方案已经清晰了,剩下是工程和一些细节。虽然没有一个统一的方案,我们逐季有一个自己提出的架构。我们不觉得人的大脑是纯端到端的,它都是数据驱动的,但我们觉得它是分层的,因为人的大脑也是分区的。我们大概有个三层的架构,跟Figure的架构有一些类似,但细节上非常不同,对应人体的几个部分。最上层,就跟人的前额叶差不多,本质上是一个思考引擎,以大语言模型、视觉语言模型,甚至未来的World Model为引擎的一个Objective System。主角是老师,干这个的,它只负责记忆管理、收集指令信息、任务规划、做出决策。剩下是视觉运动层,它接受上层的决策,然后看到环境,做出一些规划。下边的小脑运控是把它完成掉。大概分这几块。上面我管它叫只想不动,下边叫只动不想。现在大家常用的词叫VLA或者World Action Model,这只是实现这个高阶技能层的两种不同技术方式,对表象没什么关系。每一层都有很多研究,我今天不细讲了。但我觉得行业真正挑战并不是把每一层单独扣得多细,而是把这三层联合起来,做到毫秒级的协同,尤其是跟硬件要联合优化。人类大概经历了从最早的类人,应该经过七百多万年,我们需要用几年的时间在AI的辅助下把这个打通,让大脑真正能指引行动。我管这个词叫大小脑融合技术,这是逐季最重要的投入,也是驱动行业发展真正落地最重要的投入方向。笼统地概括机器人或人形机器人的大脑到了什么阶段,大家喜欢用GPT时刻去类比,我觉得不是特别恰当。但我们可以简单去类比,我觉得整个脑系统已经到了GPT-3。这个跟很多人是完全不一样的,大家觉得很早。但你要知道GPT-3和3.5,大家知道的ChatGPT 3.5,还有两年多的时间。再一个,这个脑是个系统,不是由单一模型决定的。这是我们觉得最大的不同思考。首先,模型不代表能力,大脑是多模型加上记忆、情感管理的一整套系统。我觉得整个系统来讲,已经进入了类比阶段的话,GPT-3左右的一个初级阶段。我们的大脑系统叫Cosmos。我觉得在整个大脑系统里最关键的是大语言模型帮我们解决掉了System R。只想不动的你可以认为它是躺在病床上的残疾人,一动也动不了,但它有脑,很多思考。如果是以大语言模型为引擎,那它就是没有眼睛的残疾人;如果是VLM驱动的,那它就是有眼睛的残疾人;如果它还有World Model,那它就学了物理,相当于霍金。但这种思考的,我们整个具身智能就是要把这个System R这个聪明的脑来指引行动,就像把残疾人进行康复运动一样,那就需要数据和练习。练习的话就是长下边的技能。技能的学习我们觉得是靠数据,这是大家公认的。这里跟其他人有一些不同的观点,我们觉得技能不需要非常通用才叫有脑。我可以不会拧螺丝或不会开车,我也是一个正常的有脑的人。所以技能的泛化性并不代表智能的水平,只是你会。技能的构建跟你先学什么、再学什么和数据成本相关。所以我们最关键跟其他人不同的,是我们觉得大脑不是一个模型,它是一个操作系统。我们也是最早在这方面投入了重要研究。技能的构建我们是逐渐的。可以说个小秘密,有些技能比如跳舞是比较简单的,因为它不需要实时跟环境进行交互。凡是实时跟环境要交互的,像上楼梯这种,就是我们的奥利哈,在我们公司楼下,是一个实时的大小融合技术。这种技能相对比较难,但为什么楼梯可以呢?是因为这块可以完全在仿真下完成。有些其他技能,比如收拾桌子,不行了,你必须要真实的数据。等会儿我再看一下我们在Cosmos上,去年开始研究,今年出发时发出来的。它能接到人的指令,System R要去进行任务规划,然后调度导航定位,然后去做一些事情。刚才让它去拿包裹。这个你可以认为是残疾人刚刚恢复,所以它走路还有一点点别扭。奥利,你在这儿。你好,Siri要帮你做什么?需要你送到一楼车间。哦,那我先把水拿给客户,然后再把快递送给邻座,是十十可以吗?我们的数据还不够多,当时它生成的稍微没有那么自然。大家知道大语言模型是生成语言的Token,这个要生成对话,且还有一些自己动作的Token去完成这个任务。还有点壮观当时,现在好。
各位看到的机器人大部分是两条腿的,大部分都站在那儿不动,上面搁那弄咖啡什么的。全身的移动和操作联合起来的是比较少的,这个我觉得是非常稀缺的,那就可以干一些技能了。
你好,欢迎来到逐际动力。这是我们公司的前台,时间关系我就不放完了。感兴趣的可以了解我们的Coser,我们在行业里还是相对比较领先的概念和尝试。最近,我们的Coser有个重磅的升级,我们真正完成了全自主实时推理长程任务,当然大家看到的技能都比较短。
这是我们上周才公布的一个。这是整个没有摇操作、没有遥控器,实时推理完成全身移动的操作。第二个特点是家庭环境,这个环境相对弱,物的种类比较多,有软物体。这些都是一个模型,直接就是一个技能,直接推理完成的。目前,除了Figure以外,极少数吧,如果不是唯一的话,能够完成这样长程的移动操作通用任务。
OK,好,时间快到了。OK,还有一个特点是整个这个模型是纯数据驱动的,不需要任何专家。把它打通了以后,你只要收数据,再部署工人,就可以完成一些简单任务的部署。好吧,时间原因我就不多讲了。我先说一下,再看一下整个这个人形技术的发展,怎么推动商业化。
人形呢,我觉得首先要了解一个整个的Landscape。我们觉得有核心供应商,我们要定位嘛。机器手我觉得也是一个经销商,还有一些技术解决方案商。那可能有一些模型公司,会是未来的技术解决方案商,还有OEM人形主机厂商。人形跟其他有点不同的地方是,它会有些应用,以后Download在可能有最适合接待的,也有最适合表演的,也有最适合做东北菜的这些应用。所以在这里边,主机厂我觉得是最关键的,承上启下。
然后我们的定位是,我们是一个主机厂,产品型的大脑能力的主机厂。我们对标技术上全面对标Figure,产业化方面要比它近一点。我们的Slogan是带两条腿的人形,叫Serve People Not Process,就是服务于人,而不是服务于生产流程。所以我们并不是在工业场景去尝试它,因为我觉得它的效率还不是最好的,更适合在这个环境里向上抬这些,来为我们人提供服务。然后我觉得人形的商业化的底层逻辑,为什么可以阶段性地商业化,就是我觉得它是一个通用本体加APP的概念。就是说单一的能力,比如跳个舞,你会觉得没啥,但是它是不改变构型,你就可以叠加很多的APP。所以当有一个拐点的时候,足够多的时候,我就要吸星大法拐点,然后后来的应用都会在它身上来进行开发。所以我们会有一些阶段性商业化的东西。因为时间原因,我这里就跳过了。我们有一些构建,我们就是阶段性商业化,什么技能先开发,什么技能后开发,这件事情我们有自己的一些商业逻辑。总结一句话就是,构建这个技能的数据成本小于这个技能所创造的价值,这才可以。所以选择一个什么样的应用场景,是需要考虑到技术,也要考虑到商业价值的,综合的判断也是太难的原因。自动驾驶其实就是一个技能,它不是一个大脑。好吧,所以现在也还没有太到L4。所以你选择场景以后,你就会发现你需要的数据成本可能非常高,所以这是一个综合的考量。
好,时间关系,我跳过这些东西,我就直接坐到后边吧。不好意思,我这个有点多,时间已经到了。我们有一个创新的产品,是用来提供产品落地的这个应用开发的。它的双臂的形态真的能适合产品的开发,同时我们也提供一些很好的生态的支持。所以我们很多伙伴已经加入进来了,如果各位感兴趣,也可以跟我们联系。有非常多的应用场景,包括建筑,包括这些巡检等等。
最后说两件事。第一件,我觉得推动产业发展,具身智能不要复刻大模型的先通用在落地的发展方式。因为物理世界数据天然稀缺而且贵,而且各个物理技能的数据差异很大。你开车和包鸡蛋这两个技能在一起训,相互可借鉴性是不多的,没有必要等着会开车了再去学别的。所以我们提出的是场景和模型的数据飞轮。就是说,一定的通用性以后,就要进行场景去收集专业数据,然后再去迭代通用模型的能力。我们觉得这是比较关键的。
再一个呢,我们认为具身未来并不是一枝独秀的,所以大家不用押宝,我们是百花齐放的。所以我觉得是需要推动两个生态的建设,是开源生态的构建和产业生态的构建。我们逐渐在这方面是赋能全球创新者的状态,是推动产业生态的一个构建者。我们提供了开源的训练架构,我们可以用自然语言就可以训练一个VLA模型。如果你感兴趣,想在你的场景去尝试,你可以用我们的机器和我们的这个开源的设备。
好,时间原因,我就先分享到这儿。总体感受就是说,我觉得现在进入了一个从会动到能用的关键节点。今年是2026年,是一个POC验证的元年,明年我们希望有一些规模化的发展。非常感谢各位,谢谢。












