打开APP

GPT-6掀起具身智能风暴,恐慌与惊喜同时涌来

9月初OpenAI发布GPT-6 Astra,其在机械臂任务测试中成功率高,引发具身领域震动,业内探讨其影响及与具身模型关系,未来或分层共存。

GPT-6 Astra掀起的具身智能风暴仍在持续。

9月初,OpenAI发布GPT-6 Astra,随后几天一段段机械臂视频在社交网络上传播。新模型无需额外训练,直接操控机械臂抓取,放置物体。独立评测机构Robocurve的实机测试显示,在双臂机械臂执行“抓取方块并放入碗中”的任务上,Astra取得95%的成功率,明显高于Claude Fable 5.1的40%。

接着,GPT-6 Astra吃掉具身智能、大模型降维打击具身智能的说法迅速在圈内流传。

一位具身领域的创业者对我们说,最近行业群里讨论最多的就是这件事,有人觉得此前的一些具身路线要被推翻了。亚马逊Alexa首席科学家Zeeshan Zia公开断言,"机器人领域的OpenAI可能就是OpenAI本身,而不是Physical Intelligence或Skild。"

国内互联网上,GPT-6 Astra也点燃了具身领域人士发表看法的热情。前地瓜机器人具身负责人何泳澔(现为虚时科技CTO)甚至认为,VLA、世界模型这类方案,可能已经没有太大投入的价值了,具身的突破大概率来自基模大厂。

“这个冲击太大了,没想到那么快。”何泳澔对我们说。

极 佳视界首席科学家朱政几乎有着同样的判断,他在社交网站上写道,"语言模型已经吃掉了多模态,正在蚕食具身智能的路上,未来1到2年是关键点,具身智能团队必须加快节奏,现在具身智能没有什么真正的护城河。"

过去一周,Astra成为具身领域的高频词汇,它掀起的风暴还吹到了外滩大会上。一夜之间具身模型公司的危机感似乎更重了。

共识与分歧似乎同样清晰,对具身而言GPT-6确实改变了一些东西,或者说正在改变一些东西。

01

OpenAI等模型公司从中国购买具身数据

大模型控制机械臂似乎并不新鲜。华为具身研究员钟子明告诉《白鲸实验室》,GPT-6能控制机械臂本身是很trivial(微不足道)的,机械臂的控制信号本质上就是上下左右和夹爪开合,不是GPT-6也能控制。

当然,这里面还存在一个成功率的问题,根据第三方评测,Astra的成功率远高于Claude Fable5.1和其他模型。

更值得注意的是,在没有针对具身任务做修改的情况下,Astra控制得比此前的专用模型如π0.5更好。这也是令很多业内人士感到震惊的地方。

Astra为什么能较好地控制机械臂执行任务,自变量机器人创始人王潜在外滩大会上给出了更根本的解释。他透露,从去年年初开始,OpenAI和Anthropic就在大量采购机器人数据,并有自己的小规模数据工厂,还招募了不少机器人方向的人员。

"一个非常好的多模态模型,里面加了很多机器人数据,能做这种事情好像真的不是什么特别奇怪的事情。"王潜说。

晴岚视界CTO刘斯坦向我们证实了这一点,几个月前他们公司收到了很多数据订单,有的来自北美头部大模型厂商。“他们做的事情就是给你一堆东西,让你指出这些东西的空间位置,谁在谁的左边、前面、后面,明显就是用来训练空间理解能力的。”刘斯坦说。

因而,OpenAI通过采购机器人数据训练出的新模型,让国内一众具身创业者折服就不足为奇了。不过它的表现也并不是那么完 美。

破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲,认为GPT-6 Astra是相当惊艳的,他们团队在Astra可用当天就做了测试。

他给出的结论是,如果把具身任务拆成语义泛化、空间泛化和物理泛化三个维度,Astra在前两项上很强,只在物理泛化上较弱。

Astra甚至能抓起一根放在桌面上的筷子,这种小物体此前需要机器人顶住桌面、打滑才能抓起,还能把筷子立起来插进杯子里。但一旦涉及带物理接触的复杂任务,比如用筷子挑开东西、叠衣服、叠盒子,Astra都是做不了的。

这就是当前的真实边界。Astra证明了通用大模型可以解决具身中的语义理解和空间推理问题,但对于那些需要接触力、变形、摩擦的精细操作,仍然是专用具身模型的阵地。

刘斯坦并不认为Astra很惊艳。他在深圳的实验室和中山大学张瑞茂教授团队密集测试了GPT-6,最后他的结论是,很多被认为只有GPT-6能做的事,拿Gemini、Claude或者千问,也能干。

为何这次讨论的比较多,本质上是大家对大模型能力在具身方向的一种新的发掘。换句话说,Astra引起具身领域的恐慌中有一部分是认知差,大模型的能力边界一直被低估,而Astra很可能只是把它推到了物理世界的门口。

不过更多的人还是相信Astra很快将会改变一些什么,妙动科技创始人杨硕的预测代表了这种乐观派的判断。

他说,两个月内可能看到人形机器人带着Astra水平的Agent走来走去做家务,六个月内各AI模型公司的空间理解能力会逐步增强,甚至有人会谈论一种新的模型Spatial-Language-Model (SLM), 把原本Vision-Language-Model(VLM)的空间理解能力大幅提升。

刘斯坦对此保留态度,"高频调用是不可能的,你给GPT-6说一个hello他都能想那么久,他怎么可能让机器人做家务?如果是低频率的规划思考,那其实我们已经在用了。"

02

大脑与小脑的分工

目前Astra还没能给具身领域带来实质性的改变,大多存在于猜想当中。真正值得关心的问题是,如果Astra不能替代具身模型,那它和具身模型之间应该是什么关系?

答案很可能是分层模型,分层模型被认为是和VLA、世界模型不同的技术路线。上层是通用大模型,负责语义理解、任务规划和调度,下层是具身专用模型,负责感知、控制和物理交互。

华为具身研究员钟子明用一个具体场景解释了为什么必须分层。"你跟机器人说帮我做个饭,它应该先规划做饭有几个步骤,然后说第 一步我要找到锅铲,如果当前视角没有,就把拿锅铲这个任务打断,改成去找锅铲。"这种调度能力,目前所有具身模型基本都没有。

而一旦锅铲掉了、被人拿走了,机器人需要判断并重新规划。这正是大模型擅长的纠错闭环。

类比大模型的发展,早期语言模型只能写一段代码,后来加上Harness(执行环境),就能写完代码自己跑、跑出错误自己改。具身也需要这样一套Harness,大模型做大脑,世界模型或VLA做执行,前者负责"做什么",后者负责"怎么做"。

钟子明判断,Robot Harness可能是具身下一个必然经历的阶段,只是目前具身还停留在相当于大模型写代码的那个阶段。

但这个架构有一个绕不开的工程问题,就是频率。

刘斯坦算了一笔账。人脑在静息状态下大概只有15瓦,思考时也不过30瓦,而一个跑在4090显卡上的大模型,能耗是几百瓦,而且推理频率极低。物理世界的运作有天然的高频要求,机器人保持平衡需要50赫兹以上的控制频率,也就是每20毫秒一次反馈。

"你20毫秒输入的命令都还没到达OpenAI的服务器,机器人已经倒了。"刘斯坦说。

他不认可GPT6对具身智能会产生多大的威胁,并用一个生动的比方解释了GPT 6控制机械臂,“现在GPT6做具身,相当于用大脑去干小脑的活。”一个小脑受损的人,靠大脑思考每一步肌肉动作,也能扶着墙站起来,但这和人类真正多频率、高效节能的运动模式差得很远。

按照刘斯坦的说法,未来大模型内部会分化出不同频率的模块。他预测,也许到GPT-8,云端大模型会划出极小的一块专门负责高频运动控制,通过6G网络和本体实时通信,把图像传上去,巨聪明的一个大脑,只激活那个神经系统的一丢丢,然后把动作发回来。

在那之前,端云协同是更现实的方案。机器人身体里跑一个高频的专用模型负责走路和操作,需要通用知识时再调用云端大模型的API。"我叫一个机器人教小孩子做作业,可能需要物理知识,这个时候调个DeepSeek的API就好了。正常走来走去干个活,这些都用不上。"刘斯坦说。

刘斯坦和公司首席科学家正在研究的课题,正是这种分层的端云协同架构。

关于频率的问题业内也有一些人在思考。前地瓜机器人具身负责人何泳澔认为,未来可能会出现一种高频执行器,在一个很短的时空中,在确保没有agent反馈的时候能够继续流畅完成接下来的动作,大概率会是以小脑概念存在。

还有状态验证器,关键事件的判断,如失败恢复,细节处理,完成判定等。

这实际上意味着,具身智能的架构可能不会简单地变成“一个大模型包打天下”,会逐渐形成不同频率、不同职责的分层系统。

大脑负责理解任务、规划路径和做高层决策,小脑负责高频、连续的动作控制。而状态验证器则像一个持续运行的“裁判”,判断当前动作究竟有没有做对,任务进行到了哪一步,以及什么时候需要重新规划。

03

真正核心的可能还是数据

架构之上,决定胜负的可能还是数据。

今年是具身智能数据备受关注的一年。2026年4月智源社区专访中,上海交通大学助理教授穆尧提出"数据为王"的概念,并认为2026年会是具身数据规模化的元年。

这个说法也得到了一些具身企业的响应。智元机器人孵化的觅蜂科技,其MEgo系列无本体采集设备已量产交付超2万套,累计产出超百万小时无本体数据,覆盖22大类场景、万余个真实环境和500余种细分任务。宇树科技则在IPO募投项目中明确将数据采集列为研发投入方向。

自变量创始人王潜在外滩大会上提出了一个判断,"今天智能的本体是存在于数据里面的,模型更多的是蒸馏器和容器。"

他认为,语言模型每一代的提升,一部分是因为模型的规模在变大,这个更多的是Infra,更大的其实是因为越来越好的数据。Coding先被解决,因为它是最容易制造和验证的数据,数学紧随其后,3D和视频生成也因为相对容易标注而快速进步。

具身数据是最难制造、最难验证的一类,这既是壁垒,也是瓶颈。

2026年关于具身数据路线的分歧已经公开化。例如苏度科技押注仿真,韩铮的团队在2024年重构了整套仿真数据管线,去年底在抓取、放置、组装类任务上实现了物体和环境几乎无限制下的接近100%成功率。

他的理由很朴素,真实数据收集效率慢、质量受限,仿真是绕不过去的。

蚂蚁灵波则更坚持真实数据。首席科学家沈宇军的论点是第 一性原理的,机器人最终只能依赖身上的传感器做观测,而真实传感器一定有误差。他们测过很多真实传感器和仿真输出,基本上千差万别,不管是频率、幅值、传感器之间的一致性。

如果Real-to-Sim(把真实传感器特性搬进仿真)不可规模化,那么只谈Sim-to-Real的差距缩小意义不大。

而在真实数据这边,"十万小时"的叙事正在被祛魅。华为具身研究员钟子明透露,某具身数据公司喊出十万小时,他实际下载下来只有一万小时。

什么才是好数据,正在成为具身智能行业最核心的竞争壁垒之一。数据怎么采、怎么筛、怎么配,以及哪些数据真正能提升模型能力,可能只有少数头部团队掌握了完整答案。好数据还必须和训练方式绑定,比如要做ICL(上下文学习),数据里就得有"机器人做"和"人做"的对应关系。

"具身到底想要什么样的数据,什么样的标注,这些基本都是黑盒。"钟子明说。

比数据更深层的分歧是范式。沈宇军认为,具身不会简单复刻数字大模型的技术路线,数字世界的模型是轮次式的,你问一句,它答一句。但机器人必须一边工作一边推理,传感器输入7×24小时不间断。

这种从出发点就不同的应用场景,必然催生新的训练范式。

王潜则从更宏观的角度论证了具身不可替代。在他看来,人类科学研究有两种思维方式,逻辑推理和物理直觉,二者无法互相弥补。视频、3D、Code都无法获得物理交互的能力,而真正的AGI,乃至递归自我改进(RSI),都绕不开物理世界。

他描绘了一个五年后的场景,今天做一个APP可能需要一个大团队一年,未来一个人开一堆Agent几个小时就能完成。而造一架飞机,也许在具身智能和通用大模型的辅助下,也能像今天做APP一样简单。

回到最初的问题,GPT-6会重做具身智能吗。

一个被多次报道的事件是,OpenAI CEO奥特曼已经宣布要做人形机器人。如果大模型真能降维打击具身,OpenAI没必要去做又脏又累的硬件,答案或许是,数据壁垒真实存在,物理世界的能力无法仅靠语言和视频获得。

OpenAI需要身体去采集数据,正如它需要数据来喂养模型。

这反过来印证了王潜的判断。如果OpenAI做具身也要碰数据、碰硬件、碰真实世界的evaluation,"那它只是另外一个具身智能公司而已"。这些难度并不会因为它在基础模型上的优势而降低。

数据量无疑很重要,可一些数据在实际表现中似乎并不好,可能被高估了。许华哲直言,百万小时没有比几万小时训出更好的模型,另外,被低估的是整体智能模型的进展,或者具身智能模型的进展。

不过许华哲十分乐观,他觉得三年内具身智能就可以在很多地方开始服务,而且是通用的服务,不是在这儿后训练好的服务。

综合来看,未来最 大概率或许不是谁吃掉谁,应当是分层共存。OpenAI们做大脑,具身公司做小脑和身体,通过标准化接口协作。正如人脑本身,大脑负责思考,小脑负责运动,脊髓负责反射,各安其位,缺一不可。

【本文由投资界合作伙伴微信公众号:白鲸实验室授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关企业

机器人数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】