打开APP

机器人的“ChatGPT时刻”还差什么?差一个真实世界的数字副本

2026-07-28 12:19 网络

当人形机器人在展台上流畅地完成抓取、搬运、装配等动作时,很少有人会去想:这些动作背后,究竟需要“喂”多少数据?

答案是——比大多数人想象的要多得多。

行业共识是,能实现通用自主能力的具身大模型,至少需要千万小时级的高质量真实交互数据。而截至2026年初,全球合规、可用的真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一。缺口超过99%。

数据,正在成为具身智能从实验室走向真实世界最 大的“看不见的瓶颈”。

一座国家级基地的“数据实验”

今年5月,国家人工智能应用中试基地(具身智能)在杭州高新区(滨江)正式揭牌。这是国内唯 一专注具身智能领域的国家级中试平台,已聚集18家首批入驻企业和18家共建合伙人。

1784875843472815.jpg

这座基地的特殊之处在于,它不仅仅是机器人的“训练场”。宽敞的大开间内,讨论声与电话铃声此起彼伏——验场景、采数据、练模型,基地正加快打通国产具身智能机器人技术的全链条。在家庭仿真场景中,机器人学习识别、抓取与放置日常用品;在仓储物流仿真场景中,进行分拣与搬运作业训练。

而在18家共建合伙人中,有一家企业的角色颇为特殊——它是唯 一一家专注于数据基础设施的共建方。这家名为景联文科技的企业,承担的是基地数据方向的建设任务。近期,该公司完成近亿元A轮融资,市场分析认为,这折射出数据基础设施在AI产业链中的价值正在快速抬升,是产业需求爆发的自然结果。

这并非偶然。在具身智能的产业链上,算力、算法、数据三者缺一不可。但相比于算力集群和算法模型的高调亮相,数据基础设施建设往往显得“沉默”——却又至关重要。

从“拉框”到“教机器人看世界”

数据标注行业正在经历一场深刻的变化。

过去,数据标注被理解为“拉框”——在图片上框出物体、在语音中转写文字,拼的是人力和速度。但大模型进入医疗、工业、具身智能等专业领域后,一个残酷的现实浮出水面:通用模型能写诗聊天,却“看不懂”手术台上的操作逻辑,也“不理解”工厂里的工艺控制。

行业高质量数据集的建设,已被提升到国家战略层面。国家数据局印发的《关于推进行业高质量数据集建设行动的实施方案》提出,要推动数据加工和标注等技术加速向智能化、精细化发展。数据标注正在从人工逐条处理,转向模型批量处理与人工重点复核相结合。

这意味着,数据标注的核心竞争力不再是“人头”,而是行业知识和专业技术平台。

走进真实世界

景联文科技的做法,某种程度上代表了这一趋势——把数据采集从“手工作坊”重构为覆盖人员、设备、流程、质控全链路的标准化工程体系。公司已在芜湖、重庆、贵阳建成三大具身智能数据采集基地,覆盖居家、酒店、商超、办公室、工厂五大真实场景。

今年6月,景联文科技携手国家具身智能中试基地、百度云、蚂蚁数科等16家伙伴,共同启动“100万小时超高质量真实数据计划”。目标是打通机器人数据全链路,夯实国内具身智能产业发展底座。

与此同时,全国范围内的数据采集基础设施正在加速铺开。数据显示,截至2026年4月底,中国已有至少90个人形机器人数据采集和训练中心处于使用或规划建设中。

一个更大的命题

这场关于数据的实验,指向的其实是一个更大的命题:人工智能要真正走进真实世界,就需要有人走进医院、走进工厂、走进城市、走进机器人训练现场——把真实发生的一切,转化为AI能够理解、能够学习、能够持续进化的数据。

2026年《政府工作报告》首次提出“打造智能经济新形态”。智能经济新形态以人工智能技术为核心驱动力,以数据为关键生产要素。而数据,恰恰是最需要“笨功夫”的那一环。

国家数据局已明确提出,力争到2028年底建成一批覆盖重点领域的行业高质量数据集。数据从供给到价值释放的良性循环正在形成。

机器人的“ChatGPT时刻”或许还有距离。但每一个走进真实场景采集数据的人,都在让这个时刻更近一步。

(免责声明:本文转载自其它媒体,转载目的在于传递更多信息,并不代表本站赞同其观点和对其真实性负责。请读者仅做参考,并请自行承担全部责任。)

相关资讯

【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】