当人形机器人在展台上流畅地完成抓取、搬运、装配等动作时,很少有人会去想:这些动作背后,究竟需要“喂”多少数据?
答案是——比大多数人想象的要多得多。
行业共识是,能实现通用自主能力的具身大模型,至少需要千万小时级的高质量真实交互数据。而截至2026年初,全球合规、可用的真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一。缺口超过99%。
数据,正在成为具身智能从实验室走向真实世界最 大的“看不见的瓶颈”。
一座国家级基地的“数据实验”
今年5月,国家人工智能应用中试基地(具身智能)在杭州高新区(滨江)正式揭牌。这是国内唯 一专注具身智能领域的国家级中试平台,已聚集18家首批入驻企业和18家共建合伙人。
这座基地的特殊之处在于,它不仅仅是机器人的“训练场”。宽敞的大开间内,讨论声与电话铃声此起彼伏——验场景、采数据、练模型,基地正加快打通国产具身智能机器人技术的全链条。在家庭仿真场景中,机器人学习识别、抓取与放置日常用品;在仓储物流仿真场景中,进行分拣与搬运作业训练。
而在18家共建合伙人中,有一家企业的角色颇为特殊——它是唯 一一家专注于数据基础设施的共建方。这家名为景联文科技的企业,承担的是基地数据方向的建设任务。近期,该公司完成近亿元A轮融资,市场分析认为,这折射出数据基础设施在AI产业链中的价值正在快速抬升,是产业需求爆发的自然结果。
这并非偶然。在具身智能的产业链上,算力、算法、数据三者缺一不可。但相比于算力集群和算法模型的高调亮相,数据基础设施建设往往显得“沉默”——却又至关重要。
从“拉框”到“教机器人看世界”
数据标注行业正在经历一场深刻的变化。
过去,数据标注被理解为“拉框”——在图片上框出物体、在语音中转写文字,拼的是人力和速度。但大模型进入医疗、工业、具身智能等专业领域后,一个残酷的现实浮出水面:通用模型能写诗聊天,却“看不懂”手术台上的操作逻辑,也“不理解”工厂里的工艺控制。
行业高质量数据集的建设,已被提升到国家战略层面。国家数据局印发的《关于推进行业高质量数据集建设行动的实施方案》提出,要推动数据加工和标注等技术加速向智能化、精细化发展。数据标注正在从人工逐条处理,转向模型批量处理与人工重点复核相结合。
这意味着,数据标注的核心竞争力不再是“人头”,而是行业知识和专业技术平台。
走进真实世界
景联文科技的做法,某种程度上代表了这一趋势——把数据采集从“手工作坊”重构为覆盖人员、设备、流程、质控全链路的标准化工程体系。公司已在芜湖、重庆、贵阳建成三大具身智能数据采集基地,覆盖居家、酒店、商超、办公室、工厂五大真实场景。
今年6月,景联文科技携手国家具身智能中试基地、百度云、蚂蚁数科等16家伙伴,共同启动“100万小时超高质量真实数据计划”。目标是打通机器人数据全链路,夯实国内具身智能产业发展底座。
与此同时,全国范围内的数据采集基础设施正在加速铺开。数据显示,截至2026年4月底,中国已有至少90个人形机器人数据采集和训练中心处于使用或规划建设中。
一个更大的命题
这场关于数据的实验,指向的其实是一个更大的命题:人工智能要真正走进真实世界,就需要有人走进医院、走进工厂、走进城市、走进机器人训练现场——把真实发生的一切,转化为AI能够理解、能够学习、能够持续进化的数据。
2026年《政府工作报告》首次提出“打造智能经济新形态”。智能经济新形态以人工智能技术为核心驱动力,以数据为关键生产要素。而数据,恰恰是最需要“笨功夫”的那一环。
国家数据局已明确提出,力争到2028年底建成一批覆盖重点领域的行业高质量数据集。数据从供给到价值释放的良性循环正在形成。
机器人的“ChatGPT时刻”或许还有距离。但每一个走进真实场景采集数据的人,都在让这个时刻更近一步。