打开APP

人类还能给AI做多久的老师?

9月30日亚马逊将永久关闭旗下MTurk,其曾是AI关键基础设施,因AI发展而关停,如今人类仍在为机器人采集数据,引发对未来人机关系的思考。

最近,亚马逊宣布,旗下MTurk将于9月30日永 久关闭。

MTurk着实是一个有故事的同学。作为从亚马逊内部孵化、面向全球的AI数据平台,MTurk解决了AI早期的一个关键问题:当计算机还无法准确识别数据时,先由人类给出标注,以便让AI通过反馈机制持续学习,贝索斯称其为“人工的人工智能”(artificial artificial intelligence)。正是MTurk解决了李飞飞ImageNet数据集最头疼的标注问题。

可以说,MTurk是众包数据标注模式的开创者,也是早期AI发展的关键基础设施。没有它,就没有此后的深度学习革命的爆发。

而MTurk的关停,也是因为AI的发展,有三分之一到一半的MTurk工人(Turkers)已经开始使用AI完成自己的标注任务。

人类给AI做老师,而不断进步的AI终有一天可以独立完成任务。MTurk的使命结束了。但是MTurk之后,这套轮回仍然在继续。

机器人需要千万小时量级多模态数据,无论是东南亚的Human Archive、美国的DoorDash Tasks,还是中国的90个人形机器人数据采集和训练中心,都在让人类遥操机器人或者穿戴设备,采集机器人需要的数据,以期有一天机器人能够学会做家务、纺织、组装零件。

▎MTurk往事

千禧年之交,亚马逊商品目录涌入数万条重复商品,工程师尝试用软件去重,但是发现无法做到,工程师把问题描述为 “insurmountable”(不可逾越)——机器无法识别,只能依靠人眼。

2001年,亚马逊经理Venky Harinarayan解决了这一问题,即把网站切成碎片发给分散工人,后来他提交了这项专利——"hybrid machine/human computing arrangement"(人机混合计算安排)。

2005年11月2日,MTurk上线,平台上数万个任务全部来自亚马逊自己。这也是亚马逊一贯以来的逻辑——内部能力产品化,和AWS、物流一样,先内部自用,再卖给世界。

MTurk这个名字也有些说头。"Mechanical Turk"取自18世纪的一个著名骗局——一台宣称会下国际象棋的机器,后来被揭穿,原来柜子里藏着一位真人棋手。亚马逊使用这个名字所表达的意义很明显:你以为是机器完成的任务,其实是这个平台后面有很多真人在工作,也就是贝索斯所说的"artificial artificial intelligence"(人工的人工智能)。

MTurk上的任务(称为“HITs”,即Human Intelligence Tasks)种类繁多,主要是那些计算机难以处理、但人类可以轻松完成的简单、重复性任务,比如在图片中判断图片内容是否包含特定物品、从大型目录中识别并删除重复的商品条目、判断评论是正面还是负面情绪,等等。

这些任务的报酬按件计算,从几美分到几美元不等。巅 峰时期,MTurk有超过50万注册工人、遍布190个国家。

MTurk最著名的客户是李飞飞的ImageNet团队。李飞飞在她的自传《我看见的世界》回忆了这一过程。

为了创建一个大规模、高质量、标准化的图像数据集,需要先使用人工标注数百万张图片,李飞飞团队雇佣了普林斯顿大学的本科生手动标注,但发现按照这个速度,完成全部标注工作需要整整19年。直到研究生孙民向李飞飞介绍了MTurk。

“你听说过众包吗?”他解释说,在线平台可以将任务分配和结果收集过程自动化,有效组织远程的临时工作团队,规模小到个人,大到数百万人的团队。“如果你感兴趣的话,亚马逊就在提供这种服务,叫作‘土耳其机器人’。”

这让李飞飞惊喜不已,团队开始使用MTurk发布标注任务,先后动员了来自167个国家的约4.9万工人,完成320万张图片(2009年发布),工人平均每分钟识别50张图,后扩展至 1400万张、2.2万个类别——把19年压缩到2.5年,约8倍时间压缩。

ImageNet数据集后来成为2012年AlexNet的“燃料”,并直接点燃了深度学习革命。

MTurk还成为RLHF(基于人类反馈的强化学习)的主要工业渠道——工人对比两个AI输出,选“哪个更有帮助、哪个更无害”,真人的偏好判断编码进奖励模型,塑造了ChatGPT及前后所有大模型。

MTurk的关停正是由于深度学习、大模型的进步太快。2023年,瑞士EPFL研究显示,33%-46%的Turker已开始用LLM完成自己的标注任务,人用AI假装真人判断,再用结果去训练AI以替代人,就像层层嵌套的套娃。

2026年7月30日,亚马逊停止接受MTurk新客户,8月25日,亚马逊宣布将于9月30日永 久关闭MTurk。

MTurk开创了一个时代,但最终也被这个时代所超越。

▎在制衣厂教机器人缝制

2026年被视为“具身数据规模化元年”。

一个行业共识是,具身智能达到真正可用需要千万小时量级多模态数据,当前全球有效积累不足5%。因为以前的数据都在互联网上、在数字世界里,而在真实世界中,机器人如何从桌上端起一杯水,只能从零开始学习,粗略估计需要1000条数据,2-3周时间。

所以,人类再次担当起了AI的老师。但这次不是坐在电脑前点击鼠标,而是在更大物理空间中操作。

2026年1月成立的Human Archive给零工工人(家政、云厨房、餐厅、酒店、服装厂)穿戴相应设备,一边干活一边产出数据,规划采集者网络5万人,日采8000小时,已扩张东南亚和美国。

类似的众包数据采集平台还有很多,海外有Egolab.AI、Objectways、DoorDash Tasks、Sunday Robotics,等等。国内则有觅蜂科技、穹彻智能、帕西尼、鹿明机器人、数据堂,京东,等等。

在具身数据采集领域,中国还有大量集中式数据采集中心。据统计,截至2026年4月底,全国至少90个人形机器人数据采集和训练中心,64个已投用,至少13个部署百台以上机器人。

需要采集的数据五花八门,既有家庭里的整理打扫,也有工厂里的纺织缝纫。针对后一种类型,最常见的争议是,当机器人学会这些技能,不就取代人类的工作了吗?

亿邦AI曾受邀参观京东在宿迁的数据采集中心,一位纺织工人回答了这个问题。

50多岁的程为清在制衣厂干了十多年,她负责缝制工序——把裁好的布料片对齐、送进缝纫机、控制速度、收边。她在干活的同时,头上戴着的数采设备正默默记录着她的双手轨迹、视线移动和操作节奏。

“机器人要是能学会缝制,对我们这个行业是好事。”她说这话时,脚下的机器没停,“我们这代人做服装做了一辈子,做得也挺苦的,年轻人谁还愿意干这个?”程为清的女儿不愿意继承母亲的手艺、进服装厂工作,已经在保险公司上班。

▎师傅和徒弟

就在9月1日,马斯克在G20创新部长级会议上发表视频讲话,给出了非常激进的预测:到2027年末,人工智能有望全面接管所有数字工作。这里的数字工作指发生在电脑里的工作,比如写代码、查资料、做分析、处理表格、生成设计稿、调用企业软件等。

至于物理世界中工作,马斯克预计10年后人形机器人可能超过10亿台,单台机器人的生产率约为人类的5倍。他还说,机器人最终会参与制造机器人,形成递归增长。

与此同时,马斯克还乐观地评估,人工智能的普及将推动全球经济规模扩张20%-30%,相当于每年创造20万至30万亿美元的新增产值。

老话说,教会徒弟,饿死师傅。如果终有那么一天,机器人学会了人类的大多数技能,能够完成大多数工作,没工作可做的人类,处境会更糟吗?

我有一些非严肃的假想,给这个问题提供一些乐观的回答。

机器人可以传承一些古老的技艺。比如民族非遗传统技艺,靠师傅带徒弟的形式流传,如果愿意学习的年轻人越来越少,面临失传风险,不如让机器人来学,机器人不怕枯燥、不怕吃苦,也不会因为这个手艺不太挣钱怨天尤人。

机器人可以替你干活、给你挣钱。比如在制衣厂中,厂长解雇了所有工人,购买了一批机器人干活,听起来确实有点糟糕。反过来想,机器人的所有者不是厂长,而是工人呢?工人把自己的能力教授给机器人,派机器人去工厂上班赚薪水,自己在家躺平,如果这家工厂效益不好,还可以换一家打工。

这样也不错对吧?教会徒弟,乐死师傅。

【本文由投资界合作伙伴微信公众号:亿邦动力网授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】