“万亿参数模型,竟惨遭 1% 规模的小模型倒挂? ”
最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。
它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。
有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。
还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。
与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。
数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。
“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。
01 数据上的“粗放式弯路”
预训练返工,本质上是在补数据的课。
“多就行了”的误区
一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”
于是开始一味地粗放式堆数据,只求规模不讲质量。
再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。
很多数据的标注和筛选也没有处理好,导致训练出来的第 一版模型效果较差。
然后大家才发现,不注重数据质量,会让模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。
脏数据的代价
“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。
他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。
模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。
事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。
不当的数据 KPI
基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。
而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。
其实,对数据团队的考核不当,是不少模型厂商都踩过的一个坑。
比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉团队从头清洗数据。
“数据团队的考核只看数据量的话,会很荒谬。”前述数据专家赵翔补充道。
因为大模型拼的是数据的信息密度和干净程度,而非绝 对体积。考核只盯数量,等于在鼓励团队拿垃圾凑数。几百 T 的脏数据灌进去,训出来的模型反而会变笨,甚至训练崩溃。
02 数据背后的“苦活”与“花活”
地基要重打,可好数据并不是说有就有的。
互联网时代攒的家底,不顶用了
本地生活、社交、游戏、电商与搜索,这些在互联网时代被各家大厂视作“壁垒”的场景数据,到了 AI 时代,不奏效了。
因为基模比的是通用能力,某一场景数据的优势,落到通用能力上,影响变得有限。各家虽然都在拿自己的场景数据训一些垂直小模型,但最终应用面没那么广。
“按理说 Google 各类场景数据最多,应该做得最 好,但显然并不是。Anthropic、OpenAI 这类此前在数据上零积累的厂商反而冲得更猛,国内亦然。”一位基模公司的算法负责人徐栋告诉雷峰网。
大家站到了同一起跑线。
这时候,能拉开差距的是:卡够不够,数据拿得快不快,质量够不够高,以及有没有一条能把数据稳定转化成模型能力的管线。
没有秘方,只有苦活
那么,数据优化到底有没有捷径?
前述数据专家赵翔向雷峰网坦言,技巧秘方其实不多。数据工作更偏苦活累活,重要的是持续做下去,投入足够的人力和定力,把原来 60 分的数据,逐步优化到 90 分,争取每次优化之后都能拿到一点正反馈。
这时候要算两本账:一是优化成本,二是训练周期。
“网上那么多数据,不可能每条都校验一遍。训练又有周期,不能等数据全部优化完再开训。所以要先挑重要的做,分期做,小步快跑,不断迭代。”赵翔补充道。
不过,需要说明的是,数据的难题并不只出在预训练。后训练要的专家数据、Agent 长程轨迹数据,获取难度和成本也都不低。
卡住数据优化的:钱与产能
多位 AI 数据从业者告诉雷峰网,眼下卡住各家数据工作的,主要有两个因素:钱和产能。
一个反直觉的地方在于:大厂看起来都不差钱,但预算拆开,分摊到数据上的其实并不多。
“数据在模型厂商的训练预算里占比并不大。业内流传的一个粗略拆解是:每投 100 块钱在 AI 训练上,其中 40 块花在算力上,30 块花在人才上,20 块花在打广告上,剩下 10 块钱花在数据上。”某 AI 数据供应商业务负责人周骏表示。
以专家数据为例,周骏告诉雷峰网,专家的长程任务数据需求量极大,几家大厂的预算口径基本都是几个亿,但真到付款时,就比较抠搜。
“同样的专家数据,美国 HLE 调研一条起价一两万美金,国内基本只给开一两千人民币。”
然而,比预算更卡人的,是产能。
高质量数据从来都是稀缺的。正规渠道供不够,各家就开始自找门路。
周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意,做 Token 转发。一方面有收益,但更重要的是,可以借此收集大量用户行为数据。
用户调用各种先进模型时,请求和结果都要从这家厂商的转发层走一遍,于是真实的任务数据就被留在了平台上,这比公开爬来的语料更接近训练想要的有效样本。
眼下还有一批做 Routing(模型路由)的创业公司,也在盯着“数据”这块资产;而各家大厂也有类似的路由平台,但由于优先接自家模型,很难沉淀到其他先进模型的轨迹数据,而且由于模型接入不够全面,平台本身用户量也有限。
“这几年,各家在获取AI数据上可谓八仙过海,但这些门路能让一家公司领 先多久,并不好说。”周骏补充道。
03 飞轮还没转起来
业内有一种声音认为,大模型本身没有护城河,真正的护城河更多在于“数据飞轮”:模型越强,越多用户愿意拿它处理高难度任务,回流的高质量数据就越多,这些数据再喂回去,模型又强出一截。
这套逻辑听上去闭环。但到今天为止,真正把“数据飞轮”转起来的没几家。
除了前面提到的“预算受限”、“外部高质量数据获取难”外,还有一层原因在公司内部。
大厂自己的AI产品每天都在产生用户行为,可这些数据能不能规模化地回到训练环节,取决于中间那条通路有没有修好。
眼下这条通路有三处堵点。
一处是组织调整还在持续进行中,各部门之间数据墙的破除还在艰难推进中;另一处是数据类人才的匮乏。
多位 AI 猎头告诉雷峰网,目前市场上比较缺数据清洗、数据管道搭建、数据工程、数据研究等岗位。这些岗位过去被划在辅助工种里,行情真正起来,也是最近的事。
此外,更重要的是,国内模型厂商还面临内生数据匮乏的问题。
眼下,长程轨迹数据主要出自 AI Coding 和 AI 办公这两个场景:但前者市场份额的一大块被海外模型 Claude、Codex 占去;后者的产品能力目前处于初级阶段,所能覆盖的工作场景与复杂度有限,沉淀下来的轨迹数据还较为单薄。
04 没有捷径的长期战争
回到开头那句话:“AI 下半场的胜负手是数据”。
这话大体没错,但大家可能低估了这场仗的周期和复杂度。
预训练返工只是第 一波阵痛。数据治理、数据获取、数据飞轮,每一块都是硬骨头。算力可以买,人才可以挖,但高质量数据的积累没有捷径,它需要时间、定力和组织层面的系统性投入。
多位业内人士向雷峰网坦言,未来一两年内,行业很可能还会看到更多“推倒重来”的案例。这不是某一家的问题,而是整个行业都在补课。
真正的分野,大概要等到这轮数据基建基本完成后,才能看得更清楚。谁能先把那条从用户行为到模型训练的数据通路修通,谁就有机会在下一阶段跑出来。
但至少从目前看,这条路的终点还远得很。
雷峰网后续将持续推出 AI 数据相关的深度观察。对这一话题感兴趣、或想聊聊业内实况的朋友,欢迎添加下方作者交流、探讨。
* 文中受访者赵翔、王斌、徐栋、周骏均为化名。
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。














