打开APP

大模型「偷师」是迫不得已

国内厂商正在加大基础研究投入,在高效训练、小样本学习、多模态融合等领域出现不少研究成果。

2月23日,美国AI公司Anthropic发布公告,指控中国三家大模型厂商DeepSeek、Kimi和MiniMax发起了工业级“蒸馏”攻击,通过使用虚假账户与代理服务方式,大规模调用其Claude模型接口获取输出结果,用于优化自身模型能力。

在AI模型技术领域,“蒸馏”是一种被广泛使用的训练方式,通常指用强模型的输出去训练弱模型。利用商业模型生成合成数据来提升自家模型性能,已被全球AI开源社区HuggingFace亚太生态负责人王铁震视作“公开的秘密”。不过,包括Anthropic在内的一些海外AI公司在服务条款(ToS)中,明确禁止厂商使用其输出结果来开发竞争模型。

硅基流动联合创始人杨攀反问:模型就在那里,不让人用吗?

为进一步解释“蒸馏”及Anthropic的指控,杨攀举了一个例子,学霸辛苦学习后考了95分,将自己整理的学科笔记放在班里公开展示,学渣将笔记抄了回去,成绩也从60分提高到了80分,学霸见状骂学渣窃取了自己的劳动果实。

在开发者社区里,支持Anthropic的开发者认为,这种大规模注册假账号、针对性“薅羊毛”的行为违反商业契约,破坏了AI行业的公平竞争原则。也有网友讽刺Anthropic,“你训练模型时用的互联网数据,难道都给原作者付过费吗?”

杨攀没有对Anthropic指控一事下定义。他认为,模型厂商间的“蒸馏”行为更像是“偷师”。

王铁震在采访中也提及Claude爬取了互联网上相当多的信息,他将此描述为Claude“偷师”人类。埃隆·马斯克直接发帖嘲讽,“他们怎么敢偷An-thropic从人类程序员那里偷来的东西?”不仅如此,马斯克还曾公开指出Claude“蒸馏”了其他模型的能力。

经济观察报向被点名的三家国产大模型公司管理层人士求证,截至发稿,未获回应。

技术逻辑

在模型公司负责海外业务与技术开源的工程师李轩看来,Anthropic公告中的“蒸馏”攻击(distillationattack)一词包含贬义。他也不认可杨攀将国产模型厂商类比为“学渣”的说法。

在李轩看来,被点名的三家中国大模型企业学习态度并不差,只是与An-thropic这样的厂商相比,更像是穷孩子与富孩子,“后者有钱买各类书籍去学习,而前者买不起”。

李轩试图纠正一种认知,“偷师”海外模型并不代表国产模型的技术能力差,“把别人的答案当成标准,其实是一些模型厂商迫不得已的事”。

从技术定义来看,“蒸馏”的边界并非*。李轩更愿意用“数据合成”“冷启动”等中性词汇替代“蒸馏”。他指出,DeepSeek在其V3大模型的技术报告中称,公司使用了“冷启动数据”,未明确数据来源。“本质上通过调用其他模型获取训练素材的做法,在行业内非常普遍,大家只是心照不宣。”李轩称,这是通过调用其他模型的输出结果来补充训练数据,提升模型在特定领域的表现,弥补自身的能力短板。

李轩认为,这考验模型厂商能否知己知彼,既明确自家模型要走的技术方向,也了解模型“蒸馏”的效果,避免“蒸馏”效果还比不上购买数据集投入模型训练的效果。

“蒸馏”更有性价比?

Anthropic“指控”三家大模型厂商模拟复杂的编程场景和API(应用程序编程接口)调用环境,让Claude展示其拆解任务,调用搜索、读写文件等外部工具的过程,甚至使用2.4万个虚假账号,通过分散的商业代理服务器在全球范围内伪装IP,模拟成普通用户,以避免触发API的频率限制和风控。

王铁震呼吁行业辩证地去看待“偷师”。他认为,在资源不足的情况下,“蒸馏”成为这些模型厂商不得不取舍的选择,只能加大投入去采集数据。

以数学竞赛题为例,海外厂商可投入上亿美元邀请*科学家标注数据;而国产厂商受资金限制,难以承担如此高昂的成本。“一套IMO(国际数学奥林匹克竞赛)级别的数学题,标注成本可能高达数千万元,单条题目标注费用甚至超过1万元。”李轩算了一笔账,MiniMax被指控向Claude模型发送的请求量超过1300万次,对应的API调用成本可能高达数亿元。

MiniMax在招股书中披露,其从2023年至2025年前9个月,不到3年时间,账面亏损超12亿美元。摩根士丹利据此估算,MiniMax月均现金消耗约2790万美元。

国产大模型的发展速度与算力、数据、算法息息相关。在李轩看来,决定模型表现的核心因素并非技术,而是数据。海外厂商凭借雄厚资金,可以对细分领域数据进行*标注。例如,为提升数学竞赛能力,海外厂商会针对一道错题衍生出100道相似题目进行标注,确保模型实现无死角覆盖。

相比之下,国内数据标注产业仍处在发展阶段。“国内高端数据标注人才稀缺,如IMO级别的数学题,国内能准确解答的专家数量有限。”李轩称,数据标注成本高昂,国内厂商根本无力复制海外的*标注模式。

除了数据,算力也是国产大模型面临的隐性瓶颈。目前,国内大模型训练主要依赖英伟达GPU,但受美国出口管制影响,高端芯片获取难度极大。“国产大模型面临‘有钱也买不到卡’的困境,训练阶段算力不足会限制模型规模,推理阶段算力不足会影响用户体验。”李轩说。

2025年7月,KimiK2宣布完全开源且允许商用,AI研究科学家Se-bastianRaschka称,KimiK2的架构与DeepSeekV3基本一致。

Kimi团队随后在社交平台上回复称,团队曾尝试多种不同于DeepSeekV3的MoE/Dense结构变种,但始终没有任何设计在loss(损失值)指标上显著超过 DeepSeekV3。Kimi团队最终决定,完全继承DeepSeekV3的底层架构。

“并非国内厂商缺乏创新能力,而是创新成本过高。”李轩称,自研新架构需要投入大量资源进行实验验证,且失败风险极高。相比之下,借鉴成熟架构的性价比更高,一些模型厂商为进一步节约成本会选择采集冷启动数据。

发力垂直场景

在长期推动模型业务“出海”过程中,李轩逐渐意识到,海外模型在中文理解和文化适配方面存在不足,“这正是国产模型的机会”。

尤其当“蒸馏”成为行业普遍操作,“偷师”逐渐出现天花板。

一位国产大模型管理人士告诉经济观察报,现今模型间已经“蒸”不出高价值的数据了,如果全球从业者都选择蒸馏,没有人探索原生逻辑,AI的进化或将陷入“近亲繁殖”的循环。

面对数据枷锁,国产大模型厂商并非无计可施。上述国产大模型管理人士认为,与海外厂商追求全能型模型不同,国内厂商可聚焦垂直场景,打造细分领域的优势,如中文处理、政务服务、医疗健康等。

李轩还观察到,国内厂商正在加大基础研究投入,在高效训练、小样本学习、多模态融合等领域出现不少研究成果,甚至可以基于*的国产模型架构进行二次创新,推出更高效的新模型,加入到全球模型能力的竞争中。

(应受访者要求,李轩为化名)

【本文由投资界合作伙伴微信公众号:经济观察报授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

红熊AI上海算模算样科技有限公司
融资时间2026-07-20 当前轮次A+轮 融资金额数千万人民币
AI
涉及机构: 九纬基金彰宜资产格睿丰
记忆张量记忆张量(上海)科技有限公司
融资时间2026-07-20 当前轮次Pre-A轮 融资金额亿级人民币
AI
涉及机构: 哈勃投资荣耀商汤国香资本深创投和玉资本
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】