“一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决后面的的那10分。”谈及蒸馏在当前LLM(大语言模型)训练的作用,一位基模研究员这样说道。
他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,尽快得到一个可以继续训练的基础版本。
对模型公司而言,“不蒸馏”则意味着要放弃这段加速过程,从基础能力开始自行探索。这样做的好处是,可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。
《智能涌现》此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。一名字节人士解释,团队希望进入全球第 一梯队,而这“通过蒸馏难以达到”。张一鸣在7月底一次Seed内部会议上也明确表示,即使暂时落后于国内同行,字节也不会把蒸馏当作提升模型能力的捷径。
这一番关于“不蒸馏”的表态,不只是一个训练方法上的技术判断,而是对长期路线的选择。
另一方面,在张一鸣表态“不蒸馏”的前一周,英伟达CEO黄仁勋在接受Axios联合创始人迈克·艾伦采访时曾表达过完全相反的观点:“蒸馏,也就是向AI学习、向其他知识来源学习,是智能的基础。”
在这场采访结束几天后,黄仁勋转发了一封由英伟达、Meta、微软和戴尔等公司支持的开放模型联名信。信中主张建立能够进入各行各业的开放模型生态,并将蒸馏列为模型改进、测试和验证中广泛使用的方法。
到底该不该蒸馏?不蒸馏的代价和回报分别是什么?《智能涌现》跟多位大模型研究员交流了相关问题。
01、不蒸馏,要付出多少时间
“数据不够、算力不够,也缺少相关的管线。”有研究员这样概括国内基模团队与海外头部厂商的对比情况。在他看来,国内预训练与北美前沿仍有差距,但已不像早期那样悬殊,而更大的差距发生在后训练和高质量数据层面。
蒸馏技术,正是能够帮助基座厂商快速补齐上述“短板”的有效手段,进而压缩模型的迭代时间周期。
选择不蒸馏的字节,不需要面对这些问题吗?实际上并不是。7月底,字节的最新一代基模Seed-2.1 Pro在Code Arena WebDev总榜列第16,落后于第2的Kimi K3和第6的GLM-5.2。
而在交流中,多位研究员都认为,“完全不蒸馏肯定会慢很多,短期内不借助蒸馏把Coding和Agentic能力做到行业前列,似乎并不现实。”
模型能力提升的时间压力来自数据飞轮。模型先达到可用水平,才会进入真实开发环境。能力带来使用,使用产生回流数据,回流数据又进入下一轮训练。
此前,一名字节人士曾告诉《智能涌现》,其Coding模型此前难以突破的原因之一,正是业务使用意愿不足、缺少足够的数据回流。
“如果冷启动第 一步都做不了,后面的管线就转不起来。”一位受访研究员说。他用“马太效应”形容这一过程:用户更倾向于选择能力最强的模型,更多使用又会带来更多真实任务和回流数据,进一步拉开模型之间的迭代差距。
Agent任务进一步放大了这种时间差。当前Agent场景中,多轮工具调用需要模型连续规划、执行和纠错,前序步骤一旦偏离,错误可能沿着任务链不断累积。模型从头探索一条成功轨迹,通常比直接学习已经跑通的过程更慢。
但“不蒸馏”带来的压力,在所有能力线上并不相同。与Seed在LLM领域未能进入国内Top阵营不同,字节在视频生成领域已经进入全球前列。
多位行业人士都将Seedance的成功概括为“一场数据的胜利”。一位接近字节的人士向《智能涌现》表示,Seedance的视频训练链路不使用外部模型蒸馏,连用于数据筛选、理解等环节的VLM,也不以其他模型的输出作为蒸馏来源。
视频生成与语言模型不同:AI生成视频仍较容易呈现可辨认的“AI感”,外部模型产出的内容很难直接替代高质量真实视频数据,蒸馏带来的增益也相对有限。
在视频生成赛道,字节凭借数据、架构和产品积累,已经在不借助外部模型蒸馏的情况下进入前沿;在Coding和Agent赛道,它仍需尽快补齐能力差距,获得更多真实使用和回流数据。同一条“不蒸馏”原则,在不同能力线上要付出的时间成本并不相同。
在LLM领域,当其他大模型公司借助蒸馏完成冷启动、提前进入真实场景时,坚持不蒸馏的字节要用更长的训练周期,验证这套自建数据体系能否转化为领 先能力。
这也能解释为什么字节要在近期成立一级部门“AI数据与安全”,为旗下大模型提供寻源采购、合成清洗和质量评测等服务——在模型和产品之外,字节必须把数据能力作为独立的组织支柱,以支撑自己的训练体系。
02、蒸馏的回报和代价
现代知识蒸馏的经典范式,可以追溯到图灵奖得主、深度学习先驱辛顿等人在2015年发表的《神经网络中的知识蒸馏》。论文提出,让较小的“学生模型”学习大型“教师模型”的输出分布,从而以更低成本承接其能力。
例如,2019年发布的DistilBERT将BERT缩小40%,保留97%的语言理解能力,并把推理速度提高60%。当时,蒸馏主要解决模型太大、部署太贵的问题。
生成式AI兴起后,更强模型生成的答案、解释和任务轨迹,也开始被直接用于训练其他模型。2023年3月,斯坦福团队用OpenAI模型生成5.2万条指令数据,以不到500美元的数据成本训练Alpaca;同年,微软让130亿参数的Orca学习GPT-4给出的解释轨迹,在Big-Bench Hard复杂零样本推理上达到与ChatGPT相当的水平。
严格来说,利用“教师”模型生成数据再做监督微调,并不等同于传统知识蒸馏。但在大模型行业的语境中,这类“用强模型输出训练另一个模型”的路线也被纳入广义蒸馏。2024年发布Llama 3.1 405B时,Meta CEO扎克伯格就已将蒸馏小模型列为开放旗舰模型的重要用途;Meta同期还把合成数据生成写进了该模型的主要工作流。
到2026年,蒸馏已经成熟应用在模型能力合并上。DeepSeek V4技术报告披露,团队先以监督微调和强化学习分别训练十多个数学、Coding和Agent等领域专家,再让通用模型在自己采样的轨迹上,学习各个专家的输出分布,以多教师在线策略蒸馏合并能力。
Kimi K3也把蒸馏放进后训练主流程。其技术报告显示,团队围绕通用推理、Coding和Agent任务,以及low、high、max三档思考强度,形成9个教师模型,再通过多教师在线策略蒸馏整合到同一个模型中。
“归根结底,蒸馏是一种构造数据的方法。”一位研究员这样概括它的回报:与从零搭建合成数据管线、反复试错,或者为复杂任务组织专家标注相比,让更强模型生成答案和操作轨迹,通常能更快把模型送到可用的起点。
这种回报在Agent训练中尤其直接。上周,韩国科学技术院研究团队提交的一项研究显示,从GPT-5-mini的成功轨迹中提取任务流程、子任务示例和工具调用经验,在三项工具使用基准中均提升了4B至8B模型的任务准确率。
蒸馏也可以把更昂贵的强化学习留给难题。“稍微简单一点的问题,直接蒸馏就好了,没必要再让模型用强化学习探索,会浪费很多资源。”一位研究员说。
苹果研究团队2025年发表的“蒸馏缩放定律”则给这笔成本算了一笔账:当教师模型已经存在,或需要反复训练多个学生模型时,蒸馏通常更省算力;如果只训练一个学生,还要为此从头训练教师,直接训练往往更划算。
蒸馏节省了寻找答案的时间,却不能替模型公司决定应该解决什么问题。
“蒸馏说白了并不复杂,一道题让更强的模型跑一遍,再把轨迹拿出来改成训练格式。”一位研究员说,相比之下,“难度反而落在造题上”:题目可以来自网络抓取、专家提供,也可以由团队自行构造。
蒸馏的回报是时间和算力,但这种效率也有代价。不少研究员向《智能涌现》表示,蒸馏通常用于把模型尽快推过可用门槛;等多家模型来到相近起点,继续提升未必还要依赖蒸馏。“到了边际收益递减的时候,大家就会慢慢把这个东西换掉。”
“但真正有能力把蒸馏、强化学习和正向研发同时推进的团队不是特别多。”上述研究员坦言。
此外,蒸馏也会改变一家公司的资源分配。有研究员提到,蒸馏能让模型短期拿到一个“还可以的成绩”,但见效太快,也可能让团队“比较贪恋这种方式”。如果要进入最顶 级的竞争,“光蒸馏是不够的,还是要回到算法和正向研发上去做突破”。
几周前,在Kimi K3发布后,劳德研究所研究者、Snorkel AI联合创始人布雷登·汉考克表示,仅靠蒸馏,不可能在如此短的时间里训练出这种强度的模型。
艾伦人工智能研究所研究员内森·兰伯特也指出,如果蒸馏足以复制前沿能力,其他团队本应很容易追上GLM或Kimi,但现实并非如此。
有研究员选择把答案留给接下来的模型迭代。在他看来,不蒸馏路线最 大的阻碍,在于能否承受一段时间内没有“拿得出手的产出”。
围绕蒸馏,这场长期主义和时间成本的博弈还在继续,在资源和团队技术路线的比拼之外,也考验着行业等待结果的耐心。









