2019年前后,一位在大型云端服务业者任职的朋友兴奋地分享:他们训练一个CNN模型处理单据文字識別,效果不错,但直接上线的运算成本太高,于是用「蒸馏」(distillation)训练出一个较小的模型来提供服务,发现还挺有效的。
蒸馏一直是深度学习常用的策略之一,也称为师生架构(teacher-student)。用一个能力好的大模型当「老师」,训练另一个「学生」模型(不一定较小)。手上有没有原始标注數據,各有对应的做法。早期做法在2015年前后成形,最直接的是让学生去逼近老师的输出,不需要标注。后来加上「软目标」,或与原始标注數據一起用;也可以让学生模仿網絡中间层,不只看最后的输出。
这套做法到今天仍在用,但搬的不只是模型大小,而是能力。我们近期的研究让老师看密集的3D点云、学生处理刻意稀疏化的点云,把两边的中间特征(理解能力)对起来,稀疏点云限制下的3D識別能力(机器人、自驾车)就被提升上来。
到了大型语言模型,蒸馏的角色又不一样了。2025年初,一个开放权重的大型推论模型把自己的推论过程蒸馏进一系列小模型,有些的表现接近当时的闭源前沿模型。从那之后,能不能用前沿大模型训练出成本可接受的小模型,就成为大家瞩目的焦点。
语言模型的训练,可以粗分成两大阶段。预训练(pre-training)吃的是海量文字,学的是语言结构与世界知识,可以说是让模型牙牙学语的阶段。后训练(post-training)教的是另一件事,模型怎么遵循指令、把话说得专业,把复杂问题抽丝剥茧处理好(推论)。需要的训练數據就是「一个专业的回答长什么样」,而前沿模型正好能生成这样的數據。所以蒸馏用在后训练特别直觉。
蒸馏怎么做,开放权重的模型多半会披露在技术报告中。差别主要在老师给学生什么信號。最简单的一种是把老师生成的文字当教材。设定一批问题让老师(前沿模型)回答,收下来的问答就是训练數據,只要拿得到API,蒸馏就能启动。细一点的是让学生逼近老师在每个字上的机率分布,这需要模型权重。Google的Gemma连预训练都用蒸馏,后训练再从大型的指令模型蒸馏一次。近期较受关注的on-policy蒸馏又更进一步,让学生先用自己的方式作答、老师逐字批改。在数学竞赛题上,用约10分之1的运算量就能达到强化学习的水准。
老师也不必只有一个或一定更大。已经有模型用上超过10个各自专精的领域老师,把不同专长蒸馏转移进同一个学生。把公司數據训进模型之后,原本的对话与指令能力常会退化,这时拿还没微调过的原始版本当老师,有机会把退化的部分教回来。
但蒸馏并非总是有效:2026年的一项研究指出,老师与学生用同一批數據、量又足够大时,增益相当有限,數據稀少的领域任务才是它发挥空间较大的地方。
前面谈的是狭义的蒸馏,老师与学生都是模型。把范围拉大,前沿模型也可以当成知识与數據的来源,协助标注甚至担任代理人(Agent)。过去要建數據集,得找标注人力、写规范、做品管,周期以月计。现在例行、量大的标注工作,部分前沿模型的输出品质已经堪用,单位成本也低得多,需要专家判断的领域当然还有难处。
一种做法是让大模型直接提供监督信號。如低光源影像增强传统上需要成对的明暗影像当参考,训练影像不易取得。我们近期的做法是改用视觉语言模型(VLM)对影像内容的理解当引导,就能在没有参考影像的条件下训练,下游的分类与物件侦测都因此受惠。
另一种是用大模型产生數據标注。我们建过一个电影理解的问答數據集,问的是角色动机与情节因果这类需要思考推论的问题,人工出题慢,也难维持一致品质。做法是让多个语言模型扮演不同的思考代理人,各自提问、互相检视与修正,再产出问答數據集。前沿模型直接担任數據标注的Agent。
还有一种是把常识搬进训练系统。长时序的机器人操作任务难在中间没有回馈信號,我们的做法是先用语言模型把任务拆成不同阶段与所需动作,列出各阶段应有的物体状态,再让视觉模型依这套结构判断任务进度、建立奖励信號。这些过去要靠工程师逐条写进系统的常识,现在能从前沿模型(自动)取得。
令人更期待的是,蒸馏有机会做出能力好的较小模型,把运算从云端往外移。对企业来说,较小的模型在部分推论任务上已逼近前沿,有机会在数张GPU的地端服務器部署。自建小模型也因此从构想变成可评估的选项:法务、财务、产业know-how这类信息密集又不宜外传的领域尤其明显。训练前沿模型的花费以数亿美元计,但能力一旦以API或开放权重现身,让小模型接近它的成本低了一到两个数量级。
另一个方向是终端装置:手机、机械手臂、检测设备都可受惠于蒸馏。机器人的需求特别直接,它要在实体空间里實時执移動作,许多控制环节没有等待云端往返的余裕。高速产线的检测设备也一样,模型再准,跟不上产线节拍就用不上。
使用大模型生成或标注數據再训练自己的模型,已经是研发的常态,前提是条款允许。前沿模型供应商的服务条款多半禁止拿模型输出去训练与他们竞争的模型,各家的界线并不一致。另一条路是改用可自行部署的开放权重模型,生成与训练都在自己手上,也避开數據外流。早年蒸馏搬的是識別模型的效率,现在搬的是语言、推论与常识。老师模型愈强,能搬的就愈多。