ByteByteGo Newsletter

How Big Models Teach Small Models to Be Smart

8.5内容质量
How Big Models Teach Small Models to Be Smart

TL;DR · AI 摘要

知识蒸馏通过大模型训练小模型,实现高效部署,降低计算成本。

核心要点

  • 知识蒸馏使小模型在特定任务上表现可媲美大模型,降低部署成本。
  • 与压缩方法不同,知识蒸馏生成独立模型,提升推理效率。
  • 实践中,知识蒸馏在移动端和高并发场景有显著优势。

结构提纲

按章节快速跳转。

  1. 介绍知识蒸馏在AI工程中的重要性及应用场景。

  2. 解释知识蒸馏与模型压缩的本质区别及技术原理。

  3. 展示知识蒸馏在移动端和高并发场景的性能提升数据。

  4. 分析知识蒸馏在复杂任务中的表现瓶颈及优化方向。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 知识蒸馏
    • 机制对比
      • 与压缩方法的区别
      • 教师-学生模型架构
    • 应用场景
      • 移动端部署
      • 高并发服务
    • 技术挑战
      • 复杂任务适配性
      • 知识保留度优化

金句 / Highlights

值得收藏与分享的关键句。

#知识蒸馏#模型压缩#AI工程#机器学习
打开原文

大模型如何教导小模型变聪明

ByteByteGo

2026年8月5日

[网络研讨会] 你能证明AI正在起作用吗?(赞助)

AI已经融入你的工程工作流程。虽然token消耗量显示了这一点,但吞吐量却未能体现。人类仍然深度参与其中,而这实际上是一个上下文问题。

8月19日(免费)加入直播学习:

  • 衡量AI在生产前收益泄露的4个指标
  • 上下文成熟度的8个阶段、限制你指标的具体瓶颈,以及定位团队所处阶段的免费工具
  • 为什么更多MCP和更大的上下文窗口并不足够,以及如何从你的代理中获取真正的价值

立即注册

最强大的AI模型同时也是运行成本最高的模型。它们需要专用硬件,消耗大量内存,并且会为每个请求增加成本和延迟。

这些特性使得它们难以部署在资源有限的场景中,例如移动设备或需要快速且低成本响应的高流量服务。

还有一个乍看之下似乎矛盾的事实:在某些特定任务上,小模型有时能与甚至超越远比它大的模型,即使小模型所学内容全部来自大模型。从直觉上看,一个模型通过学习另一个模型的输出似乎会继承其上限而非突破它,但实际结果却有所不同。使这种现象成为可能的方法称为知识蒸馏,如今已成为构建生产级AI系统标准流程的一部分。

在本文中,我们将从基础开始逐步讲解这一概念。我们将重点覆盖以下内容:

  • 什么是蒸馏,以及它与压缩有何不同
  • 为什么从模型输出学习可能优于从原始标签学习
  • 三种主要方法及其主导地位
  • 蒸馏模型在实际中的表现
  • 该方法的局限性及其未来发展方向

知识蒸馏

蒸馏训练一个新小模型来复制大模型的行为。该过程涉及两个模型:

  • 第一个是功能强大的大模型,称为教师模型
  • 第二个是较小的模型,称为学生模型,它被训练来复现教师模型的输出

训练完成后,学生模型独立运行,而教师模型则退出流程。

一个常见的假设是学生模型是教师模型的压缩版本。但实际情况却有所不同。

量化和剪枝等压缩方法从一个模型开始,通过降低数值精度或移除对结果贡献较小的部分来减少模型体积。模型本身保持不变,只是变得更小更轻。

而蒸馏则产生一个真正独立的模型,拥有自己的参数和通常不同的设计,其训练目标是模仿教师模型的行为。

一种方法是缩小现有模型,另一种方法是训练全新模型。这种差异具有实际价值,因为小模型可以在单个服务中运行或在手机上运行,响应时间更短,每请求成本更低,在某些情况下甚至可以直接在设备上运行而无需将数据发送到其他地方。

这种方法现已成为标准实践。例如,Google 的 Gemma 模型在训练过程中使用了蒸馏技术,借鉴了 Gemini 系列中的更大模型。这两个概念也可以按顺序协同工作:通常先对模型进行蒸馏以生成一个更小但功能强大的模型,然后再通过量化进一步压缩该模型以适配特定设备。

明确区分这两个概念非常重要,因为它会影响我们对后续概念的理解。压缩模型内部包含了原始模型的副本,而蒸馏模型则是通过训练来模仿原始模型行为的独立模型,这正是它有时会表现出原始模型不具备行为的原因。

如果学生只是复制教师模型,为什么复制能如此有效?

答案在于教师模型传递的内容。

软标签

从模型输出中学习比从原始数据中学习更有效,因为输出包含比简单答案更多的信息。

标准训练数据每个示例只提供一个答案。例如,一张猫的图片会带有“猫”的标签,模型会因输出“猫”而获得奖励,因输出其他内容而受到惩罚。而教师模型提供的内容更丰富:其输出不是单一答案,而是一组跨选项的概率分布,例如猫的概率为 0.70,狗为 0.25,狐狸为 0.05。这组完整的概率分布被称为软标签,与普通数据中仅包含单一硬标签(如“猫”)形成对比。

这些额外的数值携带了更多信息。它们表明教师模型的输出将狗视为一个合理的替代选项,而将狐狸视为较远的选项,这揭示了类别之间的关系。研究人员有时将这种现象称为“暗知识”,即模型置信度中隐藏的结构,而普通标签无法体现。

在训练过程中,学生模型会努力匹配这种分布。其概率分布与教师模型的差距会被量化,训练过程会推动学生缩小这个差距。换句话说,学生模型学习的是教师模型完整的置信度模式,而非单一正确答案,而这种模式作为训练信号比单字标签更强大。

这是知识蒸馏效果如此显著的核心原因。单一正确标签会丢弃选项之间的关系,而软标签则保留了这些关系。

早期的一项研究展示了这种技术的实际价值:当学生模型基于软目标进行训练时,只需更少的示例即可达到良好的性能,因为每个示例现在携带的不仅是单一答案。2015 年的原始研究为此目的引入了“温度”控制参数,温度越高,概率分布越分散,从而暴露出更多细微结构供学生模型学习。

机制明确后,下一个问题是:在实践中如何实现这一点?这个问题的答案不止一种。

方法

知识蒸馏主要有三种形式,它们的区别在于学生模型复制的内容:

  • 输出蒸馏:学生模型匹配教师模型的最终输出,包括上述的软标签。这是 2015 年的原始形式,也是最直接的方式。
  • 特征蒸馏:学生模型匹配教师模型的内部表示,即模型在处理输入并得出最终答案前计算的中间值。目标是获得相似的内部结构,而不仅仅是相似的输出。Google 的 EmbeddingGemma 就是通过这种方式训练的,它学习生成与更大 Gemini 模型相近的内部表示。
  • 合成数据蒸馏:教师生成一个示例数据集,学生以与处理普通数据相同的方式在该数据集上进行微调。斯坦福大学的Alpaca是早期案例,通过现有大模型生成的示例进行微调,从而提升其遵循指令的能力。

第三种方法在实践中已成为最普遍的方案,其中部分原因与访问权限有关。

许多强大模型只能通过返回文本的接口访问,其内部值和概率保持私有。当这些内部信息无法获取时,生成数据仍然是可行的途径。

这三种方法在需求上也存在差异。输出蒸馏需要教师的概率值,特征蒸馏需要访问其内部值,而合成数据蒸馏仅需要教师生成的文本,这也是为什么它在封闭模型中传播最广的原因。

这些方法也可以组合使用。一次训练过程可能同时使用生成的数据集和软标签,而更新的方法则在训练过程中混合教师和学生的生成内容。

这些方法不仅是理论上的概念。下一章节将展示它们的实际效果。

结果

实际效果非常显著,但有一个重要前提。

2025年初,一家名为DeepSeek的实验室提供了一个明确案例。他们使用一个大型推理模型生成训练示例集,然后在这些示例上对多个现有小型模型进行微调。其中一个结果尤为突出。

一个70亿参数的学生模型在数学竞赛基准测试中表现优于320亿参数的模型,尽管它仅通过在大型模型输出上进行普通微调生成。发布的蒸馏模型系列参数规模从15亿到700亿不等,较小的模型体积足够小,可以在单张显卡上运行,这也是该发布引发广泛关注的原因之一。实际效果是,这些狭窄任务的高性能表现可以由小型团队本地低成本运行,而不再依赖大型托管模型。

这个前提条件与主要结论同样重要。

这些成功案例通常出现在数学和代码等狭窄且定义明确的任务上。在这些任务中,小型蒸馏模型的表现可以达到其体积所暗示的水平之上。但在更广泛的常识性知识评估中,这些小型模型仍落后于大型模型。例如,一个模型可以通过蒸馏在竞赛数学上表现出色,但在广泛的世界知识问答上仍较弱。因此,小型模型击败大型模型的说法通常仅在特定狭窄的范围内成立。

如果效果如此显著,自然会引发方法局限性的疑问,下一章节将直接探讨这一问题。

限制

蒸馏方法有明确的局限性,这些局限性在决定是否适用于特定问题时至关重要。

  • 教师的天花板效应:以教师输出为训练数据的学生模型,其表现通常不会超过教师在相同数据上的水平。当教师生成错误答案时,学生会同时学习到错误答案和正确答案。教师的质量设定了基准,这也使教师选择成为整个过程中最关键的决策之一。
  • 过大的差距可能适得其反:更强的教师模型并不总是能培养出更优秀的学生。当教师与学生之间的差距过大时,知识迁移效果可能下降,因为学生吸收教师模型所表达信息的能力有限。关于这种能力差距的研究发现,最强的教师模型有时反而是最差的选择。为此存在一套方法,通过增加中间步骤来弥合这种差距:教师模型先训练一个中等规模的模型,再由该模型训练小型学生模型,使每次知识传递的跨度更小。
  • 架构可能比规模更重要:基础模型的设计可能比参数数量更重要。在一项研究中,一个320亿参数的学生模型在相同任务上表现优于700亿参数的学生模型,因为较小的模型基于更强的基础架构。单看规模大小,对知识蒸馏效果的预测作用非常有限。
  • 教师模型可能传递超出任务本身的特性:在2025年发表于《自然》期刊的一项研究中,一个具有特定特征(偏好猫头鹰)的教师模型被用来生成仅包含数字序列的训练数据。基于这些数字训练的学生模型即使经过数据过滤去除所有可见特征痕迹后,仍继承了对猫头鹰的偏好。这种现象在更严肃的行为特征中也出现,且仅在教师和学生共享相同基础模型时发生。这表明知识蒸馏可能传递超出教学任务本身的特性,而仅过滤可见数据有时过于粗略,无法阻止这种传递。

这些限制设定了边界,但在此边界内,该方法仍在持续进步。下一节将探讨其发展方向。

自动化

知识蒸馏的最新方向通过自动化整个流程来减少人工干预。

在此设置中,大模型自主完成完整训练循环。它自行生成训练数据、微调学生模型、使用自行生成的保留数据集评估学生模型,并重复该过程,调整输出内容直至学生模型停止提升。人类的作用仅限于初始阶段定义任务和成功标准,并在最后对真实数据进行最终检查。

2026年的最新研究将该方法应用于检测任务,发现效果良好,其中一项发现值得特别注意。

教师模型的选择对结果产生显著影响。在相同训练循环和相同学生模型的条件下,不同教师模型生成的学生模型质量存在明显差异。因此,自动化虽然消除了人工操作,但使教师模型的初始选择变得更为关键,因为该选择现在驱动着整个自主运行流程,而非单次训练过程。

同样的训练循环还预示着未来将减少人工构建的流水线工作,因为越来越多的数据生成和评估工作将由模型自身完成。对团队而言,其吸引力在于无需先构建大型人工标注数据集,即可直接构建小型任务专用模型,因为教师模型同时提供了训练示例和用于评分的数据。

结论

知识蒸馏是一种训练小型可部署模型以复制大型昂贵模型行为的方法。它生成的是独立模型而非原始模型的压缩版本,这种区别解释了其大部分行为特征。

其有效的原因在于,模型的输出包含比普通标签更多的信息,这些信息以软标签形式呈现,展示了所有选项上的完整置信度模式。

在实际应用中,最常见的形式是教师生成一个学生学习的训练集,结果可能很强,但通常仅限于狭窄的任务。

限制是真实存在的:

  • 教师设定了上限,
  • 更大的规模差距可能适得其反,
  • 架构可能比规模更重要
  • 该过程可能会传递从未预期的特性。

综合来看,当任务明确且有能干的教师时,知识蒸馏通常是一个很好的选择;而当目标是广泛、开放的能力时,其适用性则较弱。

参考资料:

  • Distilling the Knowledge in a Neural Network
  • DeepSeek-R1
  • Gemma 3 Technical Report
  • EmbeddingGemma architecture and recipe
  • Alpaca
  • Improved Knowledge Distillation via Teacher Assistant
  • Explainable Sentiment Analysis with DeepSeek-R1
  • Language models transmit behavioural traits through hidden signals in data
  • Anthropic summary .
  • Agentic Knowledge Distillation