什么是知识蒸馏?
知识蒸馏是一种模型压缩技术:把大而强的“教师模型”学到的能力,迁移给小而快的“学生模型”,让小模型用少得多的参数逼近大模型的效果。这一概念由深度学习先驱 Geoffrey Hinton 等人在 2015 年正式提出。
打个比方:资深教授把多年积累的解题思路和判断直觉,整理成方法教给一名中学生。学生的“脑容量”(参数量)远不如教授,但掌握了套路,考试也能拿到接近的分数,而且做题更快、成本更低。
对大模型时代来说,它的价值非常直接:让大模型变小、变快、变便宜,从而能跑进手机、汽车、企业内网等资源受限的环境。
知识蒸馏是怎么运作的?
核心:学“思路”,而不只学“答案”
普通训练中,模型看到的是“标准答案”(硬标签),比如“这张图是猫”,只有对错两种信息。知识蒸馏则让学生模仿教师的完整输出分布(软标签):教师会说“是猫的概率 85%、像狗 12%、像狐狸 3%”。这些概率藏着类别间的相似关系,业内称之为“暗知识”。学生学到这层判断逻辑,泛化能力往往比死记答案更强。训练时还会用“温度”参数把概率分布“调软”,让细微差异更容易被学走。
蒸馏的基本流程
- 训练教师:用海量数据把大模型训练到位;
- 生成软标签:让教师对大量样本输出带概率的“答案”;
- 训练学生:让学生在软标签(可混合真实标签)上反复训练,对齐教师的行为。
除了模仿最终输出,进阶做法还包括模仿教师的中间层特征、样本之间的关联关系等。
教师模型与学生模型对比
| 对比维度 | 教师模型(大) | 学生模型(小) |
| 参数规模 | 千亿级以上 | 几亿到几百亿 |
| 算力成本 | 极高,需要 GPU 集群 | 低,单卡甚至手机可跑 |
| 职责 | 产出知识、生成软标签 | 模仿学习、承担部署 |
| 运行位置 | 云端 | 端侧、本地、高并发服务 |
一句话理解:知识蒸馏就是“名师出高徒”——大模型负责博学,小模型负责上岗。
代表产品与工具
蒸馏早已是大模型行业的“标配工艺”,不少国内产品背后都有它的影子:
- DeepSeek(深度求索):开源推理模型 DeepSeek-R1 同步发布了基于通义千问、Llama 蒸馏的多款小模型(如 R1-Distill-Qwen-7B、14B、32B),消费级显卡即可部署,是最典型的公开蒸馏实践。
- 通义千问 Qwen(阿里):其开源小尺寸模型被大量团队选作“学生”底座,也广泛装进手机等终端设备。
- 豆包(字节跳动):豆包大模型提供轻量版本,支撑豆包 App、扣子等高并发、低成本场景。
- 智谱 GLM:开源了 GLM-4-9B 等中小尺寸模型,适合本地部署与二次蒸馏。
- Kimi、文心一言等厂商普遍采用“大杯、中杯、小杯”的模型分层,小杯型号常借助蒸馏等技术压低成本。
对开发者而言,“用开源教师造数据、再训小模型”的工具链已较成熟,小团队也能跑通蒸馏全流程。
典型应用场景
- 端侧与手机 AI:输入法联想、相册理解、离线语音助手,都要把能力装进几 GB 内存。
- 企业私有化部署:金融、政务、医疗机构用小模型在内网运行,数据不出域,算力投入大幅下降。
- 高并发在线服务:智能客服、搜索摘要等海量请求场景,用小模型换更低延迟和更便宜的账单。
- 垂直领域小模型:把大模型本领“定向灌输”给法律、电商、客服等专用小模型,小而专反而更好用。
- 边缘与车载:智能座舱、摄像头、IoT 终端算力有限,蒸馏是让 AI 上车、上端的关键技术。
常见问题
知识蒸馏和模型量化是一回事吗?
不是。蒸馏是把能力迁移到一个参数更少的新模型上,需要重新训练;量化则保持参数个数不变,把数值精度从 16 位压到 8 位甚至 4 位来省空间。两者常配合使用:先蒸馏瘦身,再量化压缩。
学生模型能超过教师模型吗?
整体能力通常达不到教师的上限,但在特定任务上可能“青出于蓝”——专注垂直领域的学生模型,完全可能反超通用型教师。此外还有“自蒸馏”:让模型教自己、或同代模型互当师生,同样能带来提升。
个人或小团队能用上蒸馏吗?
可以。最省事的路径是直接使用现成成果,例如 DeepSeek-R1-Distill 系列开源小模型,单卡即可部署;进阶做法是调用大模型 API 批量生成高质量软标签数据,再用开源训练框架训练自己的小模型,千元级成本即可试水。
辽公网安备21021102001760号