AI 技能百科 English

模型蒸馏:把大模型能力压缩进可部署系统

AI 技能百科 › AI 工程 · 最后更新: 2026-08-16

定义

模型蒸馏(knowledge distillation)是一种模型压缩与能力迁移方法:让较小的学生模型学习较强教师模型的 logits、概率分布、生成样本、推理痕迹或偏好信号。现代 AI 工程中,它常用于把通用大模型压缩成低成本的任务模型、领域专家模型或边缘可部署模型。完整流程包括选择教师信号、构建代表性数据集、训练学生模型,并用质量、校准、安全和回归测试验证是否接近教师表现。

为什么对 AI 求职重要

招聘方重视模型蒸馏,因为它直接连接模型能力和生产成本。大模型效果好,但在高流量、低延迟、私有化或边缘场景中可能太贵、太慢或太难部署。懂蒸馏的工程师能设计评测集,负责任地生成训练数据,选择学生模型结构,量化质量、成本、吞吐和延迟之间的取舍,并把较小模型安全地上线。这对 inference platform、model efficiency、企业 AI 和领域助手团队都很有价值。

核心概念

  • 教师-学生训练:用强模型提供 logits、标签、示范或解释,让小模型学习目标行为。
  • 软标签与温度:不仅学习硬标签,还学习概率分布中的不确定性和类别关系。
  • 任务蒸馏:把通用模型能力收敛到某个产品流程、领域或延迟预算。
  • 评测对齐:在离线基准、生产 trace、安全用例和回归集上比较教师与学生。
  • 质量-成本-延迟取舍:用成本、吞吐、内存和效果决定小模型是否足够好。
  • 数据治理:跟踪教师生成数据的来源、许可、隐私和污染风险。

学习路径

  1. 先复现经典分类蒸馏:用教师 logits 训练小模型,并与只用硬标签的结果比较。
  2. 针对一个窄任务,用教师模型生成示范数据,训练学生语言模型或适配器。
  3. 建立同一工作负载下的评测脚本,同时报告质量、延迟、显存/内存和单位成本。
  4. 加入安全与回归测试,确认学生模型没有继承不良行为,也没有在边界样本上退化。
  5. 把学生模型接入 serving endpoint,并定义何时使用学生、教师或 fallback 路由。

资源链接