知识蒸馏训练较小的“学生”模型模仿较大的“教师”模型,以更低成本保留大部分质量。许多快速、廉价的「mini」或「flash」模型都是从更大的旗舰模型蒸馏而来,用少量精度换取大幅更低的延迟与成本——非常适合高并发的生产环境。