跳到内容

量化(Quantization)

降低模型权重的数值精度(如降至 4-bit),以缩小体积并在更低硬件上运行。

4-bit 量化后的模型体积约为 16-bit 原版的四分之一,能让 7B–8B 模型在笔记本上运行,质量损失通常很小且可接受。

相关资源