量子化(Quantization)モデル重みの数値精度(例:4-bit)を下げてサイズを縮小し、低いハードで実行。4-bit 量子化モデルは 16-bit 版の約4分の1のサイズになり、7B〜8B モデルをノートPCで動かせる。品質低下は通常小さく許容範囲。