AI 量子化とは?AIモデルを軽くする仕組みを整理2026.08.01ローカルLLMで必ず出てくる「量子化」を整理します。float32からint8・int4へ落とすと容量がどれだけ減るのか、精度はどこで落ちるのか、weight packingやPTQまで順番に解説します。