INT4とは、ディープラーニングモデルのパラメータや演算を4ビット整数で表現するデータ形式です。一般的なFP16と比べてメモリ使用量を大幅に削減できるため、大規模言語モデルをパーソナルコンピュータやモバイル端末などのエッジ環境で効率的に推論実行する量子化技術として広く活用されています。
INT4とは
INT4(4ビット整数)とは、AIモデルの重みや数値を4ビット(16通りの値)の整数値で表現・計算する手法です。モデルサイズを極小化し、軽量なデバイスでも効率的な推論を可能にする量子化技術の中核として注目されています。
詳しく解説
ディープラーニングモデルでは従来、FP16(16ビット半精度浮動小数点数)などの高い精度の数値形式が広く使われてきました。しかし、大規模言語モデル(LLM)のパラメータ数が巨大化するにつれて、モデルを動かすために必要なメモリ容量と通信帯域が大きな課題となりました。これに対し、パラメータを4ビット整数に変換する「量子化」を行うことで、FP16に比べてメモリフットプリントを約4分の1に圧縮できます。INT4への変換手法としてAWQやGPTQなどのアルゴリズムが開発され、モデルの精度低下を最小限に抑えながら高効率な実行が可能になっています。
具体例・使われ方
例えば、70億パラメータのLLMをFP16で動かすには約14GB以上のGPUメモリが必要ですが、INT4に量子化することで約4GB前後のメモリでも動作可能になります。これにより、高価なサーバー用GPUを用意しなくても、民生用パソコンやスマートフォンなどのローカル環境でチャットAIを軽快に動作させることができます。
似た用語との違い
INT4とINT8の違いはビット幅と精度のトレードオフにあります。INT8(8ビット整数)は256通りの値を扱えるため、多くのモデルで元の精度をほぼ保ったままFP16比で約半分のサイズに削減できます。一方、INT4は16通りの値しか表現できないため、より強力な圧縮効果が得られる反面、適切な量子化手法を適用しないと推論精度が劣化しやすくなります。
注意点
INT4を適用する際の注意点として、単純に数値を丸めるとモデルの出力品質や推論性能が大きく低下するリスクがあります。また、INT4は主にモデルのパラメータを保存・ロードするメモリ帯域の削減に用いられることが多く、実際の計算時には一時的にFP16などへ復元して演算する場合もあるため、ハードウェアの対応状況によって実行速度の向上幅が異なる点に留意が必要です。