GPTQ (訓練後量子化手法)
読み: じーぴーてぃーきゅー
最終更新: 2026-07-29・AI PICKS編集部
定義
GPTQとは、学習済みの大規模言語モデルの重みを再学習なしで4bit程度まで圧縮する訓練後量子化(PTQ)手法のことである。
GPTQ (訓練後量子化手法)とは — 詳しく解説
GPTQは重み行列を層ごとに二次近似誤差を最小化しながら整数値へ量子化する手法で、4bitや3bitまで圧縮しても精度劣化を抑えやすい点が評価され、LLM推論の軽量化手法として広く採用されているとされる。2026年時点の実運用では、量子化後の精度は元モデルの品質やキャリブレーションデータの選び方に強く依存するため、公開ベンチマークの数値だけで判断すると現場のタスクで想定した精度が出ないことがある。また量子化そのものより、対応する推論エンジンやGPUカーネルの整備状況がボトルネックになりやすく、選定時はAWQやGGUFなど他の量子化手法との相場感や運用実績を比較した上で、モデルサイズ・VRAM容量・許容コストに応じて使い分けることが現場では重視される。
GPTQ (訓練後量子化手法)の使用例
- 7BモデルをGPTQで4bit量子化し、VRAM8GBのGPU1枚でチャットボットをローカル推論する構成。
- 自社サーバーでLlamaベースモデルをGPTQ量子化し、推論コストを抑えて社内文書検索AIを運用する例。
GPTQ (訓練後量子化手法)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1163語以上を体系的に整理しています
辞典トップへ