Prefill/Decode分離 (Disaggregated Inference)
読み: ぷりふぃる・でこーどぶんり
最終更新: 2026-07-30・AI PICKS編集部
定義
Prefill/Decode分離とは、LLM推論におけるプロンプト処理(Prefill)と逐次生成(Decode)を別々のGPU群に分離して実行する推論アーキテクチャのこと。
Prefill/Decode分離 (Disaggregated Inference)とは — 詳しく解説
Prefill/Decode分離(Disaggregated Inference)は、LLM推論を構成する2フェーズ、プロンプトを一括処理し計算量が支配的なPrefillと、トークンを逐次生成しメモリ帯域が支配的なDecodeを、別々のGPUクラスタに切り分けて実行するアーキテクチャとされる。両フェーズは計算特性が大きく異なり、同一GPU上で混在させるとバッチ処理の効率が落ちやすいため、分離によりそれぞれ最適なハードウェア構成を充てられる点が利点とされる。vLLMやNVIDIA Dynamoなど主要な推論基盤で採用が広がり、2026年時点では大規模推論サービスの標準構成の一つとされる。実運用では、Prefill側からDecode側へのKVキャッシュ転送がボトルネックになりやすく、ネットワーク帯域が細いと分離のメリットが相殺される落とし穴があるとされる。また専用クラスタを2系統維持するため、小〜中規模のトラフィックでは相場感としてGPUの遊休コストが割高になりやすく、現場ではリクエスト量がまとまってから導入を検討する選び方が一般的とされる。
Prefill/Decode分離 (Disaggregated Inference)の使用例
- 入力プロンプトが長い検索拡張(RAG)用途で、PrefillとDecodeを別GPUに分離しレイテンシを安定させる推論基盤の構成例。
- チャットボットのように出力トークン数が多いワークロードで、Decode専用GPU群を薄く並べてスループットを稼ぐ構成。
Prefill/Decode分離 (Disaggregated Inference)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1213語以上を体系的に整理しています
辞典トップへ