AI PICKS
AI用語辞典インフラ・学習

KVキャッシュオフロード (KV Cache Offloading)

読み: けーぶいきゃっしゅおふろーど

最終更新: 2026-08-31・AI PICKS編集部

定義

KVキャッシュオフロードとは、LLM推論時に生成されるKey-Valueキャッシュの一部をGPU VRAMから外部メモリ(CPU RAM/SSD等)に退避させる技術のこと。

KVキャッシュオフロード (KV Cache Offloading)とは — 詳しく解説

KVキャッシュオフロードは、Transformer系LLMの自己注意機構で各トークンごとに生成されるKey-Valueテンソルを、GPU VRAMに収まりきらない場合にCPUメモリやNVMe SSD、専用の高速ストレージ層へ退避・階層化する仕組みで、長いコンテキストや多数の同時セッションを扱う推論基盤で広く採用されているとされる。GPUメモリは高価かつ容量が限られるためKVキャッシュ肥大がボトルネックになりやすく、オフロードにより同一GPU台数でも扱えるコンテキスト長や同時接続数を増やせる一方、退避先とGPU間の転送がレイテンシ悪化として表面化しやすい。2026年時点の実運用では、PCIe帯域やストレージI/O性能がボトルネックになりやすく、GPUメモリ従量課金のクラウド推論ではコスト削減効果が薄まるケースもあるとされ、現場ではレイテンシ要件とコストの相場感を踏まえてオフロード対象や階層構成を選ぶ必要がある。

KVキャッシュオフロード (KV Cache Offloading)の使用例

  • 長文チャットボットでKVキャッシュオフロードを有効化し、GPU VRAM不足によるOOMエラーを回避する設定例。
  • 同時接続ユーザー数が多い推論APIで、KVキャッシュをCPUメモリ層にオフロードしスループットを維持する構成。

KVキャッシュオフロード (KV Cache Offloading)に関連するAIツール

KVキャッシュオフロード (KV Cache Offloading)の関連記事

関連用語

インフラ・学習」の他の用語

用語がわかったら、次はツール選び

12カテゴリ・1568語以上を体系的に整理しています