AI PICKS
AI用語辞典インフラ・学習

TensorRT-LLM (NVIDIA推論エンジン)

読み: てんそーあーるてぃーえるえるえむ

最終更新: 2026-07-28・AI PICKS編集部

定義

TensorRT-LLMとは、NVIDIA GPU向けに最適化された大規模言語モデル(LLM)推論を高速化するオープンソースの推論エンジンのことである。

TensorRT-LLM (NVIDIA推論エンジン)とは — 詳しく解説

TensorRT-LLMとは、NVIDIAが提供するオープンソースの推論エンジンで、TensorRTをベースにLLM向けの演算最適化(カーネル融合・量子化・In-Flight Batchingなど)を組み込み、NVIDIA GPU上での推論スループットとレイテンシを改善する技術のことである。業界標準としてvLLMやOllamaと並び自社ホスティング推論の選択肢の一つとされる。2026年時点の実運用では、モデルごとにGPUアーキテクチャ向けのエンジンを事前ビルドし直す必要があり、モデル更新やGPU世代変更のたびに再ビルド工数とテストコストが発生する点が現場でつまずきやすい落とし穴とされる。またNVIDIA GPU以外では動かないためクラウドのGPUインスタンス費用が相対コストの中心となり、小規模な問い合わせ量ならAPI課金の相場感と比較して割高になりやすい。現場での選び方としては、大量トラフィックを自社インフラで捌く前提かつNVIDIA GPUを継続利用する場合に候補とし、そうでなければマネージド推論APIの利用が優先されるとされる。

TensorRT-LLM (NVIDIA推論エンジン)の使用例

  • 自社サーバーでLlama系モデルをTensorRT-LLMでビルドし、vLLMと処理速度を比較検討する。
  • GPUクラウドの月額見積もり時にTensorRT-LLM対応の有無を確認し、推論コストを試算する。

TensorRT-LLM (NVIDIA推論エンジン)に関連するAIツール

関連用語

インフラ・学習」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1113語以上を体系的に整理しています

辞典トップへ