TensorRT-LLM (NVIDIA推論エンジン)
読み: てんそーあーるてぃーえるえるえむ
最終更新: 2026-07-28・AI PICKS編集部
定義
TensorRT-LLMとは、NVIDIA GPU向けに最適化された大規模言語モデル(LLM)推論を高速化するオープンソースの推論エンジンのことである。
TensorRT-LLM (NVIDIA推論エンジン)とは — 詳しく解説
TensorRT-LLMとは、NVIDIAが提供するオープンソースの推論エンジンで、TensorRTをベースにLLM向けの演算最適化(カーネル融合・量子化・In-Flight Batchingなど)を組み込み、NVIDIA GPU上での推論スループットとレイテンシを改善する技術のことである。業界標準としてvLLMやOllamaと並び自社ホスティング推論の選択肢の一つとされる。2026年時点の実運用では、モデルごとにGPUアーキテクチャ向けのエンジンを事前ビルドし直す必要があり、モデル更新やGPU世代変更のたびに再ビルド工数とテストコストが発生する点が現場でつまずきやすい落とし穴とされる。またNVIDIA GPU以外では動かないためクラウドのGPUインスタンス費用が相対コストの中心となり、小規模な問い合わせ量ならAPI課金の相場感と比較して割高になりやすい。現場での選び方としては、大量トラフィックを自社インフラで捌く前提かつNVIDIA GPUを継続利用する場合に候補とし、そうでなければマネージド推論APIの利用が優先されるとされる。
TensorRT-LLM (NVIDIA推論エンジン)の使用例
- 自社サーバーでLlama系モデルをTensorRT-LLMでビルドし、vLLMと処理速度を比較検討する。
- GPUクラウドの月額見積もり時にTensorRT-LLM対応の有無を確認し、推論コストを試算する。
TensorRT-LLM (NVIDIA推論エンジン)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1113語以上を体系的に整理しています
辞典トップへ