vLLMは、カリフォルニア大学バークレー校のSky Computing Labで生まれた、LLMの推論と配信のためのオープンソースライブラリです。現在は2000人を超える貢献者を持つコミュニティで開発されています。

主な機能

中核はアテンションのキー・バリューのメモリを効率よく管理するPagedAttentionで、リクエストを連続的にまとめる連続バッチ処理、プレフィックスキャッシュ、投機的デコーディングと組み合わせてGPUの利用効率を高めます。FP8、INT4、GPTQ、AWQ、GGUFなどの量子化、テンソル・パイプライン・エキスパートの並列化による分散推論、複数のLoRAの同時配信にも対応します。

APIはOpenAI互換のサーバーに加えてAnthropic Messages APIとgRPCに対応し、ストリーミング出力、構造化出力、ツール呼び出しを扱えます。Hugging Face上の200以上のモデルアーキテクチャに対応し、LlamaやQwen、Gemma、DeepSeekなどの主要なオープンモデルを動かせます。ハードウェアはNVIDIA・AMD・IntelのGPUとCPUのほか、Google TPU、Intel Gaudi、Huawei Ascend、Appleシリコンなどにプラグインで対応します。

料金と導入

無料のオープンソースで、uv pip install vllm でインストールできます。Python 3.10以上が必要です。周辺にはWeb UIのvLLM Playground、本番運用向けのProduction Stack、量子化ツールのLLM Compressorがあります。

注意点

GPUサーバーとPython環境の構築知識が前提で、個人のPCで手軽にチャットする用途には向きません。ドキュメントは英語です。