AirLLMは、モデルの各層を1層ずつGPUメモリへストリーミングして推論を実行するオープンソースのPythonライブラリです。全パラメータをVRAMに常駐させず、実行中のレイヤーのみを保持する構造を採用しています。量子化や蒸留による精度低下を伴わずに、4GBのGPUで70Bモデル、8GBで405Bモデルといった大規模言語モデルを民生用ハードウェアで実行できます。高価なエンタープライズ向けGPUを持たない開発者や研究者が、ローカル環境でモデルの挙動検証やバッチ処理を行う用途に向いています。