ZML/LLMDは、パリのAIエンジニアリング企業ZMLが提供する、LLM推論をハードウェアに近い層で動かすためのオープンソースの推論サーバーです。Pythonのランタイムに頼らず、AIモデルを下層のハードウェアから切り離して実行する技術を土台にしています。

主な特徴

  • Python不要の推論技術で、重いランタイム層や隠れた状態を持ち込まない設計
  • モデルからハードウェア(Metal)までを一気通貫で組み上げ、性能を詰める方針
  • NVIDIA、AMD、TPU、Trainiumなど複数のアクセラレータを一つのコードベースで扱える
  • 抽象化すべき80%は抽象化し、残り20%はハードウェアごとに作り込むという考え方
  • 暗黙より明示、システムより組み合わせやすさ、魔法より予測しやすさを重視

誰に向いているか

特定のGPUベンダーに縛られずにLLMを自前で動かしたいAI基盤チーム、MLエンジニア、SREや推論基盤の担当者に向いています。複数の種類のアクセラレータを併用している組織では、ハードウェアごとに推論環境を作り分ける手間を減らせる可能性があります。

料金と注意点

Apache-2.0ライセンスの公開リポジトリとして無料で提供されており、セルフホストで利用します。GitHubのドキュメントやDockerイメージが用意され、コミュニティはDiscordで運営されています。一方で、インフラや推論の運用知識が前提となるため、導入の難易度は高めです。有料プランや商用サポートの料金は公開されていないため、業務で使う場合は問い合わせ窓口から確認する必要があります。