Inference Providersとは

Hugging Faceの推論サービスは「Inference API」から「Inference Providers」へと名称・構造が変わり、現在はBaseten、Cerebras、Cohere、DeepInfra、Fal AI、Featherless AI、Fireworks、Groq、HF Inference、Novita、Nscale、OVHcloud AI Endpoints、Public AI、Replicate、Scaleway、Together、WaveSpeedAI、Z.aiなど外部推論プロバイダーを横断的にルーティングするマーケットプレイス型のAPIとなっている。対応モデルは数百〜数千規模で、テキスト生成・画像/動画生成・埋め込み・音声認識・分類など多様なタスクをOpenAI互換の単一クライアントから扱える。

プロバイダー選択の仕組み

モデルIDに:fastest(デフォルト、最高スループット)、:cheapest(最安)、:preferred(設定した優先順位)のポリシーを付与するか、:groqのように個別プロバイダーを直接指定できる。Hugging Face側の上乗せ手数料はなく、各プロバイダーのレートがそのまま適用される。

対象ユーザー

複数の推論プロバイダーを比較・使い分けたい開発者、特定モデル(例: gpt-oss系)を単一トークンで素早く試したい研究者やコーディングエージェント連携(Claude Code, Codex等)に向く。無料枠があり、PROプランやTeam & Enterpriseでは追加クレジットが付与される。