レート制限 (Rate Limit)
読み: れーとせいげん
最終更新: 2026-07-26・AI PICKS編集部
定義
レート制限とは、一定時間内に受け付けるAPIリクエスト数の上限を定め、過剰なアクセスやサーバー過負荷を防ぐ仕組みのことである。
レート制限 (Rate Limit)とは — 詳しく解説
レート制限は、API提供者がサーバー負荷や不正利用を防ぐため、一定時間あたりのリクエスト数に上限を設ける仕組みで、HTTPステータス429(Too Many Requests)で通知されるのが業界標準の実装とされる。多くのLLM APIでは、RPM(1分あたりのリクエスト数)とTPM(1分あたりのトークン数)の両方で制限がかかる方式が広く採用されており、2026年時点でも従量課金プランのコストと直結する設計になっている。実運用での落とし穴は、バッチ処理やエージェントが同時多発的にリクエストを投げるケースで、リトライ処理を挟まないと本番障害につながりやすい点にある。現場での選び方としては、指数バックオフとジッターを組み込んだリトライ、リクエストのキューイング、上位プランへのアップグレードによる上限緩和などを組み合わせて設計するのが定石とされる。コスト最適化の観点では、上限に張り付く前にモニタリングでアラートを設定し、無駄なリトライで課金だけが膨らむ事態を避ける運用が求められる。
レート制限 (Rate Limit)の使用例
- APIレスポンスヘッダーのX-RateLimit-Remainingで残りリクエスト数を確認する使い方。
- 「429エラー時は指数バックオフで再試行するコードにして」と指示するプロンプト例。
レート制限 (Rate Limit)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1013語以上を体系的に整理しています
辞典トップへ