AI PICKS
AI用語辞典評価指標

P95レイテンシ (テール遅延)

読み: ぴーきゅうじゅうごれいてんしー

最終更新: 2026-07-29・AI PICKS編集部

定義

P95レイテンシとは、リクエストの応答時間を速い順に並べたとき、下から95%目に位置する値のことで、平均値では見えない一部の遅い処理(テール遅延)を可視化する指標のこと。

P95レイテンシ (テール遅延)とは — 詳しく解説

P95レイテンシとは、システムへのリクエスト応答時間を測定し、速い順に並べたときに全体の95%がその時間以内に収まる値のことで、平均レイテンシでは埋もれる一部の遅い処理(テール遅延)を捉えるために業界標準の指標として広く採用されているとされる。平均値だけを追うと、大半のユーザーには速く感じられても、一部のリクエストが数秒〜数十秒待たされる体験を見落としやすい。2026年時点の実運用では、LLM API呼び出しやRAG検索を組み合わせたエージェント処理でP95が跳ねやすく、モデル呼び出し回数が増えるほどテール遅延が悪化する傾向がある。現場での選び方は、ユーザー向け同期処理はP95(場合によってはP99)を、バッチ処理は平均値やスループットを重視するという使い分けが定石。監視コストや対策(キャッシュ・タイムアウト設計・非同期化)も込みで相場感を把握したうえで、SLA設計に組み込むのが実務上の落とし穴を避けるコツとされる。

P95レイテンシ (テール遅延)の使用例

  • P95レイテンシが800msの場合、95%のリクエストは800ms以内に完了するが、残り5%はそれ以上かかることを示す。
  • LLMチェイン処理でP95が悪化したら、まずリトライ回数上限とタイムアウト設計を見直す。

P95レイテンシ (テール遅延)に関連するAIツール

関連用語

評価指標」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1163語以上を体系的に整理しています

辞典トップへ