トークン効率 (Token Efficiency)
読み: とーくんこうりつ
最終更新: 2026-07-27・AI PICKS編集部
定義
トークン効率とは、LLMへの入出力に使うトークン数あたりでどれだけの性能や成果を引き出せるかを示す指標のことである。
トークン効率 (Token Efficiency)とは — 詳しく解説
トークン効率とは、LLMが処理する入力・出力トークン数に対して、どれだけ精度の高い成果を引き出せるかを表す考え方で、モデル選定やプロンプト設計の評価軸として業界で広く使われている。トークン数はAPI課金の基準となるため、同じ品質の出力をより少ないトークンで得られるほどコストは下がるとされる。2026年時点の実運用では、長大なコンテキストを丸ごと投入する設計や冗長なfew-shot例が、精度向上より先にコスト増を招く落とし穴として指摘されている。現場での選び方としては、RAGで関連情報だけを絞り込んで渡す、プロンプトを簡潔に保つ、モデルのコンテキストウィンドウをキャッシュ機能で再利用するといった工夫が採られることが多い。相場感としては、入力トークンより出力トークンの単価が高いモデルが一般的であるため、出力の冗長さを削る設計がコスト最適化の観点で重視される傾向にある。
トークン効率 (Token Efficiency)の使用例
- 同じ回答精度なら、長いコンテキストを丸ごと渡すよりRAGで関連箇所だけ抽出する方がトークン効率は高い。
- プロンプト末尾に不要な参考資料を貼り付けると、出力品質が変わらないままコストだけ増えトークン効率が下がる。
トークン効率 (Token Efficiency)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・1063語以上を体系的に整理しています
辞典トップへ