NDCG (正規化割引累積利得)
読み: えぬでぃーしーじー
最終更新: 2026-07-19・AI PICKS編集部
定義
NDCGとは、検索やレコメンドの順位付け結果について、関連度の高い項目が上位に来ているほど高いスコアになるよう設計された評価指標のこと。
NDCG (正規化割引累積利得)とは — 詳しく解説
NDCG(正規化割引累積利得)は、検索エンジンやレコメンドシステムの並び順の良し悪しを測る情報検索分野の業界標準指標とされる。各アイテムの関連度スコアを、順位が下がるほど対数的に割り引いて合計したDCGを、理想的な並び順で得られる最大値(IDCG)で正規化し、0〜1の値で表す。実運用では、関連度ラベルが二値か多段階かで評価の粒度が変わり、@10や@20など評価対象の順位範囲(カットオフ)の選び方次第でスコアが大きく変動する点が落とし穴になりやすい。現場では、正解ラベルの人手作成にコストがかかるため、2026年時点ではLLMによる関連度自動採点とNDCGを組み合わせて相場感のある評価を効率化する運用が広がっているとされる。
NDCG (正規化割引累積利得)の使用例
- RAGの検索結果をNDCG@10で評価し、埋め込みモデル変更前後の検索精度を比較する。
- レコメンド一覧の並び順をNDCGでスコア化し、モデル更新による改善度を数値で比較する。
NDCG (正規化割引累積利得)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・713語以上を体系的に整理しています
辞典トップへ