コンテキスト適合率 (Context Precision)
読み: こんてきすとてきごうりつ
最終更新: 2026-08-14・AI PICKS編集部
定義
コンテキスト適合率とは、RAGが検索した文脈情報のうち、実際に回答生成に関連する情報がどれだけの割合を占めるかを示す評価指標のこと。
コンテキスト適合率 (Context Precision)とは — 詳しく解説
コンテキスト適合率(Context Precision)は、RAGシステムが検索した複数のコンテキストチャンクのうち、質問に対して実際に関連性の高いものがどの順位・割合で含まれているかを測る指標で、RAGASなどの評価フレームワークで業界標準的に採用されている。適合率が高いほどノイズの少ない文脈がLLMに渡り、ハルシネーションの抑制や生成コストの削減につながるとされる。一方で2026年時点の実運用では、チャンク分割の粒度やEmbeddingモデルの選定次第で適合率が大きく変動し、指標上は高スコアでも実際の回答品質が伴わないケースが現場で報告されている。評価には正解ラベル付きテストセットとLLM-as-judgeによる自動採点を組み合わせる手法が広く採用されており、運用コストとのバランスを見ながら再現率(Recall)とセットで継続モニタリングする体制が選び方の要になるとされる。
コンテキスト適合率 (Context Precision)の使用例
- RAGASでContext Precisionを算出し、検索スコア上位のチャンクほど質問との関連度が高いかを0〜1で評価する。
- チャンクサイズを512→256トークンに縮小したところ適合率は改善したが、再現率(Recall)が低下したケースが報告されている。
コンテキスト適合率 (Context Precision)に関連するAIツール
コンテキスト適合率 (Context Precision)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1468語以上を体系的に整理しています