回答関連性 (Answer Relevance)
読み: かいとうかんれんせい
最終更新: 2026-08-06・AI PICKS編集部
定義
回答関連性とは、LLMが生成した回答が、入力された質問の意図や文脈にどれだけ的確に対応しているかを測るRAG評価指標のこと。
回答関連性 (Answer Relevance)とは — 詳しく解説
回答関連性(Answer Relevance)は、RAGやLLMアプリケーションの品質評価で使われる指標のひとつとされる。埋め込みベースのコサイン類似度や、別のLLMに採点させるLLM-as-a-judge方式で、生成された回答が元の質問の意図とどれだけ意味的に整合しているかをスコア化する手法が広く採用されている。2026年時点の実運用でよく踏む落とし穴は、事実誤りを含む回答でも質問文と表現が似ていれば関連性スコアが高く出てしまう点で、忠実性(Faithfulness)など他の評価軸と組み合わせないと精度の実態を見誤りやすい。コスト面では、評価のたびに高性能モデルをLLM-as-a-judgeとして都度呼び出すと相場感として運用コストが膨らむため、軽量な埋め込みモデルによる代替評価や、サンプリング頻度を絞った回帰テスト運用が現場で選ばれやすい。
回答関連性 (Answer Relevance)の使用例
- RAGチャットボットに返品ポリシーはと聞いた際、返品条件に絞って答えれば関連性スコアは高く評価される。
- 質問と無関係な一般論を長く答えると、内容が正しくても回答関連性スコアは低く判定される。
回答関連性 (Answer Relevance)に関連するAIツール
回答関連性 (Answer Relevance)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています