引用正確性 (Citation Accuracy)
読み: いんようせいかくせい
最終更新: 2026-08-01・AI PICKS編集部
定義
引用正確性とは、AI が生成した回答に含まれる引用・出典の内容が、実際の一次情報の記述と正確に一致しているかどうかを測る評価指標のこと。
引用正確性 (Citation Accuracy)とは — 詳しく解説
引用正確性 (Citation Accuracy) とは、RAG や AI 検索エンジンが回答に付与した引用・出典が実際の一次情報の内容と一致している度合いを測る指標のこと。学術的には引用の適合率 (Precision) と再現率 (Recall) の2軸で評価するのが標準とされ、引用URLが実在するかだけでなく引用文が原文の主張を正しく反映しているかまで見る。2026年現在の実運用では、URLは生きていても文脈だけ抜き出して原文の結論を歪める「文脈ずれ」型の誤引用が多いと指摘され、単純なリンク到達率チェックでは見抜けない落とし穴とされる。現場での検証にはLLM-as-a-judgeによる引用文と原文の意味的一致率チェックが広く採用されているが、追加のAPIコールが発生するためコスト感を見ながらサンプリング検証にとどめる運用が一般的。ツール選定では引用元の透明性 (URL明示) と検証機能の有無を優先条件にするのが定石。
引用正確性 (Citation Accuracy)の使用例
- この回答の引用URLを一次情報と突き合わせ、主張が原文と一致しているか検証して。
- 生成された引用の適合率と再現率をLLM-as-a-judgeで採点し、文脈ずれの箇所を指摘して。
引用正確性 (Citation Accuracy)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・1313語以上を体系的に整理しています
辞典トップへ