FActScore (長文事実性評価)
読み: ふぁくとすこあ
最終更新: 2026-07-31・AI PICKS編集部
定義
FActScoreとは、生成された長文を細かい事実単位(atomic facts)に分解し、各事実を外部知識源と照合して正誤を判定する事実性評価指標のこと。
FActScore (長文事実性評価)とは — 詳しく解説
FActScoreは長文生成の事実性を測る評価指標で、出力文を独立した「原子的事実(atomic fact)」の単位に分解し、各事実をWikipediaなど信頼できる知識源と照合して正誤を判定、正しい事実の割合をスコア化する手法が業界標準の一つとして広く採用されているとされる。BLEUやROUGEのような表層一致指標では検出できない、もっともらしいが誤った記述(ハルシネーション)を捕捉できる点が評価される一方、2026年時点の実運用では、判定に大規模言語モデルを用いる場合の判定コストがかさむことや、知識源が古い・不十分だと誤判定が増える落とし穴が指摘されている。現場での選び方としては、評価対象ドメインをカバーする知識源を用意できるか、判定コストが継続運用の予算(相場感)に見合うかを事前に確認したうえで、他の事実性指標や人手レビューと併用する運用が現実的とされる。
FActScore (長文事実性評価)の使用例
- 生成AIの要約結果にFActScoreを算出し、事実性の低い出力を公開前に検知するチェック工程に用いる。
- 医療・法律などの分野でLLM出力を人手レビュー前にスクリーニングする足切り指標としてFActScoreを使う。
FActScore (長文事実性評価)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・1263語以上を体系的に整理しています
辞典トップへ