構造化出力の妥当率 (Schema Validity Rate)
読み: こうぞうかしゅつりょくのだとうりつ
最終更新: 2026-09-01・AI PICKS編集部
定義
構造化出力の妥当率とは、 LLM が出力した JSON などの構造化データが、 事前定義したスキーマに準拠している割合のこと。
構造化出力の妥当率 (Schema Validity Rate)とは — 詳しく解説
構造化出力の妥当率 (Schema Validity Rate) とは、 LLM が生成した JSON や関数呼び出し引数などの構造化出力のうち、 事前定義したスキーマ (型・必須フィールド・enum 制約など) にエラーなく準拠している割合を指す指標のこと。 業界では JSON Schema 準拠率や Function Calling のパース成功率として計測されるのが一般的とされる。 2026年時点の実運用では、 妥当率が高くても値そのものの正しさ (ハルシネーション) は保証されない点が落とし穴として知られる。 現場ではリトライ・自己修復ループを組み込んで最終的な妥当率を引き上げる運用が広く採用されているが、 その分トークン数と処理時間が増えコスト増につながるため、 初回妥当率と最終妥当率を分けて計測し、 相場感としてどの程度のリトライ許容度で運用するかを見極めるのがツール選定の勘所とされる。
構造化出力の妥当率 (Schema Validity Rate)の使用例
- 出力形式を JSON Schema で固定し、 妥当率が98%を下回ったら自動リトライさせるパイプライン設計。
- Function Calling のレスポンスをバリデーションし、 妥当率を週次でダッシュボード監視する運用。
構造化出力の妥当率 (Schema Validity Rate)に関連するAIツール
構造化出力の妥当率 (Schema Validity Rate)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1618語以上を体系的に整理しています