公平性指標 (Demographic Parity等)
読み: こうへいせいしひょう
最終更新: 2026-09-01・AI PICKS編集部
定義
公平性指標とは、AIモデルの予測結果が性別・人種・年齢などの属性によって不当な偏りを生んでいないかを定量的に測る評価基準のこと。
公平性指標 (Demographic Parity等)とは — 詳しく解説
公平性指標は、機械学習モデルの判定結果が性別・年齢・国籍などのセンシティブ属性によって統計的に偏っていないかを定量化する指標群で、代表例にDemographic Parity(属性間でpositive判定率を揃える)、Equalized Odds(真陽性率と偽陽性率を揃える)、Equal Opportunity(真陽性率のみ揃える)がある。採用・与信・保険審査など人に影響する判定AIで業界標準として使われるが、Demographic ParityとEqualized Oddsは数学的に同時達成が難しいトレードオフ関係にあり、どれを優先するかは業務要件次第という落とし穴がある。2026年時点の実運用では、属性データの取得自体が個人情報保護の制約で難しく、居住地域などの代理変数を経由した間接差別を現場で見落としがちとされる。監査体制の構築や外部監査ツールの導入にはコストがかかるため、規制業種以外ではグループ別合格率の簡易モニタリングから始める相場感が一般的とされる。
公平性指標 (Demographic Parity等)の使用例
- 求人選考AIの合格率を性別・年齢層別に集計し、Demographic Parityの乖離が5%以内かを確認する。
- 与信スコアAIでEqualized Oddsを算出し、属性間で誤承認率・誤却下率に差がないか監査する。
公平性指標 (Demographic Parity等)に関連するAIツール
公平性指標 (Demographic Parity等)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1618語以上を体系的に整理しています