勝率 (Win Rate)
読み: かちりつ
最終更新: 2026-08-12・AI PICKS編集部
定義
勝率とは、AIモデルや出力同士を対戦形式で比較したときに、特定のモデルが相手より高く評価された割合のことである。
勝率 (Win Rate)とは — 詳しく解説
勝率(Win Rate)は、LLM評価においてモデルAとモデルBの出力をペアで比較し、人間評価者またはLLM-as-a-Judgeがどちらを支持したかを集計する指標として業界標準的に使われる。Chatbot Arenaのようなランキングでは、勝率をベースにEloレーティングを算出する方式が広く採用されている。2026年時点の実運用では、判定に使う審査役モデル(judge)自体にバイアスが生じやすく、出力の長さや文体が判定に影響し「実力差ではなく見た目の差」を勝率として計測してしまう落とし穴が指摘されている。現場でモデルを選定する際は、単一の勝率スコアだけでなく、比較対象のタスク種別や判定者の一致率(inter-rater reliability)も併せて確認することが推奨される。また、LLM-as-a-Judgeによる大量ペア比較はAPI呼び出しコストがかさむため、相場感としては評価対象数とペア数に比例して費用が膨らむ点に注意が必要である。
勝率 (Win Rate)の使用例
- プロンプト例:「回答Aと回答Bのどちらが質問に対してより適切か判定してください」でLLM-as-a-Judge型の勝率計測に使う。
- Chatbot Arenaのようなサービスでは、ユーザー投票の勝率からEloレーティングを算出しモデル順位を決める。
勝率 (Win Rate)に関連するAIツール
勝率 (Win Rate)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1418語以上を体系的に整理しています