正解率 (Accuracy)
読み: せいかいりつ
最終更新: 2026-07-24・AI PICKS編集部
定義
正解率(Accuracy)とは、分類モデルの全予測件数のうち、正しく予測できた件数の割合を示す評価指標のこと。
正解率 (Accuracy)とは — 詳しく解説
正解率(Accuracy)は、分類・予測タスクにおいて全体の予測件数のうち正しく予測できた件数の割合を表す、機械学習で最も基本的な評価指標の一つとされる。計算式はシンプルで(TP+TN)/(TP+TN+FP+FN)で求められ、モデル性能を手早く把握する指標として広く使われているとされる。ただし、クラス不均衡なデータでは正解率だけでは実態を見誤りやすく、少数クラスの誤判定が埋もれてしまう落とし穴があるとされる。2026年時点の実運用では、生成AIによる分類・判定タスク(スパム検知、コンテンツ審査、レコメンド精度検証など)でも正解率が一次指標として使われる一方、適合率・再現率・F1スコアと併用する運用が定着してきたとされる。現場でモデルを選ぶ際は、正解率の数値だけでなく誤判定の種類(見逃しか誤検知か)がビジネス影響としてどちらが痛いかで指標の優先順位を変える必要があるとされる。継続的な評価にはラベル付きテストデータの整備が欠かせず、相場感としては小規模チームでも月次程度の再評価にかかるコストを見込んでおくのが一般的とされる。
正解率 (Accuracy)の使用例
- スパム分類モデルで正解率98%でも、少数派の重要メールを誤って除外していないか確認する。
- 「正解率は高いのに現場のクレームが減らない」場合、クラス不均衡による見せかけの高精度を疑う。
正解率 (Accuracy)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・913語以上を体系的に整理しています
辞典トップへ