MMMU-Pro (難化版マルチモーダルベンチ)
読み: えむえむゆーゆーぷろ
最終更新: 2026-08-14・AI PICKS編集部
定義
MMMU-Proとは、大学レベルの専門知識を問うマルチモーダルベンチマークMMMUを難化させ、選択肢を10択に増やしテキストのみで解ける設問を除去した、より厳格な評価指標のこと。
MMMU-Pro (難化版マルチモーダルベンチ)とは — 詳しく解説
MMMU-Proは、画像・図表・グラフを含む大学レベルの専門問題でマルチモーダルAIの理解力を測る評価指標で、選択肢を4択から10択に増やし、テキスト情報だけで正解できてしまう設問を取り除くことで、モデルの真の視覚理解力を測れるよう設計されたとされる。従来のMMMUは上位モデル同士のスコアが天井付近で並び差が付きにくくなっていたため、その反動として採用が広がったとされる。2026年時点の実運用では、MMMU-Proのスコアが高いモデルでも、実際の業務文書や複雑な図表では読み取りミスが起きやすく、ベンチマーク上位が現場での精度をそのまま保証するわけではない点に注意が必要とされる。モデル選定の現場では単一の指標だけで判断せず、自社の画像データで独自に検証するコストを見込んでおくのが相場感とされる。
MMMU-Pro (難化版マルチモーダルベンチ)の使用例
- モデル比較資料で「MMMU-Proスコア58%」のように視覚理解力の指標として引用される。
- 「MMMUでは天井効果が見られたためMMMU-Proを採用した」という文脈で語られる。
MMMU-Pro (難化版マルチモーダルベンチ)に関連するAIツール
MMMU-Pro (難化版マルチモーダルベンチ)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1468語以上を体系的に整理しています