MathVista (視覚数学ベンチ)
読み: ますびすた
最終更新: 2026-08-15・AI PICKS編集部
定義
MathVistaとは、図表・グラフ・幾何図形など視覚情報を伴う数学問題でAIモデルの推論力を測る評価ベンチマークのこと。
MathVista (視覚数学ベンチ)とは — 詳しく解説
MathVistaは、教科書の図形問題やグラフ読み取り、統計チャートの解釈など、視覚情報と数学的推論を組み合わせた問題群でマルチモーダルAIの能力を評価するベンチマークとして広く参照される。2026年時点では、GPT系・Gemini系・Claude系など主要な大規模言語モデルの性能比較指標の一つとして扱われることが多く、公開されているリーダーボードのスコアが引用される場面が増えている。ただし実運用の現場では、ベンチマークスコアが高いモデルでも、実際の業務資料に含まれる複雑な図表や手書き数式では精度が落ちるケースがあるとされ、単純にスコアだけでモデルを選定するのは危険とされる。API利用コストや処理速度とのバランスも踏まえ、自社のユースケースに近いサンプルで個別に検証してから採用するのが現実的な選び方といえる。
MathVista (視覚数学ベンチ)の使用例
- MathVistaのスコア表はGPT-4oやGemini、Claudeなど主要モデルの視覚推論力を横並び比較する際によく引用される。
- 出題例:「棒グラフから2026年の前年比成長率を算出せよ」など、図表読解と計算を組み合わせた設問が中心。
MathVista (視覚数学ベンチ)に関連するAIツール
MathVista (視覚数学ベンチ)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1518語以上を体系的に整理しています