SWE-bench Multimodal (UI付きコード修正ベンチ)
読み: えすだぶりゅーいーべんちまるちもーだる
最終更新: 2026-08-15・AI PICKS編集部
定義
SWE-bench Multimodalとは、UIのスクリーンショットを含むGitHub issueをAIエージェントに解決させ、視覚理解力を測る評価ベンチマークのこと。
SWE-bench Multimodal (UI付きコード修正ベンチ)とは — 詳しく解説
SWE-bench Multimodalは、テキストのみだったSWE-bench/SWE-bench Verifiedを拡張し、UIバグやレイアウト崩れなど画像・スクリーンショットの理解が必要なGitHub issueを解決させる評価ベンチマークとして提案された。エージェントはissue文と画面キャプチャから原因を特定し、実際にコードを修正してPRを生成、テストスイートの通過可否でスコアが決まる。テキストのみのベンチより解決率が大きく下がる傾向が広く知られており、視覚情報からDOM構造やCSSの因果関係を推論する能力がボトルネックになりやすいとされる。2026年時点の実運用では、フロントエンド修正を任せるAIコーディングエージェントの選定基準としてこのスコアが参照されることが増えており、現場ではベンチマーク上位でも自社のUIコンポーネント構成には弱いケースがあるため、実案件に近いissueでの検証が推奨される。実行にはスクリーンショット付きの環境構築とテスト実行コストがかかり、大規模モデルを多数のissueに回す評価コストも相場感として無視できない。
SWE-bench Multimodal (UI付きコード修正ベンチ)の使用例
- 『ログインボタンが画面下にはみ出す』というスクリーンショット付きissueをエージェントに渡し、CSS修正PRを生成させて自動評価する。
- テキストのみのSWE-bench Verifiedでは高スコアでも、SWE-bench Multimodalでは解決率が落ちるエージェントの弱点発見に使う。
SWE-bench Multimodal (UI付きコード修正ベンチ)に関連するAIツール
SWE-bench Multimodal (UI付きコード修正ベンチ)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1518語以上を体系的に整理しています