知能指数 (Artificial Analysis Intelligence Index)
読み: ちのうしすう
最終更新: 2026-07-06・AI PICKS編集部
定義
知能指数(Artificial Analysis Intelligence Index)とは、複数の第三者ベンチマーク結果を統合し、LLMの総合的な性能を単一のスコアで示す評価指標のこと。
知能指数 (Artificial Analysis Intelligence Index)とは — 詳しく解説
Artificial Analysis社が公開する知能指数は、推論・数学・コーディングなど複数の第三者ベンチマークのスコアを統合し、主要LLMの総合力を一本の数値で比較できるようにした評価指標として業界で広く採用されているとされる。単一ベンチマークへの過学習を避け、モデル間の相対的な立ち位置を素早く把握できる点が支持される理由とされる。ただし2026年時点の実運用では注意点も多い。指数が高いモデルほど推論トークン数が増えやすく、コストと応答速度が悪化する傾向があるため、スコアだけで導入判断すると相場感からずれた予算設計になりやすい。現場での選び方としては、指数はモデル選定の一次フィルタに留め、自社タスクでの精度・レイテンシ・コストを個別に検証してから本番採用するのが実務的とされる。
知能指数 (Artificial Analysis Intelligence Index)の使用例
- GPT-5.5やClaude 5などのモデル発表時に、知能指数のスコア比較が性能アピールの根拠としてよく引用される。
- モデル選定では「知能指数は僅差でもコストが数倍違う」という理由で安価なモデルを選ぶ現場もあるとされる。
知能指数 (Artificial Analysis Intelligence Index)に関連するAIツール
知能指数 (Artificial Analysis Intelligence Index)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1518語以上を体系的に整理しています