Artificial Analysisは、AIモデルとそれを動かす基盤を独自に測定して公開する、独立系のベンチマークサービスです。言語・画像・動画・音声・音楽のモデルに加え、モデルを提供するクラウド、チップ、エージェントまでを評価し、結果をWebサイトで公開しています。

主な機能

看板は、AA-Briefcase、GDPval-AA、AutomationBench-AA、SciCode、Humanity's Last Examなど10種類の評価を組み合わせた「Artificial Analysis Intelligence Index」です。ほかにもコーディングエージェントを比べるCoding Agent Index、サイバー領域のCyber Index、公開度を示すOpenness Indexなどを用意しています。各モデルの出力速度(1秒あたりのトークン数)、Intelligence Indexの1タスクあたりの平均コストを、プロバイダー別のグラフで比べられます。知能・速度・コストの優先度を選ぶと候補を示すModel Recommenderや、独自のベンチマークを作れるOptimaもあります。

規模と使い道

500以上のモデル、100以上の推論プロバイダー、1,000以上のエンドポイントを測定対象にしています。新しいモデルの評価結果が随時追加されるため、APIで使うモデルの選定、コストの見積もり、社内向けの比較資料づくりに使えます。

料金

サイトの閲覧は無料です。ベンチマーク結果を取得できる無料のData APIもあり、1日1,000リクエストまで使えますが、利用時はArtificial Analysisへの出典表示が必要です。より詳しいデータは商用APIとしてパートナー向けに提供されています。

注意点

サイトの表記は英語です。スコアは評価セットの構成に左右され、Intelligence Indexのバージョンが更新されると過去の数値と単純には比べられない点にも注意が必要です。