ChatGPTの発表内容
「ChatGPT」に連なる「GPT-6 Luna」を含む6種類のモデルに各100回プレイさせ、判断速度や得点を比較できます。
利用者はブラウザ上でAI同士の対戦を観戦できるほか、4体の敵キャラクターをAIに割り当てて直接対戦もできます。API(外部のプログラムと連携する仕組み)を使う場合、TypeSafeのモデルは100万入力トークン(AIが扱う言葉の単位)あたり0.042ドルで動作します。
リアルタイムの処理が必要な業務において、モデルごとの遅延や判断傾向を導入前に確かめる材料として使えます。迷路内での瞬時の意思決定データを見ることで、自社の用途に合った速度のモデルを選べます。
つまり、どういうこと?
ひらたく言うと、素早い反射神経が求められるゲームをAIに遊ばせて、頭の回転の速さを競い合わせるテストです。ビジネスでの問い合わせ対応や自動運転のように、迷っている暇がない場面でどのAIが一番頼りになるかを、ゲームのスコアと反応時間で見える化しています。
編集部の見方

反射神経の勝負。一般的な文章生成のベンチマークとは異なり、パックマンという逃げ場のない環境で判断速度を競わせる着眼点には思わず唸りました。
ただ、ゲーム画面上で各モデルの選択肢やオッズがリアルタイムに表示される仕組みは、かなり分かりやすいです。高額な検証環境を自前で作らずに済むため、即応性を重視する開発者なら一度ブラウザで動かしてみる価値があります。
今後はゲームだけでなく、工場の自動制御やチャットの即時応答といった実務に近い場面での比較データが増えていきそうです。筆者は次のメジャーアップデートで追加される新モデルのスコア差に注目したいところです。
誰に関係するか
リアルタイムな応答を求めるシステムを開発している人は、実戦的な遅延や判断精度を比較できるようになります。


