![]()
Vending Benchとは?AIに自販機経営を365日任せて分かること (2026年版)
この記事のポイント Vending-Bench 2は、AIに$500を渡して自動販売機ビジネスを365日運営させ、判断のブレなさを測る評価です。 毎日$2の設置料が引かれ、仕入れ先とのやり取りや値付けも自分で決めます。 短い試験では満点でも、数百日後に在庫と資金のつじつまが合わなくなるモデルがあります。 2026年7月更新のリーダーボードには4モデルが載り、上位圏で最も安いのはAnthropicのClaude Opus 4.6(入力100万トークンあたり$5.00、スコア8017.590)でした。
AIに仕事を任せてみたら、最初の1週間は完璧だったのに、1か月後には話が噛み合わなくなっていた。そんな経験があるなら、この評価は刺さります。
Vending Benchが測っているのは賢さではありません。しつこさです。
Vending Benchとは、AIに自販機を1年間任せる耐久テストです

Vending Benchとは、AIエージェントに小さな自動販売機ビジネスを長期間運営させ、判断の一貫性を測るベンチマークです。開発したのはAndon Labs。実際に自動販売機の無人運営を手がけてきた経験が、そのままシミュレーションの設計に落とし込まれています。
一般的なAI評価は、問題を出して答え合わせをする形式です。数学、コード、常識問題。どれも数分で終わります。
Vending Benchは違います。1回の試行が365日分。AIは在庫を切らさないように仕入れ、価格を決め、赤字にならないよう資金を見張り続けます。
ここが肝心なところ。1日目の判断が300日目に効いてくる設計になっているため、途中で自分の方針を忘れたモデルは、どれだけ賢くても最終的な数字で負けます。
賢さと粘り強さは別の能力。それを分けて測ろうとしたのが、この評価の出発点です。
なぜ自販機なのか — 短いテストでは見えないもの

自販機経営が選ばれた理由は、ビジネスとしての最小構成だからです。仕入れ、在庫、値付け、固定費。この4つだけで、利益が出るか出ないかがはっきり決まります。
複雑すぎると何が原因で失敗したのか分かりません。単純すぎると差が出ません。その中間に自販機がありました。
もうひとつ大きいのは、ごまかしが効かない点です。文章の評価なら「それっぽい答え」で部分点が取れます。資金残高は違います。判断がずれれば、そのまま数字が減る。
- 仕入れすぎれば現金が尽きる
- 仕入れなければ売る物がない
- 値段が高ければ売れない
- 値段が安ければ利益が出ない
このトレードオフを365日、誰にも相談せずに回し続ける。人間なら退屈でうんざりする作業です。
AIの実務適性を知りたいなら、実はこの退屈さこそが本番に近い。社内で何かを自動化するとき、AIに任せたい仕事の大半は、派手な推論ではなく地味な繰り返しだからです。社内業務にAIを入れる話は内部監査・チェック業務のAI活用でも触れていますが、そこでも効いてくるのは「毎回同じ基準で判断できるか」でした。
Vending-Bench 2では何が変わった?

初代Vending-Benchが「AIエージェントの長期一貫性を測る」という問題設定を示したのに対し、Vending-Bench 2はその環境を実務寄りに作り込んだ後継版です。
大きな変更は、現実の面倒くささを持ち込んだことです。
複数の仕入れ先が登場し、AIはメールでやり取りしながら取引口座の開設や価格表の入手を進めます。相手はすぐ返事をくれるとは限りません。条件も一律ではありません。
つまり、AIは「注文する」ボタンを押すのではなく、交渉から始めることになります。
| 項目 | 初代Vending-Bench | Vending-Bench 2 |
|---|---|---|
| 主眼 | 長期一貫性という問題提起 | 実運営に近い環境での再現 |
| 仕入れ | 単純化された調達 | 複数サプライヤーとのメール交渉 |
| 期間 | 長期シミュレーション | 365日(1年)で固定 |
| 評価 | 資産の推移 | スコア化してリーダーボード公開 |
つまり2は、「賢いか」ではなく「1年間まともに商売を続けられるか」を測る方向へ振り切った改訂です。
環境が現実に近づくほど、モデル間の差は開きます。手順が決まった作業ならどのモデルもこなせますが、相手のいる交渉は選択肢が無限にあるからです。
シミュレーションの中身:$500、$2、365日

数字を並べたほうが早いので、公開されている設定をまとめます。
| 設定項目 | 値 |
|---|---|
| 初期資金 | $500 |
| 運営期間 | 365日(シミュレーション) |
| 1日あたりの設置料 | $2 |
| 仕入れ先 | 複数(メールで交渉) |
| AIが決めること | 発注量・価格・在庫管理 |
この設定、地味に厳しいです。設置料だけで年間$730。初期資金$500を上回ります。
つまり初日から「売って増やす」以外に生き残る道がない構造。手をこまねいていれば、何もしなくても資金は溶けていきます。
在庫を抱えすぎれば現金が尽き、慎重すぎれば固定費に食われる。この綱渡りを365回繰り返すわけです。
人間の小規模事業者が最初にぶつかる壁と、ほぼ同じ形をしています。
AIエージェントはどこで壊れる?
長時間タスクでAIが崩れるパターンは、だいたい似た形をしています。Vending Bench系の評価が浮かび上がらせたのは、能力不足よりも自分の状態を見失うことが致命傷になる点でした。
代表的な崩れ方を整理します。
| 崩れ方 | 何が起きるか | 現実の業務での例 |
|---|---|---|
| 記憶のすり替え | 過去の自分の決定と矛盾した行動を取る | 先週決めた運用ルールを無視して処理する |
| 在庫と帳簿のズレ | 実際の在庫と認識がずれ、発注が暴走する | 対応済みの案件を再度処理してしまう |
| 過剰な様子見 | 損を恐れて動かず、固定費だけが減っていく | 判断を保留し続けて期限を落とす |
| 交渉の空回り | 相手の返信を読み違え、取引が成立しないまま日数が過ぎる | メール対応が堂々巡りになる |
一番怖いのは2番目です。間違っていることに本人が気づいていないので、途中経過を見ても正常に見えます。気づくのは残高がおかしくなってから。
短いテストでこの症状は出ません。50ターン程度なら、どのモデルもきれいに動きます。
ここまでの整理をひとことで言うと、Vending Benchは「AIが賢いか」ではなく「AIが自分の過去を正しく引き継げるか」を測る装置です。
リーダーボードの読み方 — 順位よりコスト効率
公開されているリーダーボードは、2026年7月に更新されました。掲載は4モデル。
ここで注目したいのは1位が誰かではありません。上位圏の中でいくら払うかです。
| 公開されている値 | 内容 |
|---|---|
| 最終更新 | 2026年7月 |
| 掲載モデル数 | 4 |
| 上位圏で最安のモデル | Claude Opus 4.6(Anthropic) |
| そのスコア | 8017.590 |
| そのモデルの入力単価 | 100万トークンあたり$5.00 |
「首位から10%以内」という枠の中で最も安かったのがClaude Opus 4.6、という並びになっています。つまりトップ集団の性能差はそれほど大きくなく、差がついているのは価格側。
長時間タスクではここが効きます。365日分の思考を回すと、消費するトークン(AIが扱う文字のかたまり)は膨大になるからです。単価がわずかに違うだけで、請求額は何倍にもなります。
スコアだけを見て一番上を選ぶのは、正直もったいない選び方。実運用では「必要な精度に届いている中で一番安いもの」が一択です。
各モデルの素の性能を比べたい場合はClaude、ChatGPT、Geminiの各ページに料金と特徴をまとめてあります。
リーダーボードのスコアはそのまま信じていい?
半分は信じていい、というのが妥当な線です。
信じていい部分は、長時間で崩れるかどうかの傾向。これは他のベンチマークではほぼ測れません。数学やコードの点数が高くても、300日目に破綻するモデルはあります。その情報はここでしか手に入りません。
慎重に扱うべき部分は3つあります。
- 掲載は4モデルのみ。市場にあるモデル全部を網羅した表ではありません
- 環境は自販機です。あなたの業務と構造が違えば、順位も変わり得ます
- スコアは一定の条件下での結果です。設定を変えれば結果も動きます
要するに、採用の決め手ではなく、足切りの材料として使うのが現実的です。「長期タスクで崩れるモデルを外す」用途には強い。「うちの業務で一番良いモデルを決める」用途には足りません。
ベンチマークの数字を鵜呑みにしない姿勢は、画像生成の分野でも同じです。ComfyUIとStable Diffusionの比較を見ると、公開スコアと実際の使い勝手がずれる例が分かりやすく出ています。
業務で「長期一貫性」が効く場面はどこ?
自販機の話が自社に関係あるのか、という疑問はもっともです。関係するのは、AIに継続的な判断を任せたい場面すべて。
具体的にはこのあたりです。
- 問い合わせ対応を数か月にわたり同じ基準で捌く
- 在庫や発注の推奨を毎日出し続ける
- 定期レポートを同じ観点で書き続ける
- 案件のステータスを追いかけて漏れを拾う
どれも1回きりなら簡単。3か月続けると、基準がだんだんずれていきます。
人間の担当者でも起きる劣化ですが、人間は「あれ、前と違うな」と気づきます。AIは気づかない。だから気づける仕組みを外側に作る必要があるという結論になります。
リサーチ業務のように長期の文脈を持ち越す作業なら、Feloの使い方ガイドで紹介している検索ベースの進め方のほうが、記録が残るぶん扱いやすいこともあります。
自社の仕事に置き換えるとどう測る?
Vending Benchをそのまま社内で回すのは現実的ではありません。ただ、考え方は移植できます。
必要なのは4つの要素だけです。
| 要素 | Vending Benchでの実装 | 自社での置き換え例 |
|---|---|---|
| 明確なゴール | 資産を増やす | 処理件数と正答率 |
| 時間経過 | 365日 | 30日分のログを連続で流す |
| 減っていくコスト | 1日$2の設置料 | APIの利用料と人の確認時間 |
| ごまかせない結果 | 残高 | 人が後から検算できる数値 |
要するに、数か月分の実データをまとめて食わせて、途中でおかしくならないかを見るという設計です。
やり方はシンプル。過去の実務ログを時系列で並べ、AIに順番に処理させます。そして最初の10件と最後の10件で、判断基準が同じかを人が見る。
ここで基準がずれていたら、そのモデルは長期運用に向きません。プロンプト(AIへの指示文)を直すか、定期的に文脈をリセットする運用に切り替えます。
評価コストを抑えたいなら、全期間を一度に流さず、100件ごとに区切って比較するだけでも十分に傾向は出ます。
エージェントを長持ちさせる4つの設計
崩れるのが分かっているなら、崩れない作りにすればいい話です。Vending Bench系の失敗パターンから逆算すると、有効な手はだいたい決まってきます。
1. 状態を外に置く 在庫や残高のような数字は、AIの記憶ではなくファイルやデータベースに持たせます。AIには毎回そこを読ませる。記憶に頼らせないのが最優先。
2. 定期的に方針を読み直させる 最初に決めたルールを、一定間隔で再提示します。人間の朝礼と同じ役割。
3. 異常値でアラートを出す 残高や件数が想定範囲を外れたら止める。AIの自己申告ではなく、外側の仕組みで検知します。
4. 取り返しのつく単位で動かす 1回の判断で失える金額に上限をかけます。365日任せきりにしない。
この4つを入れると、モデルの素の一貫性が多少弱くても実用範囲に収まります。逆に言えば、設計でカバーできるので、スコア1位のモデルを無理に取りに行く必要はありません。
エージェント型のツールを探しているなら、AIエージェントのカテゴリに主要な選択肢をまとめてあります。
導入前のチェックリスト
AIに長期タスクを任せる前に、この6項目を確認してください。ひとつでも空欄があるなら、まだ本番投入は早いです。
| 確認項目 | 判断基準 |
|---|---|
| 成功の定義 | 数字1つで言えるか |
| 停止条件 | どうなったら止めるかが決まっているか |
| 状態の保存先 | AIの記憶の外にあるか |
| 検算の担当 | 誰がいつ確認するか決まっているか |
| コスト上限 | 月額の天井を設定したか |
| 巻き戻し手段 | 間違えた処理を戻せるか |
特に4番目。ここが空欄のまま走らせた自動化は、だいたい半年後に事故として発覚します。
チェックが埋まったら、まずは1週間分から。いきなり365日は誰も推奨しません。
関連する比較・代替を見る
長期タスクを任せるモデル選びで迷ったら、このあたりの比較が参考になります。
- ChatGPT vs Claude — 長文の文脈保持と料金の考え方の違い
- Claude vs Gemini — 長時間の作業でどちらが安定するか
- ChatGPT vs Gemini — 汎用タスクでの使い分け
- Claudeの代替ツール — 同等の用途を安く回したい場合
- ChatGPTの代替ツール — 業務要件が特殊な場合の選択肢
用途がSNSや社内チャットへの組み込みなら、Meta AIの使い方で無料枠の範囲を確認してからのほうが無駄がありません。
AI PICKS編集部の判定
Vending Benchは、公開ベンチマークの中でもかなり実務寄りの部類です。参考にする価値は十分あります。
評価したいのは問題設定。「1年間まともに商売を続けられるか」という問いは、AIを業務に入れる側が本当に知りたいことと重なっています。数学やコードの点数を眺めていても、この情報は手に入りません。
ただし、掲載モデルが4という点は物足りない。市場にはもっと多くの選択肢があり、この表だけで選定を完結させるのは無理があります。順位表としては未完成です。
使い方としては、足切りに使って、最終判断は自社データで下す。これが一択です。スコアの絶対値を追いかけるより、上位圏の中で単価が安いものを選び、崩れる前提で監視の仕組みを外側に作るほうが、結果的に安く済みます。
長期タスクを任せる前提でモデルを選ぶなら、このベンチマークは見ておいて損はありません。ただ、鵜呑みにするには早い。そういう温度感です。
よくある質問(FAQ)
Q. Vending Benchは誰でも見られますか?
リーダーボードはWeb上で公開されており、閲覧は無料です。運営はAndon Labsで、公式サイト(https://andonlabs.com)から辿れます。日本語版の公開情報はありません。
Q. Vending-Bench 2の設定を教えてください
初期資金$500、運営期間は365日分のシミュレーション、1日あたり$2の設置料がかかります。AIは複数の仕入れ先とメールでやり取りしながら、発注量と価格を自分で決めます。
Q. 現時点で何モデルが評価されていますか?
2026年7月更新のリーダーボードには4モデルが掲載されています。首位から10%以内の集団で最も入力単価が安いのはClaude Opus 4.6で、スコアは8017.590、入力100万トークンあたり$5.00です。
Q. スコアが高いモデルを選べば業務でも安心ですか?
そうとは限りません。評価環境は自販機経営に固定されており、業務の構造が違えば結果も変わります。長期タスクで崩れるモデルを外す用途には有効ですが、最終判断は自社データでの検証が必要です。
Q. なぜ短いテストでは長期一貫性が測れないのですか?
50ターン程度なら、ほとんどのモデルが問題なく動くからです。判断のズレは数百ターンを超えたあたりから蓄積し、本人が気づかないまま積み上がります。期間を延ばさないと症状が出ません。
Q. 自社でも似た評価はできますか?
できます。過去の実務ログを時系列で連続処理させ、最初の10件と最後の10件で判断基準が同じかを人が確認する方法が手軽です。全期間を流さず、100件ごとの区切りでも傾向はつかめます。
Q. AIが長期タスクで崩れるのを防ぐ方法はありますか?
状態をAIの記憶ではなく外部ファイルに持たせる、一定間隔で方針を読み直させる、異常値を外側の仕組みで検知する、1回の判断で失える額に上限をかける。この4つで実用範囲に収まります。
Q. Vending Benchと初代の違いは何ですか?
2では複数の仕入れ先が登場し、メール交渉を経て取引を成立させる必要があります。手順が決まった作業から、相手のいる交渉へ。環境が現実に近づいたぶん、モデル間の差が開きやすくなりました。
長期タスクにAIを組み込む話の次は、判断基準を揃えたまま業務を回す仕組みづくりが課題になります。内部監査・チェック業務のAI活用は、まさに「毎回同じ基準で判断できるか」を扱っているので、この記事の続きとして読むと具体策が見えてきます。ビジュアル面の自動化を考えているならAIイラストツールの比較も合わせてどうぞ。
各ツールの公式サイト(一次情報)
料金・機能・対応範囲は各社公式が一次情報です。本記事は公開時点の検証に基づきますが、最新かつ正確な条件は必ず各公式ページで確認してください。
- Claude — 公式サイト(AI PICKSの詳細)
- ChatGPT — 公式サイト(AI PICKSの詳細)
- Gemini — 公式サイト(AI PICKSの詳細)
