YOLOとは、1枚の画像を1回だけ処理して、写っているモノの「名前」と「位置」を同時に答える物体検出AIです。2026年時点の現役は実質3つ。YOLOv8、YOLO11、そして2026年1月に公開されたYOLO26。開発元のUltralyticsは、新規プロジェクトの出発点としてYOLO26を公式に推奨しています。
番号が飛び飛びなのは、あなたの読み落としではありません。10年のあいだに作り手が何度も入れ替わり、別のチームが同じ「YOLO」を名乗ってきた結果です。
だから全部を覚える必要はありません。現役の3つだけで足ります。
YOLOとは何をしてくれるAIなのか?
YOLOは画像を1回だけ処理して、物体の名前・位置・確からしさを同時に返すAIモデルです。物体検出という分野の、事実上の共通語になっています。

名前は "You Only Look Once" の頭文字。日本語なら「見るのは一度だけ」。何度も見返さずに一発で答える設計思想が、そのまま名前になりました。
返ってくる答えは3点セットです。
- バウンディングボックス: 物体を囲む四角い枠の座標
- クラスラベル: その枠が何なのか(人、車、ネコ)
- 信頼度スコア: どれくらい確からしいか(0〜1の数値)
ここで「画像分類」と混ぜないでください。分類は写真1枚につき「これはネコの写真です」と1つ答えるだけ。検出は「左上にネコが1匹、右下にもう1匹、信頼度0.91と0.78」と、数と位置まで返します。
工場の検品も、店舗の来客カウントも、駐車場の空き判定も、必要なのは後者です。分類では「何個あるか」に永遠にたどり着けません。ここが最初の分かれ道。
「AI」と「機械学習」の言葉の関係がまだあいまいなら、AIと機械学習の違いを3分で理解する記事を先に読むと、この先の専門用語が軽くなります。書類の文字を読み取りたいだけの人は、そもそもYOLOの出番ではなくOCRの領分なので、AI OCRツールの比較記事へ寄り道したほうが早いです。
では、なぜ「一度だけ」がそこまでの武器になるのでしょうか。
なぜ1回見るだけで速いのか?
YOLOは画像を格子状のマス目に区切り、全マスが「ここに何かあるか」「あるなら何か」を同時に予測します。候補を切り出してから判定する二段構えを、1つのネットワークに畳み込んだのが速さの正体です。

YOLO以前の主流は2工程でした。物体がありそうな場所を数百か所ぶん切り出し、そのあと1つずつ「これは何か」を判定する。候補の数だけ処理が積み上がるので、当然遅いです。
YOLOは切り出す工程そのものを消しました。
処理の流れを並べると差がはっきりします。
| 工程 | 従来の | YOLO |
|---|---|---|
| 候補の切り出し | 数百か所を個別に生成 | なし |
| 判定 | 候補ごとに1回ずつ | 画像全体で1回 |
| 出力 | 統合処理が必要 | 枠・ラベル・スコアが同時 |
つまり処理回数が「候補の数」ではなく「1」に固定されます。これが速度差の全部です。
効いてくるのは動画のときです。防犯カメラの映像は1秒あたり15〜30枚の画像の連続なので、1枚あたりが遅いと即座に破綻します。リアルタイム検出の定番がYOLOになったのは、この構造のおかげ。
速さはチューニングの結果ではなく、設計から出ている。だから10年たっても同じ名前で呼ばれ続けています。
その10年で、作り手は何度も交代しました。
バージョン番号はなぜ飛ぶのか?
YOLOの番号が順番に並ばないのは、1つのチームが育てたシリーズではないからです。初代論文は2015年6月(arXiv:1506.02640)。以来ほぼ毎年、別の研究者や企業が新版を名乗ってきました。

系譜を並べると、混乱の理由がわかります。
| バージョン | 発表時期 | 主な |
|---|---|---|
| YOLOv1 | 2015年6月 | Joseph Redmon |
| YOLOv2 | 2016年12月 | Joseph Redmon |
| YOLOv3 | 2018年4月 | Joseph Redmon, Ali Farhadi |
| YOLOv4 | 2020年4月 | Alexey Bochkovskiy |
| YOLOv5 | 2020年6月 | Ultralytics |
| YOLOv6 | 2022年6月 | 美団(Meituan)技術チーム |
| YOLOv7 | 2022年7月 | Alexey Bochkovskiy |
| YOLOv8 | 2023年1月 | Ultralytics |
| YOLOv9 / v10 | 2024年 | 大学研究チーム(台湾・清華大学ほか) |
| YOLO11 | 2024年9月 | Ultralytics |
| YOLOv12 | 2025年2月(arXiv:2502.12524) | 大学研究チーム |
| YOLO26 | 2026年1月 | Ultralytics |
つまり「v12がv11より新しくて強い」とは限りません。開発元が違えば、比べる土俵も違うからです。
見るべき線は1本だけ。Ultralyticsが出したもの(v5・v8・YOLO11・YOLO26)が、ドキュメント・学習コード・エコシステムまで揃った本流です。v9・v10・v12は大学発の研究成果で、論文としての価値は高いものの、日本語の情報も導入事例も圧倒的に少ない。
YOLO11で「v」が消えたのも混乱のもとですが、これは表記の変更だけ。YOLOv11ではなくYOLO11が正式名です。YOLO26も同じ流儀で、西暦の下2桁が入っています。
研究論文を追う立場でないなら、v9・v10・v12は無視していい。ここは割り切りが正解です。
では現役3つの中身を見ます。
毎週月曜の朝に、今週のAIの主なニュース・新しく載ったツール・よく読まれた記事をまとめて届けます。登録特典は「AIツール選定チェックリスト 2026」。
確認メールのボタンを押すと登録が完了します。配信はいつでも解除できます。
YOLOv8・YOLO11・YOLO26はどこが違うのか?
3つの違いは「枯れているか」「新しいか」の一軸でほぼ説明がつきます。YOLOv8が情報量で最強、YOLO11が中間、YOLO26が性能で最前線です。
比較の前提として、それぞれの立ち位置を1行で。
| モデル | 公開 | 立ち位置 |
|---|---|---|
| YOLOv8 | 2023年1月 | 日本語情報が最も多い。既存案件の主力 |
| YOLO11 | 2024年9月 | v8の正統進化。移行コストが小さい |
| YOLO26 | 2026年1月 | NMS不要。CPU推論がYOLO11比で最大43%高速 |
つまり、いま新しく作るならYOLO26、すでにv8で動いているなら触らない。これが結論です。
YOLO26の目玉はNMSフリーという設計変更。NMS(Non-Maximum Suppression)とは、同じ物体に重なって出てしまった枠を後から1つに間引く処理のことです。従来のYOLOは、推論のあとにこの後片付けを必ず走らせていました。
YOLO26はこの工程をモデル本体に組み込み、後処理そのものを消しました。効くのは2点。
- 速くなる: 後処理の時間が丸ごと消えるので、CPUでの推論がYOLO11比で最大43%高速
- 読みやすくなる: 処理時間がブレなくなり、「何ミリ秒で返るか」が予測しやすい
とくに2つ目が地味に効きます。工場のラインやドローンのように「遅れたら破綻する」現場では、平均速度より最悪値の安定が価値を持つからです。
YOLO26はGPUのない環境を狙って設計されています。産業用カメラ、スマホアプリ、GPUを積めないIoT機器。ここに一番効きます。
対応タスクも、検出だけではありません。領域を塗り分けるセグメンテーション、画像分類、人の関節を推定するポーズ推定、傾いた枠を扱うOBB(回転バウンディングボックス)まで、YOLO26は1系統でカバーします。サイズもNanoからExtra Largeまで5段階。
ここまでの整理: YOLOは「1回見るだけ」で速い。番号が飛ぶのは作り手が違うから。現役はv8・YOLO11・YOLO26の3つで、新規ならYOLO26が公式の推奨。ここから先は、あなたが実際に選ぶ段の話です。
残る問題は、n〜xのどれを選ぶか。
モデルサイズn〜xはどう選ぶのか?
YOLOには同じバージョンの中に5段階のサイズがあります。選び方はシンプルで、まずnano(n)で試し、精度が足りなければ1段上げる。これだけです。
ファイル名の末尾に付くアルファベットがサイズを表します。
| 記号 | 呼び名 | 向いている |
|---|---|---|
| n | nano | スマホ、ラズパイ、GPUなしのPC |
| s | small | 一般的なノートPC、軽いGPU |
| m | medium | 業務用GPU、精度と速度の折衷 |
| l / x | large / extra large | サーバー、精度最優先の検証 |
つまり、下に行くほど賢く、重く、お金がかかります。
やりがちな失敗は、いきなりxから始めること。「せっかくなら一番いいやつ」と考える気持ちはわかりますが、これは高確率で遠回りになります。学習に何時間もかかり、推論も重く、そのうえ「そもそもデータ側の問題だった」と後で判明するパターンが多いからです。
nano版なら学習も推論も軽く、失敗に気づくのが早い。試行回数を稼げるほうが結果的に速く着地します。
判断の目安は単純です。
- リアルタイム性が最優先(カメラ映像、動画)→ nまたはs
- 精度が最優先(静止画を後からまとめて解析)→ m以上
- 迷ったら → nで始めて、足りなければ上げる
なお、精度が出ない原因の大半はモデルサイズではなく学習データです。枚数が足りない、アノテーション(正解の枠付け)が雑、撮影条件が本番とズレている。サイズを上げる前にここを疑うほうが、はるかに効率がいい。
サイズが決まったら、いよいよ動かす段です。
無料で動かす最短手順は?
Google Colabなら、環境構築ゼロ・費用ゼロで5分以内に動きます。Pythonのインストールもドライバ設定も不要です。

Google Colabとは、ブラウザ上でPythonを動かせるGoogleの無料サービスのこと。GPUも無料枠で使えます。手順はこの流れです。
- Googleアカウントでcolab.research.google.comを開き、新規ノートブックを作成
- メニューの「ランタイム」→「ランタイムのタイプを変更」でGPUを選択
- 下のコードを貼り付けて実行
!pip install ultralytics
from ultralytics import YOLO
model = YOLO("yolo26n.pt") # 学習済みモデルを自動ダウンロード
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show() # 検出結果を表示
実質5行。学習済みモデルは初回実行時に自動で落ちてくるので、事前準備はいりません。バス・人・自転車に枠が付いて返ってくれば成功です。
この学習済みモデルはCOCOという公開データセットで訓練されていて、人・車・イヌ・ネコ・イスなど80種類を最初から認識できます。「一般的なモノを数えたいだけ」なら、これで完成です。
自分のデータで学習させたい場合も同じ構造で書けます。
model = YOLO("yolo26n.pt")
model.train(data="mydata.yaml", epochs=100, imgsz=640)
必要なのは画像と、それに対応するアノテーション(正解の枠)のファイル。目安として1クラスあたり最低100枚、実用なら500枚以上ほしいところです。
ただし、ここからが本題。「無料で動いた」と「無料で使ってよい」は別の話です。
AGPL-3.0ライセンスの落とし穴とは?
Ultralytics製のYOLO(v5・v8・YOLO11・YOLO26)はAGPL-3.0というライセンスで公開されています。無料ですが、商用サービスに組み込むと自社のソースコードを公開する義務が発生しうるのが最大の注意点です。
AGPL-3.0を一言でいうと「これを使うなら、あなたのコードも同じ条件で公開してね」というルール。しかも「ネットワーク越しにサービスとして提供する場合」も公開義務の対象に含まれます。ここが普通のGPLと違う、いちばん怖い部分です。
用途別に整理します。
| 用途 | AGPL-3.0のまま |
|---|---|
| 個人の趣味・学習 | 問題なし |
| 大学・研究機関の研究 | 問題なし |
| 社内検証(外部提供なし) | おおむね問題なし。要法務確認 |
| 自社サービスに組み込んで提供 | ソース公開義務のおそれ。商用ライセンス検討 |
つまり、外に出すものに使うなら止まって確認する。これが鉄則です。
「社内で使うだけだからセーフ」という判断も、実は微妙です。社内システムでも、ネットワーク越しに他部署が使う形なら解釈が割れます。SaaSとして外部提供するなら、ほぼ確実にアウト。
正攻法は商用ライセンス(Enterprise License)の購入です。Ultralyticsが有償で提供しており、これを買えばソース公開義務から解放されます。日本では2026年7月29日から、エクセルソフトがUltralyticsの販売代理店として国内販売を開始しました。日本語での見積もり・購入手続きに対応します。円建てで買えるのは、稟議を通す側からすると圧倒的にラクです。
ライセンス料は公開されていないため、金額は個別に問い合わせる前提で考えてください。
回避策としてAGPLでないモデルを選ぶ手もあります。YOLOv9やYOLOv10の一部実装、あるいはMITライセンスで公開されている派生モデル。ただし情報量とサポートで大きく劣るため、開発コストで相殺されがちです。
法務リスクを技術で回避しようとするのは、たいてい高くつく。素直に商用ライセンスを検討したほうが早い場面が多いです。
お金の話が出たので、ライセンス以外のコストも見ておきます。
実際いくらかかるのか?
YOLO本体は無料ですが、動かす環境にお金がかかります。学習にはGPUが要り、ここが費用の中心です。
代表的な選択肢を並べます。
| 手段 | 費用感 | 向いている |
|---|---|---|
| Google Colab無料枠 | 0円 | まず試す。時間制限あり |
| Google Colab有料プラン | 月額課金 | 継続的に学習を回す |
| クラウドGPU(AWS / GCP等) | 従量課金 | 本番運用・大規模学習 |
| GPU搭載PCを自前調達 | 初期20万円〜 | 長期で回数を打つなら |
つまり、検証はColab無料枠、本番はクラウドか自前GPU。段階を分けるのが定石です。
無料枠でどこまでいけるかというと、nanoモデル+数百枚の画像なら十分に学習できます。制約は連続使用時間で、長時間の学習中に切断されることがある点。落ちたら学習をやり直しなので、無料枠で100エポック回すのは現実的でないと考えたほうがいいです。
推論だけならCPUでも動きます。とくにYOLO26はCPU推論を強く意識した設計なので、GPUなしの業務PCでも実用速度が出ます。「学習は借りたGPUで、推論は手元のPCで」が、いちばん財布に優しい構成。
見落とされがちなのが人件費です。学習データのアノテーション、つまり画像1枚ずつに正解の枠を付ける作業。1,000枚規模なら数十時間かかります。ここを外注すると、GPU代よりはるかに大きい金額が動きます。
本当のコストはGPUではなくデータ作りにある。ここを見積もりに入れていない計画は、だいたい途中で止まります。
自動化の設計そのものを見直したい人は、AI自動化ツールのカテゴリに業務側から攻める選択肢が並んでいます。画像を「作る」側に興味が移った人はAI画像生成のカテゴリへ。
ここまでで技術とお金は揃いました。最後に、使う場面の話です。
どんな現場で使われているのか?
YOLOが強いのは「数える」「見張る」「見つける」の3つです。人間がやると疲れて精度が落ちる作業と、きれいに噛み合います。
代表的な使い方を挙げます。
- 製造ラインの外観検査: キズ・欠け・異物を検出。24時間まばたきしない
- 店舗の人数カウント: 入店数・滞留エリアの把握。売場の改善判断に直結
- 駐車場の空き検出: カメラ1台で複数区画を同時に判定
- 農業の生育管理: ドローン画像から作物・病害を検出
つまり、対象が視覚的に区別でき、かつ数や位置が意味を持つ業務ならほぼ適用できます。
とくに製造業での定着が早い。目視検査は人依存になりやすく、夜勤帯で精度が落ちる悩みが構造的にあるからです。製造業でどこから手を付けるかを整理したい人は、製造業のAI始め方ガイドに導入順の考え方がまとまっています。店舗側なら小売・店舗運営のAI活用ガイドのほうが近いです。
逆に、YOLOが向かない仕事もはっきりしています。
- 書類の文字を読む(OCRの領分)
- 顔から個人を特定する(顔認証は別技術)
- 画像の雰囲気や良し悪しを判定する(分類・評価モデルの領分)
「画像を扱うAI=YOLO」ではありません。検出したい対象が「四角い枠で囲める物体」かどうかが、適用の分かれ目です。画像認識全体の地図を持っておきたいなら、AI画像認識の基礎をまとめた記事が最短で視界が開けます。
疑問が残りやすい点をまとめておきます。
編集部の評価
公開情報とドキュメントを突き合わせた率直な評価として、YOLOは「使えるかどうか」を議論する段階を10年前に終えた技術です。2026年に判断すべきは、どのバージョンを選ぶかと、ライセンスをどう処理するかの2点だけ。
YOLO26のNMSフリー設計は、地味に見えて大きい変更です。速度が最大43%上がったこと以上に、処理時間がブレなくなったことに価値がある。リアルタイム処理の現場では、平均値より最悪値の安定が効きます。GPUなしで戦える幅が広がったのは破格です。
一方で、素直にイマイチだと思う点もあります。バージョン名の混乱は完全に開発側の都合であり、初学者にとって不親切きわまりない。v12がYOLO26より新しそうに見える表記は、検索で最初に当たる人を確実に迷わせます。「番号が大きいほうが新しい」が通じない技術は、そこだけで学習コストを1段上げている。
そしてAGPL-3.0。無料で強力なモデルが手に入る代償として、商用利用のハードルは決して低くありません。「とりあえずPoC(試作検証)まで無料、本番で有償」という設計は合理的ですが、有償ライセンスの金額が公開されていない以上、予算を先に組みたい企業は動きづらい。ここは正直、使う側が構えざるを得ない部分です。
エクセルソフトによる国内販売開始(2026年7月29日)は、この壁を1枚だけ薄くしました。円建てで見積もりが取れて日本語でやり取りできるのは、社内稟議を通す立場からすると重宝します。海外ベンダーとの直接契約が障壁になっていた企業には、ここが転機になります。
総評として、新規プロジェクトでYOLO26を選ばない理由は見当たりません。一択です。ただし「本番投入の前に法務を通す」を工程表に最初から書いておくこと。後から気づくと、開発が終わってから止まります。
よくある質問(FAQ)
Q. YOLOを使うのにプログラミングの知識は必要ですか?
Pythonの基本文法がわかれば十分です。学習済みモデルを動かすだけなら5行程度で、コピペでも動きます。ただし自分のデータで学習させる段階では、ファイル構成の設計やエラーの読み解きが必要になるので、初歩の知識は要ります。プログラミング自体が未経験なら、まずColabで学習済みモデルを動かすところまでを目標にするのが現実的です。
Q. YOLOv8で動いているシステムを、YOLO26に移行すべきですか?
急ぎません。動いているものを触るのは、明確な理由があるときだけにしてください。移行を検討すべきなのは「処理速度が足りない」「CPU環境に移したい」「新機能が必要」のいずれかに当てはまる場合です。Ultralytics製どうしなのでコードの書き方はほぼ共通ですが、再学習と検証のコストは必ず発生します。
Q. YOLO26とYOLOv12はどちらが新しいのですか?
YOLO26です。YOLOv12は2025年2月に大学研究チームから発表されたもので、YOLO26は2026年1月にUltralyticsから公開されました。番号の大小は発表順を表しません。開発元が別なので、そもそも連番として比較する前提が成り立たないからです。
Q. GPUがないパソコンでも使えますか?
推論(検出の実行)ならCPUだけでも動きます。とくにYOLO26はCPU環境を狙って設計されており、YOLO11比で最大43%速くなっています。一方、学習はCPUだけだと現実的な時間で終わりません。学習はGoogle Colabなどの無料GPUを借りるのが定石です。
Q. 日本語の対応はどうなっていますか?
モデル自体は画像を扱うので、言語は関係ありません。検出結果のラベル名("person"、"car"など)は英語で返りますが、表示時に日本語へ置き換えるだけの話です。公式ドキュメントは英語ですが、YOLOv8を中心に日本語の解説記事が豊富にあります。ライセンスについては、2026年7月29日からエクセルソフトが国内販売代理店として日本語対応しています。
次に読むならこれ
物体検出の手前にある「画像をAIがどう見ているか」が曖昧なままだと、YOLOの設定値をいじる根拠が持てません。AI画像認識の基礎をまとめた記事を1本読んでおくと、モデルサイズやデータ量の判断が自分の言葉でできるようになります。
