Hugging Faceの発表内容
Googleは2026年10月9日に、画像や動画の検索に使える小型モデル「EmbeddingGemma 2」を公開しました。AIモデル共有サイトのHugging Faceなどで配布しています。利用規約には商用利用が可能なApache 2.0を採用しました。
このモデルは、文字だけでなく写真や動画、音声の内容を数値データへ変換します。テキストのみなら約191MB、画像や音声を含めても約567MBのメモリー容量で端末上で動きます。
最長5.5分の音声や29枚の画像、58コマの動画をまとめて読み込めます。外部サーバーにデータを送ることなく、手元の端末だけで写真や録音データの横断検索を作れます。
つまり、どういうこと?
ひらたく言うと、手元のパソコンやスマートフォンだけで写真や動画の中身を検索できるようにする仕組みです。これまでは文字の検索が中心でしたが、声の録音から該当する動画の場面を探し出したり、写真を手がかりに似た画像を集めたりできます。
データをクラウドへ送らず手元の機器だけで計算できるため、会社の秘密情報や顧客のデータを外部に出さずに整理できます。
編集部の見方

端末で動かすAIといえば文字の要約が定番でした。そこへ画像や動画をまとめて処理できる小型モデルが出てきた点に驚きます。
手元の機材で動く軽さ。
クラウドに社内データを預けたくない現場にとって、有力な選択肢になりそうです。通信環境のない場所でも動くため、現場作業の記録整理などにも向いています。まずは先行する開発者向けライブラリでどの程度の実用速度が出るかを見届けたいところです。
誰に関係するか
社内の画像や音声データを外部に送信できない環境で仕事をしている人は、手元のPCだけで高速なメディア検索システムを構築できるようになります。
出典: Google ↗/ Impress Watch (AI Watch)も報道


