Gemma 4とOllamaとは?

Gemma 4とは、Googleが2026年4月2日に公開したオープンモデルです。Ollamaとは、こうしたAIモデルを自分のPCで動かすための無料ソフトです。
Gemma 4はApache 2.0ライセンスで配布されています。仕事で使っても、自社サービスに組み込んでも構いません。テキストに加えて画像・音声・動画を理解できる「マルチモーダル」なモデルとして発表されました。
Ollamaの役割は、モデルの形式変換やメモリ管理といった面倒な作業の肩代わりです。コマンド1行でモデルを落とし、そのまま会話を始められます。
Gemma 4そのものの特徴や各サイズの成り立ちを先に押さえたい方は、Gemma 4とは?E2B・E4B・26B・31Bの違いと無料で動かす方法・必要スペックを読むと、この先のサイズ選びが早くなります。Ollama自体の基本操作が初めてなら、Ollamaの使い方完全ガイドも手元に置いておくと安心です。
Gemma 4は公開初日から、Ollama以外の実行環境にも対応しました。代表的なものは次のとおりです。
- Ollama:コマンド1行で動く。初心者向けの定番
- LM Studio:画面操作で使えるデスクトップアプリ
- llama.cpp / MLX:細かく調整したい人向け。MLXはMac専用
- vLLM:複数人で同時に使うサーバー向け
個人のPCで試すなら、Ollamaが一番手数が少ない選択です。ここからはOllama前提で進めます。

編集部のおすすめ
ローカルLLMを
大きなモデルほどメモリやVRAMが要ります。統合メモリの多いミニPCや、GPU搭載のデスクトップが候補です。
GMKtec(ミニPC)Ryzen AI搭載で統合メモリの大きいミニPCがあり、机の上に置ける大きさでローカルLLMを動かせる
ミニPC / Ryzen AI搭載モデルあり(価格は公式ストアで確認)
FRONTIER(BTOパソコン)GeForce RTX搭載のデスクトップを構成を選んで買える。VRAMの大きいGPUも選べる
BTOパソコン / GeForce RTX搭載モデルあり(構成と価格は公式で確認)

Gemma 4はどのサイズを選ぶ?5モデルの性能差

性能だけで選ぶなら31B、速さとのバランスなら26B A4Bが本命です。12Bは16GBクラスのPCで動かせる「ちょうどいい中間」にあたります。
Google公式のモデルカードに載っている主要ベンチマークを並べます。比較用に前世代のGemma 3 27B(思考なし)も入れました。
| ベンチマーク | 31B | 26B | 12B | E4B | E2B | Gemma |
|---|---|---|---|---|---|---|
| MMLU Pro(知識・推論) | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% |
| AIME 2026(数学・ツールなし) | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% |
| LiveCodeBench v6(コード) | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% |
| Codeforces ELO(競技プログラミング) | 2150 | 1718 | 非掲載 | 940 | 633 | 110 |
つまり、26B A4Bは31Bとほぼ互角で、12Bでさえ前世代の27Bを大きく上回ります。
特に数学のAIMEが目を引きます。Gemma 3 27Bの20.8%に対し、Gemma 4 12Bは77.5%。半分以下のサイズで4倍近いスコアです。「前のGemmaは賢くなかった」という印象を持っている人ほど、試す価値があります。
差が開くのはCodeforces ELOです。31Bの2150に対し、26B A4Bは1718。難しいプログラミング問題を解かせる用途なら、31Bを選ぶ理由になります。
ではモデル名の「A4B」や「E4B」は何を意味するのか。ここを知らないと、必要なメモリを読み違えます。
- 31B:310億個のパラメータ(AIの知識を蓄えた数値)を毎回すべて使う「密」なモデル
- 26B A4B:全体は260億個。1回の計算で使うのは約40億個分だけ(A=Active)
- 12B:120億個の密なモデル。モデルカードでは「12B Unified」と表記
- E4B / E2B:スマホやノートPC向けの軽量版。実質40億・20億個相当
A4Bのように「一部だけ使う」構造は、MoE(専門家を切り替える仕組み)と呼ばれます。計算量は小さく済みます。ただし、全部の専門家をメモリに置いておく必要があるのが落とし穴。次の章で数字を見ていきます。
26B・31Bに必要なメモリはどれくらい?
31Bは約19GB、26B A4Bは約16GBが、4bit量子化でのモデル本体の目安です。会話の履歴を置く余白も要るので、VRAM 24GBか、ユニファイドメモリ32GB以上のMacが安全ラインになります。
量子化とは、モデルの数値を粗くして軽くする圧縮技術のことです。Ollamaで配られているモデルは、多くが4bit前後に圧縮されています。4bitなら、パラメータ1つあたり約0.5〜0.6バイト。この計算式で各サイズを見積もりました。
| モデル | 4bitでの本体 | 快適に | ギリギリ動く |
|---|---|---|---|
| 31B | 約19GB | VRAM 24GB / Mac 32GB以上 | Mac 24GB(短い会話のみ) |
| 26B A4B | 約15〜17GB | VRAM 24GB / Mac 32GB以上 | VRAM 16GB+メインメモリ併用 |
| 12B | 約7〜8GB | VRAM 12〜16GB / Mac 16GB以上 | VRAM 8GB+メインメモリ併用 |
| E4B | 数GB程度 | メモリ8GB以上のPC | ノートPC全般 |
| E2B | さらに小さい | メモリ8GBのPC | 古めのノートPC |
つまり、26B A4Bは「計算は軽いのにメモリは重い」モデルです。
表の数字は、パラメータ数から計算した編集部の概算です。実際のファイルサイズは、Ollamaのモデルページにあるタグ一覧で確認してください。31Bの約19GBという値は、公開されている実行例ともほぼ一致します。
「余白」はなぜ必要か
モデル本体の他に、会話の文脈を覚えておくためのメモリが要ります。これを「KVキャッシュ」と呼びます。長い資料を読ませるほど、この部分が膨らみます。
目安として、本体サイズに2〜5GBの余白を足しておくと安心です。24GBのGPUに19GBの31Bを載せると、残りは5GB。普段の会話なら十分でも、長文を大量に貼るとあふれます。
Macはメモリ全部をAIに使えない
Macのユニファイドメモリは、CPUとGPUで共有されます。ただしmacOSは、GPU側で使える量に上限を設けています。32GBのMacでも、AIに回せるのは全体の7割前後と考えてください。
だから、24GBのMacで31Bは厳しいです。動いても、他のアプリを閉じないと落ちる状態。32GBあれば31Bも26B A4Bも実用圏、64GBなら長文も余裕です。
Windows・Linuxで足りないときはどうなる?
VRAMが足りない場合、Ollamaは入りきらない部分をメインメモリへ逃がします。動くことは動く。ただし速度は大きく落ちます。
GPUのメモリとPCのメモリでは、データを運ぶ速さがけた違いだからです。VRAM 16GBのGPUで31Bを動かすより、同じGPUで12Bを動かすほうが体感は明らかに上。「重いモデルをギリギリで動かす」は、正直イマイチな選択です。
ここまでで自分に合うサイズが決まったはずです。いよいよ実際の手順に入ります。
手順1:Ollamaをインストールする
公式サイトからインストーラーを落として実行すれば完了です。Mac・Windows・Linuxのどれでも、5分かからず終わります。
ダウンロードは Ollama公式サイト から行います。OSごとの流れは次のとおりです。
| OS | インストール方 | 確認の |
|---|---|---|
| Mac | .zipを展開し、アプリをアプリケーションフォルダへ移動 | メニューバーにアイコンが出る |
| Windows | .exeのインストーラーを実行 | タスクトレイにアイコンが出る |
| Linux | 公式サイトに載っている1行のコマンドを実行 | サービスとして自動起動する |
つまり、どのOSでも「入れたら常駐する」形で準備が終わります。
インストール後、ターミナル(Windowsならコマンドプロンプト)を開き、次を打ちます。
ollama --version
バージョン番号が表示されれば成功です。ここで数字を確認しておくのには理由があります。後で説明するMTPによる高速化は、Ollama 0.31以降で計測された結果だからです。
古いOllamaがすでに入っている人は、先に最新版へ上げておきましょう。Gemma 4は新しいモデルなので、古いOllamaでは読み込めない場合があります。
手順2:Gemma 4をダウンロードする
ollama pull gemma4 でモデルを取得します。サイズを指定したい場合は、コロンの後ろにタグを付けます。
もっとも短いコマンドはこれです。
ollama pull gemma4
タグを付けないと、Ollamaが標準に指定しているサイズが落ちてきます。どのサイズが標準かは時期によって変わりえます。狙ったサイズを確実に取りたいなら、タグ指定が確実です。
ollama pull gemma4:<タグ名>
タグ名は Ollamaのgemma4モデルページ に一覧があります。サイズごと、量子化の度合いごとにタグが分かれています。各タグの横にファイルサイズも出るので、前の章の表と見比べてください。
ダウンロード中に確認したいのは空きディスク容量です。31Bなら約19GB、複数サイズを試すなら40GB以上は空けておきたいところ。落としたモデルは次のコマンドで確認できます。
ollama list
使わなくなったモデルは ollama rm モデル名 で消せます。数十GB単位でディスクを食うので、試し終わったら整理するのが地味に効きます。
回線速度によっては、31Bの取得に数十分かかります。途中で止まっても、同じコマンドをもう一度打てば続きから再開されます。
手順3:対話してGemma 4の動作を確かめる
ollama run gemma4 で会話が始まります。日本語で質問して、自然な返事が返れば準備完了です。
ollama run gemma4
>>> という入力待ちが出たら、そのまま日本語で話しかけます。試すなら、次のような質問が確認しやすいです。
- 「日本の四季を100字で説明して」:日本語の自然さを見る
- 「1から100までの素数を数えて」:推論の正確さを見る
- 「Pythonで重複を除く関数を書いて」:コードの質を見る
会話を終えるときは /bye と打ちます。
思考モードのオン・オフ
Gemma 4には、答える前に考える「思考モード」があります。難しい問題では精度が上がる一方、返事が出るまで時間がかかります。
Ollamaの対話画面では、/set think で思考を表示し、/set nothink で切ります。雑談や短い要約なら切ったほうが快適です。数学やコードの問題なら入れたままにしておくと安心。
画像を読ませる
Gemma 4は画像も理解できます。Ollamaの対話画面では、質問文の中に画像ファイルのパスを書くと読み込まれます。
モデルページには、画像を読むときの「トークン予算」の説明もあります。トークンとは、AIが扱う文字のかたまりのことです。予算は70・140・280・560・1120の5段階から選べます。
- 低い予算(70〜140):分類やキャプション付け向け。速い
- 高い予算(560〜1120):文字の読み取りや書類の解析向け。細部に強い
レシートや資料の文字を読ませたいなら、高い予算が向いています。写真の中身をざっくり答えさせるだけなら、低い予算で十分です。
今どれだけメモリを使っているか
別のターミナルで次を打つと、読み込み中のモデルと使用メモリが見えます。
ollama ps
「100% GPU」と出ていれば、モデルは全部GPUに載っています。「CPU/GPU」と割合が分かれていたら、メモリが足りずにあふれている状態。遅さの原因はほぼこれです。
動作が確認できたら、次はGemma 4をほかのアプリから呼び出せるようにします。
手順4:APIやアプリからGemma 4につなぐ
Ollamaは起動中、PC内に http://localhost:11434 という窓口を開いています。ここに送れば、自作のプログラムやチャットアプリからGemma 4を使えます。
APIとは、他のソフトからAIを呼び出すための窓口のことです。Ollamaは起動しているだけで、この窓口を自動で用意します。
もっとも単純な呼び出し例です。
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "ローカルLLMの利点を3つ挙げて"}]
}'
Ollamaは、OpenAI形式のAPIにも対応しています。OpenAI向けに書かれたツールの多くは、接続先を http://localhost:11434/v1 に変えるだけでGemma 4に切り替わります。
つなぎ先として代表的なのは次の3タイプです。
| つなぎ先 | 何が | 向いている |
|---|---|---|
| チャット画面アプリ | ChatGPT風の画面でGemma 4と会話 | ターミナルが苦手な人 |
| コーディング支援ツール | エディタ内でコード補完・修正 | 開発者 |
| 自動化ツール | メール要約や分類を定期実行 | 業務を自動化したい人 |
つまり、一度Ollamaに載せておけば、使い道は後からいくらでも足せます。
コード支援の選択肢はAIコーディングツールのカテゴリにまとまっています。定型作業を自動化したいなら、AI自動化ツールの中からOllama連携に対応したものを選ぶのが近道です。
会話の長さを伸ばす設定
長い資料を読ませると、途中から前の内容を忘れることがあります。Ollamaが一度に覚えられる長さ(コンテキスト長)を、控えめに設定しているためです。
対話画面なら /set parameter num_ctx 16384 のように指定すると伸ばせます。ただし、伸ばすほどメモリを使います。24GBのGPUで31Bを動かしている場合、大きく伸ばすとあふれやすい点には注意が必要です。
Gemma 4の速度はどれくらい出る?MTPで何が変わる?
26B A4Bは31Bより明らかに速く、MTP対応のOllamaならさらに約2倍まで伸びた計測例があります。体感でいえば、31Bは「読める速さ」、26B A4Bは「待たない速さ」です。
速度は「1秒に何トークン出せるか(tok/s)」で測ります。日本語なら、20 tok/sあれば目で追う速さを上回ります。
MTPとは何か
2026年5月5日、GoogleはGemma 4向けの「MTP」用ドラフトモデルを公開しました。MTP(Multi-Token Prediction)とは、小さな下書き役のモデルが先に数トークン分を予想する仕組みです。本体はそれを確認するだけで済むため、生成が速くなります。
Googleの発表では、出力の質を落とさずに最大3倍の速度向上をうたっています。Ollama 0.31では、Apple Silicon上でGemma 4が約50 tok/sから約95 tok/sに上がった計測が示されました。コーディングエージェント用のベンチマーク(Aider polyglot)での数字です。
コードで特に効くのには理由があります。閉じカッコや繰り返し出てくる変数名は、下書き役が当てやすいからです。雑談や創作文では、伸び幅はこれより小さくなると考えておくのが無難です。
サイズごとの速さの傾向
生成速度を決めるのは、主に「1トークンごとに読み出すデータ量」と「メモリの速さ」です。そこから見た傾向を整理します。
| モデル | 1トークンで | 速さの | 向いている |
|---|---|---|---|
| 31B | 約310億個すべて | 5モデル中もっとも遅い | じっくり考えさせる難問 |
| 26B A4B | 約40億個分 | 31Bより大幅に速い | 普段使い全般・コード補完 |
| 12B | 約120億個すべて | 26B A4Bと同程度か少し遅い | 16GB級PCでの普段使い |
| E4B / E2B | 小さい | とても速い | 軽い要約・分類・ノートPC |
つまり、メモリに収まるなら、速さと賢さの両立は26B A4Bが一択です。
ここで逆転現象が起きている点に注目してください。26B A4Bは12Bより大きいのに、使う部分が小さいぶん同程度以上に速く返答しえます。メモリさえ足りるなら、12Bより26B A4Bを選ぶ意味は大きいです。
ただし、これは「全部がGPUに載っている」場合の話。一部がメインメモリにあふれると、どのモデルも数分の1まで落ちます。速度の問題の大半は、メモリ不足が原因です。
Gemma 4が遅い・落ちるときはどう直す?
遅さの原因はほぼ「メモリからあふれている」か「Ollamaが古い」かの2つです。症状から原因をたどれば、たいていは数分で直ります。
よくある症状と対処を表にしました。
| 症状 | 考えられる | 対処 |
|---|---|---|
| 返事が1秒に数文字しか出ない | モデルがGPUに収まっていない | ollama ps を確認し、1つ小さいサイズに変える |
| 読み込み時にエラーで止まる | Ollamaが古くGemma 4に未対応 | Ollamaを最新版へ更新する |
| 長文を貼ると急に遅くなる | 会話の長さでメモリが膨らんだ | num_ctx を下げるか、会話をリセット |
| しばらく使うとPC全体が重い | ほかのアプリがメモリを使っている | ブラウザのタブや重いアプリを閉じる |
| 答えが出るまで長く待たされる | 思考モードで考えている | 簡単な質問なら /set nothink にする |
つまり、どの症状も「メモリに余裕を作る」ことで解決に向かいます。
量子化の度合いを変える
モデルページには、同じサイズでも圧縮の度合いが違うタグが並んでいます。数字が小さいほど軽く、数字が大きいほど元の精度に近づきます。
VRAM 24GBで31Bがギリギリなら、もう一段軽いタグを選ぶ手があります。逆にメモリに余裕があるMacなら、重めのタグで精度を取るのもありです。
複数モデルを同時に読み込まない
Ollamaは、使ったモデルを一定時間メモリに残します。Gemma 4の31Bを使った直後に別のモデルを呼ぶと、両方がメモリに居座ることがあります。
ollama ps で不要なモデルが見えたら、ollama stop モデル名 で降ろしましょう。これだけで速度が戻るケースは少なくありません。
ここまで来れば、Gemma 4はローカルで安定して動くはずです。最後に、クラウドAIとの付き合い方を整理します。
ローカルのGemma 4とクラウドAIはどう使い分ける?
機密データの処理や大量の定型作業はローカルのGemma 4、最先端の賢さが要る場面はクラウドAIという分担が現実的です。どちらか一方に絞る必要はありません。
両者の違いを並べます。
| 観点 | Ollama+Gemma | クラウドAI |
|---|---|---|
| 料金 | 無料(電気代のみ) | 無料枠あり。本格利用は月額や従量課金 |
| データの行き先 | PCの外に出ない | 提供会社のサーバーへ送られる |
| 賢さ | 31Bで前世代の大型モデル超え | GPT-6系やGemini Proなど最上位クラス |
| 速さ | PC性能しだい | 回線と混雑しだい |
| オフライン | ダウンロード後は可 | 不可 |
| 初期コスト | 高性能なGPUやMacが必要 | 不要 |
つまり、ローカルは「安く・秘密に・たくさん」、クラウドは「最高の賢さを手軽に」が持ち味です。
ローカルが光る場面
- 社外に出せない議事録や顧客データの要約
- 何千件ものメールやレビューの分類
- 飛行機の中など、ネットがない環境での作業
1回ずつの課金を気にせず回せるのは破格です。大量処理ほど、ローカルの恩恵は大きくなります。
クラウドに任せたい場面
最難関のコード設計や、最新ニュースを踏まえた調査はクラウドAIに分があります。ChatGPTの最上位はGPT-6系、GoogleのFlash系の最新はGemini 3.8 Flashです。
クラウドのGeminiを業務ツールと組み合わせる例は、Nottaとgeminiの比較が文字起こしの観点で参考になります。アプリ開発なら、Bolt.newとGeminiの比較やLovableとGeminiの比較を読むと、ローカルLLMとの役割分担がイメージしやすくなります。
Ollamaのクラウド実行という中間案
PCのスペックが足りない場合、Ollamaのクラウド実行も選べます。Ollama公式の料金ページには、gemma4の単価として入力0.14ドル・出力0.40ドルの表記があります。課金の単位や最新の条件は、利用前に公式ページで確かめてください。
手元のPCで12Bを動かしつつ、重い処理だけ31Bをクラウドで回す。そんな使い分けも組めます。
AI PICKS編集部の判定
Ollama+Gemma 4は、2026年に「自分のPCでAIを持つ」ならまず選ぶべき組み合わせです。公開されているベンチマークと必要メモリを突き合わせると、評価ははっきりしています。
本命は26B A4B。31Bとの差はMMLU Proで2.6ポイント、AIMEでは0.9ポイントしかありません。それでいて、1トークンで使う計算量は約8分の1です。VRAM 24GBのGPUか32GB以上のMacがあるなら、一択と言っていい選択肢です。
31Bは、競技プログラミング級の難問を解かせたい人向け。Codeforces ELOで2150と1718の差は大きく、コード中心なら選ぶ価値はあります。ただし24GBでは余白が5GB程度。長文を扱う人にとっては微妙なラインです。
見落とされがちなのが12B。前世代Gemma 3 27BをAIMEで4倍近く上回りながら、16GBのPCで動きます。「うちのPCでは無理」と諦めていた層にとって、重宝する存在になるはずです。
逆に、メモリが足りないPCで31Bを無理に動かすのは正直イマイチ。あふれた瞬間に速度が数分の1になり、ローカルLLMそのものへの印象まで悪くなります。サイズを1段落とすほうが、満足度は圧倒的に上です。
よくある質問(FAQ)
Q. OllamaでGemma 4を使うのにお金はかかりますか?
ローカルで動かす限り、Gemma 4もOllamaも無料です。かかるのは電気代とPCの購入費だけ。Ollamaのクラウド実行を使う場合のみ、公式の料金ページに載った単価で課金されます。
Q. 26B A4Bと31Bはどちらを選べばいいですか?
普段使いなら26B A4Bです。性能差は小さく、返答は大幅に速くなります。難しいプログラミング問題を中心に使うなら、Codeforces ELOで差がある31Bを選んでください。
Q. メモリ16GBのPCでも26Bは動きますか?
一部をメインメモリへ逃がせば起動はします。ただし速度が大きく落ちるため、実用的とは言いにくいです。16GBなら12Bを選ぶほうが、快適さも賢さも満足しやすいです。
Q. Gemma 4は日本語でも使えますか?
使えます。Gemma 4は多言語を理解するモデルとして公開されています。Ollamaの画面は英語ですが、質問も回答も日本語でやりとりできます。
Q. Gemma 4を商用サービスに組み込んでも大丈夫ですか?
Apache 2.0ライセンスなので、商用利用が認められています。自社アプリへの組み込みや、社内ツールでの利用も可能です。ライセンス表記の扱いは、配布元の条件を確認してください。
Q. MTPの高速化は自動で有効になりますか?
有効化の条件はOllamaのバージョンや設定で変わる可能性があります。計測例はOllama 0.31以降のものです。まずOllamaを最新版に上げ、リリースノートで設定方法を確認するのが確実です。
Q. インターネットに繋がっていなくても使えますか?
モデルのダウンロードが済めば、オフラインで動きます。入力した内容もPCの外に送られません。社外秘の資料を扱う用途と相性がいい理由がここにあります。
あわせて見たいツール・カテゴリ
Gemma 4を動かせるようになったら、つなぎ先のツール選びで使い勝手が大きく変わります。
- Ollama:本記事で使った実行ソフトの詳細と対応モデル
- AIコーディングツール一覧:ローカルLLMと組み合わせやすいエディタ連携ツール
- AIコーディングツールのランキング:人気の開発支援ツールを比べたいときに
- AIチャットボット一覧:クラウドAIとの使い分けを考えるときに
- AIチャットボットのランキング:ChatGPTやGeminiの立ち位置を確認できます
- AIエージェント一覧:Gemma 4を頭脳にした自動実行の仕組みを探すなら
- AI自動化ツール一覧:メール分類や定期処理に組み込む先を探すなら
次に読むならこれ。Ollamaの使い方完全ガイドです。Gemma 4以外の日本語モデルや代替ツールまで押さえておくと、用途ごとにモデルを切り替えられるようになります。

