ローカルLLMに必要なPCスペックは、動かしたいモデルの大きさでほぼ決まります。8B級ならVRAM 8GBのGPUで動き、70B級になると64GB以上のメモリが要ります。

「AI用PCを買いたいけれど、どこまで積めば足りるのか分からない」と迷っていませんか。そこで、Ollama・LM Studio・llama.cppの公式資料とモデル配布元の数字を並べて、必要なメモリを逆算しました。予算別の構成と購入先も最後に載せています。


ローカルLLMとは?PCのどこに負荷がかかる?

ローカルLLMとは?PCのどこに負荷がかかる?

ローカルLLMとは、ChatGPTのような文章AIのモデルを自分のPCにダウンロードし、手元だけで動かす使い方です。LLMは大規模言語モデルの略で、大量の文章を学習した「文章を作るAI」のこと。

動かすためのソフトはOllamaやLM Studioが定番で、どちらも無料です。月額料金はかからず、入力した内容も外に出ません。

問題はPCの側。モデルは起動のたびにメモリへまるごと読み込まれるので、メモリに載るかどうかが最初の関門になります。部品ごとの役割を整理すると、次のようになります。

部品ローカルLLMでの役割選ぶときの見方
GPUのVRAMモデルを載せて計算する場所。ここに全部載ると速い最優先。容量(GB)を見る
メインメモリ(RAM)VRAMに入りきらない分を受け持つ。GPUなしならここだけで動く32GBあると余裕が出る
CPUGPUに載らなかった部分の計算を担当ミドル以上なら大差は出にくい
SSDモデルファイルの置き場所1モデル数GB〜100GB超。1TB以上が安心
NPUWindowsの一部AI機能向けOllamaやLM Studioの判断材料にはしない

つまり、ローカルLLM用のPC選びは「VRAMまたはメモリを何GB積むか」の一点にほぼ集約されます。

VRAMに入りきらないと、Ollamaはモデルの一部をメインメモリに逃がして動かします。Ollamaのドキュメントでは、ollama psの表示が「100% GPU」ならすべてGPUに、「48%/52% CPU/GPU」なら両方にまたがって読み込まれた状態だと説明しています。1つのGPUに全部収まると、PCIバス越しのデータのやり取りが減って最も速く動く、とも書かれています。

動くことと、快適に動くことは別物です。VRAMからあふれたモデルも一応は答えを返しますが、待ち時間が延びます。買う前に「全部載るか」で判断するのが安全です。

必要な容量を決めるには、モデルそのものの大きさを知る必要があります。


Ollama icon
この記事で紹介 / AIチャットボット3.94無料あり最低料金 無料

モデルサイズ別に必要なメモリは?量子化で何GB変わる?

モデルサイズ別に必要なメモリは?量子化で何GB変わる?

モデルの大きさは「8B」「70B」のようにパラメータ数で表されます。Bは10億の意味で、8Bなら80億個の数字の集まりです。

量子化とは、その数字1つ1つの精度を落として、モデルを軽くする処理のことです。16bitの数字を4bitに詰め直せば、ファイルはおよそ4分の1になります。

llama.cppの量子化ドキュメントには、Llama 3.1 8Bを量子化したときのサイズが載っています。同じモデルでも、形式によって3倍以上の差が出ます。

量子化形式1数値あたりのビット数サイズ(Llama 3.1 8B)
F16(量子化なし)16.014.96GiB
Q8_08.57.95GiB
Q6_K6.566.14GiB
Q5_K_M5.705.33GiB
Q4_K_M4.894.58GiB

ローカルで配られているモデルの多くは、この表のQ4_K_Mです。Ollamaの配布版も、確認したQwen3.5 9BはQ4_K_Mでした。

同じドキュメントでは、Llama 3.1 70BがQ4_K_Mで43.1GB、405Bは249.1GBとされています。8Bで約4.6GB、70Bで約43GB。ここから「4bit量子化ならパラメータ数(B)×約0.6GB」という目安が出てきます。

精度はどこまで落としていい?

量子化で軽くなるぶん、答えの精度は少しずつ落ちます。AMDの公式ブログは、一般的な会話ならQ4_K_Mで十分としています。

一方で、プログラミング用途ではQ6以上を推奨し、Q8はほぼ劣化なしと説明しています。コード生成に使うなら、4bitより一段重い形式を載せられる容量を見込んでおくと安心です。

主要モデルの配布サイズ

実際にダウンロードするファイルの大きさは、Ollamaのモデル一覧ページで確認できます。代表的なモデルを小さい順に並べました。

モデル(Ollamaのタグ)配布サイズ載せる場所の目安
gemma3:4b3.3GBVRAM 6〜8GB、メモリ16GBのPC
llama3.1:8b4.9GBVRAM 8GB
qwen3.5:9b6.6GBVRAM 8GBでぎりぎり、12GBで余裕
qwen3:14b9.3GBVRAM 12〜16GB
gpt-oss:20b14GBVRAM 16GB
qwen3.5:27b17GBVRAM 24〜32GB
qwen3.5:35b24GBVRAM 32GB
llama3.1:70b43GB統合メモリ64GB以上
gpt-oss:120b65GB統合メモリ96〜128GB
qwen3.5:122b81GB統合メモリ128GB
qwen3:235b142GB統合メモリ256GB以上

右の列は編集部の目安で、配布サイズに会話分の余裕を足しています。ファイルがVRAMとちょうど同じ大きさだと、実際には収まりません。

gpt-oss-20bについては、OpenAIのモデルカードが「16GBのメモリ内で動く」と明記しています。gpt-oss-120bは80GBのGPU 1枚に収まる設計です。

会話が長いほどメモリを食う

見落としやすいのが、会話の長さのぶんのメモリです。モデルが一度に覚えておける文章の長さを、コンテキスト長と呼びます。

Ollamaはこの長さをVRAM量に応じて自動で決めています。24GiB未満なら4k、24〜48GiBなら32k、48GiB以上なら256kが初期値です。長い資料を読ませたいなら、そのぶんVRAMを多めに見込んでください。

モデルの大きさが分かったら、手持ちのGPUやこれから買うPCで何が動くかを当てはめてみます。


編集部のおすすめ

大きなモデルほどメモリやVRAMが要ります。統合メモリの多いミニPCや、GPU搭載のデスクトップが候補です。

  • GMKtec(ミニPC) icon
    GMKtec(ミニPC)

    Ryzen AI搭載で統合メモリの大きいミニPCがあり、机の上に置ける大きさでローカルLLMを動かせる

    ミニPC / Ryzen AI搭載モデルあり(価格は公式ストアで確認)

  • FRONTIER(BTOパソコン) icon
    FRONTIER(BTOパソコン)

    GeForce RTX搭載のデスクトップを構成を選んで買える。VRAMの大きいGPUも選べる

    BTOパソコン / GeForce RTX搭載モデルあり(構成と価格は公式で確認)

VRAM・メモリ別に何が動く?早見表で確認

まずGPUの側から。NVIDIAのGeForce RTX 50シリーズは、型番ごとにVRAMの量が決まっています。NVIDIAの仕様比較ページの値を並べると、次の通りです。

GPUVRAMローカルLLMでの位置づけ
RTX 50508GB(GDDR6)4B〜8B級向け
RTX 50608GB4B〜8B級向け
RTX 5060 Ti8GB / 16GB16GB版なら20B級まで
RTX 507012GB14B級まで
RTX 5070 Ti16GB20B級まで
RTX 508016GB20B級まで
RTX 509032GB35B級まで

注目したいのは、RTX 5070(12GB)より下位のRTX 5060 Tiの16GB版のほうがVRAMは多い点です。ゲームの性能順とLLMで使える容量の順は一致しません。

同じ考え方で、VRAMまたは統合メモリの容量ごとに「快適に載るモデル」をまとめました。

容量快適に載るモデルの例できること
VRAM 8GBLlama 3.1 8B、Gemma 3 4B短い文章の下書き、翻訳、要約
VRAM 12GBQwen3 14B、Gemma 3 12B日常の相談役として十分な受け答え
VRAM 16GBgpt-oss-20b、Qwen3 14B推論の強いモデルを手元で。画像生成との両立も可
VRAM 32GBQwen3.5 27B / 35B、Gemma 4 31B中型モデルを長い会話で
統合メモリ64GBLlama 3.1 70B(4bit)70B級がぎりぎり視野に入る
統合メモリ128GBgpt-oss-120b、Qwen3.5 122B100B級を手元で
統合メモリ256GB以上Qwen3 235B200B級の大型モデル

表の境目は、4bit量子化の配布サイズに余裕を足した編集部の目安です。8GBで70B級、というような無理な組み合わせは入れていません。

VRAM 32GBと統合メモリ64GBの間に、大きな段差があることも分かります。この段差をどう越えるかが、GPU型と統合メモリ型の分かれ目です。


GPU型と大容量統合メモリ型、どちらを選ぶ?

ローカルLLM用のPCは、大きく2つの型に分かれます。NVIDIAなどのグラフィックボードを積むGPU型と、CPUとGPUが1つのメモリを共有する統合メモリ型です。

GPU型: 速さと画像生成の対応幅が強み

GPU型は、VRAMに収まるモデルなら最も速く動きます。デスクトップなら、あとからグラフィックボードを差し替えられるのも利点です。

画像生成や動画生成のツールには、NVIDIAのGPUを前提にしたものがあります。たとえばFramePackの公式リポジトリは、動作環境をRTX 30/40/50シリーズとしています。LLMと画像生成を1台でこなすなら、GPU型が無難です。

弱点は容量の上限。GeForce RTX 50シリーズの最大はRTX 5090の32GBなので、43GBある70B級の4bit版は1枚に収まりません。

統合メモリ型: 大きなモデルを1台に載せられる

統合メモリ型の代表は、AppleのMac(Apple Silicon)と、AMDのRyzen AI Max+ 395を積んだミニPCです。メインメモリの大部分をGPUが使えるので、VRAM 32GBの壁を越えられます。

AMDの製品ページによると、Ryzen AI Max+ 395は16コアのCPUと40コアのRadeon 8060S Graphicsを内蔵し、メモリは最大128GBです。AMDの公式ブログでは、128GB構成なら最大96GBをGPU専用メモリに割り当てられると説明しています。

この機能はVariable Graphics Memoryと呼ばれ、64GB構成では最大48GBまで割り当てられます。AMDは、128GB構成で4bitのモデルを最大128Bパラメータまで動かせるとしています。

Macは、Apple公式の仕様ページで次の容量が選べます(2026年9月29日確認)。

機種・チップ統合メモリメモリ帯域幅
Mac mini(M6)16GB〜32GB153GB/sまたは170GB/s
Mac mini(M5 Pro)24GB〜64GB307GB/s
Mac Studio(M5 Max)36GB〜128GB460GB/sまたは614GB/s
Mac Studio(M5 Ultra)96GB〜512GB1.2TB/s

統合メモリ型では、メモリ帯域幅が文章を出す速さに直結します。AMDのブログでも、帯域幅が2倍になると1秒あたりに出せる文字量もおおむね2倍になると説明しています。容量と一緒に帯域幅も見てください。

2つの型を並べると

違いを一覧にすると、選ぶ基準がはっきりします。

比較軸GPU型(NVIDIA)統合メモリ型(Ryzen AI Max+ / Mac)
モデルを載せられる量最大32GB(RTX 5090)最大128GB(Ryzen AI Max+)、最大512GB(Mac Studio)
載るモデルでの速さ最も速い帯域幅しだい。GPU型より遅めになりやすい
画像・動画生成対応ツールが多い動くツールはあるが選択肢が減る
あとからの増設グラボの交換が可能メモリは購入時の構成で決まる
向く人8B〜35B級とStable Diffusionを両方使う人70B級以上のLLMを手元で動かしたい人

GMKtecのEVO-X2は、製品ページでメモリを「オンボード、増設不可」としています。統合メモリ型は、最初に積んだ容量でずっと使うことになります。迷ったら1段上の容量を選んでください。

OllamaのハードウェアサポートにはRyzen AI Max+ 395も載っています(LinuxのROCm対応表)。WindowsではVulkan経由でAMDのGPUを使う仕組みも用意されています。Apple SiliconはMetalでGPUが使われます。

ここまでの整理: 35B級までと画像生成ならNVIDIAのVRAM 16〜32GB。70B級から上を手元で動かしたいなら統合メモリ64GB以上。ここから先は画像生成の話です。


Stable Diffusion・ComfyUIに要るVRAMは?

画像生成AIは、LLMよりもVRAMの影響を受けやすい分野です。Stable DiffusionやComfyUIを使う予定があるなら、LLMとは別にVRAMの目安を押さえておいてください。

公式発表や開発元の資料に載っている数字を集めました。

モデル・ツール必要なVRAMの目安出どころ
Stable Diffusion 1.55〜7GBAMDの公式ブログ
Stable Diffusion 3.5 Medium9.9GB(テキストエンコーダーを除く)Stability AIの発表
Stable Diffusion 3 Medium(FP16)18GBAMDの公式ブログ
ComfyUIの省メモリ動作VRAM 4GB+RAM 8GBからComfyUIの公式README
FramePack(動画生成)6GB以上FramePackの公式リポジトリ

ComfyUIは、モデルを少しずつVRAMへ送り込む仕組みで、4GBのVRAMでも大きなモデルを動かせるとしています。ただし、これは「動く」の話。生成を何度も回すなら、VRAMは多いほど待ち時間が減ります。

SDXLは8GBが現実的なライン、という整理をSDXLの使い方で紹介しています。はじめてならステーブルディフュージョンの始め方で、全体の流れをつかむのが早道です。

画面の組み立て方に不安があるなら、ComfyUIの基本ノード解説が役立ちます。VRAM 8GBで動画まで作る例は、ComfyUI×WAN 2.2のローカル動画生成にまとまっています。

LLMと画像生成を両方やるなら、VRAM 16GBがちょうどいい落としどころです。gpt-oss-20bも、SD 3.5 Mediumも、1枚のGPUに収まります。

必要な容量が見えたところで、予算ごとの構成に落とし込みます。


ComfyUI icon
この記事で紹介 / AI画像生成3.95無料あり最低料金 無料

予算別にどう組む?4つの価格帯の考え方

価格は各社公式サイトの標準構成価格(税込、2026年9月29日確認)です。BTOパソコンの価格はパーツ相場で頻繁に変わるので、購入前に必ず公式サイトで最新の値を見てください。

予算帯構成の例載るモデルの目安向く人
0円今のPC(メモリ16GB以上)4B級、8B級を少しまず試したい人
30万円前後RTX 5060 Ti(8GB)+メモリ32GB8B級、SD 1.5・SDXL文章の下書きと画像生成を少し
35万〜60万円RTX 5070 Ti(16GB)、またはRyzen AI Max+ 395(64GB)20B級、統合メモリなら70B級も視野本格的に毎日使う人
100万円以上RTX 5090(32GB)、またはRyzen AI Max+ 395(128GB)・Mac Studio35B級を高速に、統合メモリなら100B級大型モデルを試したい人、開発者

表の通り、予算が上がるほど「速さのGPU型」と「容量の統合メモリ型」の選択が効いてきます。

0円: 今のPCで試してから決める

買う前に、今のPCで小さいモデルを動かしてみるのが一番の近道です。LM Studioの動作要件は、メモリ16GB以上を推奨しています。

Windowsなら専用VRAM 4GB以上が推奨です。8GBのMacでも、小さいモデルと短い会話なら使えるとされています。

手順はLM Studioの使い方やOllama完全ガイドにまとめています。4B級で物足りなければ、そこで初めて買い替えを考えれば十分です。

30万円前後: VRAM 8GBの入門機

FRONTIERの「FRGHLB860/SG1」は、Core Ultra 5 225FとRTX 5060 Ti(8GB)、メモリ32GB、SSD 1TBの構成で299,800円です。

8B級のLLMとSD 1.5やSDXLの画像生成なら、この構成で回ります。ただし、VRAM 8GBでは14B級や20B級が載りません。LLM目的なら、同じRTX 5060 Tiでも16GB版を積んだモデルを探す価値があります。

35万〜60万円: VRAM 16GBか、統合メモリ64GBか

ここが一番悩む価格帯。FRONTIERの「FRCRMB650/CG1」は、Ryzen 7 9700XとRTX 5070 Ti(16GB)、メモリ32GBで474,800円です。

同じ価格帯で、GMKtecのEVO-X2(Ryzen AI Max+ 395)は64GB+SSD 1TBが347,999円でした。GPUに割り当てられるのは最大48GBなので、43GBある70B級の4bit版がぎりぎり収まる計算です。

画像生成もやるならRTX 5070 Tiの側、LLMの大きさを優先するならEVO-X2の側。この線引きで選べば後悔は少なくなります。

100万円以上: 32GBのGPUか、128GB以上の統合メモリか

FRONTIERの「FRGBLMB650/SG3」は、Ryzen 9 9950X3DとRTX 5090(32GB)、メモリ64GB、SSD 2TBで1,249,800円です。35B級までを高速に回し、画像生成も重いモデルまで扱えます。

EVO-X2の128GB構成は、SSD 1TBで566,999円、2TBで583,000円でした。gpt-oss-120b(65GB)のような100B級を載せたいなら、こちらのほうが安く届きます。

さらに200B級まで狙うなら、統合メモリを最大512GBまで選べるMac Studio(M5 Ultra)が選択肢に入ります。価格は構成で大きく変わるので、Appleの公式サイトで確認してください。


LM Studio icon
この記事で紹介 / AIチャットボット3.84無料あり最低料金 無料

どこで買う?BTOとミニPCの購入先

構成の方向性が決まったら、購入先を選びます。GPU型ならBTOパソコン、統合メモリ型ならミニPCかMacが中心です。

FRONTIER: GeForce RTX搭載のBTOデスクトップ

FRONTIERは、インバースネット株式会社が運営するBTOパソコンの直販サイトです。商品検索にGPU名を入れると、RTX 5060 TiからRTX 5090までの構成が一覧で出てきます。

多くのモデルは受注生産です。検索結果には完売した構成も並ぶので、在庫表示も合わせて確認してください。VRAMの量は型番の後ろに「(16GB)」のように書かれている構成が多く、見比べやすい作りです。

FRONTIERの公式サイトでRTX搭載デスクトップを見る

GMKtec: Ryzen AI Max+ 395のミニPC「EVO-X2」

GMKtecのEVO-X2は、Ryzen AI Max+ 395を積んだミニPCです。製品ページの仕様では、メモリはLPDDR5X 8000MHzの64GBか128GB、OSはWindows 11 Proです。

製品ページには、メモリ容量ごとに動かせるLLMの例も載っています。64GB構成でDeepSeek-R1 32B、128GB構成で70B級やQwen3 235Bが挙げられています。これはメーカー側の案内なので、量子化の形式によっては条件が変わる点に注意してください。

先に書いた通り、メモリは増設できません。LLM用途で買うなら、128GB構成を選ぶほうが後から困りにくいです。

GMKtecの公式サイトでEVO-X2の構成と価格を見る

マウスコンピューター: G TUNEとDAIV

マウスコンピューターには、ゲーミング向けのG TUNEと、クリエイター向けのDAIVというブランドがあります。公式サイトには「AIおすすめパソコン」という探し方も用意されています。

公式サイトでは国内生産と24時間365日のサポートを打ち出しています(一部モデルは対象外)。サポート重視なら候補になります。構成と価格は時期で変わるため、公式サイトで確認してください。

マウスコンピューターの公式サイトを見る

AI向けのガジェットをほかにも比べたいなら、AI PICKSのガジェット特集も参考になります。

買う前のチェックリスト

どの購入先でも、注文前に確認したい点は共通しています。

  • VRAM(または統合メモリ)の容量。動かしたいモデルの配布サイズより2割ほど多いか
  • メモリを後から増やせるか。統合メモリ型は購入時の構成で固定されます
  • SSDの容量。Qwen3 235Bは1つで142GB、FramePackは初回に30GB超をダウンロードします
  • 電源の容量。FRONTIERのRTX 5090搭載構成には1200Wの電源が組まれています

最後の電源は見落としがち。上位GPUへの差し替えを考えているなら、最初から余裕のある電源を選んでください。


NPU搭載の「AI PC」はローカルLLMに向いている?

家電量販店で「AI PC」と書かれているのは、多くがNPUを積んだWindows PCです。NPUはAIの処理に特化した部品で、Copilot+ PCでは40TOPS以上が条件になっています。

ただし、OllamaのハードウェアサポートにNPUは載っていません。対応しているのはNVIDIAのGPU、AMDのRadeonとRyzen AIのGPU、AppleのMetal、それにVulkan経由のGPUです。

つまり、ローカルLLMを動かす目的なら、NPUのTOPS値よりメモリの容量を見るべきです。Copilot+ PCそのものの判断基準は、AI PCとCopilot+ PCの解説に詳しく書いています。

逆に、手元のPCでは足りないけれど買い替えも迷う、という場合は別の道もあります。GPUを時間単位で借りるGPUaaSの料金と選び方も比べてみてください。


AI PICKS編集部の判定

公式資料の数字を並べると、選び方はかなりシンプルになります。

  • 迷ったらVRAM 16GBのNVIDIA機が一択です。 gpt-oss-20bもSD 3.5 Mediumも1枚に収まり、LLMと画像生成を1台で回せます。RTX 5070 Tiか、RTX 5060 Tiの16GB版が狙い目
  • VRAM 8GBは、LLM目的だと正直イマイチです。 8B級は動きますが、14B級から上に進めません。画像生成が主で、LLMはおまけという人向け
  • 70B級以上を手元で動かしたいなら、統合メモリ128GBが近道です。 RTX 5090の32GBでも70B級の4bit版は載りません。EVO-X2の128GB構成は、100万円を超えるGPU機より安く大容量に届きます
  • NPUのTOPS値で選ぶのは意外と意味がありません。 OllamaもLM StudioもGPUとメモリで動きます

いちばん失敗が少ないのは、今のPCで4B級を動かしてから決める順番です。「どの大きさのモデルが自分に必要か」が分かれば、積むべき容量は表から逆算できます。


よくある質問(FAQ)

Q. GPUが無いPCでもローカルLLMは動きますか?

動きます。OllamaはGPUが無ければ、モデルをすべてメインメモリに載せてCPUで計算します。ollama psの表示が「100% CPU」になる状態です。ただし返答までの待ち時間は長くなるので、4B級などの小さいモデルから試してください。

Q. AMDのRadeonでも動きますか?

動きます。OllamaはROCmという仕組みでRadeon RX 9000/7000/6000シリーズの一部に対応しています。WindowsではVulkan経由の対応もあります。GPUを選ぶ前に、Ollamaの対応表で型番を確認しておくと確実です。

Q. ノートPCでも大丈夫ですか?

メモリ16GB以上なら、小さいモデルは動きます。GeForce搭載のゲーミングノートなら、VRAMの量でデスクトップと同じ考え方ができます。ただしNVIDIAはノートPC向けのGPUをデスクトップ向けとは別に仕様を公開しています。買う前に、そのノートの仕様表でVRAMの量を確認してください。

Q. メモリは32GBと64GB、どちらを選ぶべきですか?

GPU型なら、メインメモリは32GBで足りる場合がほとんどです。モデルはVRAMに載せるのが基本だからです。統合メモリ型の場合は話が別で、この容量がそのままモデルを載せられる上限になります。70B級を狙うなら64GBが最低ラインです。

Q. モデルを入れるSSDはどれくらい必要ですか?

1TBあれば、8B〜35B級を複数入れても困りにくいです。配布サイズは8B級で約5GB、35B級で約24GB。100B級を超えると1つで65GB〜142GBあるので、大型モデルを試すなら2TBを選んでください。

Q. 量子化したモデルは日本語が苦手になりますか?

量子化は精度を少し落とす処理で、特定の言語だけが崩れる仕組みではありません。AMDの公式ブログでは、一般的な会話ならQ4_K_Mで十分としています。日本語の自然さはモデルそのものの得意不得意で差が出るので、日本語に強いモデルを選ぶほうが効きます。


関連記事

PCが決まったら、次はOllama完全ガイドへ。届いたその日のうちに、最初のモデルを動かすところまで進めます。

各ツールの公式サイト(一次情報)

料金・機能・対応範囲は各社公式が一次情報です。本記事は公開時点の検証に基づきますが、最新かつ正確な条件は必ず各公式ページで確認してください。