Gemma 4 をローカルで実行する方法: ステップバイステップガイド

4月 3, 2026

AI モデルをローカルで実行することで、データを完全に制御し、API コストを削減し、オフラインでの利用を可能にします。Gemma 4 は、スマートフォンからワークステーションまで、幅広いハードウェアでこれを実現可能にします。本ガイドでは、最も簡単な 1 コマンドのセットアップから高度な本番サービングまで、あらゆる方法をご案内します。

前提条件

始める前に、ハードウェアとどのモデルが適合するかを確認してください。

モデル最小 RAM/VRAM最適なハードウェア
E2B (Q4)3.2 GBスマートフォン、Raspberry Pi、ノート PC
E4B (Q4)5 GBノート PC、エントリーレベル GPU
26B A4B (Q4)16 GBゲーミング GPU (RTX 3090/4090)、Apple Silicon
31B Dense (Q4)20 GBハイエンド GPU、マルチ GPU 構成、M シリーズ Mac

GPU 推論には、CUDA サポートを備えた NVIDIA GPU または Metal 対応の Apple Silicon Mac が推奨されます。CPU のみの推論も動作しますが、大きなモデルでは大幅に遅くなります。

方法 1: Ollama (最も簡単)

Ollama は最速で始められる方法です。モデルのダウンロード、量子化の選択、サービングを単一のツールで処理します。

Ollama をインストール:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Or download from https://ollama.com/download

モデルを取得して実行:

# Pull the model (one-time download)
ollama pull gemma4:26b

# Start an interactive chat
ollama run gemma4:26b

利用可能なタグ:

ollama pull gemma4:31b    # 31B Dense — highest quality
ollama pull gemma4:26b    # 26B A4B — best balance
ollama pull gemma4:e4b    # E4B — lightweight multimodal
ollama pull gemma4:e2b    # E2B — edge/mobile

Ollama はまた、他のツールとの連携用に http://localhost:11434/v1 で OpenAI 互換 API を公開します。

方法 2: LM Studio (GUI)

LM Studio は、チャットインターフェース、モデル管理、ローカル API サーバーを備えた洗練されたデスクトップアプリケーションを提供します。

  1. lmstudio.ai から LM Studio をダウンロードしてインストールします
  2. アプリを開き、モデルブラウザで "gemma-4" を検索します
  3. お好みのバリアントと量子化レベルを選択します
  4. Download をクリックし、Chat タブでチャットを開始します

LM Studio はまた、OpenAI 互換 API を公開するローカルサーバーモードも提供しており、既存のアプリケーションとの統合が容易です。

方法 3: llama.cpp (上級者向け)

llama.cpp は推論パラメータを最大限に制御でき、最も幅広いハードウェアに対応します。

ソースからビルド:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# For CUDA support:
make -j$(nproc) GGML_CUDA=1

# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1

GGUF モデルをダウンロード:

HuggingFace から事前量子化された GGUF ファイルをダウンロードします。Q4_K_M (バランス型)、Q5_K_M (高品質)、または Q8_0 (ほぼロスレス) の量子化レベルでコミュニティがアップロードしたものを探してください。

推論を実行:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

-ngl 99 フラグはすべてのレイヤーを GPU にオフロードします。VRAM に制限があり CPU と GPU で分割したい場合は、この数値を減らしてください。

方法 4: vLLM (本番向け)

vLLM は、連続バッチング、PagedAttention、テンソル並列などの機能を備えた高スループットの本番サービング向けに設計されています。

インストールとサービング:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

OpenAI 互換 API にクエリを送信:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

マルチ GPU 構成では、--tensor-parallel-size を GPU 数に合わせて増やしてください。vLLM はデバイス間でのモデルシャーディングを自動的に処理します。

適切なモデルの選び方

ハードウェア推奨モデル方法
スマートフォン / Raspberry PiE2B (Q4)Ollama、llama.cpp
ノート PC (8 GB RAM)E4B (Q4)Ollama、LM Studio
ゲーミング PC (16+ GB VRAM)26B A4B (Q4)Ollama、vLLM
ワークステーション (24+ GB VRAM)31B Dense (Q4)vLLM、llama.cpp
マルチ GPU サーバー31B Dense (FP16)テンソル並列を使用した vLLM

迷ったときは、Ollama 経由で 26B A4B モデルから始めてください。ほとんどのユーザーに対して品質とリソース効率の最良のバランスを提供します。

結論

Gemma 4 をローカルで実行することは、これまでになく簡単になりました。Ollama の 1 コマンドのシンプルさ、LM Studio のビジュアルインターフェース、llama.cpp の細かい制御、vLLM の本番グレードのサービングのいずれを選んでも、数分以内に強力なマルチモーダル AI を自身のハードウェアで稼働させることができます。

E2B モデルは AI を事実上すべてのデバイスでアクセス可能にし、31B Dense モデルは最高のプロプライエタリモデルに匹敵する品質を提供します — すべてが自身のマシン上でプライベートに動作し、API コストがかからず、データがネットワーク外に出ることはありません。

Gemma 4 Team

Gemma 4 Team