AI モデルをローカルで実行することで、データを完全に制御し、API コストを削減し、オフラインでの利用を可能にします。Gemma 4 は、スマートフォンからワークステーションまで、幅広いハードウェアでこれを実現可能にします。本ガイドでは、最も簡単な 1 コマンドのセットアップから高度な本番サービングまで、あらゆる方法をご案内します。
前提条件
始める前に、ハードウェアとどのモデルが適合するかを確認してください。
| モデル | 最小 RAM/VRAM | 最適なハードウェア |
|---|---|---|
| E2B (Q4) | 3.2 GB | スマートフォン、Raspberry Pi、ノート PC |
| E4B (Q4) | 5 GB | ノート PC、エントリーレベル GPU |
| 26B A4B (Q4) | 16 GB | ゲーミング GPU (RTX 3090/4090)、Apple Silicon |
| 31B Dense (Q4) | 20 GB | ハイエンド GPU、マルチ GPU 構成、M シリーズ Mac |
GPU 推論には、CUDA サポートを備えた NVIDIA GPU または Metal 対応の Apple Silicon Mac が推奨されます。CPU のみの推論も動作しますが、大きなモデルでは大幅に遅くなります。
方法 1: Ollama (最も簡単)
Ollama は最速で始められる方法です。モデルのダウンロード、量子化の選択、サービングを単一のツールで処理します。
Ollama をインストール:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Or download from https://ollama.com/downloadモデルを取得して実行:
# Pull the model (one-time download)
ollama pull gemma4:26b
# Start an interactive chat
ollama run gemma4:26b利用可能なタグ:
ollama pull gemma4:31b # 31B Dense — highest quality
ollama pull gemma4:26b # 26B A4B — best balance
ollama pull gemma4:e4b # E4B — lightweight multimodal
ollama pull gemma4:e2b # E2B — edge/mobileOllama はまた、他のツールとの連携用に http://localhost:11434/v1 で OpenAI 互換 API を公開します。
方法 2: LM Studio (GUI)
LM Studio は、チャットインターフェース、モデル管理、ローカル API サーバーを備えた洗練されたデスクトップアプリケーションを提供します。
- lmstudio.ai から LM Studio をダウンロードしてインストールします
- アプリを開き、モデルブラウザで "gemma-4" を検索します
- お好みのバリアントと量子化レベルを選択します
- Download をクリックし、Chat タブでチャットを開始します
LM Studio はまた、OpenAI 互換 API を公開するローカルサーバーモードも提供しており、既存のアプリケーションとの統合が容易です。
方法 3: llama.cpp (上級者向け)
llama.cpp は推論パラメータを最大限に制御でき、最も幅広いハードウェアに対応します。
ソースからビルド:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# For CUDA support:
make -j$(nproc) GGML_CUDA=1
# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1GGUF モデルをダウンロード:
HuggingFace から事前量子化された GGUF ファイルをダウンロードします。Q4_K_M (バランス型)、Q5_K_M (高品質)、または Q8_0 (ほぼロスレス) の量子化レベルでコミュニティがアップロードしたものを探してください。
推論を実行:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99-ngl 99 フラグはすべてのレイヤーを GPU にオフロードします。VRAM に制限があり CPU と GPU で分割したい場合は、この数値を減らしてください。
方法 4: vLLM (本番向け)
vLLM は、連続バッチング、PagedAttention、テンソル並列などの機能を備えた高スループットの本番サービング向けに設計されています。
インストールとサービング:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1OpenAI 互換 API にクエリを送信:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'マルチ GPU 構成では、--tensor-parallel-size を GPU 数に合わせて増やしてください。vLLM はデバイス間でのモデルシャーディングを自動的に処理します。
適切なモデルの選び方
| ハードウェア | 推奨モデル | 方法 |
|---|---|---|
| スマートフォン / Raspberry Pi | E2B (Q4) | Ollama、llama.cpp |
| ノート PC (8 GB RAM) | E4B (Q4) | Ollama、LM Studio |
| ゲーミング PC (16+ GB VRAM) | 26B A4B (Q4) | Ollama、vLLM |
| ワークステーション (24+ GB VRAM) | 31B Dense (Q4) | vLLM、llama.cpp |
| マルチ GPU サーバー | 31B Dense (FP16) | テンソル並列を使用した vLLM |
迷ったときは、Ollama 経由で 26B A4B モデルから始めてください。ほとんどのユーザーに対して品質とリソース効率の最良のバランスを提供します。
結論
Gemma 4 をローカルで実行することは、これまでになく簡単になりました。Ollama の 1 コマンドのシンプルさ、LM Studio のビジュアルインターフェース、llama.cpp の細かい制御、vLLM の本番グレードのサービングのいずれを選んでも、数分以内に強力なマルチモーダル AI を自身のハードウェアで稼働させることができます。
E2B モデルは AI を事実上すべてのデバイスでアクセス可能にし、31B Dense モデルは最高のプロプライエタリモデルに匹敵する品質を提供します — すべてが自身のマシン上でプライベートに動作し、API コストがかからず、データがネットワーク外に出ることはありません。
