Das lokale Ausführen von KI-Modellen gibt Ihnen die vollständige Kontrolle über Ihre Daten, eliminiert API-Kosten und ermöglicht die Offline-Nutzung. Gemma 4 macht dies auf einer Vielzahl von Hardware praktikabel — von Smartphones bis zu Workstations. Diese Anleitung führt Sie durch jede Methode, von der einfachsten Ein-Befehl-Einrichtung bis hin zum fortgeschrittenen Produktions-Serving.
Voraussetzungen
Bevor Sie beginnen, berücksichtigen Sie Ihre Hardware und welches Modell dazu passt:
| Modell | Mindest-RAM/VRAM | Beste Hardware |
|---|---|---|
| E2B (Q4) | 3,2 GB | Smartphones, Raspberry Pi, Laptops |
| E4B (Q4) | 5 GB | Laptops, Einsteiger-GPUs |
| 26B A4B (Q4) | 16 GB | Gaming-GPUs (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 GB | High-End-GPUs, Multi-GPU-Setups, Macs der M-Serie |
Für GPU-Inferenz werden NVIDIA-GPUs mit CUDA-Unterstützung oder Apple Silicon Macs mit Metal empfohlen. Reine CPU-Inferenz funktioniert, ist aber für größere Modelle deutlich langsamer.
Methode 1: Ollama (am einfachsten)
Ollama ist der schnellste Weg, um loszulegen. Es kümmert sich in einem einzigen Tool um den Modell-Download, die Quantisierungsauswahl und das Serving.
Ollama installieren:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Or download from https://ollama.com/downloadModell herunterladen und ausführen:
# Pull the model (one-time download)
ollama pull gemma4:26b
# Start an interactive chat
ollama run gemma4:26bVerfügbare Tags:
ollama pull gemma4:31b # 31B Dense — highest quality
ollama pull gemma4:26b # 26B A4B — best balance
ollama pull gemma4:e4b # E4B — lightweight multimodal
ollama pull gemma4:e2b # E2B — edge/mobileOllama stellt außerdem eine OpenAI-kompatible API unter http://localhost:11434/v1 bereit, zur Integration mit anderen Tools.
Methode 2: LM Studio (GUI)
LM Studio bietet eine ausgefeilte Desktop-Anwendung mit einer Chat-Oberfläche, Modellverwaltung und einem lokalen API-Server.
- Laden Sie LM Studio von lmstudio.ai herunter und installieren Sie es
- Öffnen Sie die App und suchen Sie im Modell-Browser nach „gemma-4"
- Wählen Sie Ihre bevorzugte Variante und Quantisierungsstufe
- Klicken Sie auf „Download" und beginnen Sie im Chat-Tab zu chatten
LM Studio bietet außerdem einen lokalen Servermodus, der eine OpenAI-kompatible API bereitstellt und die Integration in bestehende Anwendungen erleichtert.
Methode 3: llama.cpp (fortgeschritten)
llama.cpp gibt Ihnen maximale Kontrolle über Inferenzparameter und unterstützt die breiteste Hardware-Palette.
Aus dem Quellcode bauen:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# For CUDA support:
make -j$(nproc) GGML_CUDA=1
# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1Ein GGUF-Modell herunterladen:
Laden Sie vorquantisierte GGUF-Dateien von HuggingFace herunter. Suchen Sie nach Community-Uploads mit Quantisierung Q4_K_M (ausgewogen), Q5_K_M (höhere Qualität) oder Q8_0 (nahezu verlustfrei).
Inferenz ausführen:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99Das Flag -ngl 99 lagert alle Layer auf die GPU aus. Reduzieren Sie diese Zahl, wenn Sie begrenztes VRAM haben und zwischen CPU und GPU aufteilen möchten.
Methode 4: vLLM (Produktion)
vLLM ist für Hochdurchsatz-Produktions-Serving konzipiert, mit Funktionen wie kontinuierlichem Batching, PagedAttention und Tensor-Parallelität.
Installieren und serven:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1Die OpenAI-kompatible API abfragen:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'Für Multi-GPU-Setups erhöhen Sie --tensor-parallel-size entsprechend Ihrer GPU-Anzahl. vLLM übernimmt automatisch das Sharding des Modells über mehrere Geräte.
Das richtige Modell wählen
| Ihre Hardware | Empfohlenes Modell | Methode |
|---|---|---|
| Smartphone / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| Laptop (8 GB RAM) | E4B (Q4) | Ollama, LM Studio |
| Gaming-PC (16+ GB VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| Workstation (24+ GB VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| Multi-GPU-Server | 31B Dense (FP16) | vLLM mit Tensor-Parallelität |
Im Zweifelsfall beginnen Sie mit dem 26B A4B-Modell über Ollama. Es bietet für die meisten Nutzer die beste Balance aus Qualität und Ressourceneffizienz.
Fazit
Gemma 4 lokal auszuführen war noch nie einfacher. Ob Sie die Ein-Befehl-Einfachheit von Ollama, die visuelle Oberfläche von LM Studio, die feingranulare Kontrolle von llama.cpp oder das produktionsreife Serving von vLLM wählen — Sie können in wenigen Minuten eine leistungsstarke multimodale KI auf Ihrer eigenen Hardware zum Laufen bringen.
Das E2B-Modell macht KI auf praktisch jedem Gerät zugänglich, während das 31B Dense-Modell eine Qualität liefert, die mit den besten proprietären Modellen konkurriert — alles läuft privat auf Ihrem Rechner ohne API-Kosten und ohne dass Daten Ihr Netzwerk verlassen.
