Gemma 4 lokal ausführen: Eine Schritt-für-Schritt-Anleitung

Apr. 3, 2026

Das lokale Ausführen von KI-Modellen gibt Ihnen die vollständige Kontrolle über Ihre Daten, eliminiert API-Kosten und ermöglicht die Offline-Nutzung. Gemma 4 macht dies auf einer Vielzahl von Hardware praktikabel — von Smartphones bis zu Workstations. Diese Anleitung führt Sie durch jede Methode, von der einfachsten Ein-Befehl-Einrichtung bis hin zum fortgeschrittenen Produktions-Serving.

Voraussetzungen

Bevor Sie beginnen, berücksichtigen Sie Ihre Hardware und welches Modell dazu passt:

ModellMindest-RAM/VRAMBeste Hardware
E2B (Q4)3,2 GBSmartphones, Raspberry Pi, Laptops
E4B (Q4)5 GBLaptops, Einsteiger-GPUs
26B A4B (Q4)16 GBGaming-GPUs (RTX 3090/4090), Apple Silicon
31B Dense (Q4)20 GBHigh-End-GPUs, Multi-GPU-Setups, Macs der M-Serie

Für GPU-Inferenz werden NVIDIA-GPUs mit CUDA-Unterstützung oder Apple Silicon Macs mit Metal empfohlen. Reine CPU-Inferenz funktioniert, ist aber für größere Modelle deutlich langsamer.

Methode 1: Ollama (am einfachsten)

Ollama ist der schnellste Weg, um loszulegen. Es kümmert sich in einem einzigen Tool um den Modell-Download, die Quantisierungsauswahl und das Serving.

Ollama installieren:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Or download from https://ollama.com/download

Modell herunterladen und ausführen:

# Pull the model (one-time download)
ollama pull gemma4:26b

# Start an interactive chat
ollama run gemma4:26b

Verfügbare Tags:

ollama pull gemma4:31b    # 31B Dense — highest quality
ollama pull gemma4:26b    # 26B A4B — best balance
ollama pull gemma4:e4b    # E4B — lightweight multimodal
ollama pull gemma4:e2b    # E2B — edge/mobile

Ollama stellt außerdem eine OpenAI-kompatible API unter http://localhost:11434/v1 bereit, zur Integration mit anderen Tools.

Methode 2: LM Studio (GUI)

LM Studio bietet eine ausgefeilte Desktop-Anwendung mit einer Chat-Oberfläche, Modellverwaltung und einem lokalen API-Server.

  1. Laden Sie LM Studio von lmstudio.ai herunter und installieren Sie es
  2. Öffnen Sie die App und suchen Sie im Modell-Browser nach „gemma-4"
  3. Wählen Sie Ihre bevorzugte Variante und Quantisierungsstufe
  4. Klicken Sie auf „Download" und beginnen Sie im Chat-Tab zu chatten

LM Studio bietet außerdem einen lokalen Servermodus, der eine OpenAI-kompatible API bereitstellt und die Integration in bestehende Anwendungen erleichtert.

Methode 3: llama.cpp (fortgeschritten)

llama.cpp gibt Ihnen maximale Kontrolle über Inferenzparameter und unterstützt die breiteste Hardware-Palette.

Aus dem Quellcode bauen:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# For CUDA support:
make -j$(nproc) GGML_CUDA=1

# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1

Ein GGUF-Modell herunterladen:

Laden Sie vorquantisierte GGUF-Dateien von HuggingFace herunter. Suchen Sie nach Community-Uploads mit Quantisierung Q4_K_M (ausgewogen), Q5_K_M (höhere Qualität) oder Q8_0 (nahezu verlustfrei).

Inferenz ausführen:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

Das Flag -ngl 99 lagert alle Layer auf die GPU aus. Reduzieren Sie diese Zahl, wenn Sie begrenztes VRAM haben und zwischen CPU und GPU aufteilen möchten.

Methode 4: vLLM (Produktion)

vLLM ist für Hochdurchsatz-Produktions-Serving konzipiert, mit Funktionen wie kontinuierlichem Batching, PagedAttention und Tensor-Parallelität.

Installieren und serven:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

Die OpenAI-kompatible API abfragen:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

Für Multi-GPU-Setups erhöhen Sie --tensor-parallel-size entsprechend Ihrer GPU-Anzahl. vLLM übernimmt automatisch das Sharding des Modells über mehrere Geräte.

Das richtige Modell wählen

Ihre HardwareEmpfohlenes ModellMethode
Smartphone / Raspberry PiE2B (Q4)Ollama, llama.cpp
Laptop (8 GB RAM)E4B (Q4)Ollama, LM Studio
Gaming-PC (16+ GB VRAM)26B A4B (Q4)Ollama, vLLM
Workstation (24+ GB VRAM)31B Dense (Q4)vLLM, llama.cpp
Multi-GPU-Server31B Dense (FP16)vLLM mit Tensor-Parallelität

Im Zweifelsfall beginnen Sie mit dem 26B A4B-Modell über Ollama. Es bietet für die meisten Nutzer die beste Balance aus Qualität und Ressourceneffizienz.

Fazit

Gemma 4 lokal auszuführen war noch nie einfacher. Ob Sie die Ein-Befehl-Einfachheit von Ollama, die visuelle Oberfläche von LM Studio, die feingranulare Kontrolle von llama.cpp oder das produktionsreife Serving von vLLM wählen — Sie können in wenigen Minuten eine leistungsstarke multimodale KI auf Ihrer eigenen Hardware zum Laufen bringen.

Das E2B-Modell macht KI auf praktisch jedem Gerät zugänglich, während das 31B Dense-Modell eine Qualität liefert, die mit den besten proprietären Modellen konkurriert — alles läuft privat auf Ihrem Rechner ohne API-Kosten und ohne dass Daten Ihr Netzwerk verlassen.

Gemma 4 Team

Gemma 4 Team

Gemma 4 lokal ausführen: Eine Schritt-für-Schritt-Anleitung | Blog | Gemma 4