Gemma 4 bietet fünf unterschiedliche Modellvarianten, die jeweils für verschiedene Hardware und Anwendungsfälle optimiert sind. Dieser Leitfaden hilft Ihnen bei der Auswahl der richtigen Variante.
Die Gemma 4-Modellfamilie auf einen Blick
| Modell | Parameter | Aktive Parameter | Kontext | Am besten geeignet für |
|---|---|---|---|---|
| E2B | 2,3B | 2,3B | 128K | Mobile, IoT, Edge-Geräte |
| E4B | 4,5B | 4,5B | 128K | Laptops, Tablets, Edge-GPUs |
| 12B | — | — | — | Einheitliche multimodale Workloads (veröffentlicht am 3. Juni 2026) |
| 26B A4B | 26B | 3,8B (MoE) | 256K | Consumer-GPUs, kosteneffiziente Inferenz |
| 31B Dense | 30,7B | 30,7B | 256K | Maximale Qualität, Fine-Tuning, Workstations |
Gemma 4 E2B: Das ultrakompakte Modell
Am besten geeignet für: Smartphones, Raspberry Pi, Jetson Nano und andere ressourcenbeschränkte Geräte.
Das E2B-Modell packt beeindruckende Fähigkeiten in nur 2,3 Milliarden effektive Parameter. Bei Q4-Quantisierung benötigt es lediglich 3,2 GB Speicher — klein genug, um auf den meisten modernen Smartphones zu laufen.
Wichtige Stärken:
- Native Unterstützung für Audioeingaben
- Nahezu null Latenz für einfache Aufgaben
- Vollständig offlinefähig
- 128K Kontextfenster
Einschränkungen: Geringere Reasoning-Qualität im Vergleich zu größeren Varianten. Am besten geeignet für einfache Aufgaben wie Textzusammenfassung, grundlegende Q&A und schnelle Übersetzungen.
Gemma 4 E4B: Der Sweet Spot für Edge
Am besten geeignet für: Laptops, Tablets, Android-/iOS-Apps und Edge-GPUs.
E4B verdoppelt die Fähigkeiten von E2B und bleibt dabei auf Consumer-Hardware einsetzbar. Bei Q4-Quantisierung benötigt es etwa 5 GB — komfortabel für die meisten Laptops.
Wichtige Stärken:
- Audio- und Vision-Fähigkeiten
- AICore-Preview-Unterstützung auf Android
- ML Kit GenAI API-Integration
- Starke mehrsprachige Leistung
Wann sollten Sie E4B gegenüber E2B wählen: Wenn Sie eine bessere Reasoning-Qualität benötigen und etwas mehr Speicher zur Verfügung haben. E4B ist der empfohlene Ausgangspunkt für die meisten lokalen Bereitstellungen.
Gemma 4 12B: Die einheitliche multimodale Variante
Am besten geeignet für: Workloads, die Text, Bilder und Audio in einer einzigen Pipeline kombinieren.
Die 12B-Konfiguration wurde am 3. Juni 2026 nach der ursprünglichen Veröffentlichung im April eingeführt. Sie verwendet eine einheitliche multimodale Architektur, anstatt separate Encoder an ein Text-Backbone anzusetzen. Damit ist sie die Variante, die man sich zuerst ansehen sollte, wenn ein einzelnes Modell mehr als einen Eingabetyp verarbeiten muss, ohne dass eine eigens entwickelte Routing-Schicht erforderlich ist.
Da sie später als der Rest der Familie veröffentlicht wurde, sind die veröffentlichten Angaben zur Parameteranzahl, zum Kontextfenster und zum quantisierten Speicherbedarf noch nicht endgültig. Prüfen Sie die offizielle Modellkarte auf Hugging Face auf aktuelle Zahlen, bevor Sie die Hardware dafür dimensionieren — wir aktualisieren die obige Tabelle, sobald diese Angaben bestätigt sind.
Gemma 4 26B A4B: Der Effizienzmeister
Am besten geeignet für: Consumer-GPUs, einzelne H100, kosteneffizientes Produktions-Serving.
Hier zeigt die Mixture-of-Experts-Architektur ihre Stärken. Trotz 26 Milliarden Gesamtparametern aktivieren sich pro Token nur 3,8 Milliarden — das liefert die Qualität eines großen Modells zu den Inferenzkosten eines kleinen Modells.
Wichtige Stärken:
- Platz 6 unter offenen Modellen auf Arena AI
- 256K Kontextfenster
- Ultraschnelle Inferenz dank MoE-Effizienz
- Läuft auf Consumer-GPUs bei Q4 (15,6 GB)
Wann sollten Sie 26B gegenüber 31B wählen: Wenn Inferenzgeschwindigkeit und Kosten wichtiger sind als das Herausholen der letzten Qualitätsprozente. Für die meisten Produktionsanwendungsfälle bietet das 26B A4B das beste Qualitäts-Kosten-Verhältnis.
Gemma 4 31B Dense: Das Flaggschiff
Am besten geeignet für: Aufgaben mit maximaler Qualität, Fine-Tuning, Forschung und Workstation-Bereitstellung.
Das 31B Dense-Modell ist die leistungsfähigste Variante von Gemma 4 und belegt weltweit Platz 3 unter den offenen Modellen auf dem Arena-AI-Text-Leaderboard.
Wichtige Stärken:
- Höchste Qualität über alle Benchmarks hinweg
- AIME 2026: 89,2 %
- LiveCodeBench v6: 80 %
- Optimiert für Fine-Tuning-Workflows
- 256K Kontextfenster
Hardwareanforderungen: Bei voller BF16-Präzision benötigen Sie 58,3 GB (einzelne 80-GB-H100). Bei Q4-Quantisierung sinkt der Bedarf auf 17,4 GB — machbar auf High-End-Consumer-GPUs.
Entscheidungs-Flowchart
- Läuft auf einem Smartphone oder winzigen Gerät? → E2B
- Läuft auf einem Laptop oder Tablet? → E4B
- Benötigen Sie Produktions-Serving mit guter Kosteneffizienz? → 26B A4B
- Benötigen Sie maximale Qualität oder planen Fine-Tuning? → 31B Dense
- Nicht sicher? → Beginnen Sie mit 26B A4B, wenn Sie 16+ GB VRAM haben, andernfalls mit E4B
Schnellreferenz zu Speicheranforderungen
| Modell | BF16 | FP8 | Q4_0 |
|---|---|---|---|
| E2B | 9,6 GB | 4,6 GB | 3,2 GB |
| E4B | 15 GB | 7,5 GB | 5 GB |
| 26B A4B | 48 GB | 25 GB | 15,6 GB |
| 31B | 58,3 GB | 30,4 GB | 17,4 GB |
Diese Zahlen repräsentieren nur die statischen Modellgewichte. Der tatsächliche Speicherverbrauch steigt mit der Größe des Kontextfensters, dem KV-Cache und dem Laufzeit-Overhead.
Fazit
Es gibt kein einzig „bestes" Gemma 4-Modell — die richtige Wahl hängt von Ihren Hardwarebeschränkungen und den Prioritäten Ihres Anwendungsfalls ab. Die Modellfamilie ist so konzipiert, dass Sie klein anfangen (E2B/E4B für Prototyping) und skalieren können (26B/31B für Produktion), während die API-Kompatibilität über das gesamte Lineup hinweg erhalten bleibt.
Für die meisten Entwickler, die gerade beginnen, empfehlen wir das 26B A4B — es bietet die beste Balance aus Qualität, Geschwindigkeit und Hardwarezugänglichkeit. Wenn Sie auf mobilen oder Edge-Geräten bereitstellen, beginnen Sie mit E4B und wechseln Sie nur dann zu E2B, wenn der Speicher wirklich knapp ist.
