Im April 2026 veröffentlichte Google DeepMind Gemma 4 — die neueste Generation seiner Open-Source-KI-Modellfamilie. Gemma 4 basiert auf derselben Forschungsgrundlage wie die Gemini-Modelle und stellt einen bedeutenden Sprung nach vorn für Open-Source-KI dar: echtes multimodales Verständnis, ein Kontextfenster von 256K Tokens, integrierte Reasoning-Fähigkeiten und Unterstützung für über 140 Sprachen. Alles unter der Apache 2.0-Lizenz veröffentlicht.
Dieser Leitfaden deckt alles ab, was Sie über Gemma 4 wissen müssen — was es ist, welche Modelle verfügbar sind, was es besonders macht und wie Sie loslegen können.
Die Gemma 4-Modellfamilie
Gemma 4 ist kein einzelnes Modell, sondern eine Familie von fünf Modellen, die jeweils für unterschiedliche Anwendungsfälle und Hardwareanforderungen konzipiert sind:
Gemma 4 E2B ist das kleinste Modell der Familie und verwendet eine Mixture-of-Experts (MoE)-Architektur mit 2 Milliarden aktiven Parametern von insgesamt 4 Milliarden. Trotz seiner kompakten Größe — nur 3,2 GB mit Q4-Quantisierung — liefert E2B beeindruckende Fähigkeiten für On-Device-Bereitstellung. Es läuft komfortabel auf Smartphones und Edge-Geräten und macht private, Offline-KI für jeden zugänglich.
Gemma 4 E4B skaliert den MoE-Ansatz mit 4 Milliarden aktiven Parametern von insgesamt 8 Milliarden. Es fügt vollständige multimodale Unterstützung einschließlich Audioverständnis hinzu und ist damit der Sweet Spot für Entwickler, die starke Fähigkeiten ohne schwere Infrastruktur benötigen. E4B verarbeitet Text, Bilder, Video und Audio nativ.
Gemma 4 12B wurde am 3. Juni 2026 nach der ursprünglichen Veröffentlichung im April in die Familie aufgenommen. Es verwendet eine einheitliche multimodale Architektur, anstatt separate Encoder an ein Text-Backbone anzuschließen. Damit ist es die erste Variante, die in Betracht gezogen werden sollte, wenn ein einzelnes Modell mehrere Eingabetypen verarbeiten muss, ohne dass eine von Hand erstellte Routing-Schicht erforderlich ist. Da es später als der Rest der Modellreihe veröffentlicht wurde, sind die veröffentlichten Angaben zu Parametern, Kontext und Speicher noch nicht endgültig festgelegt – prüfen Sie die offizielle Modellkarte auf Hugging Face, bevor Sie die Hardware dafür dimensionieren.
Gemma 4 26B A4B ist das Arbeitstier für die Produktion. Mit 9 Milliarden aktiven Parametern von insgesamt 26 Milliarden über seine MoE-Architektur liefert es eine Leistung, die mit viel größeren Modellen mithalten kann, während die Inferenzkosten überschaubar bleiben. Es brilliert bei Codegenerierung (80 % auf LiveCodeBench), agentenbasierter Tool-Nutzung und komplexen Reasoning-Aufgaben.
Gemma 4 31B Dense ist das Flaggschiff-Modell. Im Gegensatz zu den anderen verwendet es eine traditionelle Dense-Architektur, bei der alle 31 Milliarden Parameter während der Inferenz aktiv sind. Dies verleiht ihm die höchste Rohqualität in allen Benchmarks, insbesondere für Langkontextverständnis und nuancierte mehrsprachige Aufgaben. Es ist die beste Wahl, wenn Qualität oberste Priorität hat.
Wichtigste Funktionen
Multimodales Verständnis
Gemma 4-Modelle verarbeiten nativ Text, Bilder, Video und Audio (Audiounterstützung in E2B und E4B). Die Bildeingabe mit variabler Auflösung ermöglicht es den Modellen, Bilder in ihrer nativen Auflösung zu analysieren, ohne erzwungene Größenänderung, was die Genauigkeit bei visuellen Aufgaben wie Diagrammauswertung, Dokument-OCR und Bildanalyse verbessert.
Kontextfenster von 256K Tokens
Alle Gemma 4-Modelle unterstützen ein Kontextfenster von 256K Tokens — genug, um ganze Codebasen, lange juristische Dokumente, buchlange Texte oder ausgedehnte Mehrrundengespräche zu verarbeiten. Dies ist eine erhebliche Verbesserung gegenüber früheren Generationen und stellt Gemma 4 in Bezug auf die Kontextlänge auf Augenhöhe mit den größten proprietären Modellen.
Integriertes Reasoning
Gemma 4 enthält verbesserte Denkfähigkeiten, die es ermöglichen, komplexe Probleme Schritt für Schritt aufzuschlüsseln. Dies ist besonders wertvoll für mathematisches Reasoning, Code-Debugging und mehrstufige Planungsaufgaben. Der Reasoning-Modus kann je nach Anwendungsfall ein- oder ausgeschaltet werden.
Natives Function Calling
Für Entwickler, die Agenten und Tool-nutzende Anwendungen erstellen, unterstützt Gemma 4 natives Function Calling mit strukturierter JSON-Ausgabe. Das bedeutet, dass das Modell zuverlässig externe APIs aufrufen, Datenbanken abfragen und mehrstufige Workflows orchestrieren kann, ohne auf brüchiges Prompt-Engineering angewiesen zu sein.
Unterstützung für über 140 Sprachen
Gemma 4 unterstützt über 140 Sprachen mit durchweg starker Leistung. Auf dem Massive Multitask Multilingual Understanding (MMMLU)-Benchmark erreicht es 85,2 % — und ist damit eines der leistungsfähigsten mehrsprachigen Open-Source-Modelle. Dies ermöglicht wirklich globale Anwendungen in Übersetzung, Inhaltsmoderation und Kundensupport.
Benchmarks
Gemma 4 liefert wettbewerbsfähige oder führende Ergebnisse in wichtigen Benchmarks:
- LiveCodeBench: 80 % (26B A4B) — starke Codegenerierung und -verständnis
- MMMLU: 85,2 % — außergewöhnliches mehrsprachiges Verständnis
- MMMU: 72,4 % (31B Dense) — starkes multimodales Verständnis
- MATH-500: 91,8 % (31B Dense) — nahezu Expertenniveau im mathematischen Reasoning
- Arena Hard: 85,1 % (31B Dense) — wettbewerbsfähige konversationelle Fähigkeiten
Diese Zahlen platzieren Gemma 4 unter den besten Open-Source-Modellen und machen es wettbewerbsfähig mit vielen proprietären Alternativen.
Erste Schritte
Der einfachste Weg, Gemma 4 auszuprobieren, ist über Ollama:
ollama pull gemma4:26b
ollama run gemma4:26bFür browserbasiertes Experimentieren besuchen Sie Google AI Studio, wo Sie mit Gemma 4 chatten und kostenlos einen API-Schlüssel erhalten können.
Für die Produktionsbereitstellung sind die Modelle auf HuggingFace, Kaggle verfügbar und können mit Frameworks wie vLLM, TGI und SGLang bereitgestellt werden.
Sehen Sie sich unseren Erste-Schritte-Leitfaden für detaillierte Einrichtungsanweisungen und unsere Downloads-Seite für alle verfügbaren Plattformen an.
Fazit
Gemma 4 markiert einen Wendepunkt für Open-Source-KI. Zum ersten Mal haben Entwickler Zugang zu einer Modellfamilie, die echtes multimodales Verständnis, langen Kontext, integriertes Reasoning, native Tool-Nutzung und breite mehrsprachige Unterstützung kombiniert — alles unter einer Apache 2.0-Lizenz ohne Nutzungsbeschränkungen.
Ob Sie einen Code-Assistenten erstellen, KI auf einem Smartphone bereitstellen, Tausende von Dokumenten verarbeiten oder mehrsprachige Kundensupport-Agenten erstellen — Gemma 4 bietet eine leistungsstarke, effiziente und wirklich offene Grundlage, auf der Sie aufbauen können. Die Lücke zwischen Open-Source- und proprietärer KI war noch nie kleiner.
