Qu'est-ce que Gemma 4 ? Guide complet des modèles d'IA open source de Google

avr. 2, 2026

En avril 2026, Google DeepMind a publié Gemma 4 — la dernière génération de sa famille de modèles d'IA open source. Construit sur la même base de recherche que les modèles Gemini, Gemma 4 représente un bond en avant significatif pour l'IA open source : une véritable compréhension multimodale, une fenêtre de contexte de 256 K tokens, des capacités de raisonnement intégrées et la prise en charge de plus de 140 langues. Le tout publié sous licence Apache 2.0.

Ce guide couvre tout ce que vous devez savoir sur Gemma 4 — ce qu'il est, quels modèles sont disponibles, ce qui le rend spécial et comment démarrer.

La famille de modèles Gemma 4

Gemma 4 n'est pas un modèle unique mais une famille de cinq modèles, chacun conçu pour différents cas d'usage et contraintes matérielles :

Gemma 4 E2B est le plus petit modèle de la famille, utilisant une architecture Mixture-of-Experts (MoE) avec 2 milliards de paramètres actifs sur 4 milliards au total. Malgré sa taille compacte — seulement 3,2 Go en quantification Q4 — E2B offre des capacités impressionnantes pour le déploiement sur appareil. Il fonctionne confortablement sur les smartphones et les appareils edge, rendant l'IA privée et hors ligne accessible à tous.

Gemma 4 E4B étend l'approche MoE avec 4 milliards de paramètres actifs sur 8 milliards au total. Il ajoute une prise en charge multimodale complète, y compris la compréhension audio, en faisant le point idéal pour les développeurs qui ont besoin de capacités solides sans infrastructure lourde. E4B traite nativement le texte, les images, la vidéo et l'audio.

Gemma 4 12B a rejoint la famille le 3 juin 2026, après le lancement initial d’avril. Il utilise une architecture multimodale unifiée plutôt que de rattacher des encodeurs séparés à un socle textuel, ce qui en fait la première variante à envisager lorsqu’un modèle unique doit gérer plusieurs types d’entrée sans couche de routage conçue sur mesure. Comme il a été commercialisé plus tard que le reste de la gamme, les chiffres publiés concernant le nombre de paramètres, le contexte et la mémoire ne sont pas encore stabilisés — consultez la fiche officielle du modèle sur Hugging Face avant de dimensionner le matériel en conséquence.

Gemma 4 26B A4B est le cheval de bataille de la production. Avec 9 milliards de paramètres actifs sur 26 milliards au total grâce à son architecture MoE, il offre des performances qui rivalisent avec des modèles bien plus grands tout en maintenant des coûts d'inférence gérables. Il excelle dans la génération de code (80 % sur LiveCodeBench), l'utilisation d'outils agentiques et les tâches de raisonnement complexes.

Gemma 4 31B Dense est le modèle phare. Contrairement aux autres, il utilise une architecture dense traditionnelle où les 31 milliards de paramètres sont actifs pendant l'inférence. Cela lui confère la qualité brute la plus élevée sur les benchmarks, en particulier pour la compréhension de contexte long et les tâches multilingues nuancées. C'est le meilleur choix lorsque la qualité est la priorité absolue.

Fonctionnalités clés

Compréhension multimodale

Les modèles Gemma 4 traitent nativement le texte, les images, la vidéo et l'audio (prise en charge audio dans E2B et E4B). L'entrée d'images à résolution variable permet aux modèles d'analyser les images à leur résolution native sans redimensionnement forcé, améliorant la précision sur les tâches visuelles comme la lecture de graphiques, l'OCR de documents et l'analyse d'images.

Fenêtre de contexte de 256 K tokens

Tous les modèles Gemma 4 prennent en charge une fenêtre de contexte de 256 K tokens — suffisante pour traiter des bases de code entières, de longs documents juridiques, des textes de la taille d'un livre ou de longues conversations multi-tours. Il s'agit d'une amélioration substantielle par rapport aux générations précédentes et place Gemma 4 au niveau des plus grands modèles propriétaires en termes de longueur de contexte.

Raisonnement intégré

Gemma 4 inclut des capacités de réflexion améliorées qui lui permettent de décomposer des problèmes complexes étape par étape. Cela est particulièrement précieux pour le raisonnement mathématique, le débogage de code et les tâches de planification en plusieurs étapes. Le mode de raisonnement peut être activé ou désactivé selon le cas d'usage.

Appel de fonctions natif

Pour les développeurs qui créent des agents et des applications utilisant des outils, Gemma 4 prend en charge l'appel de fonctions natif avec sortie JSON structurée. Cela signifie que le modèle peut invoquer de manière fiable des API externes, interroger des bases de données et orchestrer des flux de travail multi-étapes sans ingénierie de prompt fragile.

Prise en charge de plus de 140 langues

Gemma 4 prend en charge plus de 140 langues avec de solides performances sur l'ensemble. Sur le benchmark Massive Multitask Multilingual Understanding (MMMLU), il obtient 85,2 % — ce qui en fait l'un des modèles multilingues open source les plus performants disponibles. Cela permet de véritables applications mondiales en traduction, modération de contenu et support client.

Benchmarks

Gemma 4 offre des résultats compétitifs ou en tête sur les principaux benchmarks :

  • LiveCodeBench : 80 % (26B A4B) — génération et compréhension de code solides
  • MMMLU : 85,2 % — compréhension multilingue exceptionnelle
  • MMMU : 72,4 % (31B Dense) — solide compréhension multimodale
  • MATH-500 : 91,8 % (31B Dense) — raisonnement mathématique quasi expert
  • Arena Hard : 85,1 % (31B Dense) — capacité conversationnelle compétitive

Ces chiffres placent Gemma 4 parmi les meilleurs modèles open source et compétitif avec de nombreuses alternatives propriétaires.

Démarrer

La façon la plus simple d'essayer Gemma 4 est via Ollama :

ollama pull gemma4:26b
ollama run gemma4:26b

Pour une expérimentation dans le navigateur, visitez Google AI Studio où vous pouvez discuter avec Gemma 4 et obtenir une clé API gratuitement.

Pour le déploiement en production, les modèles sont disponibles sur HuggingFace, Kaggle, et peuvent être servis avec des frameworks comme vLLM, TGI et SGLang.

Consultez notre Guide de démarrage pour des instructions de configuration détaillées et notre page Téléchargements pour toutes les plateformes disponibles.

Conclusion

Gemma 4 marque un tournant pour l'IA open source. Pour la première fois, les développeurs ont accès à une famille de modèles qui combine une véritable compréhension multimodale, un long contexte, un raisonnement intégré, une utilisation native d'outils et une large prise en charge multilingue — le tout sous une licence Apache 2.0 sans restrictions d'utilisation.

Que vous construisiez un assistant de code, déployiez de l'IA sur un smartphone, traitiez des milliers de documents ou créiez des agents de support client multilingues, Gemma 4 fournit une base capable, efficace et véritablement ouverte sur laquelle bâtir. L'écart entre l'IA open source et propriétaire n'a jamais été aussi réduit.

Gemma 4 Team

Gemma 4 Team

Qu'est-ce que Gemma 4 ? Guide complet des modèles d'IA open source de Google | Blog | Gemma 4