Gemma 4 propose cinq variantes de modèles distinctes, chacune optimisée pour différents matériels et cas d'usage. Ce guide vous aide à choisir la bonne.
La famille de modèles Gemma 4 en un coup d'œil
| Modèle | Paramètres | Paramètres actifs | Contexte | Idéal pour |
|---|---|---|---|---|
| E2B | 2,3 Mrd | 2,3 Mrd | 128 K | Mobile, IoT, appareils edge |
| E4B | 4,5 Mrd | 4,5 Mrd | 128 K | Ordinateurs portables, tablettes, GPU edge |
| 12B | — | — | — | Charges de travail multimodales unifiées (publiée le 3 juin 2026) |
| 26B A4B | 26 Mrd | 3,8 Mrd (MoE) | 256 K | GPU grand public, inférence économique |
| 31B Dense | 30,7 Mrd | 30,7 Mrd | 256 K | Qualité maximale, fine-tuning, stations de travail |
Gemma 4 E2B : le modèle ultra-compact
Idéal pour : Téléphones, Raspberry Pi, Jetson Nano et autres appareils à ressources limitées.
Le modèle E2B condense des capacités impressionnantes dans seulement 2,3 milliards de paramètres effectifs. En quantification Q4, il ne nécessite que 3,2 Go de mémoire — suffisamment petit pour fonctionner sur la plupart des smartphones modernes.
Points forts :
- Prise en charge native de l'entrée audio
- Latence quasi nulle pour les tâches simples
- Fonctionnement entièrement hors ligne
- Fenêtre de contexte de 128 K
Limitations : Qualité de raisonnement inférieure aux variantes plus grandes. Idéal pour les tâches directes comme la synthèse de texte, les Q&R de base et les traductions rapides.
Gemma 4 E4B : le point idéal pour l'edge
Idéal pour : Ordinateurs portables, tablettes, applications Android/iOS et GPU edge.
E4B double la capacité d'E2B tout en restant déployable sur du matériel grand public. En quantification Q4, il nécessite environ 5 Go — confortable pour la plupart des ordinateurs portables.
Points forts :
- Capacités audio et vision
- Prise en charge AICore en préversion sur Android
- Intégration avec l'API ML Kit GenAI
- Solides performances multilingues
Quand choisir E4B plutôt qu'E2B : Lorsque vous avez besoin d'une meilleure qualité de raisonnement et disposez d'un peu plus de mémoire. E4B est le point de départ recommandé pour la plupart des déploiements locaux.
Gemma 4 12B : la variante multimodale unifiée
Idéal pour : Les charges de travail qui combinent texte, images et audio au sein d’un même pipeline.
La configuration 12B est arrivée le 3 juin 2026, après le lancement initial d’avril, et utilise une architecture multimodale unifiée plutôt que de greffer des encodeurs distincts sur un backbone textuel. C’est donc la variante à examiner en premier lorsqu’un même modèle doit gérer plusieurs types d’entrées sans couche de routage conçue manuellement.
Comme elle a été publiée plus tard que le reste de la famille, les chiffres publiés concernant le nombre de paramètres, la fenêtre de contexte et l’empreinte mémoire quantifiée sont encore en cours de stabilisation. Consultez la fiche officielle du modèle sur Hugging Face pour connaître les chiffres actuels avant de dimensionner le matériel en conséquence — nous mettrons à jour le tableau ci-dessus une fois ces chiffres confirmés.
Gemma 4 26B A4B : le champion de l'efficacité
Idéal pour : GPU grand public, H100 unique, service de production économique.
C'est là que l'architecture Mixture-of-Experts brille. Malgré ses 26 milliards de paramètres au total, seulement 3,8 milliards s'activent par token — offrant la qualité d'un grand modèle au coût d'inférence d'un petit modèle.
Points forts :
- Classé #6 parmi les modèles ouverts sur Arena AI
- Fenêtre de contexte de 256 K
- Inférence ultra-rapide grâce à l'efficacité MoE
- Fonctionne sur les GPU grand public en Q4 (15,6 Go)
Quand choisir 26B plutôt que 31B : Lorsque la vitesse et le coût d'inférence comptent plus que les derniers pourcentages de qualité. Pour la plupart des cas d'usage en production, le 26B A4B offre le meilleur rapport qualité/coût.
Gemma 4 31B Dense : le modèle phare
Idéal pour : Tâches de qualité maximale, fine-tuning, recherche et déploiement en station de travail.
Le modèle 31B Dense est la variante la plus performante de Gemma 4, classée #3 parmi les modèles ouverts au niveau mondial sur le classement textuel Arena AI.
Points forts :
- Qualité la plus élevée sur tous les benchmarks
- AIME 2026 : 89,2 %
- LiveCodeBench v6 : 80 %
- Optimisé pour les flux de fine-tuning
- Fenêtre de contexte de 256 K
Exigences matérielles : En pleine précision BF16, vous avez besoin de 58,3 Go (un seul H100 80 Go). En quantification Q4, cela tombe à 17,4 Go — faisable sur les GPU grand public haut de gamme.
Organigramme de décision
- Exécution sur un téléphone ou un appareil minuscule ? → E2B
- Exécution sur un ordinateur portable ou une tablette ? → E4B
- Besoin d'un service en production avec une bonne efficacité des coûts ? → 26B A4B
- Besoin d'une qualité maximale ou plan de fine-tuning ? → 31B Dense
- Pas sûr ? → Commencez avec 26B A4B si vous avez 16 Go+ de VRAM, sinon E4B
Référence rapide des exigences mémoire
| Modèle | BF16 | FP8 | Q4_0 |
|---|---|---|---|
| E2B | 9,6 Go | 4,6 Go | 3,2 Go |
| E4B | 15 Go | 7,5 Go | 5 Go |
| 26B A4B | 48 Go | 25 Go | 15,6 Go |
| 31B | 58,3 Go | 30,4 Go | 17,4 Go |
Ces chiffres représentent uniquement les poids statiques du modèle. L'utilisation réelle de la mémoire augmente avec la taille de la fenêtre de contexte, le cache KV et la surcharge d'exécution.
Conclusion
Il n'existe pas de « meilleur » modèle Gemma 4 unique — le bon choix dépend de vos contraintes matérielles et des priorités de votre cas d'usage. La famille de modèles est conçue pour que vous puissiez commencer petit (E2B/E4B pour le prototypage) et passer à l'échelle (26B/31B pour la production) tout en maintenant la compatibilité d'API sur toute la gamme.
Pour la plupart des développeurs qui démarrent, nous recommandons le 26B A4B — il offre le meilleur équilibre entre qualité, vitesse et accessibilité matérielle. Si vous déployez sur des appareils mobiles ou edge, commencez par E4B et passez à E2B uniquement si la mémoire est vraiment contrainte.
