Comment exécuter Gemma 4 en local : un guide étape par étape

avr. 3, 2026

Exécuter des modèles d'IA en local vous donne un contrôle complet sur vos données, élimine les coûts d'API et permet une utilisation hors ligne. Gemma 4 rend cela pratique sur une large gamme de matériels — des smartphones aux stations de travail. Ce guide vous accompagne à travers chaque méthode, de la configuration la plus simple en une seule commande au service de production avancé.

Prérequis

Avant de commencer, considérez votre matériel et le modèle qui convient :

ModèleRAM/VRAM min.Matériel idéal
E2B (Q4)3,2 GoSmartphones, Raspberry Pi, ordinateurs portables
E4B (Q4)5 GoOrdinateurs portables, GPU d'entrée de gamme
26B A4B (Q4)16 GoGPU de jeu (RTX 3090/4090), Apple Silicon
31B Dense (Q4)20 GoGPU haut de gamme, configurations multi-GPU, Mac série M

Pour l'inférence GPU, les GPU NVIDIA avec support CUDA ou les Mac Apple Silicon avec Metal sont recommandés. L'inférence CPU uniquement fonctionne mais est nettement plus lente pour les modèles plus grands.

Méthode 1 : Ollama (la plus simple)

Ollama est le moyen le plus rapide de démarrer. Il gère le téléchargement du modèle, la sélection de la quantification et le service dans un seul outil.

Installer Ollama :

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Ou téléchargez depuis https://ollama.com/download

Récupérer et exécuter un modèle :

# Récupérer le modèle (téléchargement unique)
ollama pull gemma4:26b

# Démarrer un chat interactif
ollama run gemma4:26b

Tags disponibles :

ollama pull gemma4:31b    # 31B Dense — qualité maximale
ollama pull gemma4:26b    # 26B A4B — meilleur équilibre
ollama pull gemma4:e4b    # E4B — multimodal léger
ollama pull gemma4:e2b    # E2B — edge/mobile

Ollama expose également une API compatible OpenAI à http://localhost:11434/v1 pour l'intégration avec d'autres outils.

Méthode 2 : LM Studio (interface graphique)

LM Studio offre une application de bureau soignée avec interface de chat, gestion de modèles et serveur d'API local.

  1. Téléchargez et installez LM Studio depuis lmstudio.ai
  2. Ouvrez l'application et recherchez « gemma-4 » dans le navigateur de modèles
  3. Sélectionnez votre variante et votre niveau de quantification préférés
  4. Cliquez sur Download, puis commencez à discuter dans l'onglet Chat

LM Studio propose également un mode serveur local qui expose une API compatible OpenAI, facilitant l'intégration avec les applications existantes.

Méthode 3 : llama.cpp (avancé)

llama.cpp vous donne un contrôle maximal sur les paramètres d'inférence et prend en charge la plus large gamme de matériels.

Compiler depuis les sources :

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# Pour la prise en charge CUDA :
make -j$(nproc) GGML_CUDA=1

# Pour la prise en charge Metal (macOS) :
make -j$(nproc) GGML_METAL=1

Télécharger un modèle GGUF :

Téléchargez des fichiers GGUF pré-quantifiés depuis HuggingFace. Recherchez les uploads de la communauté avec quantification Q4_K_M (équilibré), Q5_K_M (qualité supérieure) ou Q8_0 (quasi sans perte).

Exécuter l'inférence :

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

Le drapeau -ngl 99 décharge toutes les couches sur le GPU. Réduisez ce nombre si vous avez une VRAM limitée et souhaitez répartir entre CPU et GPU.

Méthode 4 : vLLM (production)

vLLM est conçu pour le service de production à haut débit avec des fonctionnalités comme le batching continu, PagedAttention et le parallélisme tensoriel.

Installer et servir :

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

Interroger l'API compatible OpenAI :

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

Pour les configurations multi-GPU, augmentez --tensor-parallel-size pour correspondre au nombre de vos GPU. vLLM gère automatiquement le sharding du modèle sur les appareils.

Choisir le bon modèle

Votre matérielModèle recommandéMéthode
Smartphone / Raspberry PiE2B (Q4)Ollama, llama.cpp
Ordinateur portable (8 Go de RAM)E4B (Q4)Ollama, LM Studio
PC de jeu (16 Go+ de VRAM)26B A4B (Q4)Ollama, vLLM
Station de travail (24 Go+ de VRAM)31B Dense (Q4)vLLM, llama.cpp
Serveur multi-GPU31B Dense (FP16)vLLM avec parallélisme tensoriel

En cas de doute, commencez avec le modèle 26B A4B via Ollama. Il offre le meilleur équilibre entre qualité et efficacité des ressources pour la plupart des utilisateurs.

Conclusion

Exécuter Gemma 4 en local n'a jamais été aussi simple. Que vous choisissiez la simplicité d'une seule commande avec Ollama, l'interface visuelle de LM Studio, le contrôle fin de llama.cpp ou le service de production de vLLM, vous pouvez avoir une IA multimodale puissante qui tourne sur votre propre matériel en quelques minutes.

Le modèle E2B rend l'IA accessible sur pratiquement n'importe quel appareil, tandis que le modèle 31B Dense offre une qualité qui rivalise avec les meilleurs modèles propriétaires — le tout fonctionnant en privé sur votre machine, sans coûts d'API et sans données quittant votre réseau.

Gemma 4 Team

Gemma 4 Team