Exécuter des modèles d'IA en local vous donne un contrôle complet sur vos données, élimine les coûts d'API et permet une utilisation hors ligne. Gemma 4 rend cela pratique sur une large gamme de matériels — des smartphones aux stations de travail. Ce guide vous accompagne à travers chaque méthode, de la configuration la plus simple en une seule commande au service de production avancé.
Prérequis
Avant de commencer, considérez votre matériel et le modèle qui convient :
| Modèle | RAM/VRAM min. | Matériel idéal |
|---|---|---|
| E2B (Q4) | 3,2 Go | Smartphones, Raspberry Pi, ordinateurs portables |
| E4B (Q4) | 5 Go | Ordinateurs portables, GPU d'entrée de gamme |
| 26B A4B (Q4) | 16 Go | GPU de jeu (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 Go | GPU haut de gamme, configurations multi-GPU, Mac série M |
Pour l'inférence GPU, les GPU NVIDIA avec support CUDA ou les Mac Apple Silicon avec Metal sont recommandés. L'inférence CPU uniquement fonctionne mais est nettement plus lente pour les modèles plus grands.
Méthode 1 : Ollama (la plus simple)
Ollama est le moyen le plus rapide de démarrer. Il gère le téléchargement du modèle, la sélection de la quantification et le service dans un seul outil.
Installer Ollama :
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Ou téléchargez depuis https://ollama.com/downloadRécupérer et exécuter un modèle :
# Récupérer le modèle (téléchargement unique)
ollama pull gemma4:26b
# Démarrer un chat interactif
ollama run gemma4:26bTags disponibles :
ollama pull gemma4:31b # 31B Dense — qualité maximale
ollama pull gemma4:26b # 26B A4B — meilleur équilibre
ollama pull gemma4:e4b # E4B — multimodal léger
ollama pull gemma4:e2b # E2B — edge/mobileOllama expose également une API compatible OpenAI à http://localhost:11434/v1 pour l'intégration avec d'autres outils.
Méthode 2 : LM Studio (interface graphique)
LM Studio offre une application de bureau soignée avec interface de chat, gestion de modèles et serveur d'API local.
- Téléchargez et installez LM Studio depuis lmstudio.ai
- Ouvrez l'application et recherchez « gemma-4 » dans le navigateur de modèles
- Sélectionnez votre variante et votre niveau de quantification préférés
- Cliquez sur Download, puis commencez à discuter dans l'onglet Chat
LM Studio propose également un mode serveur local qui expose une API compatible OpenAI, facilitant l'intégration avec les applications existantes.
Méthode 3 : llama.cpp (avancé)
llama.cpp vous donne un contrôle maximal sur les paramètres d'inférence et prend en charge la plus large gamme de matériels.
Compiler depuis les sources :
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# Pour la prise en charge CUDA :
make -j$(nproc) GGML_CUDA=1
# Pour la prise en charge Metal (macOS) :
make -j$(nproc) GGML_METAL=1Télécharger un modèle GGUF :
Téléchargez des fichiers GGUF pré-quantifiés depuis HuggingFace. Recherchez les uploads de la communauté avec quantification Q4_K_M (équilibré), Q5_K_M (qualité supérieure) ou Q8_0 (quasi sans perte).
Exécuter l'inférence :
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99Le drapeau -ngl 99 décharge toutes les couches sur le GPU. Réduisez ce nombre si vous avez une VRAM limitée et souhaitez répartir entre CPU et GPU.
Méthode 4 : vLLM (production)
vLLM est conçu pour le service de production à haut débit avec des fonctionnalités comme le batching continu, PagedAttention et le parallélisme tensoriel.
Installer et servir :
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1Interroger l'API compatible OpenAI :
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'Pour les configurations multi-GPU, augmentez --tensor-parallel-size pour correspondre au nombre de vos GPU. vLLM gère automatiquement le sharding du modèle sur les appareils.
Choisir le bon modèle
| Votre matériel | Modèle recommandé | Méthode |
|---|---|---|
| Smartphone / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| Ordinateur portable (8 Go de RAM) | E4B (Q4) | Ollama, LM Studio |
| PC de jeu (16 Go+ de VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| Station de travail (24 Go+ de VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| Serveur multi-GPU | 31B Dense (FP16) | vLLM avec parallélisme tensoriel |
En cas de doute, commencez avec le modèle 26B A4B via Ollama. Il offre le meilleur équilibre entre qualité et efficacité des ressources pour la plupart des utilisateurs.
Conclusion
Exécuter Gemma 4 en local n'a jamais été aussi simple. Que vous choisissiez la simplicité d'une seule commande avec Ollama, l'interface visuelle de LM Studio, le contrôle fin de llama.cpp ou le service de production de vLLM, vous pouvez avoir une IA multimodale puissante qui tourne sur votre propre matériel en quelques minutes.
Le modèle E2B rend l'IA accessible sur pratiquement n'importe quel appareil, tandis que le modèle 31B Dense offre une qualité qui rivalise avec les meilleurs modèles propriétaires — le tout fonctionnant en privé sur votre machine, sans coûts d'API et sans données quittant votre réseau.
