Ejecutar modelos de IA localmente te da control total sobre tus datos, elimina los costes de API y permite el uso offline. Gemma 4 hace que esto sea viable en una amplia gama de hardware, desde smartphones hasta estaciones de trabajo. Esta guía te lleva por todos los métodos, desde la configuración más sencilla de un solo comando hasta el serving avanzado en producción.
Requisitos previos
Antes de empezar, ten en cuenta tu hardware y qué modelo se ajusta:
| Modelo | Mín. RAM/VRAM | Hardware recomendado |
|---|---|---|
| E2B (Q4) | 3,2 GB | Smartphones, Raspberry Pi, portátiles |
| E4B (Q4) | 5 GB | Portátiles, GPUs de entrada |
| 26B A4B (Q4) | 16 GB | GPUs gaming (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 GB | GPUs de gama alta, configuraciones multi-GPU, Macs de la serie M |
Para la inferencia en GPU, se recomiendan GPUs NVIDIA con soporte CUDA o Macs con Apple Silicon con Metal. La inferencia solo en CPU funciona, pero es considerablemente más lenta para modelos grandes.
Método 1: Ollama (el más fácil)
Ollama es la forma más rápida de empezar. Gestiona la descarga del modelo, la selección de la cuantificación y el serving en una única herramienta.
Instalar Ollama:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# O descárgalo desde https://ollama.com/downloadDescargar y ejecutar un modelo:
# Descarga el modelo (descarga única)
ollama pull gemma4:26b
# Inicia un chat interactivo
ollama run gemma4:26bEtiquetas disponibles:
ollama pull gemma4:31b # 31B Dense: máxima calidad
ollama pull gemma4:26b # 26B A4B: mejor equilibrio
ollama pull gemma4:e4b # E4B: multimodal ligero
ollama pull gemma4:e2b # E2B: edge/móvilOllama también expone una API compatible con OpenAI en http://localhost:11434/v1 para integrarse con otras herramientas.
Método 2: LM Studio (interfaz gráfica)
LM Studio ofrece una aplicación de escritorio pulida con una interfaz de chat, gestión de modelos y un servidor de API local.
- Descarga e instala LM Studio desde lmstudio.ai
- Abre la aplicación y busca "gemma-4" en el explorador de modelos
- Selecciona la variante y el nivel de cuantificación preferidos
- Haz clic en Download y empieza a chatear en la pestaña Chat
LM Studio también ofrece un modo servidor local que expone una API compatible con OpenAI, lo que facilita la integración con aplicaciones existentes.
Método 3: llama.cpp (avanzado)
llama.cpp te da el máximo control sobre los parámetros de inferencia y admite la gama más amplia de hardware.
Compilar desde el código fuente:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# Con soporte CUDA:
make -j$(nproc) GGML_CUDA=1
# Con soporte Metal (macOS):
make -j$(nproc) GGML_METAL=1Descargar un modelo GGUF:
Descarga archivos GGUF precuantificados de HuggingFace. Busca subidas comunitarias con cuantificación Q4_K_M (equilibrada), Q5_K_M (mayor calidad) o Q8_0 (casi sin pérdidas).
Ejecutar inferencia:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99La opción -ngl 99 descarga todas las capas a la GPU. Reduce este número si tienes VRAM limitada y quieres dividir el trabajo entre CPU y GPU.
Método 4: vLLM (producción)
vLLM está diseñado para serving en producción de alto rendimiento con funciones como batching continuo, PagedAttention y paralelismo de tensores.
Instalar y servir:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1Consultar la API compatible con OpenAI:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'Para configuraciones multi-GPU, aumenta --tensor-parallel-size para que coincida con el número de GPUs. vLLM gestiona automáticamente el sharding del modelo entre los dispositivos.
Elegir el modelo adecuado
| Tu hardware | Modelo recomendado | Método |
|---|---|---|
| Smartphone / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| Portátil (8 GB de RAM) | E4B (Q4) | Ollama, LM Studio |
| PC gaming (16+ GB de VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| Estación de trabajo (24+ GB de VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| Servidor multi-GPU | 31B Dense (FP16) | vLLM con paralelismo de tensores |
En caso de duda, empieza con el modelo 26B A4B a través de Ollama. Ofrece el mejor equilibrio entre calidad y eficiencia de recursos para la mayoría de los usuarios.
Conclusión
Ejecutar Gemma 4 localmente nunca ha sido tan fácil. Ya sea que elijas la sencillez de un solo comando de Ollama, la interfaz visual de LM Studio, el control detallado de llama.cpp o el serving de nivel producción de vLLM, puedes tener una potente IA multimodal ejecutándose en tu propio hardware en minutos.
El modelo E2B hace que la IA sea accesible prácticamente en cualquier dispositivo, mientras que el modelo 31B Dense ofrece una calidad que compite con los mejores modelos propietarios, todo ejecutándose de forma privada en tu máquina, sin costes de API y sin que los datos salgan de tu red.
