Cómo ejecutar Gemma 4 localmente: una guía paso a paso

abr. 3, 2026

Ejecutar modelos de IA localmente te da control total sobre tus datos, elimina los costes de API y permite el uso offline. Gemma 4 hace que esto sea viable en una amplia gama de hardware, desde smartphones hasta estaciones de trabajo. Esta guía te lleva por todos los métodos, desde la configuración más sencilla de un solo comando hasta el serving avanzado en producción.

Requisitos previos

Antes de empezar, ten en cuenta tu hardware y qué modelo se ajusta:

ModeloMín. RAM/VRAMHardware recomendado
E2B (Q4)3,2 GBSmartphones, Raspberry Pi, portátiles
E4B (Q4)5 GBPortátiles, GPUs de entrada
26B A4B (Q4)16 GBGPUs gaming (RTX 3090/4090), Apple Silicon
31B Dense (Q4)20 GBGPUs de gama alta, configuraciones multi-GPU, Macs de la serie M

Para la inferencia en GPU, se recomiendan GPUs NVIDIA con soporte CUDA o Macs con Apple Silicon con Metal. La inferencia solo en CPU funciona, pero es considerablemente más lenta para modelos grandes.

Método 1: Ollama (el más fácil)

Ollama es la forma más rápida de empezar. Gestiona la descarga del modelo, la selección de la cuantificación y el serving en una única herramienta.

Instalar Ollama:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# O descárgalo desde https://ollama.com/download

Descargar y ejecutar un modelo:

# Descarga el modelo (descarga única)
ollama pull gemma4:26b

# Inicia un chat interactivo
ollama run gemma4:26b

Etiquetas disponibles:

ollama pull gemma4:31b    # 31B Dense: máxima calidad
ollama pull gemma4:26b    # 26B A4B: mejor equilibrio
ollama pull gemma4:e4b    # E4B: multimodal ligero
ollama pull gemma4:e2b    # E2B: edge/móvil

Ollama también expone una API compatible con OpenAI en http://localhost:11434/v1 para integrarse con otras herramientas.

Método 2: LM Studio (interfaz gráfica)

LM Studio ofrece una aplicación de escritorio pulida con una interfaz de chat, gestión de modelos y un servidor de API local.

  1. Descarga e instala LM Studio desde lmstudio.ai
  2. Abre la aplicación y busca "gemma-4" en el explorador de modelos
  3. Selecciona la variante y el nivel de cuantificación preferidos
  4. Haz clic en Download y empieza a chatear en la pestaña Chat

LM Studio también ofrece un modo servidor local que expone una API compatible con OpenAI, lo que facilita la integración con aplicaciones existentes.

Método 3: llama.cpp (avanzado)

llama.cpp te da el máximo control sobre los parámetros de inferencia y admite la gama más amplia de hardware.

Compilar desde el código fuente:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# Con soporte CUDA:
make -j$(nproc) GGML_CUDA=1

# Con soporte Metal (macOS):
make -j$(nproc) GGML_METAL=1

Descargar un modelo GGUF:

Descarga archivos GGUF precuantificados de HuggingFace. Busca subidas comunitarias con cuantificación Q4_K_M (equilibrada), Q5_K_M (mayor calidad) o Q8_0 (casi sin pérdidas).

Ejecutar inferencia:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

La opción -ngl 99 descarga todas las capas a la GPU. Reduce este número si tienes VRAM limitada y quieres dividir el trabajo entre CPU y GPU.

Método 4: vLLM (producción)

vLLM está diseñado para serving en producción de alto rendimiento con funciones como batching continuo, PagedAttention y paralelismo de tensores.

Instalar y servir:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

Consultar la API compatible con OpenAI:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

Para configuraciones multi-GPU, aumenta --tensor-parallel-size para que coincida con el número de GPUs. vLLM gestiona automáticamente el sharding del modelo entre los dispositivos.

Elegir el modelo adecuado

Tu hardwareModelo recomendadoMétodo
Smartphone / Raspberry PiE2B (Q4)Ollama, llama.cpp
Portátil (8 GB de RAM)E4B (Q4)Ollama, LM Studio
PC gaming (16+ GB de VRAM)26B A4B (Q4)Ollama, vLLM
Estación de trabajo (24+ GB de VRAM)31B Dense (Q4)vLLM, llama.cpp
Servidor multi-GPU31B Dense (FP16)vLLM con paralelismo de tensores

En caso de duda, empieza con el modelo 26B A4B a través de Ollama. Ofrece el mejor equilibrio entre calidad y eficiencia de recursos para la mayoría de los usuarios.

Conclusión

Ejecutar Gemma 4 localmente nunca ha sido tan fácil. Ya sea que elijas la sencillez de un solo comando de Ollama, la interfaz visual de LM Studio, el control detallado de llama.cpp o el serving de nivel producción de vLLM, puedes tener una potente IA multimodal ejecutándose en tu propio hardware en minutos.

El modelo E2B hace que la IA sea accesible prácticamente en cualquier dispositivo, mientras que el modelo 31B Dense ofrece una calidad que compite con los mejores modelos propietarios, todo ejecutándose de forma privada en tu máquina, sin costes de API y sin que los datos salgan de tu red.

Gemma 4 Team

Gemma 4 Team