Como Rodar o Gemma 4 Localmente: Um Guia Passo a Passo

abr 3, 2026

Executar modelos de IA localmente dá a você controle total sobre seus dados, elimina custos de API e possibilita o uso offline. O Gemma 4 torna isso prático em uma ampla gama de hardware — de smartphones a workstations. Este guia apresenta todos os métodos, desde a configuração mais fácil de um comando até o atendimento avançado em produção.

Pré-requisitos

Antes de começar, considere seu hardware e qual modelo se encaixa:

ModeloMínimo de RAM/VRAMMelhor Hardware
E2B (Q4)3,2 GBSmartphones, Raspberry Pi, laptops
E4B (Q4)5 GBLaptops, GPUs de entrada
26B A4B (Q4)16 GBGPUs de jogo (RTX 3090/4090), Apple Silicon
31B Dense (Q4)20 GBGPUs de ponta, configurações multi-GPU, Macs série M

Para inferência em GPU, são recomendadas GPUs NVIDIA com suporte a CUDA ou Macs Apple Silicon com Metal. A inferência apenas em CPU funciona, mas é significativamente mais lenta para modelos maiores.

Método 1: Ollama (Mais Fácil)

Ollama é a maneira mais rápida de começar. Ele lida com o download do modelo, seleção de quantização e atendimento em uma única ferramenta.

Instale o Ollama:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Ou baixe em https://ollama.com/download

Baixe e execute um modelo:

# Baixe o modelo (download único)
ollama pull gemma4:26b

# Inicie um chat interativo
ollama run gemma4:26b

Tags disponíveis:

ollama pull gemma4:31b    # 31B Dense — maior qualidade
ollama pull gemma4:26b    # 26B A4B — melhor equilíbrio
ollama pull gemma4:e4b    # E4B — multimodal leve
ollama pull gemma4:e2b    # E2B — edge/mobile

O Ollama também expõe uma API compatível com OpenAI em http://localhost:11434/v1 para integração com outras ferramentas.

Método 2: LM Studio (GUI)

LM Studio fornece um aplicativo desktop polido com uma interface de chat, gerenciamento de modelos e um servidor de API local.

  1. Baixe e instale o LM Studio em lmstudio.ai
  2. Abra o aplicativo e pesquise por "gemma-4" no navegador de modelos
  3. Selecione sua variante preferida e nível de quantização
  4. Clique em Download e comece a conversar na aba Chat

O LM Studio também fornece um modo de servidor local que expõe uma API compatível com OpenAI, facilitando a integração com aplicações existentes.

Método 3: llama.cpp (Avançado)

llama.cpp oferece controle máximo sobre os parâmetros de inferência e suporta a maior variedade de hardware.

Compile a partir do código-fonte:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# Para suporte a CUDA:
make -j$(nproc) GGML_CUDA=1

# Para suporte a Metal (macOS):
make -j$(nproc) GGML_METAL=1

Baixe um modelo GGUF:

Baixe arquivos GGUF pré-quantizados do HuggingFace. Procure uploads da comunidade com quantização Q4_K_M (equilibrada), Q5_K_M (maior qualidade) ou Q8_0 (quase sem perdas).

Execute a inferência:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

A flag -ngl 99 transfere todas as camadas para a GPU. Reduza esse número se você tiver VRAM limitada e quiser dividir entre CPU e GPU.

Método 4: vLLM (Produção)

vLLM é projetado para atendimento de alta taxa de transferência em produção com recursos como batching contínuo, PagedAttention e paralelismo de tensores.

Instale e sirva:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

Consulte a API compatível com OpenAI:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

Para configurações multi-GPU, aumente --tensor-parallel-size para corresponder à sua contagem de GPUs. O vLLM lida automaticamente com o sharding do modelo entre dispositivos.

Escolhendo o Modelo Certo

Seu HardwareModelo RecomendadoMétodo
Smartphone / Raspberry PiE2B (Q4)Ollama, llama.cpp
Laptop (8 GB RAM)E4B (Q4)Ollama, LM Studio
PC Gamer (16+ GB VRAM)26B A4B (Q4)Ollama, vLLM
Workstation (24+ GB VRAM)31B Dense (Q4)vLLM, llama.cpp
Servidor multi-GPU31B Dense (FP16)vLLM com paralelismo de tensores

Em caso de dúvida, comece com o modelo 26B A4B via Ollama. Ele oferece o melhor equilíbrio entre qualidade e eficiência de recursos para a maioria dos usuários.

Conclusão

Rodar o Gemma 4 localmente nunca foi tão fácil. Seja escolhendo a simplicidade de um comando do Ollama, a interface visual do LM Studio, o controle refinado do llama.cpp ou o atendimento de nível de produção do vLLM, você pode ter uma poderosa IA multimodal rodando em seu próprio hardware em minutos.

O modelo E2B torna a IA acessível em praticamente qualquer dispositivo, enquanto o modelo 31B Dense entrega qualidade que compete com os melhores modelos proprietários — tudo rodando de forma privada na sua máquina com zero custos de API e nenhum dado saindo da sua rede.

Gemma 4 Team

Gemma 4 Team