Executar modelos de IA localmente dá a você controle total sobre seus dados, elimina custos de API e possibilita o uso offline. O Gemma 4 torna isso prático em uma ampla gama de hardware — de smartphones a workstations. Este guia apresenta todos os métodos, desde a configuração mais fácil de um comando até o atendimento avançado em produção.
Pré-requisitos
Antes de começar, considere seu hardware e qual modelo se encaixa:
| Modelo | Mínimo de RAM/VRAM | Melhor Hardware |
|---|---|---|
| E2B (Q4) | 3,2 GB | Smartphones, Raspberry Pi, laptops |
| E4B (Q4) | 5 GB | Laptops, GPUs de entrada |
| 26B A4B (Q4) | 16 GB | GPUs de jogo (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 GB | GPUs de ponta, configurações multi-GPU, Macs série M |
Para inferência em GPU, são recomendadas GPUs NVIDIA com suporte a CUDA ou Macs Apple Silicon com Metal. A inferência apenas em CPU funciona, mas é significativamente mais lenta para modelos maiores.
Método 1: Ollama (Mais Fácil)
Ollama é a maneira mais rápida de começar. Ele lida com o download do modelo, seleção de quantização e atendimento em uma única ferramenta.
Instale o Ollama:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Ou baixe em https://ollama.com/downloadBaixe e execute um modelo:
# Baixe o modelo (download único)
ollama pull gemma4:26b
# Inicie um chat interativo
ollama run gemma4:26bTags disponíveis:
ollama pull gemma4:31b # 31B Dense — maior qualidade
ollama pull gemma4:26b # 26B A4B — melhor equilíbrio
ollama pull gemma4:e4b # E4B — multimodal leve
ollama pull gemma4:e2b # E2B — edge/mobileO Ollama também expõe uma API compatível com OpenAI em http://localhost:11434/v1 para integração com outras ferramentas.
Método 2: LM Studio (GUI)
LM Studio fornece um aplicativo desktop polido com uma interface de chat, gerenciamento de modelos e um servidor de API local.
- Baixe e instale o LM Studio em lmstudio.ai
- Abra o aplicativo e pesquise por "gemma-4" no navegador de modelos
- Selecione sua variante preferida e nível de quantização
- Clique em Download e comece a conversar na aba Chat
O LM Studio também fornece um modo de servidor local que expõe uma API compatível com OpenAI, facilitando a integração com aplicações existentes.
Método 3: llama.cpp (Avançado)
llama.cpp oferece controle máximo sobre os parâmetros de inferência e suporta a maior variedade de hardware.
Compile a partir do código-fonte:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# Para suporte a CUDA:
make -j$(nproc) GGML_CUDA=1
# Para suporte a Metal (macOS):
make -j$(nproc) GGML_METAL=1Baixe um modelo GGUF:
Baixe arquivos GGUF pré-quantizados do HuggingFace. Procure uploads da comunidade com quantização Q4_K_M (equilibrada), Q5_K_M (maior qualidade) ou Q8_0 (quase sem perdas).
Execute a inferência:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99A flag -ngl 99 transfere todas as camadas para a GPU. Reduza esse número se você tiver VRAM limitada e quiser dividir entre CPU e GPU.
Método 4: vLLM (Produção)
vLLM é projetado para atendimento de alta taxa de transferência em produção com recursos como batching contínuo, PagedAttention e paralelismo de tensores.
Instale e sirva:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1Consulte a API compatível com OpenAI:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'Para configurações multi-GPU, aumente --tensor-parallel-size para corresponder à sua contagem de GPUs. O vLLM lida automaticamente com o sharding do modelo entre dispositivos.
Escolhendo o Modelo Certo
| Seu Hardware | Modelo Recomendado | Método |
|---|---|---|
| Smartphone / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| Laptop (8 GB RAM) | E4B (Q4) | Ollama, LM Studio |
| PC Gamer (16+ GB VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| Workstation (24+ GB VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| Servidor multi-GPU | 31B Dense (FP16) | vLLM com paralelismo de tensores |
Em caso de dúvida, comece com o modelo 26B A4B via Ollama. Ele oferece o melhor equilíbrio entre qualidade e eficiência de recursos para a maioria dos usuários.
Conclusão
Rodar o Gemma 4 localmente nunca foi tão fácil. Seja escolhendo a simplicidade de um comando do Ollama, a interface visual do LM Studio, o controle refinado do llama.cpp ou o atendimento de nível de produção do vLLM, você pode ter uma poderosa IA multimodal rodando em seu próprio hardware em minutos.
O modelo E2B torna a IA acessível em praticamente qualquer dispositivo, enquanto o modelo 31B Dense entrega qualidade que compete com os melhores modelos proprietários — tudo rodando de forma privada na sua máquina com zero custos de API e nenhum dado saindo da sua rede.
