Как запустить Gemma 4 локально: пошаговое руководство

апр. 3, 2026

Локальный запуск моделей ИИ даёт вам полный контроль над данными, устраняет затраты на API и позволяет работать офлайн. Gemma 4 делает это практичным на широком спектре оборудования — от смартфонов до рабочих станций. Это руководство проведёт вас по каждому методу — от простейшей установки одной командой до продвинутого продакшен-обслуживания.

Предварительные требования

Прежде чем начать, подумайте о вашем оборудовании и о том, какая модель подходит:

МодельМин. RAM/VRAMЛучшее оборудование
E2B (Q4)3,2 ГБСмартфоны, Raspberry Pi, ноутбуки
E4B (Q4)5 ГБНоутбуки, GPU начального уровня
26B A4B (Q4)16 ГБИгровые GPU (RTX 3090/4090), Apple Silicon
31B Dense (Q4)20 ГБВысококлассные GPU, мульти-GPU системы, Mac на M-серии

Для GPU-инференса рекомендуются видеокарты NVIDIA с поддержкой CUDA или Mac на Apple Silicon с Metal. Инференс только на CPU работает, но значительно медленнее для крупных моделей.

Метод 1: Ollama (самый простой)

Ollama — самый быстрый способ начать работу. Этот инструмент обрабатывает загрузку модели, выбор квантования и обслуживание в одном флаконе.

Установка Ollama:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Или скачайте с https://ollama.com/download

Загрузите и запустите модель:

# Загрузите модель (одноразовая загрузка)
ollama pull gemma4:26b

# Запустите интерактивный чат
ollama run gemma4:26b

Доступные теги:

ollama pull gemma4:31b    # 31B Dense — наивысшее качество
ollama pull gemma4:26b    # 26B A4B — лучший баланс
ollama pull gemma4:e4b    # E4B — лёгкая мультимодальная
ollama pull gemma4:e2b    # E2B — edge/мобильные

Ollama также предоставляет OpenAI-совместимый API по адресу http://localhost:11434/v1 для интеграции с другими инструментами.

Метод 2: LM Studio (графический интерфейс)

LM Studio предоставляет отполированное настольное приложение с чат-интерфейсом, управлением моделями и локальным API-сервером.

  1. Скачайте и установите LM Studio с lmstudio.ai
  2. Откройте приложение и найдите «gemma-4» в браузере моделей
  3. Выберите предпочитаемый вариант и уровень квантования
  4. Нажмите Download, затем начните общение во вкладке Chat

LM Studio также предоставляет режим локального сервера, который открывает OpenAI-совместимый API, упрощая интеграцию с существующими приложениями.

Метод 3: llama.cpp (продвинутый)

llama.cpp предоставляет максимальный контроль над параметрами инференса и поддерживает самый широкий спектр оборудования.

Сборка из исходников:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# С поддержкой CUDA:
make -j$(nproc) GGML_CUDA=1

# С поддержкой Metal (macOS):
make -j$(nproc) GGML_METAL=1

Скачайте модель GGUF:

Скачайте предварительно квантованные файлы GGUF с HuggingFace. Ищите загрузки сообщества с квантованиями Q4_K_M (сбалансированное), Q5_K_M (более высокое качество) или Q8_0 (практически без потерь).

Запустите инференс:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

Флаг -ngl 99 выгружает все слои на GPU. Уменьшите это значение, если у вас ограниченная VRAM и вы хотите распределить нагрузку между CPU и GPU.

Метод 4: vLLM (продакшен)

vLLM разработан для высокопроизводительного продакшен-обслуживания с такими функциями, как непрерывная батчизация, PagedAttention и тензорный параллелизм.

Установка и обслуживание:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

Запрос к OpenAI-совместимому API:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

Для мульти-GPU конфигураций увеличьте --tensor-parallel-size в соответствии с количеством ваших GPU. vLLM автоматически обрабатывает шардирование модели между устройствами.

Выбор подходящей модели

Ваше оборудованиеРекомендуемая модельМетод
Смартфон / Raspberry PiE2B (Q4)Ollama, llama.cpp
Ноутбук (8 ГБ RAM)E4B (Q4)Ollama, LM Studio
Игровой ПК (16+ ГБ VRAM)26B A4B (Q4)Ollama, vLLM
Рабочая станция (24+ ГБ VRAM)31B Dense (Q4)vLLM, llama.cpp
Мульти-GPU сервер31B Dense (FP16)vLLM с тензорным параллелизмом

Если сомневаетесь, начните с модели 26B A4B через Ollama. Она предлагает лучший баланс качества и эффективности использования ресурсов для большинства пользователей.

Заключение

Запуск Gemma 4 локально никогда не был проще. Выбираете ли вы простоту одной команды в Ollama, визуальный интерфейс LM Studio, тонкий контроль llama.cpp или продакшен-обслуживание vLLM — вы можете запустить мощный мультимодальный ИИ на собственном оборудовании за считаные минуты.

Модель E2B делает ИИ доступным практически на любом устройстве, а модель 31B Dense обеспечивает качество, конкурирующее с лучшими проприетарными моделями, — и всё это работает приватно на вашей машине без затрат на API и без того, чтобы данные покидали вашу сеть.

Gemma 4 Team

Gemma 4 Team