Локальный запуск моделей ИИ даёт вам полный контроль над данными, устраняет затраты на API и позволяет работать офлайн. Gemma 4 делает это практичным на широком спектре оборудования — от смартфонов до рабочих станций. Это руководство проведёт вас по каждому методу — от простейшей установки одной командой до продвинутого продакшен-обслуживания.
Предварительные требования
Прежде чем начать, подумайте о вашем оборудовании и о том, какая модель подходит:
| Модель | Мин. RAM/VRAM | Лучшее оборудование |
|---|---|---|
| E2B (Q4) | 3,2 ГБ | Смартфоны, Raspberry Pi, ноутбуки |
| E4B (Q4) | 5 ГБ | Ноутбуки, GPU начального уровня |
| 26B A4B (Q4) | 16 ГБ | Игровые GPU (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 ГБ | Высококлассные GPU, мульти-GPU системы, Mac на M-серии |
Для GPU-инференса рекомендуются видеокарты NVIDIA с поддержкой CUDA или Mac на Apple Silicon с Metal. Инференс только на CPU работает, но значительно медленнее для крупных моделей.
Метод 1: Ollama (самый простой)
Ollama — самый быстрый способ начать работу. Этот инструмент обрабатывает загрузку модели, выбор квантования и обслуживание в одном флаконе.
Установка Ollama:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Или скачайте с https://ollama.com/downloadЗагрузите и запустите модель:
# Загрузите модель (одноразовая загрузка)
ollama pull gemma4:26b
# Запустите интерактивный чат
ollama run gemma4:26bДоступные теги:
ollama pull gemma4:31b # 31B Dense — наивысшее качество
ollama pull gemma4:26b # 26B A4B — лучший баланс
ollama pull gemma4:e4b # E4B — лёгкая мультимодальная
ollama pull gemma4:e2b # E2B — edge/мобильныеOllama также предоставляет OpenAI-совместимый API по адресу http://localhost:11434/v1 для интеграции с другими инструментами.
Метод 2: LM Studio (графический интерфейс)
LM Studio предоставляет отполированное настольное приложение с чат-интерфейсом, управлением моделями и локальным API-сервером.
- Скачайте и установите LM Studio с lmstudio.ai
- Откройте приложение и найдите «gemma-4» в браузере моделей
- Выберите предпочитаемый вариант и уровень квантования
- Нажмите Download, затем начните общение во вкладке Chat
LM Studio также предоставляет режим локального сервера, который открывает OpenAI-совместимый API, упрощая интеграцию с существующими приложениями.
Метод 3: llama.cpp (продвинутый)
llama.cpp предоставляет максимальный контроль над параметрами инференса и поддерживает самый широкий спектр оборудования.
Сборка из исходников:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# С поддержкой CUDA:
make -j$(nproc) GGML_CUDA=1
# С поддержкой Metal (macOS):
make -j$(nproc) GGML_METAL=1Скачайте модель GGUF:
Скачайте предварительно квантованные файлы GGUF с HuggingFace. Ищите загрузки сообщества с квантованиями Q4_K_M (сбалансированное), Q5_K_M (более высокое качество) или Q8_0 (практически без потерь).
Запустите инференс:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99Флаг -ngl 99 выгружает все слои на GPU. Уменьшите это значение, если у вас ограниченная VRAM и вы хотите распределить нагрузку между CPU и GPU.
Метод 4: vLLM (продакшен)
vLLM разработан для высокопроизводительного продакшен-обслуживания с такими функциями, как непрерывная батчизация, PagedAttention и тензорный параллелизм.
Установка и обслуживание:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1Запрос к OpenAI-совместимому API:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'Для мульти-GPU конфигураций увеличьте --tensor-parallel-size в соответствии с количеством ваших GPU. vLLM автоматически обрабатывает шардирование модели между устройствами.
Выбор подходящей модели
| Ваше оборудование | Рекомендуемая модель | Метод |
|---|---|---|
| Смартфон / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| Ноутбук (8 ГБ RAM) | E4B (Q4) | Ollama, LM Studio |
| Игровой ПК (16+ ГБ VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| Рабочая станция (24+ ГБ VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| Мульти-GPU сервер | 31B Dense (FP16) | vLLM с тензорным параллелизмом |
Если сомневаетесь, начните с модели 26B A4B через Ollama. Она предлагает лучший баланс качества и эффективности использования ресурсов для большинства пользователей.
Заключение
Запуск Gemma 4 локально никогда не был проще. Выбираете ли вы простоту одной команды в Ollama, визуальный интерфейс LM Studio, тонкий контроль llama.cpp или продакшен-обслуживание vLLM — вы можете запустить мощный мультимодальный ИИ на собственном оборудовании за считаные минуты.
Модель E2B делает ИИ доступным практически на любом устройстве, а модель 31B Dense обеспечивает качество, конкурирующее с лучшими проприетарными моделями, — и всё это работает приватно на вашей машине без затрат на API и без того, чтобы данные покидали вашу сеть.
