Gemma 4 предлагает пять различных вариантов моделей, каждый из которых оптимизирован под разное оборудование и сценарии использования. Это руководство поможет вам выбрать подходящий.
Семейство моделей Gemma 4 в кратком обзоре
| Модель | Параметры | Активные параметры | Контекст | Лучше всего для |
|---|---|---|---|---|
| E2B | 2,3B | 2,3B | 128K | Мобильные, IoT, edge-устройства |
| E4B | 4,5B | 4,5B | 128K | Ноутбуки, планшеты, edge-GPU |
| 12B | — | — | — | Унифицированные мультимодальные рабочие нагрузки (выпуск 3 июня 2026 года) |
| 26B A4B | 26B | 3,8B (MoE) | 256K | Потребительские GPU, экономичный инференс |
| 31B Dense | 30,7B | 30,7B | 256K | Максимальное качество, дообучение, рабочие станции |
Gemma 4 E2B: ультракомпактная модель
Лучше всего для: телефонов, Raspberry Pi, Jetson Nano и других устройств с ограниченными ресурсами.
Модель E2B упаковывает впечатляющие возможности всего в 2,3 миллиарда эффективных параметров. При квантовании Q4 она требует всего 3,2 ГБ памяти — достаточно мало для работы на большинстве современных смартфонов.
Ключевые сильные стороны:
- Нативная поддержка аудиовхода
- Практически нулевая задержка для простых задач
- Полностью офлайн-работа
- Контекстное окно 128K
Ограничения: Более низкое качество рассуждения по сравнению с более крупными вариантами. Лучше всего подходит для простых задач, таких как резюмирование текста, базовые ответы на вопросы и быстрые переводы.
Gemma 4 E4B: золотая середина edge
Лучше всего для: ноутбуков, планшетов, приложений Android/iOS и edge-GPU.
E4B удваивает возможности E2B, оставаясь развёртываемой на потребительском оборудовании. При квантовании Q4 ей требуется около 5 ГБ — комфортно для большинства ноутбуков.
Ключевые сильные стороны:
- Возможности работы с аудио и изображениями
- Поддержка AICore preview на Android
- Интеграция с ML Kit GenAI API
- Сильная многоязычная производительность
Когда выбирать E4B вместо E2B: когда нужно лучшее качество рассуждения и доступно чуть больше памяти. E4B — рекомендованная отправная точка для большинства локальных развёртываний.
Gemma 4 12B: унифицированный мультимодальный вариант
Лучше всего подходит для: рабочих нагрузок, которые объединяют текст, изображения и аудио в едином конвейере.
Конфигурация 12B появилась 3 июня 2026 года, после первоначального запуска в апреле, и использует унифицированную мультимодальную архитектуру, а не отдельные энкодеры, подключённые к текстовой базовой модели. Поэтому именно этот вариант стоит рассматривать в первую очередь, когда одна модель должна обрабатывать более одного типа входных данных без самостоятельно созданного слоя маршрутизации.
Поскольку эта модель вышла позже остальных представителей семейства, опубликованные данные о количестве параметров, размере контекстного окна и объёме памяти для квантованной версии всё ещё уточняются. Перед расчётом конфигурации оборудования проверьте актуальные значения в официальной карточке модели на Hugging Face — мы обновим приведённую выше таблицу после их подтверждения.
Gemma 4 26B A4B: чемпион эффективности
Лучше всего для: потребительских GPU, одного H100, экономичного продакшен-обслуживания.
Именно здесь проявляется архитектура Mixture-of-Experts. Несмотря на общий объём в 26 миллиардов параметров, лишь 3,8 миллиарда активируются на токен — обеспечивая качество крупной модели по стоимости инференса малой.
Ключевые сильные стороны:
- Занимает 6-е место среди открытых моделей на Arena AI
- Контекстное окно 256K
- Сверхбыстрый инференс благодаря эффективности MoE
- Работает на потребительских GPU при Q4 (15,6 ГБ)
Когда выбирать 26B вместо 31B: когда скорость и стоимость инференса важнее, чем выжимание последних нескольких процентов качества. Для большинства продакшен-сценариев 26B A4B предлагает лучшее соотношение качества и стоимости.
Gemma 4 31B Dense: флагман
Лучше всего для: задач максимального качества, дообучения, исследований и развёртывания на рабочих станциях.
31B Dense — самый мощный вариант Gemma 4, занимающий 3-е место среди открытых моделей в мировом текстовом рейтинге Arena AI.
Ключевые сильные стороны:
- Наивысшее качество во всех бенчмарках
- AIME 2026: 89,2%
- LiveCodeBench v6: 80%
- Оптимизирована для сценариев дообучения
- Контекстное окно 256K
Требования к оборудованию: при полной точности BF16 требуется 58,3 ГБ (один 80 ГБ H100). При квантовании Q4 снижается до 17,4 ГБ — осуществимо на высококлассных потребительских GPU.
Блок-схема принятия решения
- Запускаете на телефоне или крошечном устройстве? → E2B
- Запускаете на ноутбуке или планшете? → E4B
- Нужно продакшен-обслуживание с хорошей экономической эффективностью? → 26B A4B
- Нужно максимальное качество или планируете дообучение? → 31B Dense
- Не уверены? → Начните с 26B A4B, если у вас 16+ ГБ VRAM, иначе с E4B
Краткая справка по требованиям к памяти
| Модель | BF16 | FP8 | Q4_0 |
|---|---|---|---|
| E2B | 9,6 ГБ | 4,6 ГБ | 3,2 ГБ |
| E4B | 15 ГБ | 7,5 ГБ | 5 ГБ |
| 26B A4B | 48 ГБ | 25 ГБ | 15,6 ГБ |
| 31B | 58,3 ГБ | 30,4 ГБ | 17,4 ГБ |
Эти цифры отражают только статические веса модели. Фактическое использование памяти увеличивается с размером контекстного окна, KV-кешем и накладными расходами на выполнение.
Заключение
Единственной «лучшей» модели Gemma 4 не существует — правильный выбор зависит от ограничений вашего оборудования и приоритетов сценария использования. Семейство моделей спроектировано так, чтобы вы могли начать с малого (E2B/E4B для прототипирования) и масштабироваться (26B/31B для продакшена), сохраняя совместимость API по всей линейке.
Большинству разработчиков, начинающих работу, мы рекомендуем 26B A4B — она предлагает лучший баланс качества, скорости и доступности оборудования. Если вы развёртываете на мобильных или edge-устройствах, начните с E4B и переходите на E2B только если память действительно ограничена.
