Gemma 4 提供五种不同的模型变体,分别针对不同的硬件和使用场景进行了优化。本指南帮助你选择最适合的模型。
Gemma 4 模型系列一览
| 模型 | 参数量 | 活跃参数 | 上下文 | 最佳用途 |
|---|---|---|---|---|
| E2B | 2.3B | 2.3B | 128K | 手机、IoT、边缘设备 |
| E4B | 4.5B | 4.5B | 128K | 笔记本电脑、平板、边缘 GPU |
| 12B | — | — | — | 统一多模态工作负载(2026年6月3日发布) |
| 26B A4B | 26B | 3.8B (MoE) | 256K | 消费级 GPU、高性价比推理 |
| 31B Dense | 30.7B | 30.7B | 256K | 最高质量、微调、工作站 |
Gemma 4 E2B:超紧凑模型
最适合: 手机、树莓派、Jetson Nano 等资源受限设备。
E2B 模型将令人印象深刻的能力压缩到仅 23 亿有效参数中。在 Q4 量化下,仅需 3.2 GB 内存——小到可以在大多数现代智能手机上运行。
核心优势:
- 原生音频输入支持
- 简单任务近零延迟
- 完全离线运行
- 128K 上下文窗口
局限性: 与更大变体相比推理质量较低。最适合文本摘要、基础问答和快速翻译等简单任务。
Gemma 4 E4B:边缘部署最佳选择
最适合: 笔记本电脑、平板电脑、Android/iOS 应用、边缘 GPU。
E4B 将 E2B 的能力翻倍,同时仍可在消费级硬件上部署。Q4 量化下约需 5 GB——大多数笔记本电脑都能轻松应对。
核心优势:
- 音频和视觉能力
- Android AICore 预览支持
- ML Kit GenAI API 集成
- 强大的多语言性能
何时选择 E4B 而非 E2B: 当你需要更好的推理质量且有稍多内存可用时。E4B 是大多数本地部署的推荐起点。
Gemma 4 12B:统一多模态版本
适用于: 在单一流水线中混合处理文本、图像和音频的工作负载。
12B 配置于 2026 年 6 月 3 日发布,晚于最初 4 月的发布,并采用统一的多模态架构,而不是将独立编码器附加到文本骨干网络上。因此,当单个模型需要处理不止一种输入类型,且不希望手动构建路由层时,应优先考虑这一版本。
由于它的发布时间晚于该系列的其他版本,已发布的参数量、上下文窗口和量化内存占用数据仍在逐步确定。围绕它进行硬件配置前,请在 Hugging Face 上查看官方模型卡以获取当前数据——这些数据确认后,我们会更新上面的表格。
Gemma 4 26B A4B:效率之王
最适合: 消费级 GPU、单卡 H100、高性价比生产部署。
这就是混合专家(MoE)架构大显身手的地方。尽管总参数量为 260 亿,但每个 Token 仅激活 38 亿参数——以小模型的推理成本获得大模型的质量。
核心优势:
- Arena AI 开源模型排名第六
- 256K 上下文窗口
- MoE 架构带来超快推理
- Q4 量化可在消费级 GPU 上运行(15.6 GB)
何时选择 26B 而非 31B: 当推理速度和成本比极致质量更重要时。对于大多数生产场景,26B A4B 提供了最佳的质量-成本比。
Gemma 4 31B Dense:旗舰模型
最适合: 最高质量任务、微调、研究、工作站部署。
31B Dense 是 Gemma 4 最强大的变体,在 Arena AI 文本排行榜上位列全球开源模型第三。
核心优势:
- 所有基准测试中最高质量
- AIME 2026:89.2%
- LiveCodeBench v6:80%
- 针对微调工作流优化
- 256K 上下文窗口
硬件要求: 全精度 BF16 需要 58.3 GB(单卡 80 GB H100)。Q4 量化后降至 17.4 GB——高端消费级 GPU 也可运行。
选择决策流程
- 在手机或微型设备上运行? → E2B
- 在笔记本或平板上运行? → E4B
- 需要高性价比的生产部署? → 26B A4B
- 需要最高质量或计划微调? → 31B Dense
- 不确定? → 如果有 16+ GB 显存选 26B A4B,否则选 E4B
内存需求速查
| 模型 | BF16 | FP8 | Q4_0 |
|---|---|---|---|
| E2B | 9.6 GB | 4.6 GB | 3.2 GB |
| E4B | 15 GB | 7.5 GB | 5 GB |
| 26B A4B | 48 GB | 25 GB | 15.6 GB |
| 31B | 58.3 GB | 30.4 GB | 17.4 GB |
以上数据仅代表静态模型权重。实际内存使用会随上下文窗口大小、KV 缓存和运行时开销而增加。
总结
没有单一的"最佳" Gemma 4 模型——正确的选择取决于你的硬件条件和使用优先级。模型系列的设计使你可以从小规模开始(E2B/E4B 用于原型开发),然后扩展到生产级别(26B/31B),同时保持整个系列的 API 兼容性。
对于大多数入门开发者,我们推荐 26B A4B——它提供了质量、速度和硬件可及性的最佳平衡。如果你要部署到移动或边缘设备,从 E4B 开始,只有在内存确实紧张时才降级到 E2B。
