如何在本地运行 Gemma 4:分步指南

2026/04/03

在本地运行 AI 模型让你完全掌控数据、消除 API 费用,并支持离线使用。Gemma 4 使这一切在从智能手机到工作站的广泛硬件上都变得切实可行。本指南将带你了解每种方法,从最简单的一条命令设置到高级生产部署。

前置条件

开始之前,根据你的硬件选择合适的模型:

模型最低 RAM/VRAM推荐硬件
E2B(Q4)3.2 GB智能手机、树莓派、笔记本
E4B(Q4)5 GB笔记本、入门级 GPU
26B A4B(Q4)16 GB游戏 GPU(RTX 3090/4090)、Apple Silicon
31B Dense(Q4)20 GB高端 GPU、多 GPU 配置、M 系列 Mac

GPU 推理推荐使用支持 CUDA 的 NVIDIA 显卡或支持 Metal 的 Apple Silicon Mac。纯 CPU 推理可行但对大模型来说显著更慢。

方法 1:Ollama(最简单)

Ollama 是最快的入门方式。它在单个工具中处理模型下载、量化选择和服务启动。

安装 Ollama:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# 或从 https://ollama.com/download 下载

拉取并运行模型:

# 拉取模型(一次性下载)
ollama pull gemma4:26b

# 开始交互式对话
ollama run gemma4:26b

可用标签:

ollama pull gemma4:31b    # 31B Dense — 最高质量
ollama pull gemma4:26b    # 26B A4B — 最佳平衡
ollama pull gemma4:e4b    # E4B — 轻量级多模态
ollama pull gemma4:e2b    # E2B — 边缘/移动端

Ollama 还在 http://localhost:11434/v1 提供 OpenAI 兼容 API,方便与其他工具集成。

方法 2:LM Studio(图形界面)

LM Studio 提供精美的桌面应用,包含聊天界面、模型管理和本地 API 服务器。

  1. lmstudio.ai 下载并安装 LM Studio
  2. 打开应用,在模型浏览器中搜索 "gemma-4"
  3. 选择你需要的变体和量化级别
  4. 点击下载,然后在 Chat 标签页中开始对话

LM Studio 还提供本地服务器模式,暴露 OpenAI 兼容 API,方便集成到现有应用中。

方法 3:llama.cpp(高级)

llama.cpp 提供对推理参数的最大控制,支持最广泛的硬件。

从源码构建:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# CUDA 支持:
make -j$(nproc) GGML_CUDA=1

# Metal(macOS)支持:
make -j$(nproc) GGML_METAL=1

下载 GGUF 模型:

从 HuggingFace 下载预量化的 GGUF 文件。查找社区上传的 Q4_K_M(平衡)、Q5_K_M(更高质量)或 Q8_0(接近无损)量化版本。

国内用户也可以从魔搭社区 (ModelScope) 下载模型,下载速度更快更稳定。

运行推理:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "解释 MoE 和 Dense 架构的区别" \
  -n 512 -ngl 99

-ngl 99 参数将所有层卸载到 GPU。如果 VRAM 有限,减小此数值可在 CPU 和 GPU 之间分配负载。

方法 4:vLLM(生产部署)

vLLM 专为高吞吐量生产部署设计,支持连续批处理、PagedAttention 和张量并行等特性。

安装并启动服务:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

查询 OpenAI 兼容 API:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "你好,Gemma!"}]
  }'

多 GPU 配置时,将 --tensor-parallel-size 增加到 GPU 数量。vLLM 会自动处理跨设备的模型分片。

选择合适的模型

你的硬件推荐模型方法
智能手机 / 树莓派E2B(Q4)Ollama、llama.cpp
笔记本(8 GB RAM)E4B(Q4)Ollama、LM Studio
游戏 PC(16+ GB VRAM)26B A4B(Q4)Ollama、vLLM
工作站(24+ GB VRAM)31B Dense(Q4)vLLM、llama.cpp
多 GPU 服务器31B Dense(FP16)vLLM 张量并行

如果拿不定主意,先用 Ollama 运行 26B A4B 模型。对大多数用户来说,它在质量和资源效率之间提供了最佳平衡。

总结

在本地运行 Gemma 4 从未如此简单。无论你选择 Ollama 的一条命令极简体验、LM Studio 的可视化界面、llama.cpp 的精细控制,还是 vLLM 的生产级部署,你都能在几分钟内在自己的硬件上运行一个强大的多模态 AI。

E2B 模型使 AI 在几乎任何设备上都能运行,而 31B Dense 模型提供了与最优秀闭源模型竞争的质量 — 全部在你的机器上私密运行,零 API 费用,数据不离开你的网络。

Gemma 4 Team

Gemma 4 Team