在本地运行 AI 模型让你完全掌控数据、消除 API 费用,并支持离线使用。Gemma 4 使这一切在从智能手机到工作站的广泛硬件上都变得切实可行。本指南将带你了解每种方法,从最简单的一条命令设置到高级生产部署。
前置条件
开始之前,根据你的硬件选择合适的模型:
| 模型 | 最低 RAM/VRAM | 推荐硬件 |
|---|---|---|
| E2B(Q4) | 3.2 GB | 智能手机、树莓派、笔记本 |
| E4B(Q4) | 5 GB | 笔记本、入门级 GPU |
| 26B A4B(Q4) | 16 GB | 游戏 GPU(RTX 3090/4090)、Apple Silicon |
| 31B Dense(Q4) | 20 GB | 高端 GPU、多 GPU 配置、M 系列 Mac |
GPU 推理推荐使用支持 CUDA 的 NVIDIA 显卡或支持 Metal 的 Apple Silicon Mac。纯 CPU 推理可行但对大模型来说显著更慢。
方法 1:Ollama(最简单)
Ollama 是最快的入门方式。它在单个工具中处理模型下载、量化选择和服务启动。
安装 Ollama:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# 或从 https://ollama.com/download 下载拉取并运行模型:
# 拉取模型(一次性下载)
ollama pull gemma4:26b
# 开始交互式对话
ollama run gemma4:26b可用标签:
ollama pull gemma4:31b # 31B Dense — 最高质量
ollama pull gemma4:26b # 26B A4B — 最佳平衡
ollama pull gemma4:e4b # E4B — 轻量级多模态
ollama pull gemma4:e2b # E2B — 边缘/移动端Ollama 还在 http://localhost:11434/v1 提供 OpenAI 兼容 API,方便与其他工具集成。
方法 2:LM Studio(图形界面)
LM Studio 提供精美的桌面应用,包含聊天界面、模型管理和本地 API 服务器。
- 从 lmstudio.ai 下载并安装 LM Studio
- 打开应用,在模型浏览器中搜索 "gemma-4"
- 选择你需要的变体和量化级别
- 点击下载,然后在 Chat 标签页中开始对话
LM Studio 还提供本地服务器模式,暴露 OpenAI 兼容 API,方便集成到现有应用中。
方法 3:llama.cpp(高级)
llama.cpp 提供对推理参数的最大控制,支持最广泛的硬件。
从源码构建:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# CUDA 支持:
make -j$(nproc) GGML_CUDA=1
# Metal(macOS)支持:
make -j$(nproc) GGML_METAL=1下载 GGUF 模型:
从 HuggingFace 下载预量化的 GGUF 文件。查找社区上传的 Q4_K_M(平衡)、Q5_K_M(更高质量)或 Q8_0(接近无损)量化版本。
国内用户也可以从魔搭社区 (ModelScope) 下载模型,下载速度更快更稳定。
运行推理:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "解释 MoE 和 Dense 架构的区别" \
-n 512 -ngl 99-ngl 99 参数将所有层卸载到 GPU。如果 VRAM 有限,减小此数值可在 CPU 和 GPU 之间分配负载。
方法 4:vLLM(生产部署)
vLLM 专为高吞吐量生产部署设计,支持连续批处理、PagedAttention 和张量并行等特性。
安装并启动服务:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1查询 OpenAI 兼容 API:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "你好,Gemma!"}]
}'多 GPU 配置时,将 --tensor-parallel-size 增加到 GPU 数量。vLLM 会自动处理跨设备的模型分片。
选择合适的模型
| 你的硬件 | 推荐模型 | 方法 |
|---|---|---|
| 智能手机 / 树莓派 | E2B(Q4) | Ollama、llama.cpp |
| 笔记本(8 GB RAM) | E4B(Q4) | Ollama、LM Studio |
| 游戏 PC(16+ GB VRAM) | 26B A4B(Q4) | Ollama、vLLM |
| 工作站(24+ GB VRAM) | 31B Dense(Q4) | vLLM、llama.cpp |
| 多 GPU 服务器 | 31B Dense(FP16) | vLLM 张量并行 |
如果拿不定主意,先用 Ollama 运行 26B A4B 模型。对大多数用户来说,它在质量和资源效率之间提供了最佳平衡。
总结
在本地运行 Gemma 4 从未如此简单。无论你选择 Ollama 的一条命令极简体验、LM Studio 的可视化界面、llama.cpp 的精细控制,还是 vLLM 的生产级部署,你都能在几分钟内在自己的硬件上运行一个强大的多模态 AI。
E2B 模型使 AI 在几乎任何设备上都能运行,而 31B Dense 模型提供了与最优秀闭源模型竞争的质量 — 全部在你的机器上私密运行,零 API 费用,数据不离开你的网络。
