AI 모델을 로컬에서 실행하면 데이터에 대한 완전한 제어가 가능하고, API 비용을 없애며, 오프라인 사용이 가능해집니다. Gemma 4는 스마트폰부터 워크스테이션에 이르는 광범위한 하드웨어 전반에서 이를 실용적으로 만듭니다. 이 가이드는 가장 쉬운 원커맨드 설정부터 고급 프로덕션 서빙까지 모든 방법을 단계별로 안내합니다.
사전 준비 사항
시작하기 전에 하드웨어와 어떤 모델이 적합한지 고려하세요.
| 모델 | 최소 RAM/VRAM | 최적 하드웨어 |
|---|---|---|
| E2B (Q4) | 3.2 GB | 스마트폰, Raspberry Pi, 노트북 |
| E4B (Q4) | 5 GB | 노트북, 엔트리급 GPU |
| 26B A4B (Q4) | 16 GB | 게이밍 GPU (RTX 3090/4090), Apple Silicon |
| 31B Dense (Q4) | 20 GB | 고급 GPU, 멀티 GPU 구성, M 시리즈 Mac |
GPU 추론의 경우 CUDA를 지원하는 NVIDIA GPU 또는 Metal을 지원하는 Apple Silicon Mac이 권장됩니다. CPU 전용 추론도 작동하지만 더 큰 모델에서는 상당히 느립니다.
방법 1: Ollama (가장 쉬운 방법)
Ollama는 시작하는 가장 빠른 방법입니다. 단일 도구로 모델 다운로드, 양자화 선택, 서빙을 처리합니다.
Ollama 설치:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# 또는 https://ollama.com/download 에서 다운로드모델 가져오기 및 실행:
# 모델 가져오기 (일회성 다운로드)
ollama pull gemma4:26b
# 대화형 채팅 시작
ollama run gemma4:26b사용 가능한 태그:
ollama pull gemma4:31b # 31B Dense — 최고 품질
ollama pull gemma4:26b # 26B A4B — 최적 균형
ollama pull gemma4:e4b # E4B — 경량 멀티모달
ollama pull gemma4:e2b # E2B — 엣지/모바일Ollama는 또한 다른 도구와의 통합을 위해 http://localhost:11434/v1에서 OpenAI 호환 API를 노출합니다.
방법 2: LM Studio (GUI)
LM Studio는 채팅 인터페이스, 모델 관리, 로컬 API 서버를 갖춘 세련된 데스크톱 애플리케이션을 제공합니다.
- lmstudio.ai에서 LM Studio를 다운로드하고 설치하세요
- 앱을 열고 모델 브라우저에서 "gemma-4"를 검색하세요
- 선호하는 변형과 양자화 수준을 선택하세요
- Download를 클릭한 다음 Chat 탭에서 채팅을 시작하세요
LM Studio는 또한 OpenAI 호환 API를 노출하는 로컬 서버 모드를 제공하여 기존 애플리케이션과 쉽게 통합할 수 있습니다.
방법 3: llama.cpp (고급)
llama.cpp는 추론 파라미터에 대한 최대의 제어를 제공하며 가장 광범위한 하드웨어를 지원합니다.
소스에서 빌드:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# CUDA 지원:
make -j$(nproc) GGML_CUDA=1
# Metal (macOS) 지원:
make -j$(nproc) GGML_METAL=1GGUF 모델 다운로드:
HuggingFace에서 사전 양자화된 GGUF 파일을 다운로드하세요. Q4_K_M (균형), Q5_K_M (더 높은 품질), Q8_0 (거의 무손실) 양자화가 포함된 커뮤니티 업로드를 찾으세요.
추론 실행:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99-ngl 99 플래그는 모든 레이어를 GPU로 오프로드합니다. VRAM이 제한되어 있고 CPU와 GPU 간에 분할하려는 경우 이 숫자를 줄이세요.
방법 4: vLLM (프로덕션)
vLLM은 연속 배치 처리, PagedAttention, 텐서 병렬 처리와 같은 기능을 갖춘 고처리량 프로덕션 서빙을 위해 설계되었습니다.
설치 및 서빙:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1OpenAI 호환 API 쿼리:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'멀티 GPU 구성의 경우 --tensor-parallel-size를 GPU 개수에 맞춰 늘리세요. vLLM은 기기 전반의 모델 샤딩을 자동으로 처리합니다.
올바른 모델 선택
| 하드웨어 | 권장 모델 | 방법 |
|---|---|---|
| 스마트폰 / Raspberry Pi | E2B (Q4) | Ollama, llama.cpp |
| 노트북 (8 GB RAM) | E4B (Q4) | Ollama, LM Studio |
| 게이밍 PC (16 GB+ VRAM) | 26B A4B (Q4) | Ollama, vLLM |
| 워크스테이션 (24 GB+ VRAM) | 31B Dense (Q4) | vLLM, llama.cpp |
| 멀티 GPU 서버 | 31B Dense (FP16) | 텐서 병렬 처리가 포함된 vLLM |
확신이 서지 않는다면 Ollama를 통해 26B A4B 모델로 시작하세요. 대부분의 사용자에게 품질과 리소스 효율성의 최적 균형을 제공합니다.
결론
Gemma 4를 로컬에서 실행하는 것은 그 어느 때보다 쉬워졌습니다. Ollama의 원커맨드 단순함, LM Studio의 시각적 인터페이스, llama.cpp의 세밀한 제어, vLLM의 프로덕션급 서빙 중 어느 것을 선택하든, 자신의 하드웨어에서 몇 분 안에 강력한 멀티모달 AI를 실행할 수 있습니다.
E2B 모델은 사실상 모든 기기에서 AI를 접근 가능하게 만드는 반면, 31B Dense 모델은 최고의 독점 모델과 경쟁하는 품질을 제공합니다. 모두 API 비용 없이 네트워크를 떠나는 데이터 없이 자신의 머신에서 비공개적으로 실행됩니다.
