كيفية تشغيل Gemma 4 محليًا: دليل خطوة بخطوة

أبريل ٣، ٢٠٢٦

يمنحك تشغيل نماذج الذكاء الاصطناعي محليًا تحكمًا كاملًا في بياناتك، ويلغي تكاليف API، ويتيح الاستخدام دون اتصال بالإنترنت. يجعل Gemma 4 هذا عمليًا عبر مجموعة واسعة من الأجهزة — من الهواتف الذكية إلى محطات العمل. يرشدك هذا الدليل خلال كل طريقة، من الإعداد الأسهل بأمر واحد إلى الخدمة الإنتاجية المتقدمة.

المتطلبات الأساسية

قبل أن تبدأ، ضع في اعتبارك العتاد لديك والنموذج الذي يناسبه:

النموذجالحد الأدنى من RAM/VRAMأفضل عتاد
E2B (Q4)3.2 GBالهواتف الذكية، Raspberry Pi، أجهزة الكمبيوتر المحمولة
E4B (Q4)5 GBأجهزة الكمبيوتر المحمولة، وحدات معالجة الرسومات منخفضة المستوى
26B A4B (Q4)16 GBوحدات معالجة الرسومات للألعاب (RTX 3090/4090)، Apple Silicon
31B Dense (Q4)20 GBوحدات معالجة الرسومات الراقية، إعدادات متعددة وحدات معالجة الرسومات، أجهزة Mac من سلسلة M

للاستدلال على وحدة معالجة الرسومات، يوصى بوحدات معالجة الرسومات NVIDIA مع دعم CUDA أو أجهزة Mac من Apple Silicon مع Metal. يعمل الاستدلال على وحدة المعالجة المركزية فقط ولكنه أبطأ بكثير للنماذج الأكبر.

الطريقة 1: Ollama (الأسهل)

Ollama هي أسرع طريقة للبدء. تتعامل مع تنزيل النماذج، واختيار التكميم، والخدمة في أداة واحدة.

تثبيت Ollama:

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Or download from https://ollama.com/download

سحب وتشغيل نموذج:

# Pull the model (one-time download)
ollama pull gemma4:26b

# Start an interactive chat
ollama run gemma4:26b

العلامات المتاحة:

ollama pull gemma4:31b    # 31B Dense — highest quality
ollama pull gemma4:26b    # 26B A4B — best balance
ollama pull gemma4:e4b    # E4B — lightweight multimodal
ollama pull gemma4:e2b    # E2B — edge/mobile

يكشف Ollama أيضًا عن واجهة برمجة تطبيقات متوافقة مع OpenAI على http://localhost:11434/v1 للتكامل مع الأدوات الأخرى.

الطريقة 2: LM Studio (واجهة رسومية)

يوفر LM Studio تطبيق سطح مكتب مصقول مع واجهة دردشة وإدارة النماذج وخادم API محلي.

  1. قم بتنزيل وتثبيت LM Studio من lmstudio.ai
  2. افتح التطبيق وابحث عن "gemma-4" في متصفح النماذج
  3. اختر المتغير ومستوى التكميم المفضل لديك
  4. انقر فوق Download، ثم ابدأ الدردشة في علامة التبويب Chat

يوفر LM Studio أيضًا وضع خادم محلي يكشف عن واجهة برمجة تطبيقات متوافقة مع OpenAI، مما يجعل من السهل التكامل مع التطبيقات الموجودة.

الطريقة 3: llama.cpp (متقدم)

يمنحك llama.cpp أقصى تحكم في معاملات الاستدلال ويدعم أوسع نطاق من العتاد.

البناء من المصدر:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)

# For CUDA support:
make -j$(nproc) GGML_CUDA=1

# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1

تنزيل نموذج GGUF:

قم بتنزيل ملفات GGUF المُكمَّمة مسبقًا من HuggingFace. ابحث عن تحميلات المجتمع بتكميم Q4_K_M (متوازن) أو Q5_K_M (جودة أعلى) أو Q8_0 (شبه عديم الفقد).

تشغيل الاستدلال:

./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
  -p "Explain the difference between MoE and dense architectures" \
  -n 512 -ngl 99

تقوم علامة -ngl 99 بإلغاء تحميل جميع الطبقات إلى وحدة معالجة الرسومات. قلل هذا الرقم إذا كان لديك VRAM محدود وتريد التقسيم بين وحدة المعالجة المركزية ووحدة معالجة الرسومات.

الطريقة 4: vLLM (الإنتاج)

تم تصميم vLLM لخدمة إنتاجية عالية الإنتاجية مع ميزات مثل التجميع المستمر، PagedAttention، والتوازي الموتري.

التثبيت والخدمة:

pip install vllm

vllm serve google/gemma-4-26b-a4b-it \
  --max-model-len 8192 \
  --tensor-parallel-size 1

استعلام واجهة برمجة التطبيقات المتوافقة مع OpenAI:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemma-4-26b-a4b-it",
    "messages": [{"role": "user", "content": "Hello, Gemma!"}]
  }'

لإعدادات وحدات معالجة الرسومات المتعددة، قم بزيادة --tensor-parallel-size لمطابقة عدد وحدات معالجة الرسومات لديك. يتعامل vLLM تلقائيًا مع تجزئة النموذج عبر الأجهزة.

اختيار النموذج المناسب

عتادكالنموذج الموصى بهالطريقة
هاتف ذكي / Raspberry PiE2B (Q4)Ollama، llama.cpp
كمبيوتر محمول (8 جيجابايت RAM)E4B (Q4)Ollama، LM Studio
كمبيوتر ألعاب (16+ جيجابايت VRAM)26B A4B (Q4)Ollama، vLLM
محطة عمل (24+ جيجابايت VRAM)31B Dense (Q4)vLLM، llama.cpp
خادم متعدد وحدات معالجة الرسومات31B Dense (FP16)vLLM مع التوازي الموتري

عند الشك، ابدأ بنموذج 26B A4B عبر Ollama. يقدم أفضل توازن بين الجودة وكفاءة الموارد لمعظم المستخدمين.

الخاتمة

لم يكن تشغيل Gemma 4 محليًا أسهل من أي وقت مضى. سواء اخترت بساطة الأمر الواحد لـ Ollama، أو الواجهة المرئية لـ LM Studio، أو التحكم الدقيق لـ llama.cpp، أو الخدمة الإنتاجية لـ vLLM، يمكنك الحصول على ذكاء اصطناعي قوي متعدد الوسائط يعمل على عتادك الخاص في دقائق.

يجعل نموذج E2B الذكاء الاصطناعي متاحًا فعليًا على أي جهاز، بينما يقدم نموذج 31B Dense جودة تنافس أفضل النماذج الاحتكارية — كل ذلك يعمل بشكل خاص على جهازك دون أي تكاليف API ودون مغادرة أي بيانات لشبكتك.

Gemma 4 Team

Gemma 4 Team

كيفية تشغيل Gemma 4 محليًا: دليل خطوة بخطوة | المدوّنة | Gemma 4