يمنحك تشغيل نماذج الذكاء الاصطناعي محليًا تحكمًا كاملًا في بياناتك، ويلغي تكاليف API، ويتيح الاستخدام دون اتصال بالإنترنت. يجعل Gemma 4 هذا عمليًا عبر مجموعة واسعة من الأجهزة — من الهواتف الذكية إلى محطات العمل. يرشدك هذا الدليل خلال كل طريقة، من الإعداد الأسهل بأمر واحد إلى الخدمة الإنتاجية المتقدمة.
المتطلبات الأساسية
قبل أن تبدأ، ضع في اعتبارك العتاد لديك والنموذج الذي يناسبه:
| النموذج | الحد الأدنى من RAM/VRAM | أفضل عتاد |
|---|---|---|
| E2B (Q4) | 3.2 GB | الهواتف الذكية، Raspberry Pi، أجهزة الكمبيوتر المحمولة |
| E4B (Q4) | 5 GB | أجهزة الكمبيوتر المحمولة، وحدات معالجة الرسومات منخفضة المستوى |
| 26B A4B (Q4) | 16 GB | وحدات معالجة الرسومات للألعاب (RTX 3090/4090)، Apple Silicon |
| 31B Dense (Q4) | 20 GB | وحدات معالجة الرسومات الراقية، إعدادات متعددة وحدات معالجة الرسومات، أجهزة Mac من سلسلة M |
للاستدلال على وحدة معالجة الرسومات، يوصى بوحدات معالجة الرسومات NVIDIA مع دعم CUDA أو أجهزة Mac من Apple Silicon مع Metal. يعمل الاستدلال على وحدة المعالجة المركزية فقط ولكنه أبطأ بكثير للنماذج الأكبر.
الطريقة 1: Ollama (الأسهل)
Ollama هي أسرع طريقة للبدء. تتعامل مع تنزيل النماذج، واختيار التكميم، والخدمة في أداة واحدة.
تثبيت Ollama:
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Or download from https://ollama.com/downloadسحب وتشغيل نموذج:
# Pull the model (one-time download)
ollama pull gemma4:26b
# Start an interactive chat
ollama run gemma4:26bالعلامات المتاحة:
ollama pull gemma4:31b # 31B Dense — highest quality
ollama pull gemma4:26b # 26B A4B — best balance
ollama pull gemma4:e4b # E4B — lightweight multimodal
ollama pull gemma4:e2b # E2B — edge/mobileيكشف Ollama أيضًا عن واجهة برمجة تطبيقات متوافقة مع OpenAI على http://localhost:11434/v1 للتكامل مع الأدوات الأخرى.
الطريقة 2: LM Studio (واجهة رسومية)
يوفر LM Studio تطبيق سطح مكتب مصقول مع واجهة دردشة وإدارة النماذج وخادم API محلي.
- قم بتنزيل وتثبيت LM Studio من lmstudio.ai
- افتح التطبيق وابحث عن "gemma-4" في متصفح النماذج
- اختر المتغير ومستوى التكميم المفضل لديك
- انقر فوق Download، ثم ابدأ الدردشة في علامة التبويب Chat
يوفر LM Studio أيضًا وضع خادم محلي يكشف عن واجهة برمجة تطبيقات متوافقة مع OpenAI، مما يجعل من السهل التكامل مع التطبيقات الموجودة.
الطريقة 3: llama.cpp (متقدم)
يمنحك llama.cpp أقصى تحكم في معاملات الاستدلال ويدعم أوسع نطاق من العتاد.
البناء من المصدر:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j$(nproc)
# For CUDA support:
make -j$(nproc) GGML_CUDA=1
# For Metal (macOS) support:
make -j$(nproc) GGML_METAL=1تنزيل نموذج GGUF:
قم بتنزيل ملفات GGUF المُكمَّمة مسبقًا من HuggingFace. ابحث عن تحميلات المجتمع بتكميم Q4_K_M (متوازن) أو Q5_K_M (جودة أعلى) أو Q8_0 (شبه عديم الفقد).
تشغيل الاستدلال:
./llama-cli -m gemma-4-26b-a4b-it-Q4_K_M.gguf \
-p "Explain the difference between MoE and dense architectures" \
-n 512 -ngl 99تقوم علامة -ngl 99 بإلغاء تحميل جميع الطبقات إلى وحدة معالجة الرسومات. قلل هذا الرقم إذا كان لديك VRAM محدود وتريد التقسيم بين وحدة المعالجة المركزية ووحدة معالجة الرسومات.
الطريقة 4: vLLM (الإنتاج)
تم تصميم vLLM لخدمة إنتاجية عالية الإنتاجية مع ميزات مثل التجميع المستمر، PagedAttention، والتوازي الموتري.
التثبيت والخدمة:
pip install vllm
vllm serve google/gemma-4-26b-a4b-it \
--max-model-len 8192 \
--tensor-parallel-size 1استعلام واجهة برمجة التطبيقات المتوافقة مع OpenAI:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemma-4-26b-a4b-it",
"messages": [{"role": "user", "content": "Hello, Gemma!"}]
}'لإعدادات وحدات معالجة الرسومات المتعددة، قم بزيادة --tensor-parallel-size لمطابقة عدد وحدات معالجة الرسومات لديك. يتعامل vLLM تلقائيًا مع تجزئة النموذج عبر الأجهزة.
اختيار النموذج المناسب
| عتادك | النموذج الموصى به | الطريقة |
|---|---|---|
| هاتف ذكي / Raspberry Pi | E2B (Q4) | Ollama، llama.cpp |
| كمبيوتر محمول (8 جيجابايت RAM) | E4B (Q4) | Ollama، LM Studio |
| كمبيوتر ألعاب (16+ جيجابايت VRAM) | 26B A4B (Q4) | Ollama، vLLM |
| محطة عمل (24+ جيجابايت VRAM) | 31B Dense (Q4) | vLLM، llama.cpp |
| خادم متعدد وحدات معالجة الرسومات | 31B Dense (FP16) | vLLM مع التوازي الموتري |
عند الشك، ابدأ بنموذج 26B A4B عبر Ollama. يقدم أفضل توازن بين الجودة وكفاءة الموارد لمعظم المستخدمين.
الخاتمة
لم يكن تشغيل Gemma 4 محليًا أسهل من أي وقت مضى. سواء اخترت بساطة الأمر الواحد لـ Ollama، أو الواجهة المرئية لـ LM Studio، أو التحكم الدقيق لـ llama.cpp، أو الخدمة الإنتاجية لـ vLLM، يمكنك الحصول على ذكاء اصطناعي قوي متعدد الوسائط يعمل على عتادك الخاص في دقائق.
يجعل نموذج E2B الذكاء الاصطناعي متاحًا فعليًا على أي جهاز، بينما يقدم نموذج 31B Dense جودة تنافس أفضل النماذج الاحتكارية — كل ذلك يعمل بشكل خاص على جهازك دون أي تكاليف API ودون مغادرة أي بيانات لشبكتك.
