أي نموذج ذكاء اصطناعي محلي ينبغي أن تشغّل؟ دليل GPU للسياق والبرمجة لشهر أكتوبر 2026

Table of Contents
أفضل نموذج برمجة محلي هو النموذج الذي يحتفظ بقدر كاف من مشروعك في الذاكرة ويقرأه بسرعة تكفي ليظل مفيدا. يظل حجم النموذج مهما، لكن النموذج الذي لا يلائم إلا بعد نقله إلى ذاكرة النظام غالبا ما يكون أسوأ من نموذج أصغر ذي نافذة سياق مستقرة.
اختر النموذج وميزانية الذاكرة معا. لا تختَر نموذجا من قائمة ترتيب ثم تفرضه على عتاد غير مناسب.
يركز هذا الدليل على وكلاء البرمجة، لا على مطالبات الإكمال القصيرة. يقرأ الوكيل الملفات، ومخرجات الأدوات، وأخطاء المترجم، ونتائج الاختبارات قبل أن يكتب إصلاحا. تستهلك هذه المدخلات السياق، ويغير السياق قرار العتاد.
الفيديو مرجع
يقارن الفيديو التالي بين نماذج محلية عبر عدة مستويات من ذاكرة GPU. يفيد في ملاحظاته العملية حول اختيار النموذج ونتائج العتاد التي أبلغ عنها. يتبع هذا المقال مسارا مستقلا عبر تنظيم القرار حول سلوك الذاكرة، وسياق الوكيل، ومعالجة المطالبات، وتكلفة الملكية الكاملة.
لماذا تفشل قوائم الترتيب
تربط قائمة ترتيب النماذج عادة عدد المعاملات برقم ذاكرة GPU. يفيد هذا الاختصار في التقدير الأولي. لكنه يفقد فائدته عندما يبدأ وكيل برمجة بقراءة مستودع حقيقي.
أوزان النموذج هي أول تخصيص للذاكرة. أما KV cache فهو التخصيص المتنامي. يخزن مفاتيح وقيم الانتباه للسياق النشط حتى لا يعيد وقت التشغيل حساب المطالبة كاملة بعد كل رمز مولد.
| مستهلك الذاكرة | ما الذي يحتفظ به | لماذا يهم |
|---|---|---|
| أوزان النموذج | المعاملات المكممة | متطلب تحميل لمرة واحدة |
| KV cache | ملاحظات من السياق النشط | ينمو مع نمو المطالبة والمحادثة |
| مخازن وقت التشغيل | مساحة حساب مؤقتة | تختلف حسب الواجهة الخلفية وحجم الدفعة |
| تعليمات الوكيل | مطالبات النظام وتعريفات الأدوات | تستهلك السياق قبل وصول ملفات المشروع |
ملف النموذج الذي يلائم البطاقة ليس دليلا على صلاحية الوكيل للاستخدام. يحتاج وقت التشغيل إلى مساحة للمخبأ، والمخازن المؤقتة، وتعريفات الأدوات، والاستجابة التالية.
السياق هو الميزانية الحقيقية
تنفق وكلاء البرمجة السياق على أكثر من ملفات المصدر. تشمل الميزانية أيضا تعليمات النظام، ومخططات الأدوات، وقوائم المجلدات، ومخرجات الصدفة، ورسائل المترجم، ونتائج الاختبارات، وأدوار المحادثة السابقة.
تستهلك ثلاث اتصالات MCP ذات تعريفات أدوات مطولة عدة آلاف من الرموز غالبا قبل أن يفتح الوكيل ملف مشروع. تترك نافذة السياق الافتراضية الصغيرة مساحة قليلة للكود. يستمر الوكيل في الرد، لكنه يفقد مجموعة العمل اللازمة للإصلاحات متعددة الخطوات.
تذكر
أسئلة Ollama الشائعة
سياقا افتراضيا من 4,096 رمزا. يغير إعداد OLLAMA_CONTEXT_LENGTH القيمة الافتراضية، بينما يوسع OLLAMA_NUM_PARALLEL الذاكرة المطلوبة مع عدد الطلبات المتزامنة. سجل القيمتين قبل مقارنة قياس محلي بنتيجة طلب واحد.
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_NUM_PARALLEL=1 ollama serve
يضبط هذا المثال قيمة افتراضية قدرها 32K لطلب نشط واحد. ولا يحجز 32K رمزا لملفات المشروع. تتشارك التعليمات وتعريفات الأدوات والمدخلات والمخرجات النافذة نفسها.
سجل سياق بسيط
قبل مقارنة GPU، سجل القيم التالية:
- حجم المشروع: الملفات وعدد أسطر المصدر التقريبي في مهمة عادية.
- عبء الأدوات: مطالبة النظام، ومخططات MCP، وأدوات الصدفة، وتعليمات المحرر.
- حمولة الخطأ: الطول المعتاد لمخرجات المترجم والاختبارات.
- السياق المستهدف: أكبر مطالبة تريد إبقاءها دون اقتطاع.
- مساحة الاستجابة: المساحة المحجوزة للتصحيح المخطط وشرحه.
استخدم النتيجة كمواصفة لعبء العمل. يختلف احتياج المطور الذي يعدل ملفا واحدا في كل مرة عن احتياج المطور الذي يطلب من وكيل تتبع API عبر مستودع ضخم.
يغير KV Cache الترتيب
غالبا ما تختلف تكلفة السياق بين نموذجين متقاربين في عدد المعاملات. يحتاج النموذج الكثيف الذي تساهم فيه كل طبقة في المخبأ المتنامي إلى ذاكرة أكبر من نموذج يستخدم تصميما هجينا للانتباه.
يستخدم أحد نماذج البرمجة ذات 27B المعروضة في المادة المرجعية مجموعة محدودة من طبقات الانتباه الكامل، بينما تستخدم الطبقات الأخرى ملخصا ثابت الحجم. تبقى تكلفة سياق 128K المبلغ عنها دون 9GB للمخبأ. ويحتاج نموذج مماثل الحجم بانتباه كامل متنام عبر كل طبقة إلى أكثر من 21GB عند طول السياق نفسه.
تصف هذه الأرقام بنى نماذج وإعدادات وقت تشغيل محددة. تعامل معها كسبب لفحص البنية، لا كمعادلة ذاكرة عامة.
| سلوك النموذج | أثر السياق | أثره على العتاد |
|---|---|---|
| انتباه كامل في كل طبقة | نمو كبير للمخبأ | يحتاج إلى ذاكرة أكبر للمطالبات الطويلة |
| انتباه هجين أو منزلق | نمو أقل للمخبأ في بعض الطبقات | مساحة سياق أكبر عند حجم النموذج نفسه |
| خليط الخبراء | معاملات نشطة أقل لكل رمز | حساب أقل لكل رمز، لكن الأوزان الكاملة تحتاج إلى تخزين |
| تمديد السياق الطويل | نافذة عمل أكبر | ذاكرة مخبأ أكبر وعمل أكثر لمعالجة المطالبة |
اقرأ بنية النموذج قبل شراء الذاكرة. يخفي عدد المعاملات وحده تكلفة جلسة البرمجة الطويلة.
اختر حسب مستوى ذاكرة GPU
من أربعة إلى ثمانية GB
تظل النماذج الكثيفة الصغيرة الخيار العملي. تلائم البطاقة، وتستجيب بسرعة، وتعمل جيدا للإكمال، والشروحات القصيرة، وتعديلات الملفات المحدودة.
قد ينتج نموذج أكبر مع تفريغ إلى CPU نصا، لكن زمن الاستجابة يصبح غالبا العامل المحدد. يحتاج وكيل البرمجة إلى قراءات ملفات واستدعاءات أدوات متكررة. يحول إعداد بسرعة أربعة رموز في الثانية كل إصلاح إلى انتظار طويل، حتى عندما يعمل النموذج من الناحية التقنية.
تقدم نماذج خليط الخبراء مسارا آخر. يقلل الجزء النشط الصغير ضغط الحساب، بينما تبقى مجموعة الأوزان الكاملة جزئيا في ذاكرة النظام. يكافئ هذا النهج نظاما ذا RAM وفيرة ومسارات نقل سريعة.
| عبء العمل | الاتجاه المقترح |
|---|---|
| الإكمال | نموذج كثيف صغير مع مطالبة قصيرة |
| تعديلات ملف واحد | نموذج instruct صغير مع دعم الأدوات |
| وكيل على مستوى المستودع | استئجار GPU أكبر أو زيادة ذاكرة النظام أولا |
| كود خاص بموجب NDA | استخدم نموذجا محليا، واقبل نطاقا أصغر أو تشغيلات أبطأ |
في هذا المستوى، اشتر ذاكرة نظام أولا قبل ملاحقة نموذج كبير. يتفوق نموذج صغير مستقر على نموذج كبير يقضي معظم وقته في نقل البيانات عبر الناقل.
من اثني عشر إلى ستة عشر GB
يفتح هذا المستوى الباب أمام نموذج برمجة 27B، لكن اختيار التكميم يصبح محوريا. لا تلائم نسخة 4-bit قياسية قريبة من 17GB بطاقة 16GB بعد دخول عبء وقت التشغيل في الحساب.
تترك نسخة 3-bit قريبة من 13GB مساحة أكبر للسياق. تدفع بطاقة 12GB الاختيار نحو نسخة 2-bit أو نموذج خليط خبراء أصغر. تعتمد الجودة على أداة التكميم وعملية المعايرة المحددين، لذلك تنتج نسختان بالعمق نفسه نتائج برمجة مختلفة غالبا.
تحقق من النقاط التالية قبل تنزيل نموذج مكمم:
- كاتب أداة التكميم وملاحظات الإصدار
- بيانات المعايرة ونتائج التقييم
- توافق أداة الترميز
- اختبارات استدعاء الأدوات
- طول السياق عند التكميم المختار
- دعم وقت التشغيل في Ollama أو llama.cpp أو الواجهة الأمامية المختارة
لا تتعامل مع “2-bit” أو “3-bit” كوصف كامل للجودة. تهم طريقة الحزم وسجل المعايرة.
من أربعة وعشرين إلى اثنين وثلاثين GB
يعد هذا النطاق الأكثر مرونة لنموذج برمجة 27B. تلائم بطاقة 24GB نسخة 4-bit غالبا مع سياق مفيد، لكن نافذة 128K كاملة قد تتجاوز الذاكرة المتبقية. تمنح بطاقة 32GB وقت التشغيل مساحة أكبر للمخبأ والتخصيصات المؤقتة.
يسهل هذا النطاق تبرير الملكية أيضا. تتعامل بطاقة واحدة مع العبء دون تعقيد تقسيم بطاقتين. يستهلك النظام طاقة أقل من بناء متعدد GPU، ويصبح اختبار دعم البرمجيات أسهل.
| السعة | الموقع العملي |
|---|---|
| 24GB | نموذج 4-bit قوي مع حدود سياق يجب قياسها |
| 32GB | نموذج 4-bit أو 6-bit 27B مع مساحة سياق أوسع |
| 48GB | دقة أعلى أو مخبأ أكبر دون تغيير النموذج الأساسي |
يمثل نطاق 24GB إلى 32GB منطقة الملكية المنطقية لأعمال البرمجة الخاصة المتكررة. يتجنب أضعف سلوك للتفريغ دون فرض عتاد مراكز البيانات داخل صندوق مكتبي.
ثمانية وأربعون GB فأكثر
لا تعني الذاكرة الأكبر تلقائيا نموذجا جديدا. قد يعمل النموذج نفسه 27B بدقة 8-bit على بطاقة 48GB، مع مخبأ أكبر وتنازلات أقل. يتمثل التحسن في الاتساق ومساحة السياق وجودة المخرجات، لا في مستوى جديد من الاستدلال.
عند 128GB يتغير القرار. يصبح نموذج خليط خبراء أكبر ممكنا، لكن معالجة المطالبة تصبح مصدر قلق جدي. غالبا ما يولد النموذج بسرعة بينما يستغرق وقتا طويلا لاستيعاب مستودع كبير أو نتيجة أداة جديدة.
للنماذج الكبيرة، قس سرعة الإدخال المسبق منفصلة عن سرعة فك الترميز. قد تبدو الإجابة سريعة بعد قراءة مطالبة بطيئة، لكنها تظل بطيئة في سير عمل الوكيل.
سرعة فك الترميز نصف الاختبار فقط
تقيس سرعة فك الترميز الرموز المولدة في الثانية. وتجيب عن سؤال: «ما سرعة كتابة النموذج؟» تقيس سرعة الإدخال المسبق معالجة المطالبة. وتجيب عن سؤال: «ما سرعة قراءة النموذج؟»
يقضي الوكيل جزءا كبيرا من وقته في القراءة. تضيف كل استدعاءات الأدوات نصا جديدا. يدخل ملف مصدر طويل أو أثر مكدس أو سجل اختبار إلى المطالبة قبل بدء الاستجابة التالية.
| المقياس | تجربة المستخدم |
|---|---|
| رموز فك الترميز في الثانية | سرعة ظهور الإجابة بعد المعالجة |
| رموز المطالبة في الثانية | مدة انتظار الوكيل قبل بدء الإجابة |
| زمن أول رمز | التأخير المشترك من معالجة المطالبة والإعداد |
| الاحتفاظ بالسياق | مقدار حالة المشروع المتاحة أثناء المهمة |
قِس أحجام مطالباتك الخاصة. تخفي مطالبة تركيبية قصيرة التكلفة الأهم أثناء العمل على المستودع.
إعدادات وقت التشغيل المجانية أولا
لا تكون ترقيات العتاد أول خطوة للأداء. اختبر إعدادات وقت التشغيل قبل فتح صفحة شراء.
التنبؤ بعدة رموز
تدعم بعض تركيبات النموذج والواجهة الخلفية التنبؤ بعدة رموز مستقبلية، ثم التحقق منها في تمريرة واحدة. تظهر الميزة غالبا عبر خيار وقت تشغيل أو إعداد مسودة متوافق.
تظهر الاختبارات المبلغ عنها في المادة المرجعية مكاسب كبيرة على بعض البطاقات الراقية. تختلف النتائج حسب ملف النموذج والواجهة الخلفية والتعريف والبطاقة. قد لا تحافظ مسارات Apple Metal على الميزة المطلوبة أثناء التحويل.
مستوى الاستدلال
ينفق النموذج الذي يأتي مفعلا بأقصى استدلال وقتا أطول على العمل الداخلي قبل إعادة النتيجة. يقدم الاستدلال المتوسط توازنا أفضل غالبا لإصلاح الكود، خصوصا عندما تتضمن المهمة رسالة خطأ واضحة وهدفا ضيقا لملف.
استخدم مصفوفة اختبار بسيطة:
- شغّل مهمة إصلاح الخطأ نفسها باستدلال منخفض ومتوسط وعال.
- سجل زمن أول رمز، والزمن الكلي، ونجاح التصحيح، ونتيجة الاختبار.
- كرر الاختبار بمطالبة قصيرة ومطالبة بحجم مستودع.
- احتفظ بالإعداد الذي ينتج المهمة المكتملة الأفضل، لا أعلى معدل رموز.
يمثل الاستدلال المتوسط مع مسار متوافق للتنبؤ بعدة رموز نقطة بداية قوية. تحقق من الجودة على كودك قبل جعله الإعداد الافتراضي.
العتاد المحلي أم GPU مستأجر؟
يفوز الحوسبة المستأجرة للعمل العرضي. تدفع مقابل الجلسات النشطة بدلا من شراء بطاقة وتبريدها وتحديثها وتشغيلها طوال العام.
يفوز العتاد المملوك عندما يكون العبء متكررا أو خاصا أو بلا اتصال. كما يلغي وقت الانتظار ويمنحك بيئة ثابتة للاختبارات القابلة للتكرار.
| الحالة | الخطوة الأولى الأفضل |
|---|---|
| بضع جلسات شهريا | استئجار GPU أو استخدام API |
| برمجة خاصة يومية | شراء نظام مدعوم من 24GB إلى 32GB |
| مستودع كبير مع إعادة تحميل متكررة | الاستئجار أولا وقياس سرعة الإدخال المسبق |
| لا يغادر الكود المبنى | امتلك أصغر نظام يحقق هدف السياق |
| تجربة نموذج جديد | استأجر قبل شراء العتاد |
احسب نقطة التعادل بالساعات النشطة، لا بالساعات التقويمية. أدرج الكهرباء والتخزين والتبريد والصيانة والوقت المطلوب لإبقاء وقت التشغيل عاملا.
شراء GPU راق للعمل التجريبي العرضي هو نفقة هواية. أما نظام 24GB إلى 32GB المستخدم يوميا للعمل الخاص فله مبرر اقتصادي أقوى.
قائمة شراء أفضل
استخدم هذا الترتيب عند مقارنة نموذج وGPU:
- حدد المهمة. إكمال، إصلاح ملف واحد، وكيل مستودع، أو تحليل بسياق طويل.
- قِس المطالبة. احسب تعليمات النظام المعتادة، ومخططات الأدوات، والملفات، ومخرجات الاختبارات.
- افحص سلوك المخبأ. ابحث عن ملاحظات البنية وقياسات ذاكرة السياق.
- اختر تكميفا. تحقق من نتائج الجودة للنسخة المحددة، لا من عدد البتات فقط.
- اختبر الإدخال المسبق وفك الترميز. استخدم مطالبات من مستودعك الخاص.
- اضبط الاستدلال. قارن زمن المهمة المكتملة عند مستويات استدلال متعددة.
- اختبر الخصوصية والصيانة. أكد أين ينتقل الكود ومن يدير الواجهة الخلفية.
- قارن تكلفة الاستئجار. استخدم الساعات النشطة المتوقعة وأدرج الطاقة في تقدير النظام المملوك.
التوصية النهائية
أقل من 12GB، شغّل نموذجا أصغر أو نموذج خليط خبراء مع RAM نظام كافية. لا تفرض نموذجا كثيفا 27B على إعداد يقضي معظم وقته في التفريغ.
من 12GB إلى 16GB، ركز على جودة التكميم وهدف سياق مضبوط. نسخة 2-bit أو 3-bit مختبرة جيدا مع دعم الأدوات أنفع من ملف 4-bit لا يلائم الإعداد بسلاسة.
من 24GB إلى 32GB، يصبح نموذج البرمجة 27B الخيار العملي الافتراضي للعمل الخاص اليومي. قِس استخدام السياق وسرعة المطالبة قبل افتراض توفر النافذة المعلنة كاملة.
عند 48GB فأكثر، أنفق الذاكرة الإضافية على الدقة ومساحة المخبأ والجلسات المستقرة قبل الانتقال إلى نموذج أكبر. عندما يتجاوز النموذج نطاق 128GB، تستحق سرعة قراءة المطالبة واقتصاديات الاستئجار اهتماما أكبر من السعة الخام.
اسم النموذج هو نقطة البداية فقط. السؤال المفيد هو مقدار سياق المشروع المتبقي بعد أن يأخذ النموذج ووقت التشغيل والأدوات والمخبأ نصيبها.
قراءة ذات صلة
- ذاكرة VRAM بسعة 32GB لنموذج Qwen 27B: دليل عتاد الذكاء الاصطناعي المحلي ، يركز على مسارات العتاد لعبء 27B.
- قياسات GPU لنماذج Llama 3.1 8B وQwen3.8 27B على Vast.ai ، نتائج مقاسة من GPU مستأجر وحدود السياق الطويل.
- الذكاء الاصطناعي المحلي في 2026: نموذج 27B يتفوق على Sonnet 4.6 ، جودة النموذج والتكميم واقتصاديات العتاد المحلي.
This article refers to other articles we've written:
- ذاكرة VRAM بسعة 32GB لنموذج Qwen 27B: دليل عتاد الذكاء الاصطناعي المحلي لشهر أكتوبر 2026
دليل عملي لشهر أكتوبر 2026 لتشغيل نموذج Qwen 27B مع 32GB من ذاكرة المسرّع القابلة للاستخدام. قارن بين وحدات GPU المنفردة، وبُنى البطاقتين، والذاكرة الموحدة، وبطاقات مراكز البيانات المستعملة، والحوسبة المستأجرة، ودعم البرمجيات، وحدود السياق الكامل.






