Table of Contents

وجود 32GB على ملصق المنتج لا يعني توفر 32GB لحمل عمل Qwen 27B. يغيّر نظام التشغيل، وبيئة التشغيل، وذاكرة KV cache، وتنسيق النموذج، وحزمة التعريفات، وتوزيع البطاقات النتيجة. قد تخسر بطاقة رخيصة ذات سعة كافية بوضوح في معالجة المطالبة أو وقت الإعداد.

في أكتوبر 2026، قارن الذاكرة القابلة للاستخدام والعمل المنجز مقابل كل دولار، وليس رقم VRAM وحده.

يعرض هذا الدليل الطرق العملية لتشغيل نموذج Qwen 27B بجودة 6-bit مع نافذة سياق كبيرة. ويفصل بين المواصفات المنشورة ونتائج الاختبارات المبلغ عنها، لأن نتيجة tokens-per-second لشخص واحد ليست خاصية عامة لوحدة GPU.

لماذا الهدف 32GB؟

يبدأ احتياج الذاكرة من الأوزان. يقرأ نموذج كثيف من فئة 27B مجموعة المعاملات كاملة أثناء التوليد. عند استخدام تكميم 6-bit، تشغل الأوزان نحو 20.5GB قبل احتساب تخصيصات وقت التشغيل وذاكرة السياق.

يضيف سياق من 128K رمزاً تخصيصاً كبيراً آخر. يتغير حجم KV cache الدقيق حسب بنية النموذج، ودقة التخزين المؤقت، وإعدادات الدفعات، والواجهة الخلفية. يضع تقدير عملي قريب من 8GB مجموع الأوزان والذاكرة المؤقتة عند نحو 28.5GB قبل أخذ نظام التشغيل وبيئة الاستدلال حصتهما.

التكوينما يدعمه
وحدة GPU منفصلة بسعة 24GBأوزان 4-bit مع سياق أقل، أو تفريغ جزئي
وحدة GPU منفصلة بسعة 32GBأوزان 6-bit مع هدف سياق 128K مفيد
وحدتا GPU بسعة 16GBنموذج مقسم مع هامش أقل لنفقات وقت التشغيل
ذاكرة موحدة بسعة 64GBخيارات سياق ونماذج أكبر، وفق حد تخصيص ذاكرة GPU

هدف 32GB هو نقطة لتحديد الحجم، وليس ضماناً. قد يُحمّل النموذج مع ترك مساحة قليلة جداً لمطالبة طويلة، أو دفعة أكبر، أو مدخلات متعددة الوسائط، أو عملية ثانية.

الفيديو مرجع ميداني مفيد

يعرض الفيديو التالي مقارنة عملية للطرق الرئيسية للوصول إلى 32GB للذكاء الاصطناعي المحلي. يفيد كمرجع ميداني للأسعار المبلغ عنها، وصعوبة الإعداد، ونتائج التشغيل. يقدم هذا المقال مقارنة مستقلة باستخدام مواصفات العتاد، وسلوك ذاكرة النموذج، ودعم البرمجيات، والتكلفة الكلية للملكية.

الذاكرة القابلة للاستخدام أهم من ذاكرة العلبة

الذاكرة الموحدة في Apple

تستخدم شرائح Apple silicon مجموعة مشتركة للـ CPU والـ GPU. تعرض Apple تكوينات Mac mini بذاكرة موحدة 32GB، لكن المجموعة الكاملة ليست تخصيصاً رسومياً مخصصاً. يحتاج macOS والتطبيق وبيئة الاستدلال إلى مساحة أيضاً.

تبلغ بعض جلسات llama.cpp نحو 22,906MB متاحة على نظام بسعة 32GB. يعادل هذا قرابة 21.3GiB، ما يترك مساحة قليلة لنموذج 27B بترميز 6-bit مع KV cache كبير. يعتمد الحد الدقيق على نظام التشغيل، ومشغل النموذج، وضغط الذاكرة، وإعدادات التشغيل.

تظل Apple silicon جذابة للأنظمة الهادئة. يتعامل llama.cpp مع Metal كواجهة خلفية أساسية، وتتجنب Apple مشكلات التعريفات والطاقة الموجودة في كثير من بطاقات مراكز البيانات المستعملة. المقابل هو سرعة أقل من GPU منفصل متقدم وهامش ذاكرة أقل قابلية للتنبؤ.

بطاقتان بسعة 16GB

توفر بطاقتان بسعة 16GB ما مجموعه 32GB من VRAM الفعلية، لكن بيئة التشغيل تحتاج إلى مخازن مؤقتة ومساحة اتصال لكل جهاز. قد تعرض بطاقة استخدام 13.4GB بينما تعرض الأخرى 14.4GB. السعة المتبقية ليست احتياطياً نظيفاً قدره 4GB للسياق.

تؤثر طريقة التقسيم أيضاً. يوزع تقسيم الطبقات طبقات النموذج المختلفة على بطاقات مختلفة. يزيد السعة، لكن البطاقات تتناوب على المرور عبر النموذج. يضع تقسيم الموتر العمل من الطبقة نفسها على البطاقتين، ما يزيد الاتصال، لكنه يسمح للجهازين بالمساهمة مباشرة بصورة أكبر.

طريقة التقسيمالفائدة الرئيسيةالتكلفة الرئيسية
تقسيم الطبقاتتوسيع بسيط للسعةتنتظر بطاقة غالباً بينما تعمل الأخرى
تقسيم الموترحساب متواز أفضل في بعض الأحمالضبط أكثر وحركة بيانات أكبر بين الوصلات
تفريغ CPU مع GPUتشغيل نماذج تتجاوز إجمالي VRAMانخفاض كبير في السرعة عندما يتولى CPU الطبقات المتكررة

تحتاج خطة البطاقتين إلى واجهة خلفية مجربة قبل الشراء. يؤثر جيل PCIe، وتباعد الفتحات، وتوصيل الطاقة، ودعم التعريفات، والتكميم المحدد في النتيجة.

خيارات البطاقة الواحدة

RTX 5090

تدرج NVIDIA RTX 5090 مع 32GB من GDDR7 و1,792GB/s من عرض نطاق الذاكرة. تتمتع بدعم CUDA واسع، وأدوات ناضجة، وواجهات أمامية مجربة كثيرة. يعرض جدول CUDA GPU الحالي RTX 5090 عند قدرة حوسبة 12.0.

المشكلة هي السعر. تمنح 5090 الجديدة طريقاً واضحاً إلى 32GB، لكن تكلفة الشراء تنافس أشهراً من تأجير المسرّعات. تستهلك أيضاً حتى 575W من قدرة الرسومات الكلية، لذلك يحتاج النظام إلى مزود طاقة وتبريد قويين.

Radeon AI PRO R9700

تعد R9700 خياراً من AMD في فئة 32GB مع عرض نطاق ذاكرة مرتفع وسعر دخول أقل من 5090 في قوائم كثيرة. تعتمد قيمتها بشدة على بيئة التشغيل. يعطي مسار llama.cpp الافتراضي نتيجة قابلة للاستخدام، بينما يعطي محرك مجتمعي أسرع نتيجة أعلى بكثير على البطاقة نفسها في بعض الاختبارات المبلغ عنها.

هذا أوضح مثال على سبب حاجة مقارنة GPU إلى عمودي سرعة. سرعة فك التوليد تقيس الرموز المولدة. سرعة الملء المسبق تقيس سرعة قراءة الواجهة الخلفية للمطالبة قبل أول رمز مولد. تكشف قاعدة شيفرة من 50,000 رمز مسار ملء مسبق ضعيفاً حتى عندما تبدو سرعة فك التوليد مقبولة.

Intel Arc Pro B70

تستهدف Arc Pro B70 أحمال العمل الاحترافية مع ذاكرة 32GB. وهي خيار مثير للاهتمام من حيث السعة مقابل الدولار، لكن مسار البرمجيات يحتاج إلى فحص أكبر من عتاد CUDA. يؤثر دعم GGUF القياسي، والبُنى المصححة، وإعدادات draft-token، ونضج الواجهة الخلفية في النتيجة.

لا يعوض انخفاض سعر الشراء الساعات التي تقضيها في البحث عن بنية تعمل. يمثل هذا العمل جزءاً من المشروع للهاوي. أما محطة العمل اليومية فتمنح دعم التعريفات والتطبيقات قيمة حقيقية.

بطاقات مراكز البيانات المستعملة

Tesla V100

تجذب بطاقات Tesla V100 المستعملة بسعة 32GB الانتباه لأن سعر البطاقة يبدو منخفضاً. لكن تكلفة البناء الكامل أعلى. تحتاج بطاقة مركز البيانات السلبية إلى تدفق هواء، وهيكل أو غطاء مناسب، ومحولات طاقة، ومضيف يملك مساحة PCIe كافية.

المشكلة الأخرى هي قدم البرمجيات. يركز جدول CUDA GPU الحالي على البنى الأحدث ولا يدرج V100 في جدول البنى الحالي. يحتاج مالك V100 إلى فحص إصدار CUDA الدقيق، وفرع التعريف، والواجهة الخلفية، والتفرع المجتمعي قبل الشراء.

ضع ميزانية لنظام V100 عامل، لا لبطاقة عارية. قد تتحول بطاقة معروضة قرب 680 دولاراً إلى مشروع يقارب 1,000 دولار بعد التبريد والمحولات ومنصة المضيف. ترتفع الأسعار المستعملة أيضاً عندما يدفع حمل ذكاء اصطناعي محلي شائع المشترين نحو المسرّع المتقاعد نفسه.

AMD Instinct MI50

تقدم MI50 سعراً مستعملاً جذاباً لكل جيجابايت، لكن دعمها البرمجي الحالي قيد خطير. البطاقة التي تتطلب حزمة ROCm قديمة أو تفرعاً يديره المجتمع ليست معادلة لبطاقة استهلاكية حديثة مع دعم تطبيقات واسع.

فجوة معالجة المطالبة المبلغ عنها أهم من سعر الملصق. قاست مقارنة واحدة نحو 128 رمزاً في الثانية على MI50 مقابل نحو 2,652 رمزاً في الثانية على بطاقة أحدث بسعة 32GB في حمل معالجة مطالبة. قد تستغرق قاعدة شيفرة من 50,000 رمز دقائق على المسار الأبطأ وثواني على الأسرع قبل بدء التوليد.

تلائم MI50 حالة استخدام ضيقة. تناسب باني يفضل السعة على سرعة التفاعل ويقبل صيانة التعريفات. وهي خيار سيئ لتحليل قواعد الشيفرة السريع عندما يهم وقت الملء المسبق.

البرمجيات جزء من GPU

يدعم llama.cpp واجهات CUDA وHIP وMetal وVulkan وSYCL وغيرها. كما يدعم الاستدلال الهجين بين CPU وGPU واستخدام عدة GPUs. لا تقدم هذه الميزات أداءً متطابقاً بين الموردين وتنسيقات النماذج.

غالباً ما تعرض البطاقة الفعلية نفسها فروقاً كبيرة بين:

  • بنية تطبيق افتراضية بإعدادات محافظة.
  • بنية llama.cpp مضبوطة بنوى خاصة بالواجهة الخلفية.
  • تفرع مجتمعي بتنبؤ تخميني أو تنبؤ متعدد الرموز.
  • تنسيق نموذج مصحح مصمم لمسار مسرّع واحد.

تشمل النتائج المبلغ عنها في المقارنة المرفقة نحو 27 رمزاً في الثانية لمسار AMD افتراضي بسعة 32GB، ونحو 46 رمزاً في الثانية مع التنبؤ متعدد الرموز، ونتائج أعلى بكثير على واجهة خلفية متخصصة. تفيد النتيجة كدليل على هامش البرمجيات. ولا تمثل وعداً لتثبيت جديد.

سجل الواجهة الخلفية، والالتزام البرمجي، وملف النموذج، والتكميم، وطول السياق، وطول المطالبة، وحجم الدفعة، وحالة الطاقة مع كل اختبار أداء. من دون هذه الحقول تصبح الرموز في الثانية رقماً إعلانياً.

الاستئجار بدلاً من الشراء

يغير تأجير GPU سريع الحساب. يجعل سعر إيجار RTX 5090 المبلغ عنه قرب 0.69 دولاراً في الساعة شراءً بقيمة 4,400 دولار يعادل نحو 6,377 ساعة تأجير قبل إدخال الكهرباء، وعتاد المضيف، والصيانة، وقيمة إعادة البيع في المقارنة.

يعادل ذلك قرابة تسعة أشهر من التأجير المتواصل أو نحو عامين عند ثماني ساعات يومياً. ويعادل شراء سطح مكتب ببطاقتين قرب 1,560 دولاراً نحو 2,261 ساعة بالسعر نفسه. كما يتجنب 5090 المستأجرة الحرارة والضجيج المحليين وإعداد التعريفات وتعطل البطاقة.

نمط الاستخدامالاختبار الأول الأفضل
بضع ساعات أسبوعياًنموذج مستضاف أو GPU مستأجر
مشروع قصيراستئجار بطاقة من فئة 5090 وقياس حمل العمل الحقيقي
استخدام تفاعلي يوميالشراء بعد اختبار الواجهة الخلفية وهدف السياق فقط
وكلاء يعملون طوال الليليصبح العتاد المملوك أسهل في التبرير
بيانات خاصة مع حمل ثابتعتاد مملوك مع عزل الشبكة

استأجر قبل الشراء عندما يظل النموذج أو الواجهة الخلفية أو طول السياق غير مؤكد. ويكلفك قياس استخدام حقيقي خلال عطلة نهاية أسبوع أقل من شراء محطة عمل خاطئة.

توصيات الشراء

بطاقتا RTX 5060 Ti بسعة 16GB

توفر بطاقتان بسعة 16GB مسار CUDA عملياً لمن يحتاج 32GB ويريد البرامج التعليمية والتعريفات والواجهات الأمامية الشائعة. استخدم تقسيم الموتر بعد التحقق من تنسيق النموذج والواجهة الخلفية. تقسيم الطبقات أبسط، لكنه يترك الأداء غالباً دون استغلال.

يحتاج هذا المسار أيضاً إلى لوحة أم بفتحتين قابلتين للاستخدام، وطاقة كافية، وتدفق هواء بين البطاقتين. لا يعود زوج البطاقات بناء محطة عمل صغيراً عند احتساب تكلفة المنصة.

بطاقة واحدة بسعة 32GB

اختر بطاقة واحدة بسعة 32GB عندما تكون الموثوقية، وتغطية الضمان، وسهولة النشر أهم من أقل سعر للذاكرة. تمثل R9700 وRTX 5090 نسختين مختلفتين من هذا الخيار. يركز مسار AMD على السعة والسعر. ويركز مسار NVIDIA على اتساع البرمجيات ونضج دعم CUDA.

V100 أو MI50 مستعملة

اختر عتاد مراكز البيانات المستعمل فقط عندما يتضمن المشروع نفسه اختبار التعريفات، وأعمال التبريد، وصيانة الواجهة الخلفية. سعر البطاقة هو السطر الأول في الميزانية، وليس السطر الأخير.

Apple silicon

اختر نظام Apple silicon بسعة 32GB عندما يكون الهدوء، واستهلاك الطاقة المنخفض في الخمول، وسطح المكتب الصغير أهم من أعلى إنتاجية. افحص تخصيص الذاكرة الذي يعرضه المشغل المحدد قبل افتراض توفر 32GB كاملة للنموذج.

التأجير السحابي

اختر التأجير عندما يكون الحمل متقطعاً، أو يتغير النموذج كثيراً، أو تكون الاستجابة السريعة للمطالبة أهم من الملكية المحلية. أوقف المثيل بعد الاختبار. يزيل وقت الخمول ميزة السعر سريعاً.

ورقة مقارنة أفضل

قبل الشراء، سجل القيم التالية لكل مرشح:

  • ذاكرة النموذج القابلة للاستخدام بعد نفقات وقت التشغيل.
  • تنسيق الأوزان وحجم النموذج المتوقع.
  • حجم KV cache عند طول السياق المستهدف.
  • سرعة الملء المسبق لمطالبة ممثلة.
  • سرعة فك التوليد بعد امتلاء السياق.
  • إصدار الواجهة الخلفية والتعريف المطلوب للنتيجة.
  • الطاقة في الخمول وتحت الحمل وفق سعر الكهرباء المحلي.
  • تكلفة المضيف والتبريد والمحولات والتخزين والضمان.
  • المكافئ المستأجر لعدد الساعات التي تتوقع استخدام النظام فيها.

الاختبار الأكثر فائدة هو مطالبة من حمل عملك الحقيقي. للبرمجة، استخدم قاعدة شيفرة ممثلة. وللبحث، استخدم مستنداً طويلاً مع سير الاسترجاع أو اللصق المعتاد. قس الزمن حتى أول رمز، ووقت معالجة المطالبة، وسرعة التوليد، واستخدام الذاكرة، وجودة المخرجات.

التوصية النهائية

اشتر بطاقتي RTX 5060 Ti بسعة 16GB لأقل بناء CUDA تعقيداً عند 32GB. استخدم تكوين تقسيم الموتر بعد أن يؤكد اختبار صغير عمل الواجهة الخلفية كما تتوقع.

اشتر بطاقة واحدة بسعة 32GB عندما تحتاج محطة عمل أبسط. فضل البطاقة ذات مسار البرمجيات الأقوى للمشغل الذي اخترته، لا البطاقة ذات أقل قيمة بالدولار لكل جيجابايت.

استخدم V100 أو MI50 فقط عندما تقبل مشروع الصيانة. المسرّع الرخيص ذو أداء الملء المسبق الضعيف ليس صفقة جيدة للمطالبات الطويلة على قواعد الشيفرة.

استأجر GPU من فئة 5090 عندما يكون الاستخدام غير منتظم. يمنحك اختبار التأجير بيانات حقيقية عن الذاكرة والسرعة والسياق قبل شراء كبير.

السؤال عن 32GB ليس «أي بطاقة تملك أرخص جيجابايت؟». السؤال هو «أي نظام يترك ذاكرة قابلة للاستخدام كافية، ويقرأ حمل عملي بسرعة، ويعمل مع برمجياتي، ويكسب سعر شرائه من الاستخدام المنتظم؟»

المراجع

الخطوات التالية

استخدم ورقة العمل مع مطالبة ممثلة قبل الشراء. قارن الزمن حتى أول رمز، ومعالجة المطالبة، وسرعة فك التوليد، واستخدام الذاكرة، والطاقة، وتكلفة المنصة الكلية. لمشروع قصير، استأجر أولاً واحتفظ بالنتيجة المقاسة مع قرار الشراء.