Table of Contents

يمثل الذكاء الاصطناعي المحلي خياراً عملياً للمهام المحددة ذات الفحوص الواضحة. استبدال العمل الذي تمنحه إلى ChatGPT أو Claude يتطلب توافق قدرة النموذج والذاكرة المتاحة ووكيل يفحص الناتج ويتحقق منه.

يحتاج النموذج الذي يناسب محطة عملك إلى أدوات مناسبة وسرعة كافية لتكرار المحاولات. يفصل هذا المقال بين نتائج الاختبارات وتقديرات الذاكرة وأدلة إنجاز المهام، كي تقيم كل جانب بمفرده.

أهم النقاط

  • القدرة: تصف الدرجات المرجعية إعدادات تقييم محددة، لا نسختك المحلية المكممة.
  • الذاكرة: خصص مساحة للأوزان وذاكرة السياق ومصاريف التشغيل معاً.
  • السرعة: إعادة محادثة وكيل تقيس أداء الخدمة، لا صحة النتيجة.
  • التحقق: يحتاج الوكيل إلى فحوص تناسب النتيجة المطلوبة.
  • الاختيار: قارن المهام المتكررة ووقت الإصلاح والتكلفة الكاملة قبل شراء العتاد.

اقرأ الدرجات ضمن سياقها

يجمع Artificial Analysis Intelligence Index عدة تقييمات في درجة مرجعية. تعرض قائمة النماذج ونتائج العتاد المحلي الإدخالات التالية، بعد فحصها في 6 أكتوبر 2026.

النموذج والإعداددرجة المؤشرالنشر في هذه المقارنة
Qwen3.8 27B, xhigh34أوزان قابلة للتنزيل
GLM-5.3, max45أوزان قابلة للتنزيل
GPT-6 Astra, max53خدمة مستضافة
Claude Opus 5.5, max مع البديل58خدمة مستضافة

نقاط المؤشر ليست نسباً للذكاء أو نجاح المهام. لا تثبت فجوة من 13 نقطة بين GLM وClaude فرقاً قدره 13% في نتائج البرمجة. تؤثر إعدادات الاستدلال أيضاً في المقارنة.

تصف منهجية التقييم المنشورة إعداد الاختبار. تتضمن بعض التقييمات الأدوات وبنية الوكلاء. لا تنقل الدرجة مباشرة إلى نسخة محلية مضغوطة تعمل عبر تطبيق آخر.

ChatGPT وClaude منتجان، بينما تقارن هذه الطاولة نماذج أساسية مختارة. تضيف الاشتراكات والنموذج والأدوات وسياق المهمة فروقاً أخرى. ابدأ بمهمة تكررها ثم اختبر الإعداد الكامل.

احسب الطلب كاملاً

يبدأ توافق الذاكرة بثلاثة أجزاء. تخزن أوزان النموذج المعلمات المتعلمة. تحتفظ ذاكرة المفتاح والقيمة، أو ذاكرة KV، ببيانات الانتباه أثناء الاستدلال. تستهلك مخازن التشغيل والبرامج الأخرى المساحة المتبقية.

الذاكرة المطلوبة = الأوزان المقيمة + ذاكرة السياق + هامش التشغيل
الذاكرة المتاحة = السعة الفيزيائية - حجز نظام التشغيل والتطبيقات

يقلل التكميم دقة تخزين الأوزان. تقلل الدقة الأقل متطلبات الذاكرة، بينما تعتمد الجودة على النموذج والبناء المكمم. دقة الذاكرة المؤقتة إعداد مستقل. لا يثبت ملف أوزان Q4 ذاكرة مؤقتة من أربعة بتات.

لـ27 مليار معلمة، تتطلب 16 بت نحو 50.3 GiB، و8 بت نحو 25.1 GiB، و4 بت نحو 12.6 GiB. تعكس أحجام الملفات المنشورة البيانات الوصفية والتعبئة والدقة المختلطة أيضاً. استخدم الملفات الفعلية للتخطيط.

تصف بطاقة Qwen3.8-27B و بطاقة GLM-5.3 بنيتين مختلفتين. ينشط نموذج مزيج الخبراء جزءاً من معلماته لكل رمز، لكن الأوزان المتبقية تحتاج إلى تخزين. يغير التفريغ مكان الأوزان وزمن الاستجابة، ولا يلغيها.

ابدأ بالملفات المنشورة

يقدم حجم التنزيل بداية أدق من عدد المعلمات. توضح إصدارات Qwen وGLM المنشورة من Unsloth أثر التكميم.

البناء المكممالحجم المنشور، GB عشريGiB تقريبي
Qwen3.8 27B Q4_016.115.0
Qwen3.8 27B Q8_029.027.0
GLM-5.3 UD-Q4_K_XL467434.9
GLM-5.3 UD-IQ2_M239222.6

مصادر الملفات: Qwen Q4_0 ، Qwen Q8_0 ، أجزاء GLM UD-Q4_K_XL ، و أجزاء GLM UD-IQ2_M . هذه قوائم مقربة فُحصت في 6 أكتوبر 2026. تقسم تحويلات GiB البايتات العشرية على 2³⁰.

هذه أحجام ملفات الأوزان وليست قياسات الذاكرة المقيمة الكاملة. يؤثر التحميل والذاكرة المؤقتة والمخازن المؤقتة ومكونات النموذج الأخرى في العملية. لا تقارن تنزيل 29 GB بتخصيص 30 GiB دون تحويل الوحدات.

يغير السياق الملاءمة

تقدم ذاكرة انتباه Qwen مثالاً حسابياً. تحدد الإعدادات المنشورة 64 طبقة، وانتباه كامل في كل طبقة رابعة، وأربعة رؤوس مفتاح وقيمة، وبُعد رأس قدره 256.

بايتات KV لكل رمز مع الانتباه الكامل:
16 طبقة × 4 رؤوس KV × 256 بُعداً × 2 (K وV) × 2 بايت
= 65,536 بايتاً

8,192 رمزاً  = 0.5 GiB
32,768 رمزاً = 2.0 GiB

يفترض مكون الذاكرة المحسوب مفاتيح وقيم 16 بت لتسلسل واحد. يستثني حالة الانتباه الخطي ومخازن التشغيل وزيادة المخصص ومكونات الرؤية أو فك الترميز الاختياري. تحتاج تلك التخصيصات إلى احتياط أيضاً.

لـميزانية تخطيط توضيحية، أضف 3–5 GiB للتخصيصات المتبقية إلى أحجام الأوزان المقربة. استبدل هذا الافتراض بقياسات من بيئتك.

البناء والسياقنطاق التخطيط المحسوب
Qwen Q4_0, 8K18.5–20.5 GiB
Qwen Q8_0, 8K30.5–32.5 GiB
Qwen Q8_0, 32K32.0–34.0 GiB

يترك تخصيص قابل للاستخدام قدره 30 GiB مساحة كبيرة لمثال Q4، بينما تتجاوزه سيناريوهات Q8 وفق هذه الافتراضات. لا يثبت نجاح طلب قصير قدرة كافية لجلسة برمجة طويلة.

تضيف الطلبات المتزامنة بُعداً آخر. توثق Ollama نمو ذاكرة السياق مع الطلبات المتوازية وإعدادات مستقلة لدقة الذاكرة المؤقتة. تستخدم ذاكرة Q8 نحو نصف ذاكرة F16، وتستخدم Q4 نحو ربعها، مع اختلاف الجودة حسب النموذج. راجع أسئلة Ollama الشائعة .

طابق العتاد مع التخصيص

تقدم RTX 5090 ذاكرة رسومية مخصصة قدرها 32 GB. يستخدم DGX Spark بسعة 128 GB ذاكرة مشتركة. توثق Artificial Analysis الإعدادين. تسمح السعة الأكبر بتخصيصات أكبر، لكنها لا تثبت سرعة الخدمة.

سيناريو العتادالأثر العملي
RTX 5090, 32 GBيترك Qwen Q4 مساحة سياق أكبر من Q8
DGX Spark, 128 GBمساحة لأي من بنيتي Qwen، مع الحاجة إلى هامش التشغيل
Mac Studio, 256 GBيمكن ترشيح أوزان أكبر، وفق حدود التشغيل والتخصيص

يتجاوز GLM UD-Q4_K_XL السعات الثلاث قبل إضافة الذاكرة المؤقتة. كما تتجاوز مجموعة أوزان IQ2 البالغة نحو 222.6 GiB نظاماً بسعة 128 GB. في Mac بسعة 256 GB تعتمد الإمكانية على التخصيص المتاح للمعالج الرسومي والهامش المتبقي. تحدد مواصفات Apple خيارات العتاد، لا تخصيص استدلال مضموناً.

يترك ميزانية افتراضية قابلة للاستخدام قدرها 240 GiB نحو 17.4 GiB بعد أوزان IQ2. تفشل ميزانية 192 GiB عند الأوزان وحدها. لا تثبت أي منهما احتياط النظام أو دعم الذاكرة المضغوطة أو الإنتاجية المفيدة أو جودة IQ2 المقبولة. اطلب إعداد تشغيل مثبتاً قبل الشراء.

السرعة نتيجة منفصلة

يعيد اختبار الاستدلال المحلي من Artificial Analysis تشغيل حمل مسجل من 168 دورة نموذج. تعرض نتائج الحواسيب المحمولة ومحطات العمل الأوقات التالية لإعدادات Qwen3.8 27B المختبرة.

النظاموقت إعادة تشغيل الخدمة
DGX Spark, 128 GB24.2 دقيقة
RTX 50904.9 دقيقة
Mac Studio, 256 GBلا توجد نتيجة في هذه المقارنة

تستغرق نتيجة RTX نحو خمس وقت Spark. إعدادات الخدمة مهمة، لذلك لا تمثل هذه نسبة عتاد عامة. تختلف إصدارات الخدمة المختبرة أيضاً عن أمثلة تخطيط GGUF.

يستثني وقت الإعادة تشغيل الأدوات ويفرض أطوال استجابات مسجلة. لا يقيم حل الإجابات للمهمة الأصلية. كما لا تثبت قياسات MacBook أداء Mac Studio.

أعط الوكيل ملاحظات

يوفر نظام تنفيذ الوكيل أدوات وسياقاً وحلقة عمل وتحققاً. يكتب النموذج الإجراءات أو يختارها داخل النظام. تتطلب عملية تصدير CSV قراءة ملفات المشروع وتغيير الكود وتشغيل الاختبارات واستقبال الأخطاء.

فكر في مهمة تصدير توضيحية لا تجربة مقاسة. ينشئ الوكيل ميزة تنزيل بتنسيق تاريخ خاطئ. تفشل المراجعة البصرية في اكتشاف المشكلة. يفتح اختبار ملف التصدير ويقارن التواريخ بالتنسيق المطلوب. يستقبل الوكيل الفشل ويغير المنسق ويعيد الفحص.

المكون المفقودالفشل المحتمل
السياق المناسبيعدل ملفاً غير متعلق
أدوات التنفيذيصف إصلاحاً دون تطبيقه
خطوة التحققيتوقف بعد كود يبدو صحيحاً
ملاحظات الخطأيكرر نهجاً فاشلاً

تبلغ LangChain عن تغيير من 52.8% إلى 66.5% في Terminal Bench 2.0 مع تثبيت GPT-5.2-Codex. يصف تقرير هندسة الوكلاء إرشادات التحقق وسياق البيئة واكتشاف التعديلات المتكررة وتغييرات ميزانية الاستدلال.

هذه أدلة أبلغ عنها مزود، وليست برهاناً على تطابق نموذج محلي صغير مع نموذج متقدم. تدعم نتيجة أضيق: اختيار النموذج وحده لا يفسر نتائج الوكيل. وتبلغ LangChain عن نتائج أسوأ عند استخدام أقصى استدلال طوال الوقت بسبب انتهاء المهلات.

طابق الفحوص مع العمل

يثبت الفحص الناجح ما يغطيه فقط. يترك اختبار CSV لأسماء الأعمدة تنسيق التاريخ والاقتباس وUnicode والتحكم في الوصول دون اختبار. حدد النتيجة المطلوبة قبل اختيار طريقة التحقق.

المهمةدليل الإكمال المفيد
تغيير الكوداختبارات مناسبة وفحص السلوك الناتج
إجابة بحثيةمصادر تدعم الادعاءات الفردية
حجز أو استردادحالة مخزنة صحيحة والتزام بالسياسة
تصدير مستندناتج محلل يطابق الحقول والتنسيقات المطلوبة

تقيم دراسة τ-bench الوكلاء الذين يتعاملون مع الأدوات والمستخدمين وقواعد المجال. يفحص بحثها حالة قاعدة البيانات النهائية مقابل النتائج المتوقعة. لذلك لا يكفي نص تأكيد سلس لفحص معاملة.

المحلي لا يعني بلا اتصال

تحدد الاستدلالات المحلية مكان تشغيل النموذج. تحدد التطبيقات المحيطة مكان انتقال المستندات وطلبات البحث والآثار ونتائج الأدوات. يبقى نموذج البرمجة المحلي المتصل بالبحث البعيد أو أدوات السحابة نظاماً متصلاً بالشبكة.

تذكر Ollama أنها لا تتلقى الطلبات أو الإجابات أثناء التشغيل المحلي وتوثق تعطيل ميزات السحابة. هذا تصريح خاص ببيئة التشغيل، وليس ضمان خصوصية لكل وكيل متصل. تحقق من نقطة النهاية وكل تكامل عبر وثائق البيئة .

مسار البياناتما يجب فحصه
نقطة الاستدلالعملية محلية أو خادم بعيد أو بديل تلقائي
البحث والاسترجاعالطلبات ومقاطع المستندات المرسلة خارجياً
اتصالات الأدواتالملفات والسجلات المكشوفة لكل خدمة
السجلات والآثارمكان التخزين والمحتوى المحتفظ به والوصول

يحتاج سير العمل الهجين إلى قاعدة نقل واضحة. أبق استخراج المستندات الخاصة محلياً وأرسل النتائج المجمعة المعتمدة فقط للتحليل المستضاف. راجع المواد الخارجة. يبقى الملخص حساساً إذا احتفظ بالأسماء أو بيانات العملاء أو النتائج السرية.

اختبر قبل الشراء

اختر مهمة متكررة ذات شرط إنهاء واضح. قارن الإعداد المحلي بالمنتج المستضاف الذي تستخدمه، مع أدواته. استخدم المدخلات ومعايير القبول نفسها، وكرر المهمة على أمثلة متعددة.

  1. سجل الإعداد: ملف النموذج والتكميم وإصدار الواجهة الخلفية وحد السياق وإعداد الاستدلال.
  2. حدد النجاح: الناتج المتوقع والسلوك المطلوب والآثار الجانبية الممنوعة.
  3. قس الإكمال: الزمن والفحوص الناجحة والمحاولات الفاشلة والإصلاحات اليدوية.
  4. أدخل تكلفة الملكية: العتاد والكهرباء ورسوم API والصيانة ووقتك.
  5. صنف الفشل: أخطاء الاستدلال أو حدود الذاكرة أو التأخر أو غياب السياق أو التحقق.

تلائم الاستدلالات المحلية العمل الذي تحقق جودته وزمنه متطلباتك. يبقى النموذج المستضاف مفيداً حين تقلل قدرته الإضافية الفشل أو جهد المراجعة. يوزع سير العمل الهجين المهام بعد تحديد البيانات المسموح بخروجها.

احسب التكلفة لكل نتيجة مقبولة

يغير وقت الإصلاح البشري الاقتصاد غالباً. تكلف الاستجابة المحلية السريعة التي تحتاج عشر دقائق تصحيحاً وقتاً أكثر من استجابة بطيئة تنجح في المراجعة. احسب النتائج المقبولة مع تكلفة الاستدلال.

التكلفة لكل مهمة مقبولة =
(تخصيص العتاد + الكهرباء + رسوم الخدمة + الصيانة + وقت المراجعة)
÷ المهام المقبولة

تكلفة مراجعة توضيحية: عند أجر مفترض قدره 30 دولاراً للساعة، تكلف ثماني دقائق تصحيح 4 دولارات للمهمة. تستهلك مئة مهمة 400 دولار من وقت المراجعة. هذه أمثلة حسابية وليست معدلات فشل مقاسة.

قارن النتائج المتكافئة. أدرج المحاولات المرفوضة في الوقت والتكلفة. وزع تكلفة العتاد المملوك على فترة خدمة وحجم مهام واقعيين. أدرج في الخدمة المستضافة الاشتراك أو تكلفة API وأعمال المراجعة المتبقية.

للتفاصيل، تابع دليل النموذج المحلي ووحدة GPU والسياق . وللسعة والأسعار، اقرأ مقارنة ذاكرة DGX Spark . استخدم نتائج مهامك لاختيار أصغر إعداد يلبي متطلبات الجودة والسرعة والبيانات.

فيديو مرجعي

المراجع