بطاقتا RTX 5060 Ti مقابل GB10: لماذا تخسر 32 جيجابايت من VRAM أمام 128 جيجابايت من الذاكرة الموحدة

Table of Contents
تبدو بطاقتا RTX 5060 Ti بسعة 16 جيجابايت خيارًا جذابًا في قائمة القطع. تمنحان 32 جيجابايت من VRAM الإجمالية وسرعة قوية لمعالجة المطالبات ذات السياق القصير. تتغير المقارنة عند تشغيل نموذج 27B بسياق طويل.
يستخدم نظام NVIDIA GB10 ذاكرة موحدة متماسكة بسعة 128 جيجابايت. تدرج NVIDIA منصة GB10 مع 128 جيجابايت من ذاكرة LPDDR5x الموحدة وTDP للشريحة قدره 140 واط. تستخدم RTX 5060 Ti ذاكرة GDDR7 بسعة 16 جيجابايت لكل بطاقة، وواجهة ذاكرة 128 بت، وتصنيف قدرة رسومية إجمالية قدره 180 واط. توضح مواصفات NVIDIA RTX 5060 Ti و مواصفات NVIDIA GB10 الفرق بين العتاد.
الفكرة بسيطة. لا تنشئ بطاقتان بسعة 16 جيجابايت تجمعًا سريعًا واحدًا بسعة 32 جيجابايت. بل تنشئان مجموعتين منفصلتين بسعة 16 جيجابايت متصلتين عبر النظام المضيف. في استدلال النماذج الكبيرة، تؤثر السعة الناقصة ونقل البيانات بين الأجهزة أكثر من عدد البطاقات.
مقارنة الذاكرة
| النظام | الذاكرة | نموذج الذاكرة | رقم القدرة المعلن |
|---|---|---|---|
| 2x RTX 5060 Ti 16 GB | 32 GB إجمالًا | مجموعتا ذاكرة GPU منفصلتان | 360 W إجمالي GPU |
| نظام GB10 | 128 GB | ذاكرة نظام موحدة متماسكة | 140 W TDP لـ GB10 |
لا يتفوق GB10 لأن عرض نطاق ذاكرة LPDDR5x بسعة 128 جيجابايت يطابق عرض نطاق GPU منفصل عالي الفئة. تأتي الأفضلية من السعة والموقع. يشترك CPU وGPU في مساحة العناوين نفسها، لذلك لا يلزم أن يتسع النموذج ومخازن التشغيل المؤقتة والتنشيطات وبيانات السياق داخل جهازين منفصلين بسعة 16 جيجابايت.
يواجه النظام ذو البطاقتين مشكلة توزيع أصعب. يجب أن يتوزع النموذج بين البطاقتين. ويجب على بيئة الاستدلال نقل البيانات بينهما. تضيف حركة PCIe زمن انتقال وتستهلك عرض النطاق. كما لا تدعم RTX 5060 Ti تقنية NVLink، وفق مواصفات NVIDIA.
نتيجة الاختبار
تأتي النتائج التالية من تقرير اختبار الذكاء الاصطناعي المقدم. يقارن التقرير نظام GPU مزدوجًا غير مسمى، أطلق عليه 5060ti-x2، بنظام GB10. يغطي الاختبار Qwen وGPT-OSS عند أحجام سياق متعددة.
جاءت النماذج مباشرة من Ollama. استخدم الاختبار الوسمين الافتراضيين الحرفيين qwen3.8:27b و**gpt-oss:latest**، من دون Modelfile مخصص أو تكميم بديل. استخدم نظام 5060ti-x2 واجهة PCIe Gen4 x16 وأحدث تعريفات NVIDIA لنظام Linux المتاحة عند إجراء الاختبار.
معالجة مطالبات Qwen والتوليد
| السياق | سرعة مطالبة 5060ti-x2، token/s | سرعة توليد 5060ti-x2، token/s | سرعة مطالبة GB10، token/s | سرعة توليد GB10، token/s |
|---|---|---|---|---|
| 4K | 862.5 | 56.9 | 57.4 | 27.7 |
| 16K | 917.3 | 53.5 | 62.1 | 28.1 |
| 32K | 881.4 | 48.8 | 62.4 | 26.9 |
| 64K | 795.1 | 39.6 | 59.9 | 26.1 |
| 128K | 538.7 | 28.3 | 59.9 | 28.6 |
| 256K | 189.9 | 1.2 | 59.9 | 25.8 |
عند 4K، يولد النظام ذو البطاقتين بسرعة تقارب ضعف سرعة GB10. عند 64K، ينخفض التقدم إلى نحو 1.5 مرة. عند 128K، يصل النظامان إلى سرعة توليد متقاربة.
عند 256K، تتوقف المقارنة عن إظهار تفوق البناء ذي البطاقتين. وصل طلب 5060ti-x2 إلى 171,359 رمز مطالبة فعليًا فقط. وانخفض التوليد إلى 1.2 رمز في الثانية. أكمل GB10 الاختبار الكامل عند 256K بسرعة 25.8 رمزًا في الثانية.
ولد GB10 بسرعة أعلى بنحو 21.5 مرة في نتيجة 256K المختبرة. والأهم أن GB10 أكمل السياق المطلوب. لم ينفذ النظام ذو البطاقتين الحمل نفسه.
لماذا تكون VRAM الإجمالية مضللة
1. لا يرى النموذج بطاقة واحدة بسعة 32 جيجابايت
لا تدمج وحدتا GPU ذاكرتهما في مساحة عناوين محلية واحدة. تقسم بيئة التشغيل المتوازية النموذج إلى طبقات أو موترات بين الأجهزة. وما زال كل جهاز يحتاج إلى مساحة للأوزان المخصصة له، والمخازن المؤقتة، وجزء من حالة السياق.
لذلك تكون السعة القابلة للاستخدام أقل من المجموع البسيط. تعتمد النفقات الإضافية الدقيقة على تنسيق النموذج، والتكميم، وواجهة الاستدلال، وتقسيم الموترات، وطول السياق.
2. تنمو ذاكرة السياق أثناء التوليد
أوزان النموذج جزء واحد فقط من ميزانية الذاكرة. يخزن مخزن المفاتيح والقيم، أو KV cache، بيانات الانتباه للرموز السابقة. تتطلب السياقات الأطول ذاكرة تخزين مؤقت أكبر. لا يتنبأ اختبار 4K بعملية نشر عند 128K أو 256K.
توضح النتائج المقدمة هذا الحد بوضوح. يحتفظ النظام ذو البطاقتين بتقدم قوي في معالجة المطالبات، ثم يفقد أداء التوليد مع نمو السياق. يبقى GB10 قريبًا من 26 إلى 29 رمز توليد في الثانية من 4K إلى 256K.
3. تضيف عمليات نقل PCIe تكلفة
عندما تنقل بيئة التشغيل التنشيطات أو الموترات بين وحدات GPU، تعبر عملية النقل وصلة المضيف. ينشئ هذا نقاط تزامن ويضيف زمن انتقال إلى كل خطوة. تزداد العقوبة عندما يعبر الحمل حدود الأجهزة بصورة متكررة.
لا يجعل هذا النظام ثنائي GPU بلا فائدة. يشكل توزيع الذاكرة جزءًا من نتيجة الأداء. يفوّت اختبار يبلغ عن معالجة المطالبات عند 4K فقط هذه التكلفة.
4. كفاءة الطاقة ميزة على مستوى النظام
يستخدم GB10 طاقة أقل في المقارنة مع توفير سعة ذاكرة أكبر للحمل ذي السياق الطويل المختبر. تحمل بطاقتا RTX 5060 Ti رقم قدرة رسومية مجمعًا قدره 360 واط قبل احتساب بقية النظام. تدرج NVIDIA قدرة GB10 عند 140 واط.
يستبدل GB10 سرعة السياق القصير القصوى بالسعة والإكمال وقدرة GPU أقل. تهم هذه المقايضات في استدلال Qwen ذي السياق الطويل.
تكلفة نظام 5060ti-x2 أقل بكثير
لا تمحو مقارنة الأداء فرق السعر. أدرجت محطة عمل كاملة ببطاقتي RTX 5060 Ti بسعة 16 جيجابايت بسعر 3,479 دولارًا في 10 أكتوبر 2026. يشمل الإعداد Intel Ultra 7 265K ولوحة Z890 وذاكرة DDR5 بسعة 32 جيجابايت وتخزينًا بسعة 1 تيرابايت ومزود طاقة بقدرة 1,000 واط والبطاقتين. عرض قائمة محطة العمل الكاملة ذات GPU المزدوج .
يعرض متجر NVIDIA في الولايات المتحدة جهاز DGX Spark بسعة 128 جيجابايت بسعر 6,950 دولارًا. تتضمن القائمة 128 جيجابايت من الذاكرة الموحدة المتماسكة وتخزين NVMe بسعة 4 تيرابايت، لكن النظام ظاهر كغير متوفر. تحقق من قائمة DGX Spark الحالية لدى NVIDIA .
توفر منصة AMD Ryzen AI Halo للمطورين نقطة مقارنة أخرى. يبلغ سعر نظام Strix Halo هذا 3,999.99 دولارًا في Micro Center مع 128 جيجابايت من ذاكرة LPDDR5x الموحدة وتخزين بسعة 2 تيرابايت. غالبًا ما يقع Strix Halo في الفئة العملية نفسها للذكاء الاصطناعي المحلي مثل أنظمة GB10، رغم أن الاختبارات المستقلة تقيس GB10 غالبًا متقدمًا في الإنتاجية ونضج البرمجيات. تحقق من قائمة Linux الحالية لدى Micro Center و اقرأ مراجعة Strix Halo مقابل GB10 .
| النظام الكامل | السعر المدرج في 10 أكتوبر 2026 | فرق السعر |
|---|---|---|
| محطة عمل 5060ti-x2 | $3,479 | الأساس |
| AMD Ryzen AI Halo، Strix Halo | $3,999.99 | $520.99 أكثر |
| GB10 DGX Spark بسعة 128 GB | $6,950 | $3,471 أكثر |
يوفر GB10 مجموعة ذاكرة موحدة أكبر واستخدامًا أقل للطاقة وبنية أفضل للسياق الطويل. يوفر نظام AMD فئة الذاكرة نفسها، 128 جيجابايت، بسعر يقارب 4,000 دولار. تظل محطة عمل 5060ti-x2 عند نحو 50% من سعر GB10 المدرج قبل الضريبة والشحن. يملك المشترون الذين يحتاجون إلى ذاكرة موحدة ولا يحتاجون إلى حزمة NVIDIA البرمجية بديلًا أقل تكلفة في Strix Halo.
هذه أسعار مدرجة من بائعين مختلفين، وليست سلة بيع بالتجزئة مضبوطة. كما تترك المقارنة نظام 5060ti-x2 بذاكرة نظام وتخزين أقل. ما زال فرق السعر مهمًا لأن القائمتين تصفان حاسوبين كاملين صالحين للاستخدام، لا أسعار GPU مجردة. تقترب قوائم بطاقات RTX 5060 Ti بسعة 16 جيجابايت الحالية من 789 إلى 830 دولارًا للبطاقة، وهي أعلى بكثير من سعر الإطلاق البالغ 429 دولارًا، لذلك تبقى أفضلية سعر البطاقتين حتى أثناء ارتفاع أسعار GPU الحالي. فحوص أسعار RTX 5060 Ti الحالية .
تحتاج نتيجة GPT-OSS إلى معالجة منفصلة
يعرض التقرير نفسه نتائج توليد قوية لنظام 5060ti-x2 مع GPT-OSS من 4K إلى 256K. يكمل GB10 اختبارات 4K إلى 128K، لكن اختبار GPT-OSS عند 256K معلّم بأنه غير مدعوم.
لا تستخدم جدول GPT-OSS للقول بوجود فائز عام. لا تغطي الاختبارات النطاق نفسه عند 256K. توفر نتيجة Qwen مقارنة أوضح للسياق الطويل لأن النظامين يبلغان عن نتيجة عند 256K، رغم أن تشغيل 5060ti-x2 وصل إلى 171,359 رمز مطالبة فقط.
ماذا يعني هذا لبناء Qwen 3 27B
قد يشغل إعداد ذو بطاقتين بسعة 16 جيجابايت نموذج 27B مكممًا ضمن سياق أصغر. لا تنفي المقارنة حالة الاستخدام هذه. تثبت البيانات خطأ الادعاء التالي: لا توفر 32 جيجابايت من VRAM الإجمالية هامشًا عمليًا مساويًا لنظام ذاكرة موحدة بسعة 128 جيجابايت.
إثبات تحميل النموذج على بطاقة يثبت سعة الأوزان فقط. يتكون الاحتياج الحقيقي للذاكرة من أوزان النموذج والسياق النشط وKV cache ومخازن التشغيل المؤقتة وهامش نظام التشغيل. يجب أن يتسع السياق بجانب النموذج. النموذج الذي يتم تحميله من دون مساحة لمحادثته العاملة ليس إعدادًا صالحًا للسياق الطويل.
يتفق هذا مع إرشادات تحديد الحجم في هل تكفي VRAM بسعة 16GB للعمل الجاد مع النماذج اللغوية المحلية؟ ، التي تتعامل مع الأوزان والسياق وتخصيصات التشغيل كميزانية واحدة. تصل دليل VRAM بسعة 32GB لـ Qwen 27B إلى النتيجة نفسها للبنى ذات البطاقتين. لا تساوي السعة الإجمالية الهامش القابل للاستخدام.
عند نشر Qwen 3 27B، اطرح أربعة أسئلة قبل شراء العتاد:
- هل يلائم التكميم المطلوب مخازن التشغيل المؤقتة؟ لا تحدد أوزان النموذج وحدها احتياج الذاكرة.
- هل يلائم السياق من دون ضغط شديد على KV cache؟ تغير المطالبات الطويلة النتيجة.
- هل تستخدم بيئة التشغيل تقسيمًا سريعًا للأجهزة؟ تؤثر عمليات نقل PCIe وتوزيع الموترات في كل رمز مولد.
- هل يكمل النظام السياق المستهدف؟ لا يعوض أداء 4K السريع عن حمل 256K الفاشل.
يجيب الاختبار المقدم عن السؤال الأخير للنظام ذي البطاقتين. وصل التشغيل إلى 171,359 رمزًا أثناء طلب Qwen عند 256K وولد بسرعة 1.2 رمز في الثانية. أكمل GB10 سياق 256K بسرعة 25.8 رمزًا في الثانية.
في هذا الحمل ذي السياق الطويل، تمثل الذاكرة الموحدة البنية الأفضل عندما يعتمد البديل على PCIe لتمديد مجموعة العمل الخاصة بالنموذج. يظل PCIe حلًا للسعة. لا ينشئ PCIe مجموعة الذاكرة نفسها أو زمن الانتقال نفسه أو مسار النقل نفسه. يشرح دليل سياق GPU للذكاء الاصطناعي المحلي سبب ضرورة تحديد أوزان النموذج وKV cache ومخرجات الأدوات ومخازن التشغيل معًا. كما يوضح اختبار GPU لـ Ollama Qwen3.8 27B سبب حاجة نتائج السياق الطويل إلى اهتمام منفصل عن أرقام فك الترميز ذات السياق القصير.
الحكم
بطاقتا RTX 5060 Ti بسعة 16 جيجابايت بديل ضعيف لـ GB10 عندما يكون الهدف استدلال 27B بسياق طويل. تقدمان إنتاجية مطالبة أعلى عند أحجام السياق القصيرة. وتستخدمان قدرة GPU أكبر وتعرضان بيئة التشغيل لتوزيع ذاكرة مقسم.
GB10 أبطأ في معالجة المطالبات في النتائج المقدمة. لكنه أكثر كفاءة في الطاقة، ويوفر أربعة أضعاف الذاكرة الإجمالية، ويكمل اختبار Qwen الكامل عند 256K بسرعة توليد قابلة للاستخدام.
إذا كنت تشغل مطالبات قصيرة وتقدر إدخال المطالبات، فـ 5060ti-x2 له حالة استخدام محدودة. لنموذج 27B، تكون مجموعة الذاكرة الموحدة الأكبر خيارًا أفضل لأن النموذج وسياقه يشتركان في مجموعة عمل متماسكة واحدة. تظل الذاكرة الموحدة مفضلة عند دخول عمليات نقل PCIe إلى مسار الاستدلال.
لا يثبت الاختبار أن بطاقتي RTX 5060 Ti لا تبدآن Qwen 3 27B أبدًا. توضح البيانات سبب اختلاف بدء النموذج عن تشغيل الحمل جيدًا.
حدود الاختبار
يحدد التقرير المقدم وسوم Ollama الحرفية، لكنه لا يسجل بصمات manifests المحلولة أو إصدارات النماذج أو CPU أو قياسات الطاقة أو إعداد التبريد. كما يحدد التقرير PCIe Gen4 x16 لنظام 5060ti-x2 وتعريفات NVIDIA الحالية لنظام Linux وقت الاختبار. تعامل مع الأرقام كمقارنة لنظام مرصود، لا كترتيب عام لكل زوج RTX 5060 Ti ولكل تطبيق GB10.
تأتي مواصفات العتاد أعلاه من NVIDIA. وتأتي أرقام الأداء من بيانات الاختبار المقدمة لهذه المقالة.
المراجع
- مكتبة نماذج Ollama Qwen3.8
- وسوم نماذج Ollama GPT-OSS
- هل تكفي VRAM بسعة 16GB للعمل الجاد مع النماذج اللغوية المحلية؟
- VRAM بسعة 32GB لـ Qwen 27B
- دليل سياق GPU للذكاء الاصطناعي المحلي
- اختبارات GPU لـ Qwen3.8 27B على Vast.ai
- قائمة محطة العمل الكاملة ببطاقتي RTX 5060 Ti بسعة 16 جيجابايت
- قائمة NVIDIA DGX Spark في سوق الولايات المتحدة
- قائمة AMD Ryzen AI Halo Linux بسعة 128 جيجابايت
- مراجعة Tom’s Hardware لـ Strix Halo مقابل GB10
- فحوص أسعار RTX 5060 Ti الحالية





