Table of Contents

نماذج لغة السياق (CLMs) تمنح وكيل الذكاء الاصطناعي تحكما مباشرا في المعلومات التي ترسل إلى استدعائه التالي للنموذج. يحسن هذا الأسلوب إدارة السياق في عدة تقييمات منشورة، لكنه لا يثبت نهاية الهلوسة. ما زال الوكيل يحتاج إلى أدلة لادعاءاته وفحوص مستقلة لعمله.

السؤال الهندسي هو ما إذا كان التحرير الانتقائي يحافظ على الحقائق الصحيحة بتكلفة مقبولة. تكون المحادثة الأقصر مفيدة فقط إذا احتفظ الوكيل بمتطلباته، وميز بين الملاحظات والافتراضات، واستعاد الأدلة الداعمة عند الحاجة.

أهم النقاط

  • السياق القابل للتحرير: يصف CLM أسلوب تنفيذ للنماذج الموجودة، مع تدريب اختياري لتحسين استخدامه.
  • المكاسب المشروطة: يؤثر حجم النموذج وميزانية السياق والمهمة وخلفية الخدمة في النتائج.
  • حساب الحوسبة: تتضمن FLOPs لإعادة استخدام البادئة إعادة الحساب بعد التعديلات، لكنها لا تقيس الزمن المنقضي أو الفوترة مباشرة.
  • سلامة الذاكرة: تبقى ملاحظات الوكيل نفسه قابلة للخطأ ومدخلات يحتمل أن تكون غير آمنة.
  • التقييم العملي: قس النتائج المقبولة والحقائق المفقودة والادعاءات غير المدعومة وتكلفة الاستعادة معا.

افصل الذاكرة عن الأدلة

تحتوي نافذة السياق على المدخل المتاح للنموذج أثناء الاستدعاء. تتنافس التعليمات وردود الأدوات والملاحظات العملية والرسائل السابقة على المساحة. يستبدل الضغط بعض هذه المواد بتمثيل أقصر.

لنتخيل مهمة توضيحية لترقية تبعية. يبلغ مشغل الاختبارات عن فشلين. يضغط الوكيل تاريخه في ملاحظة تقول إن الترقية نجحت. يبدأ العمل اللاحق من افتراض غير صحيح، رغم بقاء مخرجات الاختبار الأصلية على القرص.

يعالج تغيير أسلوب الضغط طريقة دخول هذه الملاحظة الخاطئة إلى الذاكرة العملية. لكنه لا يستبدل مشغل الاختبارات بوصفه دليلا. قبل قبول الترقية، ما زال سير العمل يحتاج إلى نتيجة اختبار جديدة أو سجل قابل للفحص للتشغيل المعني.

الفشلالفحص المناسب
متطلب مفقودقارن الحالة الحالية بمعايير القبول الأصلية
ملاحظة مختلقةطابق الادعاء مع نتيجة أداة أو سجل مصدر
استدلال غير صحيحاختبر النتيجة مقابل السلوك المتوقع للمهمة
تعليمة غير مصرّح بهاطبّق الأذونات خارج الملاحظات التي كتبها النموذج

يهم هذا التمييز عند تقييم أي تقنية للذاكرة. الحفظ والصحة خاصيتان منفصلتان. يبقى النظام الذي يحفظ ادعاء غير صحيح بدقة غير صحيح.

ما الذي تغيره CLMs

قدم Rulin Shao والمؤلفون المشاركون، ومنهم باحثون في Meta Superintelligence Labs وجامعة واشنطن، نماذج CLM في مسودة أولية بتاريخ 29 سبتمبر 2026. يعرض تنفيذهم السياق الحي كملف قابل للتحرير. يستخدم الوكيل أوامر الصدفة أو الشيفرة لتعديله، ثم يرسل وقت التشغيل المحتوى المنقح في الاستدعاء التالي. راجع نماذج لغة السياق .

Ordinary continuation:
existing context + new response + new tool output

Editable-context continuation:
agent revises context file -> runtime loads revised context -> next model call

لا تحتاج بنية النموذج إلى الاستبدال في أسلوب zero-shot. يضيف وقت التشغيل قدرة حول نموذج موجود. وتبحث الورقة بصورة منفصلة في التعليمات واستراتيجيات إدارة السياق المتعلمة والتعلم المعزز.

يختلف ملف الملاحظات عن ذلك. تضيف قراءة ملاحظة محفوظة محتواها إلى محادثة. ولا يزيل تحرير الملف لاحقا النص القديم من السياق الحي تلقائيا. يحتاج CLM إلى دعم من وقت التشغيل لمزامنة التعديلات مع الطلبات اللاحقة. يحتوي التنفيذ الرسمي على شيفرة الوكيل وامتداد خدمة منفصل.

يبقى التخزين الخارجي مفيدا. أبق السجلات التفصيلية ومستندات المصدر متاحة للاستعادة، مع الاحتفاظ بمراجع موجزة في الذاكرة العملية. غالبا ما يهم موقع المستند والادعاء الذي يدعمه أكثر من إبقاء كل سطر في المطالبة التالية.

اقرأ النتائج بعناية

تحسينات المعايير مقارنات محددة. تأتي النتائج التالية من تقييمات المؤلفين، وليست اختبارات أجريت لهذا المقال. يبقى البحث مسودة أولية، ولا تثبت نتائج معيار مختار الاعتمادية عبر سير العمل العشوائي.

التقييمالنتيجة المبلغ عنهاالتفسير
BrowseComp-Plus، zero-shotزيادة نسبية في الدقة قدرها 11.4% وانخفاض FLOPs لإعادة استخدام البادئة قدره 21.5% مقابل أقوى خط أساستحسنت الدقة والحوسبة في هذا الإعداد
TerminalBench 2.1يطابق دقة أقوى خط أساس مع FLOPs أقل بنسبة 29.5%الفائدة هي الكفاءة مع دقة مماثلة
EdgeBench، تشغيل 12 ساعةنتيجة أعلى بنسبة 5% مع FLOPs أقل بنسبة 59%نتيجة لتحسين البرمجيات، وليست معدل هلوسة
Qwen3.5-9B مدربدقة CLM هي 42.5% مقابل 42.1% للتلخيص المدربفرق دقة صغير مع فرق حوسبة أكبر

تستخدم مقارنة 9B المدربة 1.34 مقابل 2.19 PFLOPs لكل سؤال، أي حوسبة أقل بنحو 38.8% مع CLM. وتحسنها من 28.8% قبل التدريب إلى 42.5% بعده مقارنة مختلفة عن فجوة 0.4 نقطة مقابل التلخيص المدرب. أبق خط الأساس واضحا. راجع نتائج الورقة وجدول التدريب .

تحتاج النسب النسبية إلى مقام أيضا. الزيادة من نحو 53.3% إلى 59.4% تساوي نحو 6.1 نقاط مئوية، أو 11.4% نسبيا. لا تعني أي من العبارتين أن النظام يجيب عن كل سؤال إجابة صحيحة.

تغير ميزانية السياق النتائج

تظهر ميزانية سياق قدرها 32K في التقييمات الرئيسية. وتفرض قيدا مهما على الاحتفاظ والتحرير. لا ينبغي تعميم النتائج عند هذه الميزانية على كل عملية نشر ذات نافذة أكبر.

عند 128K في EdgeBench-10، يعرض الملحق F النتائج التالية عبر عشر مهام وثلاث بذور:

الطريقةالنتيجة النهائيةمتوسط PFLOPs لإعادة استخدام البادئة لكل تجربة
التلخيص47.8222
CLM47.3142
CLM مع وكلاء فرعيين50.2219

دقة الوكيل الواحد متقاربة، بينما يستخدم CLM حوسبة أقل بنحو 36% في هذه المقارنة. ويغير إعداد الوكلاء الفرعيين النتيجة مرة أخرى. يجب أن تقارن سعة السياق وإعداد الوكيل وميزانية الحوسبة مع اسم الطريقة.

ما زالت قدرة النموذج مهمة

لا تدير النماذج الأصغر الذاكرة جيدا تلقائيا. في مقارنة التدريب، يبدأ CLM غير المدرب 9B تحت خط أساس التلخيص. ويبلغ تقييم تكميلي منفصل 39.9% مقابل 37.7% في BrowseComp-Plus. هذه إعدادات تجريبية مختلفة وليست قياسات قابلة للاستبدال.

ويبلغ تحليل TerminalBench التكميلي أيضا عن عدم إجراء تعديلات على السياق في نصف مهام 9B. منح النموذج واجهة تحرير لا يضمن استخدامه لها بفعالية. قيّم النموذج والإعدادات المختارة بدلا من اعتبار CLM ترقية عامة.

احسب إعادة المعالجة

تخزن ذاكرة KV حسابات الانتباه الوسيطة. مع التخزين المؤقت العادي للبادئة، يعيد النص غير المتغير في بداية الطلب التالي استخدام الحساب السابق. يقلل التحرير قرب البداية البادئة القابلة لإعادة الاستخدام ويفرض معالجة النص اللاحق مرة أخرى.

Previous request: A + B + C
Revised request:  A + replacement for B + C

Standard prefix reuse:
reuse A, recompute replacement for B and C

يحسب مقياس FLOPs لإعادة استخدام البادئة في الورقة التوليد ومعالجة المطالبة بعد أول عدم تطابق. ويمثل PFLOP مقدار 10¹⁵ من عمليات الفاصلة العائمة. هذا إجمالي حوسبة مقدر، وليس درجة جودة أو قياس إنتاجية أو فاتورة.

يستخدم مثال 7.7× في الملحق C مطالبة توضيحية من 20,000 رمزا واستجابة من 500 رمز. يكلف التحرير في البداية 7.7 مرات تكلفة الدور الملحق المقدر ذي البادئة القابلة لإعادة الاستخدام البالغة 18,000 رمز. هذه عقوبة إعادة حساب بأطوال محددة، وليست انخفاضا مقاسا قدره 7.7 مرات في الهلوسة.

يعتمد الكمون المحلي على إنتاجية المطالبة. كمثال حسابي، تستغرق إعادة قراءة 24,000 رمز بسرعة مفترضة قدرها 800 رمز في الثانية 30 ثانية قبل النفقات الأخرى. هذا ليس معيارا لجهاز Mac أو GPU محدد. قس خلفية الخدمة والتكميم وأحجام المطالبات الفعلية التي تنوي استخدامها.

يوضح نقاش llama.cpp حول إعادة معالجة النموذج الهجين سبب أهمية تغييرات البادئة ونقاط فحص الحالة التكرارية. ولا يثبت سلوكا متماثلا عبر كل الإصدارات أو التطبيقات التي تستخدم llama.cpp. سجل إصدار وقت التشغيل وافحص سجلات الذاكرة المؤقتة.

مدخرات التخزين المؤقت محدودة

تحتفظ إعادة استخدام ذاكرة اللاحقة (SCR) بالحالات المخزنة مؤقتا للنص الباقي بعد التحرير. يستهدف الامتداد المنشور SGLang، ويحدد ملف README الإصدار 0.5.16. هذا تحسين خدمة منفصل، وليس شرطا لأسلوب السياق القابل للتحرير الأساسي.

إعادة الاستخدام تقريبية. تحتفظ الرموز الباقية بالحالات المحسوبة تحت السياق السابق. لذلك لا تثبت مطابقة أداء المعيار التكافؤ العددي مع إعادة حساب المطالبة الجديدة كاملة.

يبلغ المؤلفون عن حوسبة أقل بنسبة 35% على الخادم في مقارنة BrowseComp-Plus. ومن نقاط النسبة المئوية السبع والباقية من رموز المطالبة المعاد استخدامها إضافيا، تأتي 5.3 من كتل الاستدلال المجردة و2.5 من تعديلات أخرى. لذلك ينطبق جزء كبير من هذه الفائدة خارج تحرير CLM الصريح. راجع ملاحظات تنفيذ SCR .

في فوترة API، افصل الإدخال العادي وكتابات الذاكرة المؤقتة وقراءاتها. تسعر Anthropic Sonnet 4.6 بمقدار 3 و3.75 و0.30 دولار لكل مليون رمز على الترتيب للإدخال العادي وكتابات الذاكرة لخمس دقائق وضربات الذاكرة. تكلف إعادة كتابة 20,000 رمز ككتابة ذاكرة 0.075 دولار، مقابل 0.006 دولار للضربة. يستبعد فرق 0.069 دولار الإخراج وتعديلات الفوترة الأخرى. وثائق التخزين المؤقت للمطالبات ، فُحصت في 10 أكتوبر 2026.

تحدد تكلفة المهمة الكلية المفاضلة. تحقق التعديلات المكلفة العرضية وفرا إذا خفضت الإدخال اللاحق بدرجة كبيرة. وتتيح التعديلات المتكررة التي تتبعها أدوار قليلة فرصة أقل لاسترداد تكلفتها.

افحص سلوك الذاكرة المؤقتة في مسار الخدمة الذي تنشره. لا تثبت قياسات إعادة الاستخدام في الورقة أن API أو إصدار SGLang أو وقت التشغيل المحلي يعرض عناصر التحكم نفسها. سجل ضربات الذاكرة والرموز المطلوبة وإعادة الحساب وسلوك إعادة الضبط أثناء التجربة. اعتبر غياب القياس قيدا على التقييم.

أبق الملاحظات أدنى من التعليمات

الذاكرة التي يكتبها النموذج بيانات مهمة غير موثوقة. تحتوي على ملاحظات وتفسيرات وأخطاء أحيانا. ويمنح اعتبار كل ملاحظة تعليمة تلك الأخطاء سلطة على الإجراءات اللاحقة.

وثقت OpenAI 27 ملخصا للضغط شبيها بكسر الحماية في تشغيل تدريبي منفصل لنموذج من عائلة Astra لم يصدر. تجاهلت بعض التعليمات المحقونة، بينما أثرت قيود خاصة بالمهمة في متابعة واحدة مبلغ عنها. يصف التقرير سلوكا نادرا ويذكر أن إعادة التوليد لم تكرره في نموذج Astra النهائي أو نقاط الفحص المستخدمة لحركة المرور. هذه أدلة على نمط فشل، وليست دليلا على انتشاره في CLMs المنشورة. راجع تقرير OpenAI عن ملخص الضغط .

يجب أن يفصل التنفيذ الدفاعي هذه المسؤوليات:

المكوّنالمعالجة
متطلبات المستخدم والأذوناتاحتفظ بها خارج طبقة الملاحظات القابلة للتحرير
ملاحظات العملاسمح بمراجعتها، واحتفظ بمصدرها، وحدد عدم اليقين
الأدلة الأصليةاحتفظ بسجلات قابلة للاستعادة مستقلة عن الملخصات
الإجراءات والتعديلاتسجل التغييرات وطبّق ضوابط الوصول في الشيفرة

الحذف ليس محوا بالضرورة. تحتفظ SCR بحالات تأثرت بالسياق السابق. وباستنتاج هندسي، لا ينبغي اعتبار إزالة النص من ملف قابل للتحرير دليلا على إزالة كل تأثير من الحالة المخزنة مؤقتا. اختبر سلوك إعادة الضبط الصريح عندما يتطلب سير العمل بداية نظيفة.

اختبر تجربة محدودة

ابدأ بمتطلبات الاحتفاظ، لا بطول سياق معلن. اختر مهمة متكررة ذات إجابات معروفة وسجلات إدخال غير قابلة للتغيير وفحص إكمال واضح. استخدم بيئة معزولة تحتوي على بيانات اصطناعية للمقارنة الأولى.

  1. أنشئ حقائق دقيقة: أدرج المعرفات والمتطلبات المتغيرة والمحاولات الفاشلة وقيمة مصححة واحدة.
  2. شغّل إعدادات قابلة للمقارنة: تلخيص ثابت وسياق قابل للتحرير وسير عمل ملاحظات لجلسة جديدة.
  3. ثبّت المدخلات: استخدم النموذج ومجموعة المهام والأدوات وحدود التوليد وميزانية السياق نفسها.
  4. افحص بعد تغييرات الذاكرة: اختبر التذكر الدقيق واستعادة المصدر وما إذا بقيت الحقائق المستبدلة موسومة كقديمة.
  5. قس التشغيل كاملا: سجل معدل النجاح والادعاءات غير المدعومة والزمن المنقضي والتعديلات واستعادة تجاوز السعة والتصحيحات اليدوية.

ينتمي حساب الرموز إلى وقت التشغيل. يجد الملحق G وعيا محدودا بطول السياق في النماذج المختبرة، مع تحسين التقديرات بفضل الإشارات البيئية. ويتضمن الإعداد التجريبي أيضا استعادة تجاوز السعة. وفر أعداد الرموز المقاسة واترك مساحة للاستجابة بدلا من الاعتماد على النموذج لتقدير السعة.

تكون البدائل القائمة على الملاحظات مفيدة عندما لا يتوفر تحرير السياق الحي. أبق التسليم موجزا ومرتبطا بالأدلة. السجل التالي توضيحي، وليس صيغة API لـ CLM:

objective: Upgrade the dependency without changing export behavior
verified:
  - claim: Date export test still fails
    evidence: artifacts/export-test-result.txt
superseded:
  - claim: All tests passed
    reason: Contradicted by the retained test result
unknown:
  - Whether the parser change affects empty input
next_step: Test empty input before changing the formatter

تدفع الجلسة الجديدة تكلفة قراءة هذه الملاحظة، وتنقل الملاحظة السيئة معلومات سيئة. أعد فتح الأدلة للادعاءات المؤثرة، وأبق مواصفة المهمة الأصلية متاحة. هذا سير عمل للتوافق، وليس دليلا على مكاسب مساوية لـ CLM.

قرر بحسب النتائج المقبولة

جرّب CLMs عندما تفقد المهام طويلة التشغيل حالة مفيدة مرارا أو تنفق حوسبة كبيرة على سياق قديم. توفر المحادثة القصيرة ذات التاريخ القليل فرصة أقل لهذا التحسين المحدد.

يخضع المستودع الرسمي لشروط CC BY-NC 4.0. افحص الترخيص قبل اعتماد التنفيذ في مشروع تجاري. لا يمنح توفر المصدر العام وحده إعادة استخدام تجارية غير مقيدة.

يبقى الإكمال الموثوق هو الهدف. احتفظ بالطريقة فقط إذا حسنت النتائج المقبولة أو خفضت التكلفة دون إضعاف فحوص الأدلة. لخيارات النشر ذات الصلة، اقرأ مقارنة الذكاء الاصطناعي المحلي والنماذج المستضافة و دليل تخطيط GPU والسياق .

المراجع