needhelp
← Back to blog

Gated DeltaNet-2: فصل المحو والكتابة في الانتباه الخطي

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

عنق الزجاجة في الانتباه

آلية انتباه softmax القياسية التي تشغل كل Transformer لديها مشكلة أساسية: التعقيد التربيعي. لتسلسل بطول N، الانتباه يحسب تفاعلات N×N زوجية، مما يعني أن معالجة المستندات الطويلة تستهلك ذاكرة وحوسبة بمعدل غير مستدام.

هذا هو السبب في أن نماذج مثل GPT-5 و Claude Opus 4.7 لديها حدود سياق عملية — ولماذا يتسابق الجميع لإيجاد بدائل.

الانتباه الخطي هو المنافس الرئيسي. بدلاً من تخزين مصفوفة انتباه N×N كاملة، يضغط التاريخ في حالة استرجاعية ثابتة الحجم — مثل حمل دفتر ملاحظات واحد بدلاً من مكتبة. تكلفة مزج التسلسل تنخفض من O(N²) إلى O(N)، وفك التشفير يستخدم ذاكرة ثابتة.

المشكلة الأساسية: ربط المحو والكتابة

لكن الانتباه الخطي يقدم مشكلة أدق: كيف تحرر ذاكرة مضغوطة؟

فكر في الحالة الاسترجاعية كلوحة بيضاء. كل رمز جديد يحتاج إلى:

  1. محو المعلومات القديمة ذات الصلة بالاستعلام الحالي
  2. كتابة ارتباطات جديدة في الحالة

النماذج السابقة — Gated DeltaNet و Kimi Delta Attention (KDA) — تستخدم بابة قياسية مفردة للتحكم في كلتا العمليتين. هذا كاستخدام مقبض واحد لضبط كل من درجة حرارة الماء وضغطه في الدش: يعمل، لكن لا يمكنك تحسين كل منهما بشكل مستقل.

الرؤية الحاسمة للورقة: محو المحتوى القديم (على جانب المفتاح) وإلتزام المحتوى الجديد (على جانب القيمة) هما عمليتان مختلفتان جوهرياً يجب ألا تشاركا متحكماً واحداً.

Gated DeltaNet-2: الحل

باحثون من NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) قدموا Gated DeltaNet-2، الذي يفصل مساري المحو والكتابة ببابتين مستقلتين على مستوى القناة:

المكون الرمز الدور
بوابة المحو b_t تتحكم في كمية المحتوى القديم للإزالة (جانب المفتاح)
بوابة الكتابة w_t تتحكم في كمية المحتوى الجديد للإلتزام (جانب القيمة)
الانحلال على مستوى القناة موروث من KDA معدل نسيان متكيف لكل قناة

هذا الفصل يعني أن النموذج يمكنه أن يقرر الاحتفاظ بالارتباطات القديمة سليمة بينما يكتب ارتباطات جديدة بقوة، أو محو السياق القديم تماماً بينما يحدث بشكل خفيف — شيء مستحيل تحت نظام البابة القياسية.

لماذا هذا مهم

الآثار تمتد إلى أبعد من المعايير الأكاديمية:

  1. تكاليف استدلال LLM: انتباه خطي مع ذاكرة فك تشفير O(1) يعني استدعاءات API أرخص للمحادثات الطويلة ومعالجة المستندات
  2. التوليد المعزز بالاسترجاع: استرجاع متعدد المفاتيح أفضل يحسن أنظمة RAG التي تحتاج لتوليف المعلومات من أقسام مستندات متعددة
  3. الذكاء الاصطناعي على الجهاز: حالة ثابتة الحجم تمكن تشغيل نماذج قادرة على أجهزة محدودة الذاكرة
  4. معالجة الأدبيات العلمية: نماذج يمكنها معالجة أوراق كاملة وبراءات اختراع ومستندات قانونية دون حيل تلخيص

References

Share this page