Gated DeltaNet-2: فصل المحو والكتابة في الانتباه الخطي
عنق الزجاجة في الانتباه
آلية انتباه softmax القياسية التي تشغل كل Transformer لديها مشكلة أساسية: التعقيد التربيعي. لتسلسل بطول N، الانتباه يحسب تفاعلات N×N زوجية، مما يعني أن معالجة المستندات الطويلة تستهلك ذاكرة وحوسبة بمعدل غير مستدام.
هذا هو السبب في أن نماذج مثل GPT-5 و Claude Opus 4.7 لديها حدود سياق عملية — ولماذا يتسابق الجميع لإيجاد بدائل.
الانتباه الخطي هو المنافس الرئيسي. بدلاً من تخزين مصفوفة انتباه N×N كاملة، يضغط التاريخ في حالة استرجاعية ثابتة الحجم — مثل حمل دفتر ملاحظات واحد بدلاً من مكتبة. تكلفة مزج التسلسل تنخفض من O(N²) إلى O(N)، وفك التشفير يستخدم ذاكرة ثابتة.
المشكلة الأساسية: ربط المحو والكتابة
لكن الانتباه الخطي يقدم مشكلة أدق: كيف تحرر ذاكرة مضغوطة؟
فكر في الحالة الاسترجاعية كلوحة بيضاء. كل رمز جديد يحتاج إلى:
- محو المعلومات القديمة ذات الصلة بالاستعلام الحالي
- كتابة ارتباطات جديدة في الحالة
النماذج السابقة — Gated DeltaNet و Kimi Delta Attention (KDA) — تستخدم بابة قياسية مفردة للتحكم في كلتا العمليتين. هذا كاستخدام مقبض واحد لضبط كل من درجة حرارة الماء وضغطه في الدش: يعمل، لكن لا يمكنك تحسين كل منهما بشكل مستقل.
الرؤية الحاسمة للورقة: محو المحتوى القديم (على جانب المفتاح) وإلتزام المحتوى الجديد (على جانب القيمة) هما عمليتان مختلفتان جوهرياً يجب ألا تشاركا متحكماً واحداً.
Gated DeltaNet-2: الحل
باحثون من NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) قدموا Gated DeltaNet-2، الذي يفصل مساري المحو والكتابة ببابتين مستقلتين على مستوى القناة:
| المكون | الرمز | الدور |
|---|---|---|
| بوابة المحو | b_t | تتحكم في كمية المحتوى القديم للإزالة (جانب المفتاح) |
| بوابة الكتابة | w_t | تتحكم في كمية المحتوى الجديد للإلتزام (جانب القيمة) |
| الانحلال على مستوى القناة | موروث من KDA | معدل نسيان متكيف لكل قناة |
هذا الفصل يعني أن النموذج يمكنه أن يقرر الاحتفاظ بالارتباطات القديمة سليمة بينما يكتب ارتباطات جديدة بقوة، أو محو السياق القديم تماماً بينما يحدث بشكل خفيف — شيء مستحيل تحت نظام البابة القياسية.
لماذا هذا مهم
الآثار تمتد إلى أبعد من المعايير الأكاديمية:
- تكاليف استدلال LLM: انتباه خطي مع ذاكرة فك تشفير O(1) يعني استدعاءات API أرخص للمحادثات الطويلة ومعالجة المستندات
- التوليد المعزز بالاسترجاع: استرجاع متعدد المفاتيح أفضل يحسن أنظمة RAG التي تحتاج لتوليف المعلومات من أقسام مستندات متعددة
- الذكاء الاصطناعي على الجهاز: حالة ثابتة الحجم تمكن تشغيل نماذج قادرة على أجهزة محدودة الذاكرة
- معالجة الأدبيات العلمية: نماذج يمكنها معالجة أوراق كاملة وبراءات اختراع ومستندات قانونية دون حيل تلخيص