Gated DeltaNet-2: جداسازی پاک کردن و نوشتن در توجه خطی
تنگنای توجه
مکانیزم توجه softmax استاندارد که هر Transformer را تغذیه میکند یک مشکل بنیادین دارد: پیچیدگی درجه دو. برای یک دنباله به طول N، attention N×N تعامل زوجی محاسبه میکند، یعنی پردازش اسناد طولانی حافظه و compute را با نرخی ناپایدار مصرف میکند.
به همین دلیل مدلهایی مثل GPT-5 و Claude Opus 4.7 محدودیتهای زمینه عملی دارند—و چرا همه در مسابقه یافتن جایگزینها هستند.
توجه خطی مدعی پیشرو است. به جای ذخیره یک ماتریس توجه کامل N×N، تاریخچه را در یک حالت بازگشتی با اندازه ثابت فشرده میکند—مثل حمل یک دفترچه به جای یک کتابخانه. هزینه ترکیب دنباله از O(N²) به O(N) کاهش مییابد و رمزگشایی از حافظه ثابت استفاده میکند.
مشکل اصلی: گره زدن پاک کردن و نوشتن
اما توجه خطی یک مشکل ظریفتر معرفی میکند: چطور یک حافظه فشرده را ویرایش میکنی؟
حالت بازگشتی را به عنوان یک تخته سفید در نظر بگیر. هر token جدید باید: ۱. اطلاعات قدیمی مرتبط با پرسش فعلی را پاک کند ۲. ارتباطات جدید را در حالت بنویسد
مدلهای قبلی—Gated DeltaNet و Kimi Delta Attention (KDA)—از یک دروازه اسکالر تکی برای کنترل هر دو عملیات استفاده میکنند. این مثل استفاده از یک دسته برای تنظیم هم دمای آب و فشار در دوش است: کار میکند، اما نمیتوانی هرکدام را مستقل بهینه کنی.
بینش حیاتی مقاله: پاک کردن محتوای قدیمی (سمت کلید) و ثبت محتوای جدید (سمت مقدار) عملیاتهای اساساً متفاوتی هستند که نباید یک کنترلگر مشترک داشته باشند.
Gated DeltaNet-2: راهحل
محققان NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) Gated DeltaNet-2 را معرفی کردند که مسیرهای پاک کردن و نوشتن را با دو دروازه مستقل کانالی جدا میکند:
| مؤلفه | نماد | نقش |
|---|---|---|
| دروازه پاک کردن | b_t | کنترل میزان محتوای قدیمی حذفشده (سمت کلید) |
| دروازه نوشتن | w_t | کنترل میزان محتوای جدید ثبتشده (سمت مقدار) |
| زوال کانالی | به ارث برده از KDA | نرخ فراموشی تطبیقی هر کانال |
این جداسازی یعنی مدل میتواند تصمیم بگیرد ارتباطات قدیمی را دستنخورده نگه دارد در حالی که aggressively جدیدها را مینویسد، یا زمینه قدیمی را کاملاً پاک کند در حالی که فقط بهروزرسانی سبک انجام میدهد—چیزی که در رژیم دروازه اسکالر غیرممکن بود.
نتایج آزمایشی
در ۱.۳B پارامتر آموزشدیده روی ۱۰۰B توکن FineWeb-Edu، Gated DeltaNet-2 علیه Mamba-2، Gated DeltaNet، KDA و Mamba-3 ارزیابی شد.
Gated DeltaNet-2 به بهترین نتایج کلی در وظایف بازیابی زمینه بلند میرسد، با بهبودهای به خصوص چشمگیر در تنظیم بازیابی چندکلیدی—جایی که مدل باید چندین واقعیت پراکنده را پیدا کند و مرتبط کند.
چرا این مهم است
۱. هزینههای استنتاج LLM: توجه خطی با حافظه رمزگشایی O(1) یعنی فراخوانی API ارزانتر برای مکالمات طولانی و پردازش اسناد ۲. تولید تقویتشده با بازیابی: بازیابی چندکلیدی بهتر مستقیماً سیستمهای RAG را بهبود میدهد ۳. هوش مصنوعی روی دستگاه: حالت با اندازه ثابت اجرای مدلهای توانمند روی دستگاههای محدود از نظر حافظه را ممکن میکند