needhelp
← Back to blog

Gated DeltaNet-2: جداسازی پاک کردن و نوشتن در توجه خطی

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

تنگنای توجه

مکانیزم توجه softmax استاندارد که هر Transformer را تغذیه می‌کند یک مشکل بنیادین دارد: پیچیدگی درجه دو. برای یک دنباله به طول N، attention N×N تعامل زوجی محاسبه می‌کند، یعنی پردازش اسناد طولانی حافظه و compute را با نرخی ناپایدار مصرف می‌کند.

به همین دلیل مدل‌هایی مثل GPT-5 و Claude Opus 4.7 محدودیت‌های زمینه عملی دارند—و چرا همه در مسابقه یافتن جایگزین‌ها هستند.

توجه خطی مدعی پیشرو است. به جای ذخیره یک ماتریس توجه کامل N×N، تاریخچه را در یک حالت بازگشتی با اندازه ثابت فشرده می‌کند—مثل حمل یک دفترچه به جای یک کتابخانه. هزینه ترکیب دنباله از O(N²) به O(N) کاهش می‌یابد و رمزگشایی از حافظه ثابت استفاده می‌کند.

مشکل اصلی: گره زدن پاک کردن و نوشتن

اما توجه خطی یک مشکل ظریف‌تر معرفی می‌کند: چطور یک حافظه فشرده را ویرایش می‌کنی؟

حالت بازگشتی را به عنوان یک تخته سفید در نظر بگیر. هر token جدید باید: ۱. اطلاعات قدیمی مرتبط با پرسش فعلی را پاک کند ۲. ارتباطات جدید را در حالت بنویسد

مدل‌های قبلی—Gated DeltaNet و Kimi Delta Attention (KDA)—از یک دروازه اسکالر تکی برای کنترل هر دو عملیات استفاده می‌کنند. این مثل استفاده از یک دسته برای تنظیم هم دمای آب و فشار در دوش است: کار می‌کند، اما نمی‌توانی هرکدام را مستقل بهینه کنی.

بینش حیاتی مقاله: پاک کردن محتوای قدیمی (سمت کلید) و ثبت محتوای جدید (سمت مقدار) عملیات‌های اساساً متفاوتی هستند که نباید یک کنترل‌گر مشترک داشته باشند.

Gated DeltaNet-2: راه‌حل

محققان NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) Gated DeltaNet-2 را معرفی کردند که مسیرهای پاک کردن و نوشتن را با دو دروازه مستقل کانالی جدا می‌کند:

مؤلفه نماد نقش
دروازه پاک کردن b_t کنترل میزان محتوای قدیمی حذف‌شده (سمت کلید)
دروازه نوشتن w_t کنترل میزان محتوای جدید ثبت‌شده (سمت مقدار)
زوال کانالی به ارث برده از KDA نرخ فراموشی تطبیقی هر کانال

این جداسازی یعنی مدل می‌تواند تصمیم بگیرد ارتباطات قدیمی را دست‌نخورده نگه دارد در حالی که aggressively جدیدها را می‌نویسد، یا زمینه قدیمی را کاملاً پاک کند در حالی که فقط به‌روزرسانی سبک انجام می‌دهد—چیزی که در رژیم دروازه اسکالر غیرممکن بود.

نتایج آزمایشی

در ۱.۳B پارامتر آموزش‌دیده روی ۱۰۰B توکن FineWeb-Edu، Gated DeltaNet-2 علیه Mamba-2، Gated DeltaNet، KDA و Mamba-3 ارزیابی شد.

Gated DeltaNet-2 به بهترین نتایج کلی در وظایف بازیابی زمینه بلند می‌رسد، با بهبودهای به خصوص چشمگیر در تنظیم بازیابی چندکلیدی—جایی که مدل باید چندین واقعیت پراکنده را پیدا کند و مرتبط کند.

چرا این مهم است

۱. هزینه‌های استنتاج LLM: توجه خطی با حافظه رمزگشایی O(1) یعنی فراخوانی API ارزان‌تر برای مکالمات طولانی و پردازش اسناد ۲. تولید تقویت‌شده با بازیابی: بازیابی چندکلیدی بهتر مستقیماً سیستم‌های RAG را بهبود می‌دهد ۳. هوش مصنوعی روی دستگاه: حالت با اندازه ثابت اجرای مدل‌های توانمند روی دستگاه‌های محدود از نظر حافظه را ممکن می‌کند


References

Share this page