Gated DeltaNet-2: लीनियर अटेंशन में Erase और Write को अलग करना
अटेंशन बॉटलनेक
स्टैंडर्ड सॉफ़्टमैक्स अटेंशन मैकेनिज्म — जो हर Transformer को पावर देता है — की एक बुनियादी समस्या है: क्वाड्रेटिक कॉम्प्लेक्सिटी। N लंबाई के सीक्वेंस के लिए, अटेंशन N×N पेयरवाइज़ इंटरैक्शन कंप्यूट करता है, जिसका मतलब है कि लंबे डॉक्युमेंट प्रोसेस करना अनसस्टेनेबल रेट से मेमोरी और कंप्यूट खाता है।
लीनियर अटेंशन इसका मुख्य दावेदार है। पूरा N×N अटेंशन मैट्रिक्स स्टोर करने के बजाय, यह हिस्ट्री को एक फ़िक्स्ड-साइज़ रिकरंट स्टेट में कंप्रेस करता है।
मुख्य समस्या: Erase और Write को एक साथ बाँधना
लेकिन लीनियर अटेंशन एक और सूक्ष्म समस्या पेश करता है: आप कंप्रेस्ड मेमोरी को कैसे एडिट करते हैं?
पिछले मॉडल — Gated DeltaNet और Kimi Delta Attention — एक सिंगल स्केलर गेट का इस्तेमाल करते हैं जो दोनों ऑपरेशन को कंट्रोल करता है। यह एक ही नॉब से शॉवर का पानी का तापमान और प्रेशर दोनों एडजस्ट करने जैसा है।
अहम इनसाइट: पुराने कंटेंट को मिटाना (की साइड) और नया कंटेंट कमिट करना (वैल्यू साइड) फ़ंडामेंटली अलग ऑपरेशन हैं जिन्हें एक कंट्रोलर शेयर नहीं करना चाहिए।
Gated DeltaNet-2: समाधान
NVIDIA के रिसर्चर्स ने Gated DeltaNet-2 पेश किया, जो दो इंडिपेंडेंट चैनल-वाइज़ गेट्स के साथ erase और write पाथवे को अलग करता है:
| कम्पोनेंट | सिंबल | रोल |
|---|---|---|
| Erase गेट | b_t | कंट्रोल करता है कितना पुराना कंटेंट हटाना है (की-साइड) |
| Write गेट | w_t | कंट्रोल करता है कितना नया कंटेंट कमिट करना है (वैल्यू-साइड) |
प्रयोगात्मक परिणाम
1.3B पैरामीटर पर 100B FineWeb-Edu टोकन पर ट्रेन करके, Gated DeltaNet-2 ने RULER बेंचमार्क पर सबसे मज़बूत परिणाम हासिल किए — खासकर मल्टी-की रिट्रीवल सेटिंग में जहाँ मॉडल को कई बिखरे हुए तथ्यों को ढूँढ़ना और जोड़ना होता है।
यह क्यों मायने रखता है
- LLM इन्फ़्रेंस कॉस्ट: O(1) डिकोडिंग मेमोरी के साथ लीनियर अटेंशन का मतलब है लंबी बातचीत के लिए सस्ते API कॉल
- RAG: बेहतर मल्टी-की रिट्रीवल सीधे RAG सिस्टम को इम्प्रूव करता है
- ऑन-डिवाइस AI: फ़िक्स्ड-साइज़ स्टेट मेमोरी-कंस्ट्रेंड डिवाइसेज़ पर मॉडल चलाने में सक्षम बनाता है
कोड
- GitHub: NVlabs/GatedDeltaNet-2 (12,300+ स्टार्स)
- Paper: arXiv:2605.22791