needhelp
← Back to blog

Gated DeltaNet-2: लीनियर अटेंशन में Erase और Write को अलग करना

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

अटेंशन बॉटलनेक

स्टैंडर्ड सॉफ़्टमैक्स अटेंशन मैकेनिज्म — जो हर Transformer को पावर देता है — की एक बुनियादी समस्या है: क्वाड्रेटिक कॉम्प्लेक्सिटी। N लंबाई के सीक्वेंस के लिए, अटेंशन N×N पेयरवाइज़ इंटरैक्शन कंप्यूट करता है, जिसका मतलब है कि लंबे डॉक्युमेंट प्रोसेस करना अनसस्टेनेबल रेट से मेमोरी और कंप्यूट खाता है।

लीनियर अटेंशन इसका मुख्य दावेदार है। पूरा N×N अटेंशन मैट्रिक्स स्टोर करने के बजाय, यह हिस्ट्री को एक फ़िक्स्ड-साइज़ रिकरंट स्टेट में कंप्रेस करता है।

मुख्य समस्या: Erase और Write को एक साथ बाँधना

लेकिन लीनियर अटेंशन एक और सूक्ष्म समस्या पेश करता है: आप कंप्रेस्ड मेमोरी को कैसे एडिट करते हैं?

पिछले मॉडल — Gated DeltaNet और Kimi Delta Attention — एक सिंगल स्केलर गेट का इस्तेमाल करते हैं जो दोनों ऑपरेशन को कंट्रोल करता है। यह एक ही नॉब से शॉवर का पानी का तापमान और प्रेशर दोनों एडजस्ट करने जैसा है।

अहम इनसाइट: पुराने कंटेंट को मिटाना (की साइड) और नया कंटेंट कमिट करना (वैल्यू साइड) फ़ंडामेंटली अलग ऑपरेशन हैं जिन्हें एक कंट्रोलर शेयर नहीं करना चाहिए।

Gated DeltaNet-2: समाधान

NVIDIA के रिसर्चर्स ने Gated DeltaNet-2 पेश किया, जो दो इंडिपेंडेंट चैनल-वाइज़ गेट्स के साथ erase और write पाथवे को अलग करता है:

कम्पोनेंट सिंबल रोल
Erase गेट b_t कंट्रोल करता है कितना पुराना कंटेंट हटाना है (की-साइड)
Write गेट w_t कंट्रोल करता है कितना नया कंटेंट कमिट करना है (वैल्यू-साइड)

प्रयोगात्मक परिणाम

1.3B पैरामीटर पर 100B FineWeb-Edu टोकन पर ट्रेन करके, Gated DeltaNet-2 ने RULER बेंचमार्क पर सबसे मज़बूत परिणाम हासिल किए — खासकर मल्टी-की रिट्रीवल सेटिंग में जहाँ मॉडल को कई बिखरे हुए तथ्यों को ढूँढ़ना और जोड़ना होता है।

यह क्यों मायने रखता है

  1. LLM इन्फ़्रेंस कॉस्ट: O(1) डिकोडिंग मेमोरी के साथ लीनियर अटेंशन का मतलब है लंबी बातचीत के लिए सस्ते API कॉल
  2. RAG: बेहतर मल्टी-की रिट्रीवल सीधे RAG सिस्टम को इम्प्रूव करता है
  3. ऑन-डिवाइस AI: फ़िक्स्ड-साइज़ स्टेट मेमोरी-कंस्ट्रेंड डिवाइसेज़ पर मॉडल चलाने में सक्षम बनाता है

कोड

Share this page