Gated DeltaNet-2: লিনিয়ার অ্যাটেনশনে ইরেজ এবং রাইট আলাদা করা
অ্যাটেনশন বটলনেক
স্ট্যান্ডার্ড সফটম্যাক্স অ্যাটেনশন মেকানিজম যা প্রতিটি ট্রান্সফরমারকে শক্তি দেয় তার একটি মৌলিক সমস্যা আছে: কোয়াড্রেটিক কমপ্লেক্সিটি। N দৈর্ঘ্যের সিকোয়েন্সের জন্য, অ্যাটেনশন N×N পেয়ারওয়াইজ ইন্টারঅ্যাকশন কম্পিউট করে, যার মানে লম্বা ডকুমেন্ট প্রসেস করতে মেমোরি এবং কম্পিউট খরচ হয় অসহনীয় হারে।
লিনিয়ার অ্যাটেনশন প্রধান প্রতিদ্বন্দ্বী। পূর্ণ N×N অ্যাটেনশন ম্যাট্রিক্স স্টোর করার পরিবর্তে, এটি হিস্ট্রিকে একটি ফিক্সড-সাইজ রিকারেন্ট স্টেটে কম্প্রেস করে। সিকোয়েন্স মিক্সিং খরচ O(N²) থেকে O(N)-এ নেমে আসে, এবং ডিকোডিং কনস্ট্যান্ট মেমোরি ব্যবহার করে।
মূল সমস্যা: ইরেজ এবং রাইট বাঁধা
কিন্তু লিনিয়ার অ্যাটেনশন একটি সূক্ষ্ম সমস্যা নিয়ে আসে: তুমি কীভাবে একটি কম্প্রেসড মেমোরি এডিট করো?
রিকারেন্ট স্টেটকে একটা হোয়াইটবোর্ড হিসেবে ভাবো। প্রতিটি নতুন টোকেনের প্রয়োজন: ১. পুরানো তথ্য ইরেজ করা ২. নতুন অ্যাসোসিয়েশন রাইট করা
পূর্ববর্তী মডেল — Gated DeltaNet এবং Kimi Delta Attention (KDA) — উভয় অপারেশন নিয়ন্ত্রণে একক স্কেলার গেট ব্যবহার করে। এটা এমন যেন বাথরুমে একটা নব দিয়ে জলের তাপমাত্রা আর চাপ দুটোই নিয়ন্ত্রণ করা: কাজ করে, কিন্তু প্রতিটাকে আলাদাভাবে অপ্টিমাইজ করতে পারো না।
পেপারের মূল অন্তর্দৃষ্টি: পুরানো কন্টেন্ট ইরেজ করা (কী সাইডে) এবং নতুন কন্টেন্ট কমিট করা (ভ্যালু সাইডে) মৌলিকভাবে ভিন্ন অপারেশন যাদের আলাদা কন্ট্রোলার থাকা উচিত।
Gated DeltaNet-2: সমাধান
NVIDIA-র গবেষকরা (Ali Hatamizadeh, Yejin Choi, Jan Kautz) Gated DeltaNet-2 পরিচয় করিয়ে দিয়েছেন, যা দুটি স্বাধীন চ্যানেল-ওয়াইজ গেট দিয়ে ইরেজ এবং রাইট পাথওয়ে আলাদা করে:
| কম্পোনেন্ট | সিম্বল | ভূমিকা |
|---|---|---|
| ইরেজ গেট | b_t | কতটা পুরানো কন্টেন্ট সরাতে হবে তা নিয়ন্ত্রণ করে (কী-সাইড) |
| রাইট গেট | w_t | কতটা নতুন কন্টেন্ট কমিট করতে হবে তা নিয়ন্ত্রণ করে (ভ্যালু-সাইড) |
এই আলাদাকরণ মানে মডেল পুরানো অ্যাসোসিয়েশন অক্ষত রেখে আক্রমনাত্মকভাবে নতুন লেখার সিদ্ধান্ত নিতে পারে, অথবা অপ্রাসঙ্গিক কন্টেন্ট ভালোভাবে মুছে ফেলে হালকাভাবে আপডেট করতে পারে — স্কেলার-গেট শাসনে যা অসম্ভব।
কেন এটা গুরুত্বপূর্ণ
প্রভাব একাডেমিক বেঞ্চমার্কের বাইরেও বিস্তৃত:
১. LLM ইনফারেন্স খরচ: O(1) ডিকোডিং মেমোরি সহ লিনিয়ার অ্যাটেনশন মানে লম্বা কথোপকথন এবং ডকুমেন্ট প্রসেসিংয়ের জন্য সস্তা API কল ২. রিট্রিভাল-অগমেন্টেড জেনারেশন: ভালো মাল্টি-কী রিট্রিভাল সরাসরি RAG সিস্টেম উন্নত করে ৩. অন-ডিভাইস AI: ফিক্সড-সাইজ স্টেট মেমোরি-সীমিত ডিভাইসে সক্ষম মডেল চালানো সক্ষম করে ৪. বৈজ্ঞানিক সাহিত্য প্রক্রিয়াকরণ: মডেল সম্পূর্ণ পেপার, পেটেন্ট বা আইনি ডকুমেন্ট কার্যকরভাবে প্রসেস করতে পারে
সফটম্যাক্স অ্যাটেনশনের আধিপত্যের যুগ শেষের দিকে। লিনিয়ার অ্যাটেনশন আর্কিটেকচার পরিণত হওয়ার সাথে সাথে, আমরা এমন একটি বিন্দুতে পৌঁছাচ্ছি যেখানে ট্রান্সফরমারের O(N²) ট্যাক্স আর প্রয়োজনীয় খরচ নয়।