needhelp
← Back to blog

Gated DeltaNet-2: লিনিয়ার অ্যাটেনশনে ইরেজ এবং রাইট আলাদা করা

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

অ্যাটেনশন বটলনেক

স্ট্যান্ডার্ড সফটম্যাক্স অ্যাটেনশন মেকানিজম যা প্রতিটি ট্রান্সফরমারকে শক্তি দেয় তার একটি মৌলিক সমস্যা আছে: কোয়াড্রেটিক কমপ্লেক্সিটি। N দৈর্ঘ্যের সিকোয়েন্সের জন্য, অ্যাটেনশন N×N পেয়ারওয়াইজ ইন্টারঅ্যাকশন কম্পিউট করে, যার মানে লম্বা ডকুমেন্ট প্রসেস করতে মেমোরি এবং কম্পিউট খরচ হয় অসহনীয় হারে।

লিনিয়ার অ্যাটেনশন প্রধান প্রতিদ্বন্দ্বী। পূর্ণ N×N অ্যাটেনশন ম্যাট্রিক্স স্টোর করার পরিবর্তে, এটি হিস্ট্রিকে একটি ফিক্সড-সাইজ রিকারেন্ট স্টেটে কম্প্রেস করে। সিকোয়েন্স মিক্সিং খরচ O(N²) থেকে O(N)-এ নেমে আসে, এবং ডিকোডিং কনস্ট্যান্ট মেমোরি ব্যবহার করে।

মূল সমস্যা: ইরেজ এবং রাইট বাঁধা

কিন্তু লিনিয়ার অ্যাটেনশন একটি সূক্ষ্ম সমস্যা নিয়ে আসে: তুমি কীভাবে একটি কম্প্রেসড মেমোরি এডিট করো?

রিকারেন্ট স্টেটকে একটা হোয়াইটবোর্ড হিসেবে ভাবো। প্রতিটি নতুন টোকেনের প্রয়োজন: ১. পুরানো তথ্য ইরেজ করা ২. নতুন অ্যাসোসিয়েশন রাইট করা

পূর্ববর্তী মডেল — Gated DeltaNet এবং Kimi Delta Attention (KDA) — উভয় অপারেশন নিয়ন্ত্রণে একক স্কেলার গেট ব্যবহার করে। এটা এমন যেন বাথরুমে একটা নব দিয়ে জলের তাপমাত্রা আর চাপ দুটোই নিয়ন্ত্রণ করা: কাজ করে, কিন্তু প্রতিটাকে আলাদাভাবে অপ্টিমাইজ করতে পারো না।

পেপারের মূল অন্তর্দৃষ্টি: পুরানো কন্টেন্ট ইরেজ করা (কী সাইডে) এবং নতুন কন্টেন্ট কমিট করা (ভ্যালু সাইডে) মৌলিকভাবে ভিন্ন অপারেশন যাদের আলাদা কন্ট্রোলার থাকা উচিত।

Gated DeltaNet-2: সমাধান

NVIDIA-র গবেষকরা (Ali Hatamizadeh, Yejin Choi, Jan Kautz) Gated DeltaNet-2 পরিচয় করিয়ে দিয়েছেন, যা দুটি স্বাধীন চ্যানেল-ওয়াইজ গেট দিয়ে ইরেজ এবং রাইট পাথওয়ে আলাদা করে:

কম্পোনেন্ট সিম্বল ভূমিকা
ইরেজ গেট b_t কতটা পুরানো কন্টেন্ট সরাতে হবে তা নিয়ন্ত্রণ করে (কী-সাইড)
রাইট গেট w_t কতটা নতুন কন্টেন্ট কমিট করতে হবে তা নিয়ন্ত্রণ করে (ভ্যালু-সাইড)

এই আলাদাকরণ মানে মডেল পুরানো অ্যাসোসিয়েশন অক্ষত রেখে আক্রমনাত্মকভাবে নতুন লেখার সিদ্ধান্ত নিতে পারে, অথবা অপ্রাসঙ্গিক কন্টেন্ট ভালোভাবে মুছে ফেলে হালকাভাবে আপডেট করতে পারে — স্কেলার-গেট শাসনে যা অসম্ভব।

কেন এটা গুরুত্বপূর্ণ

প্রভাব একাডেমিক বেঞ্চমার্কের বাইরেও বিস্তৃত:

১. LLM ইনফারেন্স খরচ: O(1) ডিকোডিং মেমোরি সহ লিনিয়ার অ্যাটেনশন মানে লম্বা কথোপকথন এবং ডকুমেন্ট প্রসেসিংয়ের জন্য সস্তা API কল ২. রিট্রিভাল-অগমেন্টেড জেনারেশন: ভালো মাল্টি-কী রিট্রিভাল সরাসরি RAG সিস্টেম উন্নত করে ৩. অন-ডিভাইস AI: ফিক্সড-সাইজ স্টেট মেমোরি-সীমিত ডিভাইসে সক্ষম মডেল চালানো সক্ষম করে ৪. বৈজ্ঞানিক সাহিত্য প্রক্রিয়াকরণ: মডেল সম্পূর্ণ পেপার, পেটেন্ট বা আইনি ডকুমেন্ট কার্যকরভাবে প্রসেস করতে পারে

সফটম্যাক্স অ্যাটেনশনের আধিপত্যের যুগ শেষের দিকে। লিনিয়ার অ্যাটেনশন আর্কিটেকচার পরিণত হওয়ার সাথে সাথে, আমরা এমন একটি বিন্দুতে পৌঁছাচ্ছি যেখানে ট্রান্সফরমারের O(N²) ট্যাক্স আর প্রয়োজনীয় খরচ নয়।

Share this page