Gated DeltaNet-2: แยก Erase และ Write ใน Linear Attention
คอขวดของ Attention
กลไก softmax attention มาตรฐานที่ขับเคลื่อน Transformer ทุกตัวมีปัญหาพื้นฐาน: quadratic complexity สำหรับ sequence ยาว N attention คำนวณ N×N pairwise interactions ซึ่งหมายถึงการประมวลผลเอกสารยาวกิน memory และ compute ในอัตราที่ยั่งยืนไม่ได้
นี่คือเหตุผลที่โมเดลอย่าง GPT-5 และ Claude Opus 4.7 มี context limits ที่ practical และทำไมทุกคนถึงแข่งกันหาทางเลือก
Linear attention คือผู้เข้าแข่งขันนำ แทนที่จะเก็บ full N×N attention matrix มันบีบอัดประวัติเป็น fixed-size recurrent state — เหมือนพกสมุดเล่มเดียวแทนทั้งห้องสมุด
ปัญหาหลัก: การผูก Erase และ Write
คิดถึง recurrent state เหมือนกระดานขาว แต่ละ token ใหม่ต้อง:
- ลบ ข้อมูลที่ล้าสมัย
- เขียน ความสัมพันธ์ใหม่ลงใน state
โมเดลก่อนหน้า — Gated DeltaNet และ Kimi Delta Attention (KDA) — ใช้ single scalar gate เพื่อควบคุมทั้งสอง operation นี่เหมือนการใช้ปุ่มเดียวปรับทั้งอุณหภูมิน้ำและแรงดันในฝักบัว: มันใช้ได้ แต่คุณไม่สามารถปรับแต่ละอย่างแยกกัน
ข้อมูลเชิงลึกสำคัญ: การลบเนื้อหาเก่าและการเพิ่มเนื้อหาใหม่เป็น operation ที่แตกต่างกันโดยพื้นฐานและไม่ควรแชร์ controller
Gated DeltaNet-2: ทางออก
นักวิจัยจาก NVIDIA นำเสนอ Gated DeltaNet-2 ซึ่งแยก erase และ write pathways ด้วย independent channel-wise gates สองตัว
ทำไมเรื่องนี้ถึงสำคัญ
- ต้นทุน LLM Inference: Linear attention กับ O(1) decoding memory = API calls ถูกกว่าสำหรับการสนทนายาว
- Retrieval-Augmented Generation: การ multi-key retrieval ที่ดีขึ้นโดยตรงช่วย RAG systems
- On-Device AI: Fixed-size state ทำให้รันโมเดลบนอุปกรณ์ที่มีหน่วยความจำจำกัด
- การประมวลผลเอกสารวิทยาศาสตร์: โมเดลสามารถประมวลผล paper, patent หรือเอกสารกฎหมายได้
อ้างอิง
- Paper: arXiv:2605.22791
- Code: NVlabs/GatedDeltaNet-2