needhelp
← Back to blog

Gated DeltaNet-2: แยก Erase และ Write ใน Linear Attention

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

คอขวดของ Attention

กลไก softmax attention มาตรฐานที่ขับเคลื่อน Transformer ทุกตัวมีปัญหาพื้นฐาน: quadratic complexity สำหรับ sequence ยาว N attention คำนวณ N×N pairwise interactions ซึ่งหมายถึงการประมวลผลเอกสารยาวกิน memory และ compute ในอัตราที่ยั่งยืนไม่ได้

นี่คือเหตุผลที่โมเดลอย่าง GPT-5 และ Claude Opus 4.7 มี context limits ที่ practical และทำไมทุกคนถึงแข่งกันหาทางเลือก

Linear attention คือผู้เข้าแข่งขันนำ แทนที่จะเก็บ full N×N attention matrix มันบีบอัดประวัติเป็น fixed-size recurrent state — เหมือนพกสมุดเล่มเดียวแทนทั้งห้องสมุด

ปัญหาหลัก: การผูก Erase และ Write

คิดถึง recurrent state เหมือนกระดานขาว แต่ละ token ใหม่ต้อง:

  1. ลบ ข้อมูลที่ล้าสมัย
  2. เขียน ความสัมพันธ์ใหม่ลงใน state

โมเดลก่อนหน้า — Gated DeltaNet และ Kimi Delta Attention (KDA) — ใช้ single scalar gate เพื่อควบคุมทั้งสอง operation นี่เหมือนการใช้ปุ่มเดียวปรับทั้งอุณหภูมิน้ำและแรงดันในฝักบัว: มันใช้ได้ แต่คุณไม่สามารถปรับแต่ละอย่างแยกกัน

ข้อมูลเชิงลึกสำคัญ: การลบเนื้อหาเก่าและการเพิ่มเนื้อหาใหม่เป็น operation ที่แตกต่างกันโดยพื้นฐานและไม่ควรแชร์ controller

Gated DeltaNet-2: ทางออก

นักวิจัยจาก NVIDIA นำเสนอ Gated DeltaNet-2 ซึ่งแยก erase และ write pathways ด้วย independent channel-wise gates สองตัว

ทำไมเรื่องนี้ถึงสำคัญ

  1. ต้นทุน LLM Inference: Linear attention กับ O(1) decoding memory = API calls ถูกกว่าสำหรับการสนทนายาว
  2. Retrieval-Augmented Generation: การ multi-key retrieval ที่ดีขึ้นโดยตรงช่วย RAG systems
  3. On-Device AI: Fixed-size state ทำให้รันโมเดลบนอุปกรณ์ที่มีหน่วยความจำจำกัด
  4. การประมวลผลเอกสารวิทยาศาสตร์: โมเดลสามารถประมวลผล paper, patent หรือเอกสารกฎหมายได้

อ้างอิง

Share this page