needhelp
← Back to blog

Gated DeltaNet-2: Memisahkan Erase dan Write dalam Linear Attention

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

Bottleneck Attention

Mekanisme softmax attention standar yang mendukung setiap Transformer punya masalah fundamental: kompleksitas kuadratik.

Linear attention adalah pesaing utama. Alih-alih menyimpan matriks attention N×N penuh, ia mengompresi sejarah ke state recurrent ukuran tetap.

Masalah Inti: Mengikat Erase dan Write

Pikirkan state recurrent sebagai papan tulis. Setiap token baru harus:

  1. Erase informasi usang
  2. Write asosiasi baru ke state

Model sebelumnya menggunakan gerbang skalar tunggal untuk mengontrol kedua operasi.

Gated DeltaNet-2

Peneliti dari NVIDIA memperkenalkan Gated DeltaNet-2, yang memisahkan jalur erase dan write dengan dua gerbang channel-wise independen:

Komponen Simbol Peran
Erase gate b_t Kontrol hapus konten lama (key-side)
Write gate w_t Kontrol commit konten baru (value-side)

Hasil Eksperimental

Pada 1.3B parameter dilatih pada 100B FineWeb-Edu tokens:

Gated DeltaNet-2 mencapai hasil terkuat secara keseluruhan pada benchmark RULER untuk retrieval konteks panjang.

Kenapa Ini Penting

  1. Biaya Inferensi LLM: Memory decoding O(1) berarti panggilan API lebih murah
  2. RAG: Retrieval multi-kunci yang lebih baik langsung meningkatkan sistem RAG
  3. AI On-Device: State ukuran tetap memungkinkan model mumpuni di perangkat terbatas memori

Reproducibility

Kode: NVlabs/GatedDeltaNet-2 (12.300+ bintang)

Paper: arXiv:2605.22791

Share this page