Gated DeltaNet-2: Memisahkan Erase dan Write dalam Linear Attention
Bottleneck Attention
Mekanisme softmax attention standar yang mendukung setiap Transformer punya masalah fundamental: kompleksitas kuadratik.
Linear attention adalah pesaing utama. Alih-alih menyimpan matriks attention N×N penuh, ia mengompresi sejarah ke state recurrent ukuran tetap.
Masalah Inti: Mengikat Erase dan Write
Pikirkan state recurrent sebagai papan tulis. Setiap token baru harus:
- Erase informasi usang
- Write asosiasi baru ke state
Model sebelumnya menggunakan gerbang skalar tunggal untuk mengontrol kedua operasi.
Gated DeltaNet-2
Peneliti dari NVIDIA memperkenalkan Gated DeltaNet-2, yang memisahkan jalur erase dan write dengan dua gerbang channel-wise independen:
| Komponen | Simbol | Peran |
|---|---|---|
| Erase gate | b_t | Kontrol hapus konten lama (key-side) |
| Write gate | w_t | Kontrol commit konten baru (value-side) |
Hasil Eksperimental
Pada 1.3B parameter dilatih pada 100B FineWeb-Edu tokens:
Gated DeltaNet-2 mencapai hasil terkuat secara keseluruhan pada benchmark RULER untuk retrieval konteks panjang.
Kenapa Ini Penting
- Biaya Inferensi LLM: Memory decoding O(1) berarti panggilan API lebih murah
- RAG: Retrieval multi-kunci yang lebih baik langsung meningkatkan sistem RAG
- AI On-Device: State ukuran tetap memungkinkan model mumpuni di perangkat terbatas memori
Reproducibility
Kode: NVlabs/GatedDeltaNet-2 (12.300+ bintang)
Paper: arXiv:2605.22791