Gated DeltaNet-2: Tách Biệt Xóa và Ghi Trong Linear Attention
by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning
Nút Thắt Attention
Softmax attention tiêu chuẩn có vấn đề cơ bản: độ phức tạp bậc hai. Với chuỗi độ dài N, attention tính toán N×N tương tác.
Linear attention nén lịch sử thành trạng thái recurrent kích thước cố định. Chi phí giảm từ O(N²) xuống O(N).
Vấn Đề Cốt Lõi: Gắn Xóa và Ghi
Các mô hình trước dùng cổng scalar đơn để kiểm soát cả hai thao tác. Gated DeltaNet-2 tách biệt hai đường dẫn với hai cổng độc lập theo kênh.
Kết Quả Thực Nghiệm
Ở 1.3B tham số huấn luyện trên 100B FineWeb-Edu tokens, Gated DeltaNet-2 đạt kết quả mạnh nhất trên RULER benchmark — bài kiểm tra tìm kim trong đống cỏ ngữ cảnh dài.
| Benchmark | Mamba-2 | GDN-2 |
|---|---|---|
| Language Modeling | baseline | best |
| Commonsense Reasoning | baseline | best |
| Multi-key Retrieval | weak | strongest |
Tại Sao Quan Trọng
- Chi phí inference LLM: Bộ nhớ O(1) → gọi API rẻ hơn
- RAG: Truy xuất đa khóa tốt hơn
- AI trên thiết bị: Trạng thái kích thước cố định
Tài Liệu Tham Khảo
- Paper: arXiv:2605.22791
- Code: NVlabs/GatedDeltaNet-2