needhelp
← Back to blog

Gated DeltaNet-2: Tách Biệt Xóa và Ghi Trong Linear Attention

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

Nút Thắt Attention

Softmax attention tiêu chuẩn có vấn đề cơ bản: độ phức tạp bậc hai. Với chuỗi độ dài N, attention tính toán N×N tương tác.

Linear attention nén lịch sử thành trạng thái recurrent kích thước cố định. Chi phí giảm từ O(N²) xuống O(N).

Vấn Đề Cốt Lõi: Gắn Xóa và Ghi

Các mô hình trước dùng cổng scalar đơn để kiểm soát cả hai thao tác. Gated DeltaNet-2 tách biệt hai đường dẫn với hai cổng độc lập theo kênh.

Kết Quả Thực Nghiệm

1.3B tham số huấn luyện trên 100B FineWeb-Edu tokens, Gated DeltaNet-2 đạt kết quả mạnh nhất trên RULER benchmark — bài kiểm tra tìm kim trong đống cỏ ngữ cảnh dài.

Benchmark Mamba-2 GDN-2
Language Modeling baseline best
Commonsense Reasoning baseline best
Multi-key Retrieval weak strongest

Tại Sao Quan Trọng

  1. Chi phí inference LLM: Bộ nhớ O(1) → gọi API rẻ hơn
  2. RAG: Truy xuất đa khóa tốt hơn
  3. AI trên thiết bị: Trạng thái kích thước cố định

Tài Liệu Tham Khảo

Share this page