needhelp
← Back to blog

Gated DeltaNet-2: разделение стирания и записи в линейном внимании

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

Узкое место внимания

Стандартный softmax attention — квадратичная сложность O(N²). Для последовательности N токенов вычисляются N×N попарных взаимодействий.

Линейное внимание — ведущий кандидат. Вместо хранения полной матрицы, сжимает историю в рекуррентное состояние фиксированного размера. Сложность O(N), константная память для декодинга.

Проблема: связанные стирание и запись

Рекуррентное состояние — как доска. Каждый новый токен должен:

  1. Стереть устаревшую информацию
  2. Записать новые ассоциации

В оригинальном DeltaNet эти операции связаны: стирание и запись используют один механизм (одни и те же забывающие ворота).

Решение Gated DeltaNet-2

Gated DeltaNet-2 разделяет эти операции, вводя отдельные механизмы для стирания и записи:

  • Стирание: выборочно удаляет из состояния информацию, более нерелевантную для текущего запроса
  • Запись: добавляет новую информацию без влияния на существующие стабильные воспоминания

Как разделение чтения/записи в базах данных — каждый оптимизирован для своей задачи.

Результаты

Модель RULER (длинный контекст) Эффективность состояния
Mamba-2 87.3% Высокая
DeltaNet 89.1% Высокая
Gated DeltaNet-2 93.8% Очень высокая
Transformer (full attention) 95.2% O(N²)

Gated DeltaNet-2 достигает 93.8% на retrieval — вплотную к полному Transformer, но с O(N) сложностью.

Share this page