Gated DeltaNet-2: разделение стирания и записи в линейном внимании
Узкое место внимания
Стандартный softmax attention — квадратичная сложность O(N²). Для последовательности N токенов вычисляются N×N попарных взаимодействий.
Линейное внимание — ведущий кандидат. Вместо хранения полной матрицы, сжимает историю в рекуррентное состояние фиксированного размера. Сложность O(N), константная память для декодинга.
Проблема: связанные стирание и запись
Рекуррентное состояние — как доска. Каждый новый токен должен:
- Стереть устаревшую информацию
- Записать новые ассоциации
В оригинальном DeltaNet эти операции связаны: стирание и запись используют один механизм (одни и те же забывающие ворота).
Решение Gated DeltaNet-2
Gated DeltaNet-2 разделяет эти операции, вводя отдельные механизмы для стирания и записи:
- Стирание: выборочно удаляет из состояния информацию, более нерелевантную для текущего запроса
- Запись: добавляет новую информацию без влияния на существующие стабильные воспоминания
Как разделение чтения/записи в базах данных — каждый оптимизирован для своей задачи.
Результаты
| Модель | RULER (длинный контекст) | Эффективность состояния |
|---|---|---|
| Mamba-2 | 87.3% | Высокая |
| DeltaNet | 89.1% | Высокая |
| Gated DeltaNet-2 | 93.8% | Очень высокая |
| Transformer (full attention) | 95.2% | O(N²) |
Gated DeltaNet-2 достигает 93.8% на retrieval — вплотную к полному Transformer, но с O(N) сложностью.