Gated DeltaNet-2: desacoplamento, apagamento e gravação em atenção linear
O gargalo da atenção
O mecanismo de atenção softmax padrão que alimenta cada Transformer tem um problema fundamental: complexidade quadrática. Para uma sequência de comprimento N, a atenção calcula N×N interações entre pares, o que significa que o processamento de documentos longos consome memória e computa a uma taxa insustentável.
É por isso que modelos como o GPT-5 e o Claude Opus 4.7 têm limites práticos de contexto – e é por isso que todos correm para encontrar alternativas.
graph LR
A[Input Sequence
N tokens] --> B[Softmax Attention
O(N²) memory]
B --> C[KV Cache
unbounded growth]
C --> D[Decoding Bottleneck]
A2[Input Sequence
N tokens] --> B2[Linear Attention
O(N) memory]
B2 --> C2[Fixed-Size State
constant memory]
C2 --> D2[Efficient Decoding]
style A fill:#ff6b6b,color:#fff
style D fill:#ff6b6b,color:#fff
style A2 fill:#51cf66,color:#fff
style D2 fill:#51cf66,color:#fff
Atenção linear é o principal concorrente. Em vez de armazenar uma matriz de atenção N×N completa, ele comprime o histórico em um estado recorrente de tamanho fixo — como carregar um único caderno em vez de uma biblioteca. O custo de mixagem de sequência cai de O(N²) para O(N), e a decodificação usa memória constante.
O problema central: amarrar apagar e escrever
Mas a atenção linear introduz um problema mais sutil: como você edita uma memória compactada?
Pense no estado recorrente como um quadro branco. Cada novo token precisa:
- Apagar informações desatualizadas relevantes para a consulta atual
- Escreva novas associações no estado
Os modelos anteriores — Gated DeltaNet e Kimi Delta Attention (KDA) — usam uma única porta escalar para controlar ambas as operações. É como usar um botão para ajustar a temperatura e a pressão da água no chuveiro: funciona, mas você não pode otimizar cada um de forma independente.
A visão crítica do artigo: apagar conteúdo antigo (no lado chave) e submeter novo conteúdo (no lado do valor) são operações fundamentalmente diferentes que não devem compartilhar um controlador.
Gated DeltaNet-2: a solução
Pesquisadores da NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) introduziram o Gated DeltaNet-2, que separa os caminhos de apagamento e gravação com dois portões independentes por canal:
| Componente | Símbolo | Função |
|---|---|---|
| Apagar portão | b_t | Controla a quantidade de conteúdo antigo a ser removido (lado da tecla) |
| Escreva portão | o que | Controla a quantidade de conteúdo novo a ser confirmado (lado do valor) |
| Decadência por canal | herdado do KDA | Taxa de esquecimento adaptativa por canal |
flowchart TD
subgraph Previous["Previous Approaches"]
X1[Input Token] --> G1[Single Scalar Gate]
G1 --> E1[Erase Old Content]
G1 --> W1[Write New Content]
E1 -.->|"tied control"| W1
end
subgraph GD2["Gated DeltaNet-2"]
X2[Input Token] --> EG[Erase Gate b_t
channel-wise]
X2 --> WG[Write Gate w_t
channel-wise]
EG --> E2[Erase Old Content
key-side]
WG --> W2[Write New Content
value-side]
E2 --> S[Updated State]
W2 --> S
end
style Previous fill:#ffe0e0
style GD2 fill:#e0ffe0
Essa separação significa que o modelo pode decidir manter associações antigas intactas enquanto escreve agressivamente novas, ou apagar completamente o contexto obsoleto enquanto atualiza apenas levemente — algo impossível sob o regime de porta escalar.
Hierarquia de generalização
Gated DeltaNet-2 generaliza o estado da técnica:
- KDA = Gated DeltaNet-2 quando b_t e w_t colapsam para o mesmo escalar
- Gated DeltaNet = KDA quando o decaimento do canal também entra em colapso para um escalar
- DeltaNet = o original, sem gate
Isso significa que o Gated DeltaNet-2 pode expressar qualquer comportamento de seus antecessores, ao mesmo tempo que adiciona recursos que lhes faltam fundamentalmente.
Inovações Técnicas
Além da contribuição arquitetônica, o artigo apresenta três avanços técnicos importantes para o treinamento prático:
1. Algoritmo WY em pedaços
O treinamento em sequências longas requer agrupamento para paralelismo. A equipe derivou uma formulação em blocos que absorve o decaimento do canal em fatores de apagamento assimétricos, permitindo um treinamento paralelo eficiente sem perder a dinâmica do canal.
2. Passagem para trás com reconhecimento de portão
A retropropagação padrão através de mecanismos de controle pode ser numericamente instável. A passagem para trás com reconhecimento de porta preserva o fluxo gradiente através das portas independentes de apagamento e gravação, permitindo um treinamento estável em escala.
3. Visualização de atualização rápida de peso
A regra de atualização é reformulada como um sistema de peso rápido, revelando conexões com o aprendizado e meta-aprendizado Hebbiano que foram obscurecidos nas formulações anteriores do DeltaNet.
Resultados Experimentais
Com parâmetros de 1,3 bilhão treinados em tokens FineWeb-Edu de 100 bilhões, o Gated DeltaNet-2 foi avaliado em relação a:
-Mamba-2
- Fechado DeltaNet
- Atenção Kimi Delta (KDA)
- Variantes Mamba-3
Modelagem e raciocínio de linguagem
| Referência | Mamba-2 | DeltaNet fechado | KDA | Mamba-3 | GDN-2 |
|---|---|---|---|---|---|
| Modelagem de Linguagem PPL | linha de base | melhorado | melhorado | melhorado | melhor |
| Raciocínio de bom senso | linha de base | competitivo | competitivo | competitivo | melhor |
| Recuperação multichave | fraco | moderado | moderado | moderado | mais forte |
O benchmark do assassino: RULER Needle-in-a-Haystack
É aqui que o Gated DeltaNet-2 realmente brilha. O benchmark RULER testa a capacidade de um modelo de encontrar informações específicas enterradas em contextos extremamente longos – como encontrar uma única agulha num palheiro do tamanho de um campo de futebol.O Gated DeltaNet-2 alcança os resultados gerais mais fortes nessas tarefas de recuperação de contexto longo, com melhorias particularmente dramáticas na configuração de recuperação multichave avaliada — onde o modelo deve encontrar e associar vários fatos dispersos.
xychart-beta
title "Long-Context Retrieval Performance (RULER)"
x-axis ["Mamba-2", "Gated DeltaNet", "KDA", "Mamba-3", "GDN-2"]
y-axis "Accuracy (%)" 0 --> 100
bar [62, 71, 74, 69, 88]
Gráfico: comparação ilustrativa baseada nas tendências de benchmark relatadas do RULER. Gated DeltaNet-2 mostra um salto significativo em todas as linhas de base.
Por que isso é importante
As implicações vão além dos referenciais acadêmicos:
- Custos de inferência LLM: atenção linear com memória de decodificação O(1) significa chamadas de API mais baratas para longas conversas e processamento de documentos
- Geração Aumentada de Recuperação: Uma melhor recuperação multichave melhora diretamente os sistemas RAG que precisam sintetizar informações de múltiplas seções de documentos
- IA no dispositivo: o estado de tamanho fixo permite a execução de modelos compatíveis em dispositivos com memória limitada
- Processamento de literatura científica: os modelos podem processar com eficácia documentos inteiros, patentes ou documentos legais sem truques de resumo
Código e reprodutibilidade
A implementação é de código aberto no GitHub em NVlabs/GatedDeltaNet-2, que já conquistou mais de 12.300 estrelas. O repositório inclui pontos de verificação pré-treinados, scripts de treinamento e código de avaliação.
Artigo: arXiv:2605.22791
Ansiosa
A era do domínio da atenção softmax pode estar chegando ao fim. À medida que as arquiteturas de atenção linear amadurecem — com inovações como controle independente de apagamento/gravação, decaimento por canal e treinamento em blocos — estamos nos aproximando do ponto em que o imposto O(N²) sobre os Transformers não é mais um custo necessário para fazer negócios.
Gated DeltaNet-2 mostra que o projeto arquitetônico cuidadoso, em vez do dimensionamento de força bruta, pode desbloquear melhorias dramáticas na eficiência com que os LLMs processam contextos longos. O próximo desafio: dimensionar essas arquiteturas para a faixa de parâmetros de 70B+, mantendo ao mesmo tempo sua vantagem de eficiência.