needhelp
← Back to blog

Gated DeltaNet-2: desacoplamento, apagamento e gravação em atenção linear

by needhelp
mecanismo de atenção
atenção linear
transformador
llm
contexto longo
aprendizagem profunda

O gargalo da atenção

O mecanismo de atenção softmax padrão que alimenta cada Transformer tem um problema fundamental: complexidade quadrática. Para uma sequência de comprimento N, a atenção calcula N×N interações entre pares, o que significa que o processamento de documentos longos consome memória e computa a uma taxa insustentável.

É por isso que modelos como o GPT-5 e o Claude Opus 4.7 têm limites práticos de contexto – e é por isso que todos correm para encontrar alternativas.

graph LR
    A[Input Sequence
N tokens] --> B[Softmax Attention
O(N²) memory] B --> C[KV Cache
unbounded growth] C --> D[Decoding Bottleneck] A2[Input Sequence
N tokens] --> B2[Linear Attention
O(N) memory] B2 --> C2[Fixed-Size State
constant memory] C2 --> D2[Efficient Decoding] style A fill:#ff6b6b,color:#fff style D fill:#ff6b6b,color:#fff style A2 fill:#51cf66,color:#fff style D2 fill:#51cf66,color:#fff

Atenção linear é o principal concorrente. Em vez de armazenar uma matriz de atenção N×N completa, ele comprime o histórico em um estado recorrente de tamanho fixo — como carregar um único caderno em vez de uma biblioteca. O custo de mixagem de sequência cai de O(N²) para O(N), e a decodificação usa memória constante.

O problema central: amarrar apagar e escrever

Mas a atenção linear introduz um problema mais sutil: como você edita uma memória compactada?

Pense no estado recorrente como um quadro branco. Cada novo token precisa:

  1. Apagar informações desatualizadas relevantes para a consulta atual
  2. Escreva novas associações no estado

Os modelos anteriores — Gated DeltaNet e Kimi Delta Attention (KDA) — usam uma única porta escalar para controlar ambas as operações. É como usar um botão para ajustar a temperatura e a pressão da água no chuveiro: funciona, mas você não pode otimizar cada um de forma independente.

A visão crítica do artigo: apagar conteúdo antigo (no lado chave) e submeter novo conteúdo (no lado do valor) são operações fundamentalmente diferentes que não devem compartilhar um controlador.

Gated DeltaNet-2: a solução

Pesquisadores da NVIDIA (Ali Hatamizadeh, Yejin Choi, Jan Kautz) introduziram o Gated DeltaNet-2, que separa os caminhos de apagamento e gravação com dois portões independentes por canal:

Componente Símbolo Função
Apagar portão b_t Controla a quantidade de conteúdo antigo a ser removido (lado da tecla)
Escreva portão o que Controla a quantidade de conteúdo novo a ser confirmado (lado do valor)
Decadência por canal herdado do KDA Taxa de esquecimento adaptativa por canal
flowchart TD
    subgraph Previous["Previous Approaches"]
        X1[Input Token] --> G1[Single Scalar Gate]
        G1 --> E1[Erase Old Content]
        G1 --> W1[Write New Content]
        E1 -.->|"tied control"| W1
    end

    subgraph GD2["Gated DeltaNet-2"]
        X2[Input Token] --> EG[Erase Gate b_t
channel-wise] X2 --> WG[Write Gate w_t
channel-wise] EG --> E2[Erase Old Content
key-side] WG --> W2[Write New Content
value-side] E2 --> S[Updated State] W2 --> S end style Previous fill:#ffe0e0 style GD2 fill:#e0ffe0

Essa separação significa que o modelo pode decidir manter associações antigas intactas enquanto escreve agressivamente novas, ou apagar completamente o contexto obsoleto enquanto atualiza apenas levemente — algo impossível sob o regime de porta escalar.

Hierarquia de generalização

Gated DeltaNet-2 generaliza o estado da técnica:

  • KDA = Gated DeltaNet-2 quando b_t e w_t colapsam para o mesmo escalar
  • Gated DeltaNet = KDA quando o decaimento do canal também entra em colapso para um escalar
  • DeltaNet = o original, sem gate

Isso significa que o Gated DeltaNet-2 pode expressar qualquer comportamento de seus antecessores, ao mesmo tempo que adiciona recursos que lhes faltam fundamentalmente.

Inovações Técnicas

Além da contribuição arquitetônica, o artigo apresenta três avanços técnicos importantes para o treinamento prático:

1. Algoritmo WY em pedaços

O treinamento em sequências longas requer agrupamento para paralelismo. A equipe derivou uma formulação em blocos que absorve o decaimento do canal em fatores de apagamento assimétricos, permitindo um treinamento paralelo eficiente sem perder a dinâmica do canal.

2. Passagem para trás com reconhecimento de portão

A retropropagação padrão através de mecanismos de controle pode ser numericamente instável. A passagem para trás com reconhecimento de porta preserva o fluxo gradiente através das portas independentes de apagamento e gravação, permitindo um treinamento estável em escala.

3. Visualização de atualização rápida de peso

A regra de atualização é reformulada como um sistema de peso rápido, revelando conexões com o aprendizado e meta-aprendizado Hebbiano que foram obscurecidos nas formulações anteriores do DeltaNet.

Resultados Experimentais

Com parâmetros de 1,3 bilhão treinados em tokens FineWeb-Edu de 100 bilhões, o Gated DeltaNet-2 foi avaliado em relação a:

-Mamba-2

  • Fechado DeltaNet
  • Atenção Kimi Delta (KDA)
  • Variantes Mamba-3

Modelagem e raciocínio de linguagem

Referência Mamba-2 DeltaNet fechado KDA Mamba-3 GDN-2
Modelagem de Linguagem PPL linha de base melhorado melhorado melhorado melhor
Raciocínio de bom senso linha de base competitivo competitivo competitivo melhor
Recuperação multichave fraco moderado moderado moderado mais forte

O benchmark do assassino: RULER Needle-in-a-Haystack

É aqui que o Gated DeltaNet-2 realmente brilha. O benchmark RULER testa a capacidade de um modelo de encontrar informações específicas enterradas em contextos extremamente longos – como encontrar uma única agulha num palheiro do tamanho de um campo de futebol.O Gated DeltaNet-2 alcança os resultados gerais mais fortes nessas tarefas de recuperação de contexto longo, com melhorias particularmente dramáticas na configuração de recuperação multichave avaliada — onde o modelo deve encontrar e associar vários fatos dispersos.

xychart-beta
    title "Long-Context Retrieval Performance (RULER)"
    x-axis ["Mamba-2", "Gated DeltaNet", "KDA", "Mamba-3", "GDN-2"]
    y-axis "Accuracy (%)" 0 --> 100
    bar [62, 71, 74, 69, 88]

Gráfico: comparação ilustrativa baseada nas tendências de benchmark relatadas do RULER. Gated DeltaNet-2 mostra um salto significativo em todas as linhas de base.

Por que isso é importante

As implicações vão além dos referenciais acadêmicos:

  1. Custos de inferência LLM: atenção linear com memória de decodificação O(1) significa chamadas de API mais baratas para longas conversas e processamento de documentos
  2. Geração Aumentada de Recuperação: Uma melhor recuperação multichave melhora diretamente os sistemas RAG que precisam sintetizar informações de múltiplas seções de documentos
  3. IA no dispositivo: o estado de tamanho fixo permite a execução de modelos compatíveis em dispositivos com memória limitada
  4. Processamento de literatura científica: os modelos podem processar com eficácia documentos inteiros, patentes ou documentos legais sem truques de resumo

Código e reprodutibilidade

A implementação é de código aberto no GitHub em NVlabs/GatedDeltaNet-2, que já conquistou mais de 12.300 estrelas. O repositório inclui pontos de verificação pré-treinados, scripts de treinamento e código de avaliação.

Artigo: arXiv:2605.22791

Ansiosa

A era do domínio da atenção softmax pode estar chegando ao fim. À medida que as arquiteturas de atenção linear amadurecem — com inovações como controle independente de apagamento/gravação, decaimento por canal e treinamento em blocos — estamos nos aproximando do ponto em que o imposto O(N²) sobre os Transformers não é mais um custo necessário para fazer negócios.

Gated DeltaNet-2 mostra que o projeto arquitetônico cuidadoso, em vez do dimensionamento de força bruta, pode desbloquear melhorias dramáticas na eficiência com que os LLMs processam contextos longos. O próximo desafio: dimensionar essas arquiteturas para a faixa de parâmetros de 70B+, mantendo ao mesmo tempo sua vantagem de eficiência.

Share this page