needhelp
← Back to blog

Gated DeltaNet-2: 선형 어텐션에서 지우기와 쓰기 분리

by needhelp
attention-mechanism
linear-attention
transformer
llm
long-context
deep-learning

어텐션 병목

모든 Transformer를 구동하는 표준 softmax 어텐션 메커니즘에는 근본적인 문제가 있다: 2차 복잡도. 길이 N의 시퀀스에 대해 어텐션은 N×N 쌍별 상호작용을 계산하므로, 긴 문서를 처리하는 것은 지속 불가능한 속도로 메모리와 컴퓨팅을 소비한다.

이것이 GPT-5, Claude Opus 4.7 같은 모델이 실용적 컨텍스트 한계를 가지는 이유다 — 그리고 모두가 대안을 찾기 위해 경쟁하는 이유다.

선형 어텐션이 선두 주자다. 전체 N×N 어텐션 행렬을 저장하는 대신, 역사를 고정 크기 순환 상태로 압축한다 — 도서관 대신 단일 노트북을 들고 다니는 것과 같다. 시퀀스 혼합 비용이 O(N²)에서 O(N)으로 떨어지고, 디코딩은 상수 메모리를 사용한다.

핵심 문제: 지우기와 쓰기 연결

하지만 선형 어텐션은 더 미묘한 문제를 도입한다: 압축된 메모리를 어떻게 편집할까?

순환 상태를 화이트보드로 생각하자. 각 새 토큰은:

  1. 현재 쿼리와 관련된 오래된 정보 지우기
  2. 새로운 연관성을 상태에 쓰기

이전 모델(Gated DeltaNet, Kimi Delta Attention)은 단일 스칼라 게이트로 두 연산을 모두 제어한다. 이는 샤워에서 수온과 수압을 모두 하나의 손잡이로 조절하는 것과 같다: 작동은 하지만 각각을 독립적으로 최적화할 수 없다.

논문의 핵심 통찰: 오래된 내용 지우기(키 측)와 새 내용 쓰기(값 측)는 근본적으로 다른 연산이며, 하나의 제어기를 공유해서는 안 된다.

Gated DeltaNet-2: 해결책

NVIDIA 연구진(Ali Hatamizadeh, Yejin Choi, Jan Kautz)이 Gated DeltaNet-2를 도입했다. 이는 두 개의 독립적인 채널별 게이트로 지우기와 쓰기 경로를 분리한다:

구성 요소 기호 역할
지우기 게이트 b_t 제거할 오래된 내용의 양 제어 (키 측)
쓰기 게이트 w_t 커밋할 새 내용의 양 제어 (값 측)
채널별 감쇠 KDA에서 상속 적응형 채널별 망각률

이 분리는 모델이 오래된 연관성을 그대로 유지하면서 새 내용을 적극적으로 쓰거나, 오래된 컨텍스트를 철저히 지우면서 가볍게만 업데이트할 수 있게 한다 — 스칼라 게이트 체제에서는 불가능했다.

기술 혁신

1. 청크별 WY 알고리즘

긴 시퀀스 훈련은 병렬화를 위해 청킹이 필요하다. 팀은 채널별 감쇠를 비대칭 지우기 계수로 흡수하는 청크별 공식을 도출하여, 채널별 동역학을 잃지 않으면서 효율적 병렬 훈련을 가능하게 했다.

2. 게이트 인식 역전파

게이팅 메커니즘을 통한 표준 역전파는 수치적으로 불안정할 수 있다. 게이트 인식 역전파는 독립적인 지우기 및 쓰기 게이트를 통한 그래디언트 흐름을 보존하여 대규모에서 안정적 훈련을 가능하게 한다.

3. 빠른 가중치 업데이트 뷰

업데이트 규칙이 빠른 가중치 시스템으로 재구성되어, 이전 DeltaNet 공식에서는 obscured됐던 Hebbian 학습 및 메타 학습과의 연결을 드러낸다.

실험 결과

1.3B 파라미터에서 100B FineWeb-Edu 토큰으로 훈련된 Gated DeltaNet-2는 Mamba-2, Gated DeltaNet, Kimi Delta Attention(KDA), Mamba-3 변형과 비교 평가됐다.

킬러 벤치마크: RULER Needle-in-a-Haystack

Gated DeltaNet-2가 진정으로 빛나는 분야다. RULER 벤치마크는 모델이 극도로 긴 컨텍스트에 묻힌 특정 정보를 찾는 능력을 테스트한다.

Gated DeltaNet-2는 이러한 장기 컨텍스트 검색 태스크에서 가장 강력한 전체 결과를 달성했으며, 특히 평가된 다중 키 검색 설정에서 극적인 개선을 보였다 — 모델이 여러 흩어진 사실을 찾아 연결해야 하는 태스크다.

References

Share this page