needhelp
← Back to blog

1967년 공식이 현대 AI의 가장 큰 문제를 해결했을 때

by needhelp
AI 연구
강화 학습
수학
과학 발견

Sutton의 우아한 수정

강화학습에는 더러운 비밀이 있다: 스트리밍 환경에서 모델 훈련은 근본적으로 망가져 있다. 깨끗한 연구실 환경에서 아름답게 작동하는 알고리즘이 데이터가 지속적으로 도착하고 분포가 이동하는 실제 세계에 배포되면 붕괴한다.

강화학습의 대부 Richard Sutton이 방금 그것을 수정했다. 그의 해결책은 거의 당혹스러울 정도로 우아하다: 1967년의 공식.

“의도 업데이트 알고리즘”은 모델의 출력이 새 데이터마다 얼마나 변할 수 있는지 제약한다. 모순된 신호 사이에서 흔들리는 대신, 모델은 의도적으로 움직인다 — 전복되는 대신 방향타를 조정하는 배처럼.

결과? 컴퓨팅이 주류 알고리즘의 140분의 1로 감소. 이것은 미미한 개선이 아니다 — “데이터센터 필요”와 “노트북에서 실행”의 차이다.

References

  • Richard Sutton, “Intent Update Algorithm”
  • arXiv preprint on streaming RL

Share this page