반복적인 시간 진화의 결과, 과거 시퀀스의 토큰 상태가 현재 시퀀스의 토큰 상태를 먹어치움으로써 제한된 크기의 시퀀스에 대해 적은 메모리만으로도 분리된 시퀀스 간의 주의가 무한한 맥락 정보를 유지하는 것이 가능해지는 것을 논의합니다. 실험에서는 입력 토큰 윈도우 크기를 12개로 설정하고 24GB 메모리를 가진 GPU 1대를 사전 학습에 사용했습니다. 150개 이상의 길이 컨텍스트가 보존되는 것을 확인했습니다. 훈련의 샘플링 결과, 코드 및 기타 자세한 내용은 추후 이 노트의 수정 버전에 포함될 예정입니다.


ㅇㅇ..;; 


이론상 무한임 


대규모 모델에서는 아직 확인된 바가 없음