rnn때부터 긴 컨텍스트를 어떻게 처리할거냐는 계속 있어왔던 논의아닌가


rnn -> lstm -> attention 전부다 장기기억을 어떻게 가져갈것이냐에 대한 담론들이었고 실제로 엄청난 개선이 이루어졌지만 개인적으로는 아직 한두번정도는 모델 아키텍쳐 단위에서의 혁신이 있어야된다고 보긴함


고작 몇천만토큰 몇억토큰 처리하려는게 최종목적은 아니잖아 인간보다 뛰어난 기억력과 추론능력을 가진 모델을 개발하는게 목적이지