1. 로터리 위치 임베딩(RoPE)은 트랜스포머 기반 언어 모델에서 위치 정보를 효과적으로 인코딩하는 것으로 알려져 있으나, 훈련된 시퀀스 길이를 넘어서 일반화하지 못한다.



2. YaRN은 이러한 모델의 Context 윈도우를 효과적으로 확장하는 방법을 제시하며, 이전 방법보다 10배 적은 토큰과 2.5배 적은 훈련 단계가 필요하다.



3. YaRN을 사용하여 LLaMA 모델은 원래의 사전 훈련보다 훨씬 긴 Context 길이를 효과적으로 활용하고 확장할 수 있으며, 또한 Context 윈도우 확장에서 이전의 최고 기록을 뛰어넘는다.



7ceb8975bd816efe3de998a518d60403e3a01f885ad3dc91a8



7ceb8975bd816efe3de998bf06d60403e279a8700c57d463a7

특이점이 온다.