https://www.reddit.com/r/singularity/comments/148a6y6/augmenting_language_models_with_longterm_memory/


Abstract 기존의 대규모 언어 모델(LLM)은 입력 길이 제한으로 인해 고정된 크기의 입력만 처리할 수 있어 과거 입력의 풍부한 장문맥 정보를 활용하지 못합니다. 이러한 문제점을 해결하기 위해, 우리는 LLM이 긴 역사를 기억할 수 있도록 하는 장기기억으로 증강된 언어 모델(LongMem)이라는 프레임워크를 제안합니다. 우리는 메모리 인코더로 고정된 원래의 백본 LLM과 메모리 검색기 및 판독기로서 적응형 잔여 사이드 네트워크를 사용하는 새로운 분리형 네트워크 아키텍처를 설계합니다. 이러한 분리형 메모리 설계는 메모리 고갈의 문제 없이 메모리 검색을 위해 장기적인 과거 컨텍스트를 쉽게 캐싱하고 업데이트할 수 있습니다. 메모리 증강 적응 훈련으로 강화된 LongMem은 따라서 과거의 긴 문맥을 기억하고 언어 모델링에 장기 기억을 사용할 수 있습니다. 제안된 메모리 검색 모듈은 메모리 뱅크에서 길이에 제한이 없는 컨텍스트를 처리할 수 있어 다양한 다운스트림 작업에 도움이 됩니다. 일반적으로 LongMem은 장형 메모리를 65,000 토큰까지 확대할 수 있으며, 따라서 인컨텍스트 학습을 위해 많은 수의 추가 데모 예시를 장형 메모리로 캐시할 수 있습니다. 실험 결과, 우리의 방법은 까다로운 장문맥 모델링 벤치마크인 ChapterBreak에서 강력한 장문맥 모델보다 성능이 뛰어나며, LLM에 비해 메모리 증강 인컨텍스트 학습에서 괄목할 만한 개선을 달성하는 것으로 나타났습니다. 이 결과는 제안된 방법이 언어 모델이 긴 형식의 콘텐츠를 암기하고 활용하는 데 효과적이라는 것을 보여줍니다.


Translated with www.DeepL.com/Translator (free version)