https://arxiv.org/abs/2203.15556

주어진 컴퓨팅 예산에서 변환기 언어 모델을 훈련하기 위한 최적의 모델 크기와 토큰 수를 조사합니다. 우리는 훈련 데이터의 양을 일정하게 유지하면서 언어 모델을 확장하는 데 최근 초점을 맞춘 결과로 현재의 큰 언어 모델이 상당히 훈련되지 않았음을 발견했습니다. 500억에서 5000억 개의 토큰에 대해 7000만에서 160억 개 이상의 매개변수 범위에 있는 \nummodels 언어 모델에 대해 훈련함으로써 컴퓨팅 최적화 훈련의 경우 모델 크기와 훈련 토큰 수가 동일하게 조정되어야 함을 발견했습니다. 모델 크기 훈련 토큰의 수도 두 배가 되어야 합니다. 우리는 예측된 컴퓨팅 최적 모델인 \chinchilla를 훈련하여 이 가설을 테스트합니다. 이 모델은 \gopher와 동일한 컴퓨팅 예산을 사용하지만 70B 매개변수와 4 ×더 많은 데이터. \chinchilla는 광범위한 다운스트림 평가 작업에서 \Gopher(280B), GPT-3(175B), Jurassic-1(178B) 및 Megatron-Turing NLG(530B)를 균일하고 크게 능가합니다. 이것은 또한 \chinchilla가 미세 조정 및 추론을 위해 훨씬 적은 컴퓨팅을 사용하여 다운스트림 사용을 크게 촉진한다는 것을 의미합니다. 하이라이트로, \chinchilla는 MMLU 벤치마크에서 67.5\%의 최첨단 평균 정확도에 도달하여 \gopher에 비해 7\% 개선되었습니다.


언어 모델 더 발달되었다는 이야기같네! ㄹㅇ특이점은 오고 있다..