[2203.15556] Training Compute-Optimal Large Language Models (arxiv.org)
Chinchilla 700억 패러미터
Gopher 2800억 패래미터
GPT-3 1750억 패러미터
[2203.15556] Training Compute-Optimal Large Language Models (arxiv.org)
Chinchilla 700억 패러미터
Gopher 2800억 패래미터
GPT-3 1750억 패러미터
일정한 데이터 양에 대해서 모델크기 증가가 영원히 성능향상을 가져오지는 않는다는 거네. 데이터양과 모델크기를 같이 늘려야하는게 맞긴하지 ㅇㅇ
이게 왜 추천을 안 받지?