라마3 70b짜리가 기존 llm들보다 막대한 데이터를 학습시켜서 파라미터를 엄청나게 작게 하고도 gpt4 바로 아래 수준인데,


gpt2도 100b 전후 크기로 파라미터를 줄였음에도 막대한 데이터를 학습시켜서 gpt4 수준의 성능을 낸다. 그런 거 아닐까.