Language는 인간의 지능을 가장 효율적이고 압축적으로 표현하는 표상임.

그런 언어에 대한 자가지도학습은 그 표상을 거대한 그릇에 계속 옮겨담는 작업임


마치 일반적인 인공신경망 Distillation과 원리가 비슷함

유사한 크기(케파)일수록,

유사한 구조의 inductive bias를 반영할수록,

어딘가에 표현된 정보가 다른 정보의 그릇으로 더 잘 옮겨지는건 당연한거임


그렇기 때매 걍 언어모델은 인간 두뇌 수준의 케파를 가질 때까지 계속 늘리면 장땡인거임

물론 어떻게하는게 더 효과적이고 효율적이냐는 부분은 당연히 계속 연구되어야겠지만

Scale은 필수적인 축임


이상태로 반도체도, scale도 무어의 법칙대로 가는거면

곧 나올 언어모델들은

시공간의 제약은 없는거나 다름 없을거고

인간의 지능은 더이상 희소한 가치의 자원이 아닐거임


모두 잘 준비하길바란다