Language는 인간의 지능을 가장 효율적이고 압축적으로 표현하는 표상임.
그런 언어에 대한 자가지도학습은 그 표상을 거대한 그릇에 계속 옮겨담는 작업임
마치 일반적인 인공신경망 Distillation과 원리가 비슷함
유사한 크기(케파)일수록,
유사한 구조의 inductive bias를 반영할수록,
어딘가에 표현된 정보가 다른 정보의 그릇으로 더 잘 옮겨지는건 당연한거임
그렇기 때매 걍 언어모델은 인간 두뇌 수준의 케파를 가질 때까지 계속 늘리면 장땡인거임
물론 어떻게하는게 더 효과적이고 효율적이냐는 부분은 당연히 계속 연구되어야겠지만
Scale은 필수적인 축임
이상태로 반도체도, scale도 무어의 법칙대로 가는거면
곧 나올 언어모델들은
시공간의 제약은 없는거나 다름 없을거고
인간의 지능은 더이상 희소한 가치의 자원이 아닐거임
모두 잘 준비하길바란다
댓글 0