우리가 말하는 GPT-?는
구글에서 발표한 트랜스포머 레이어를 겹겹히 쌓고 훈련시킨 그정도 모델로 생각하는데
내가 볼 땐 지금 GPT-4는 그런 류의 GPT랑은 좀 많이 다른 거 같음
GPT-2 까지였나? 거기까진 모델 구조가 공개된 거로 아는데
지금 서비스되고 있는 GPT-4 모델은
OpenAI 내부에서 엄청난 연구 + 시도를 거듭한 끝에 마개조된 구조의 모델을 사용하고 있지 않을까 싶음
거기에 담긴 노하우가 하나하나가 엄청날 거 같은데
논문으로 써내면 진짜 엄청난 파급력을 가진 기술조차도
외부에 공개하지 않고 그냥 회사 내부 노하우로 갖고 있을 거 같음...
그리고 그런 노하우가 한두가지가 아니라 산더미처럼 쌓여있고...
그렇지 않고서야 다른 빅테크 기업들이 이렇게까지 못 따라가는 게 말이 안됨
오픈소스 모델 중 엄청 큰 모델들도 GPT-4는 커녕 GPT-3.5도 못 따라가는 거 보면 킹리적 갓심임 ㄹㅇ
확실히 전 모델들과는 여러가지가 다르긴하지...
autoregressive이고 transformer 구조쓰면 다 generative pretrained transformer지 뭔소릴하고있노 - dc App