gpt-3가 3640 petaflops/day 연산량이 필요하다는데, 1개에 0.1petaflops 성능인 v100이 openai 슈퍼컴에 10000개 넘게 들어가 있음. 그럼 이론상 성능은 976petaflops이고 50% 효율만 낸다치면 488 petaflops임. gpt-3보다 10배 큰 1.75조 모델은 36400 petaflops/day 라 치면 74.5일이면 학습 가능. 360일이면 적어도 모델사이즈 2조는 넘길 수 있었을 거임
특술람(125.191)2021-05-30 23:36
답글
OpenAI에서 혹시 엑사플롭스급 슈퍼컴을 가지고 있거나 학습속도를 개선시킨 새로운 알고리즘을 개발한 게 아니라면 올해 수 십조 되는 모델을 보긴 어려울 거라고 보는데, 수 조 모델은 가능하다고 봄. 미국에서 4엑사플롭스 Perlmutter 발표한다니까 이거 실성능 2엑사플롭스 정도로 잡고 182일 훈련시키면 17.5조 모델 등장가능
gpt-3가 3640 petaflops/day 연산량이 필요하다는데, 1개에 0.1petaflops 성능인 v100이 openai 슈퍼컴에 10000개 넘게 들어가 있음. 그럼 이론상 성능은 976petaflops이고 50% 효율만 낸다치면 488 petaflops임. gpt-3보다 10배 큰 1.75조 모델은 36400 petaflops/day 라 치면 74.5일이면 학습 가능. 360일이면 적어도 모델사이즈 2조는 넘길 수 있었을 거임
OpenAI에서 혹시 엑사플롭스급 슈퍼컴을 가지고 있거나 학습속도를 개선시킨 새로운 알고리즘을 개발한 게 아니라면 올해 수 십조 되는 모델을 보긴 어려울 거라고 보는데, 수 조 모델은 가능하다고 봄. 미국에서 4엑사플롭스 Perlmutter 발표한다니까 이거 실성능 2엑사플롭스 정도로 잡고 182일 훈련시키면 17.5조 모델 등장가능
틀리더라도 이렇게 자세히 올려주는 사람은 얘밖에없다
나에게 항상 희망을줘서 고맙다
Gpt4 100조 모델은 사실상 언플이였다는거네