지능 향상은 x축이 시간축. y축이 지능축이라고 봐야함. 그리고 이 지능은 지수적으로 상승한다. 이거임.
스케일링의 법칙은, 모델의 크기가 클수록 지능이 상승한다. 이거인데, 주의할 게, 모델 크기에 따라 지능이 '지수적'으로 상승하는 건 아님. 상승만 말하고 있음.
그리고, 크기를 키울수록 가성비는 나빠짐.
이 두 개를 짬뽕 시켜서 생각하는 착각을 자주 하는데, 그게 작년 중순에도 있었음.
아마 구글이었나. 모델 크기를 좀 더 키웠는데 성능 향상이 유의미하게 있지 않아서 포기했다는 기사도 뜨고
GPT4보다 더 좋은 모델도 안 나와서 부정적 여론이 많았지.
어쨌든, 지금보다 GPU나 모델 크기를 1000배 키우면 몇배는 뛰어난 모델을 만들 가능성이 높음. 스케일링 법칙은 아직 틀렸다는 증거가 없으니까.
ㅇㅇ 3(218.144)2025-02-19 14:58
답글
지금까지 기념비적인 모델들은 수십배는 키우면서 주목 받았던거임.
그런데 지금 그렇게 안 하는 이유는, 앞서 말했듯 가성비가 나쁨.
x축이 모델 크기, y축이 지능이라고 할 때, 로그함수 형태가 된거지.
하드웨어가 압도적으로 싸지고, 학습 데이터가 고갈되지 않아야 가능할텐데 쉽지 않지. 이것만 보면 암울한 상황인데
추론모델이 나오면서, x축이 추론시간, y축이 지능. 이건 x축이 모델크기인 초기시절처럼 가성비가 잘 나옴.
ㅇㅇ 3(218.144)2025-02-19 15:02
답글
정리하면, 스케일링 법칙은, 무언가 계속 늘리면 지능이 계속 향상된다는거라, AGI에 언젠간 도달할 수 있을거라는 주장을 뒷받침하는 거.
GPU 몇배 늘린다고 드라마틱한 성능 향상이 나오는 시기는 지났음.
하지만, 지금은 추론시간이 더 역할을 하는 중이라, x축을 시간으로 놓고보면 지수적 발전은 여전하다고 볼 수 있다.
어허 빅브레인 남았다
로그스케일로 봐주세요
해당 댓글은 삭제되었습니다.
그런거냐? 그럼 쉽게 설명을 해주고 기분좋게 알려줘라 시발아
반사 모든것은 네게 돌아간다
ㅇㅇ 빅브레인이 진짜일듯
지능 향상은 x축이 시간축. y축이 지능축이라고 봐야함. 그리고 이 지능은 지수적으로 상승한다. 이거임. 스케일링의 법칙은, 모델의 크기가 클수록 지능이 상승한다. 이거인데, 주의할 게, 모델 크기에 따라 지능이 '지수적'으로 상승하는 건 아님. 상승만 말하고 있음. 그리고, 크기를 키울수록 가성비는 나빠짐. 이 두 개를 짬뽕 시켜서 생각하는 착각을 자주 하는데, 그게 작년 중순에도 있었음. 아마 구글이었나. 모델 크기를 좀 더 키웠는데 성능 향상이 유의미하게 있지 않아서 포기했다는 기사도 뜨고 GPT4보다 더 좋은 모델도 안 나와서 부정적 여론이 많았지. 어쨌든, 지금보다 GPU나 모델 크기를 1000배 키우면 몇배는 뛰어난 모델을 만들 가능성이 높음. 스케일링 법칙은 아직 틀렸다는 증거가 없으니까.
지금까지 기념비적인 모델들은 수십배는 키우면서 주목 받았던거임. 그런데 지금 그렇게 안 하는 이유는, 앞서 말했듯 가성비가 나쁨. x축이 모델 크기, y축이 지능이라고 할 때, 로그함수 형태가 된거지. 하드웨어가 압도적으로 싸지고, 학습 데이터가 고갈되지 않아야 가능할텐데 쉽지 않지. 이것만 보면 암울한 상황인데 추론모델이 나오면서, x축이 추론시간, y축이 지능. 이건 x축이 모델크기인 초기시절처럼 가성비가 잘 나옴.
정리하면, 스케일링 법칙은, 무언가 계속 늘리면 지능이 계속 향상된다는거라, AGI에 언젠간 도달할 수 있을거라는 주장을 뒷받침하는 거. GPU 몇배 늘린다고 드라마틱한 성능 향상이 나오는 시기는 지났음. 하지만, 지금은 추론시간이 더 역할을 하는 중이라, x축을 시간으로 놓고보면 지수적 발전은 여전하다고 볼 수 있다.