스케일링이 깨졌니 어쩌니
변수 다 고려하고, 지수적으로 스케일링 한건 맞는지? 같은 것도 다 고려해야 하는데
스케일링이 말 그대로 10배, 100배, 1000배 수준으로 가는 와중에 고작 2배 3배 올려놓고 스케일링이다 하는 거면 말도 안되는거임
중간에 병목 문제가 있을 순 있는데 그건 병목이 문제인거라 병목현상을 해결하는게 해답이지 스케일링이 문제라는 건 원인 파악이 잘못된거임
예를 들어 과도한 암기 경향이 생긴다? 이건 스케일이 애매하게 부족해서 '암기'와 '추론'이 섞이는 경우고,
진짜로 싹 다 암기할 정도로 스케일이 커지면 무조건 더 좋지
현실적으로 그정도로 스케일 키우긴 '지금은 힘드니까' 최적화 관점에서 쓴 논문이지 스케일 무용론을 증명한 논문이 아님
데이터 병목이 대표적인 원인인거 맞고 스케일링 법칙 자체가 반증된거 아니긴 한데 이미 인터넷 크롤링해서 더 뽑아낼 데이터가 거의 바닥이 났다고도하고 실용적인 관점에서 볼 때 스케일링 법칙이 현 LLM발전에 더이상 반드시 정답이 아니란거정도는 맞다고 할 순 있겠지.
인터넷 개발부터 현재까지 인터넷에 존재한 데이터보다 향후 3년동안의 데이터가 훨씬 많아질거라 문제없을 거라 봄
데이터 고갈로 인한 스케일링의 종말 어쩌고 얘긴 반년도 더 전부터 나오긴 했지 일리야도 했던 얘기고 ㅋㅋ 근데 이게 벽이냐라고 하몈 글쎄다 싶은데
애초에 arxiv에 던져진 논문이라 너무 맹신하면 안되기도함