트랜스포머 구글에서 나왔고 비트넷도 마소에서 나온거 보면 뭔가.. 인재들이 전부 기업으로 빠지다보니 슬슬 기우는것 같음
익명(shore1232)2024-03-22 01:00
답글
사실상 그 사람들도 거의 학계 사람들에 가까움.. 하는일이 연구쪽 전담을 하는거라
36악장(dranhen)2024-03-22 01:01
답글
걍 자본이 몰리는 쪽으로 가는걸지도
36악장(dranhen)2024-03-22 01:01
답글
이론 하더라도 기업에 몸담으면 그냥 산업계에 있는거지.. 슬슬 이론도 흐름이 기업에 넘어가지 않나 생각함
익명(shore1232)2024-03-22 01:03
약간 애매한 상황이 된 것 같음. 물론 GPU 많아야 빨리 돌려서 확인하기 좋은 것도 있겠지만.
스케일 때문에, 작은 모델에선 별로 개선이 안 되는 게 큰 모델에선 개선되기도 한다나봄.
즉, 대학에서 열심히 loss 줄이고, 아키텍쳐 개선하고, 정규화 하고 양자화하고 어쩌구 하는 게. 소용이 전혀 없어서 망했나~ 하고 다른 연구하러 갔는데
알고보니 그게 GPT4급에선 획기적인 개선이 될 수도 있다는거지.
익명(175.206)2024-03-22 01:01
답글
솔직히 그런느낌
36악장(dranhen)2024-03-22 01:02
답글
그냥 작은 데이터셋 학습도 구조 복잡하게한다고 성능이 서서히 좋아지는게 아니고 어느순간 성능이 팍 오르는 지점이 있는데 데이터가 많으면 더 복잡한 모델도 적합시킬수 있겠지
트랜스포머 구글에서 나왔고 비트넷도 마소에서 나온거 보면 뭔가.. 인재들이 전부 기업으로 빠지다보니 슬슬 기우는것 같음
사실상 그 사람들도 거의 학계 사람들에 가까움.. 하는일이 연구쪽 전담을 하는거라
걍 자본이 몰리는 쪽으로 가는걸지도
이론 하더라도 기업에 몸담으면 그냥 산업계에 있는거지.. 슬슬 이론도 흐름이 기업에 넘어가지 않나 생각함
약간 애매한 상황이 된 것 같음. 물론 GPU 많아야 빨리 돌려서 확인하기 좋은 것도 있겠지만. 스케일 때문에, 작은 모델에선 별로 개선이 안 되는 게 큰 모델에선 개선되기도 한다나봄. 즉, 대학에서 열심히 loss 줄이고, 아키텍쳐 개선하고, 정규화 하고 양자화하고 어쩌구 하는 게. 소용이 전혀 없어서 망했나~ 하고 다른 연구하러 갔는데 알고보니 그게 GPT4급에선 획기적인 개선이 될 수도 있다는거지.
솔직히 그런느낌
그냥 작은 데이터셋 학습도 구조 복잡하게한다고 성능이 서서히 좋아지는게 아니고 어느순간 성능이 팍 오르는 지점이 있는데 데이터가 많으면 더 복잡한 모델도 적합시킬수 있겠지