https://twitter.com/realHongyu_Wang/status/1771612062617055710
따로 더 분석해줄라고 자료 찾아보면서 글쓰고 있었는데
bitnet 1.58b 원 저작자가 나타나서 분석글에 댓글달음ㅋㅋ
둘이서 추가 정보도 서로 교환하고 다시 잘 진행했으면 좋겠네
이건 궁금한 사람들을 위한 설명인데
https://gall.dcinside.com/m/thesingularity/447412
비트넷 재현 실험해외 개발자가 최근 나온 비트넷 코드 바탕으로 재현 실험을 진행해봤습니다.15.5 M 크기의 Llama 모델 기준으로 일반적 학습과 비트넷 기반 학습을 진행했습니다.결과는 모델 loss 격차가 꽤 있다는 것이었습니다.gall.dcinside.com이거에 관련돤 설명임
사실 이 실험은 그냥 다 잘못됐음
원저자가 RMSNorm 빼라고 했는데 넣음
Learning Rate 2단계 하라고 했는데 안함
WeightDecay 안씀
근데 이런 단점보다 진짜 단점은 모델크기가 너무 작다는거임
그래서 다른 단점이 전부 씹히는 상태임
실험으로선 좀 많이 많이 아쉬움
그래도 마냥 부정적이진 않은게
이 사람 실험을 보면 일반적인 방식으로 했을때 다른 모델과의 비교가 되니까
오히려 이런 특이한 학습방법을 다른 모델에도 적용하면 효과가 있을지 모르는거라
비교 측면에서 그리 나쁘지 않았음
거기다가 자기가 실험할때 쓴 코드를 다 까서
다른 사람들이 추가 실험하고 싶을때
이사람거 참조해서 조금만 수정하면 더 정밀하게 할수있음
아무튼 원 저자가 특이한 실험을 많이 한거 사실이라서
다른 모델들 개선에도 도움이 될지 모르는거거든
아무튼 실험한 사람 관점의 핵심은
굳이 bitnet 저자들이 말하는 방향으로 새로 하드웨어를 만들 필요가 있나? 싶은 내용이었음
이거 제대로 실험하고 만들려면 진짜 자본 많이 필요할건데
걍 int4같은거 쓰면 장땡아님? 보니까 일반적인 방법으론 bitnet 1.58 이거 성능도 딸릴거같은데
누가 이걸 굳이 돈들여서 함?
내 생각엔 논문대로 안될거같은데(ngmi)
내가 실험한거 다 깔테니까 할사람 해봐
이런 내용임
그래도 실험해준것만으로도 감지덕지여서
좀 읽어보면서 씁쓸했는데
원저작자가 와서 컨텍을 했으니
잘하면 부족한 부분들 서로 DM으로 설명하거나 해서
완성된 형태로 코드가 나온 다음에
그걸 토대로 다른 사람이 다시 제대로 실험을 진행해줬으면 좋겠네
요약:
생각보다 관심 가진 똑똑이들이 많음.
지금시점에서도 최소한
LLM 소형화에 있어서 충분히 가치있는 연구일 가능성이 있음.
앞으로 다른 사람들 재실험이 쉬운 환경이 나올거임.
기존 하드웨어로는 원래 검증이 오래 걸리니
오늘 bitnet 나오나? 이런거 의미 없음.
존나 느긋하게 기다리는게 맞음.
저자들이 계속 업데이트도 꾸준히 해주고 있고 소통도 활발하고 스케일업해서 실험도 할 것으로 보이니 기달리면 된다잇.
예아 걍 완전 꿀통임 짱편함 ㅋㅋ
이거 어째 내 닉네임 사태가 떠오르는데..ㅋㅋㅋㅋ
다른점은 돌구이 전문가가 아니라 마소 연구실 "인턴"이라는거임 아 ㅋㅋ 너무 기대하지 말고 기다려보셈