해외 개발자가 최근 나온 비트넷 코드 바탕으로 재현 실험을 진행해봤습니다.
15.5 M 크기의 Llama 모델 기준으로 일반적 학습과 비트넷 기반 학습을 진행했습니다.
결과는 모델 loss 격차가 꽤 있다는 것이었습니다. 저자는 이 정도 격차로는 차라리 2 bit QAT 하는 것이 더 좋을 것 같다고 평가 했습니다.
그리고 저자는 비트넷이 주는 이론적인 inference 성능을 끌어내려면 커스텀 칩이 필요한데 이는 막대한 개발비용을 필요로 한다고 지적했습니다. 또한 스케일링 법칙이 비트넷에 통한 다는 보장도 없기 때문에 비트넷이 NGMI(not going to make it, 아무래도 안 될 거야) 라고 말합니다.
사견: 다만, 실험이 15.5M 작은 스케일에서 이루어 졌고 비트넷 후속 FAQ에서는 loss 격차가 모델이 커지면서 감소한다고 주장한 부분도 고려해야 합니다. 그리고 재현 실험은 사용한 통상적인 warmup + CosineAnneal lr 스케줄을 사용했는데 비트넷 FAQ에서는 다소 특이한 2단계 lr 스케줄 + weight decay 을 사용해서 차이가 존재하는 부분이 있습니다. 더 큰 모델에 대한 실험을 통하여 loss 격차가 줄어드는지 FAQ에서 나온 lr 스케줄과 동일하게 맞추어 주는 부분이 더 검증되어야 할 것 같습니다.
https://huggingface.co/blog/joey00072/experiments-with-bitnet-1-5Experiments with Bitnet 1.5 (ngmi)Experiments with Bitnet 1.5 (ngmi)huggingface.co
15.5 M 크기의 Llama 모델 기준으로 일반적 학습과 비트넷 기반 학습을 진행했습니다.
결과는 모델 loss 격차가 꽤 있다는 것이었습니다. 저자는 이 정도 격차로는 차라리 2 bit QAT 하는 것이 더 좋을 것 같다고 평가 했습니다.
그리고 저자는 비트넷이 주는 이론적인 inference 성능을 끌어내려면 커스텀 칩이 필요한데 이는 막대한 개발비용을 필요로 한다고 지적했습니다. 또한 스케일링 법칙이 비트넷에 통한 다는 보장도 없기 때문에 비트넷이 NGMI(not going to make it, 아무래도 안 될 거야) 라고 말합니다.
사견: 다만, 실험이 15.5M 작은 스케일에서 이루어 졌고 비트넷 후속 FAQ에서는 loss 격차가 모델이 커지면서 감소한다고 주장한 부분도 고려해야 합니다. 그리고 재현 실험은 사용한 통상적인 warmup + CosineAnneal lr 스케줄을 사용했는데 비트넷 FAQ에서는 다소 특이한 2단계 lr 스케줄 + weight decay 을 사용해서 차이가 존재하는 부분이 있습니다. 더 큰 모델에 대한 실험을 통하여 loss 격차가 줄어드는지 FAQ에서 나온 lr 스케줄과 동일하게 맞추어 주는 부분이 더 검증되어야 할 것 같습니다.
https://huggingface.co/blog/joey00072/experiments-with-bitnet-1-5Experiments with Bitnet 1.5 (ngmi)Experiments with Bitnet 1.5 (ngmi)huggingface.co
비트넷 1.58 후속 FAQ 논문:
https://github.com/microsoft/unilm/blob/master/bitnet/The-Era-of-1-bit-LLMs__Training_Tips_Code_FAQ.pdf
15.5m으로 진행한 거면 논문 안 읽어 본 거 아님?
사실 개인 개발자가 진행한 만큼 규모의 한계가 있지 않았나 생각이 드네요.
...
지좆대로실험한거같은데?
일단개추
해당 댓글은 삭제되었습니다.
실험을 지좆대로해서 애초에 실패든성공이든 아무의미가없는데 이껀은?
이새끼는 검증이란단어를모르나?
대체 오픈소스 코드에서 스캠으로 돈따먹기 할게 인텔,암드 말고 누가 있는지? 비트넷 어디서 나온건지 알기나 하냐?
아직 증명 안된거네 큰 모델로 해봐야...
비트넷 핵심이 큰 모델인데 실험 방식도 지좆대로 모델 크기도 지좆대로 ㅋㅋ
위에유동은 비트넷에 맞기라도했냐 ㅋㅋ
15.5M은 ㅅㅂ 저건 애초에 논문에서도 모델 크기 작을 때는 전체 정밀도보다 안좋다는거 깔고 갔음 아무것도 새롭게 나온건 없는거임 저 사람은 논문은 읽어는 봤나싶네
근데 커스텀칩 개발에 막대한 비용이 들어간다 << 이부분은 팩트임??
작은 모델에서 성능 떨어지니깐 사장됐던거임. 모델이 커지니깐 속도 향상을 위해서 정밀도 줄여보니깐 성능이 많이 안 떨어지니깐 그걸 뇌절해서 3비트까지 줄여봤는데 모델이 커질수록 전체 정밀도랑 차이가 점점 줄어드는걸 발견한게 비트넷 논문인데 지좆대로 실험해놓고 무슨...
3비트가 아니고 1.58비트(3진법) - dc App
ㄴ3진법이라고 썼어야 되는데 실수했네.
아무튼 학습이 되긴 한다는거네
B도 아니고 M은 좀