deepseek 저건 보니까 MoE던데
제미니 한테 넌 뭐냐고 물어보니 Dense에 Sparse(MoE랑 비슷한 거래) 가 섞여 돌아가는 구조라고 하고
GPT는 그냥 Dense 라고 답하네
걍 주류 모델은 다 Dense 인가?
MoE 방식이 서비스 할때는 파라미터 얼마 안쓰니까 좋을거 같긴한데
deepseek 쟤도 전체 671B 중에 답변할때는 37B만 쓴다니
MoE는 장기적으로 종합적인 추론능력을 기르기가 좀 힘들려나
아무래도 한몸이 아니다보니?
MoE는 아키텍쳐부터 다시 사전학습해야함. 그래서 비용 때문에 dense쓰는거