GPT 4.0가 MoE 방식인 거 아니냐는

썰들이 이전부터 있었는데 공개는 안 했었음

근데 미스트랄에서 7B 모델 8개로 MoE 만들었더니

GPT 3.5는 그냥 구닥다리로 보일 정도로

성능이 눈에 띄게 좋아짐

이번에 라마3에 100B 모델도 MoE 방식이라는데

기대 해볼만 한 듯