자기들이 직접 신규 모델들이 기존 모델보다 헛소리 심하다고 벤치마크 공개해버렸는데


심지어 자기들도 이유를 모르겠다네?


데이터 부족, 과대적합, 학습 파라미터 소실, 토큰 컨텍스트 문제 등 심증은 많지만 


문제가 있다는걸 넘어서 명시적인 원인도 모르겠다 말하는건 추후 신규모델 발표에 큰 차질이 생길것으로 보임