mmlu CoT@32 점수마저 GPT-4보다 낮았네
저기서  Uncertanity Routed까지 해야 점수가 더 높아짐
Ultra mmlu 점수가 어떻게든 GPT-4보다는 높게 나와야하니 온갖 프롬프팅 다 시도해보고 제일 잘나온 점수 붙이거잖아
와중에 GPT-4는 최저점을 올린거고
기반부터 LMM모델이라 기대되는 부분이 크긴한데

mmlu관련해서는 엄청 짜치네 올릴꺼면 둘다 Uncertanity Routed점수로 올리던가 Ultra가 이 프롬프팅에서 유리한가 더 높게 나오던만
이것도 Ultra가 강점 보이는 프롬프팅 취사선택한거니 여전히 기만이긴한데 그나마 비교기준이라도 동일하지
데모영상보다 mmlu 점수가 훨씬 실망이 크다..