수능이라고 생각하면됨 그냥 전체 문제 대비 정답 비율
자체제작 벤치인가
그 벤치마다 이름이 써있잖아요. 추론 & 지식 / 과학 / 코딩
아니 그러니까 그걸 뭘로 평가하냐 그걸 묻잖아요
인류마지막 문제도 연말에 100퍼 가깝겠네
아직 21.6%밖에 안되는데요
벤치 이름 써있는거 안보임?
아 저걸로 검새하면 다 나오는구나
LLM은 다른 분야랑 다르게 벤치마크가 엄청나게 많음. 정확하게 맞는 정답이 없는 경우가 많아서. 그러다보니 LLM이 발전하면서 계속 새로운 벤치마크들도 나오는 상황이라 그냥 검색해보는 게 좋음.
수능이라고 생각하면됨 그냥 전체 문제 대비 정답 비율
자체제작 벤치인가
그 벤치마다 이름이 써있잖아요. 추론 & 지식 / 과학 / 코딩
아니 그러니까 그걸 뭘로 평가하냐 그걸 묻잖아요
인류마지막 문제도 연말에 100퍼 가깝겠네
아직 21.6%밖에 안되는데요
벤치 이름 써있는거 안보임?
아 저걸로 검새하면 다 나오는구나
LLM은 다른 분야랑 다르게 벤치마크가 엄청나게 많음. 정확하게 맞는 정답이 없는 경우가 많아서. 그러다보니 LLM이 발전하면서 계속 새로운 벤치마크들도 나오는 상황이라 그냥 검색해보는 게 좋음.