You will be answering very difficult questions in the subfield(s) of your expertise with the help of Google, but not the help of ChatGPT or other language models. We are actively searching for participants that meet the following criteria:
매우 어려운 질문을 구글을 사용하되, 다른 LLM의 도움 없이 푸는 작업을 맡기겟다는데
박사졸업(전문가)가 LLM을 뺀 다른 기존 수단을 다 써서 몆개 맞추는지 보고
자기들 새로운 모델이 몇개나 맞추는지 서로 비교하겠다는거 아님?? ㅅㅂ
매우 어려운 질문을 구글을 사용하되, 다른 LLM의 도움 없이 푸는 작업을 맡기겟다는데
박사졸업(전문가)가 LLM을 뺀 다른 기존 수단을 다 써서 몆개 맞추는지 보고
자기들 새로운 모델이 몇개나 맞추는지 서로 비교하겠다는거 아님?? ㅅㅂ
게임오바
확정이네.
만약 그게 맞으면, 자기네 모델의 추론 능력에 대한 확인 목적인 것 같네. 구글 써도 된다했으니 open book인 셈이고, oepn book 테스트에서 자기네 모델이 인간 전문가에 비해 추론 능력이 얼마나 좋은지 확인하려는 거 아니냐
그럴듯
새로운 벤치마크 만들려하나보네ㅋㅋ 경쟁 기준이 인터넷검색가능한 박사급 인재고 ㄷㄷ
확정이네.
ㄷㄷ
인간 벤치마크?
아 맞네 인간 전문가들이랑 대결시키려고 ㄷㄷ
모두 고생 많았다
끝났다.
인간 벤치마크
싹 다 구속시켜
웹서핑으로 학습이 가능한가 그거 시도하려고 하는 듯 예를들어 파이썬과 깃헙 코드를 연계시키는거 라던가
전문가 시험은 GPQA 벤치마크 말하는 것 같은데 테스트 과목도 생물학 화학 물리학으로 똑같고
그런듯
구경해보고 싶다
알파고 vs 이세돌의 학계 버전?