https://www.aitimes.com/news/articleView.html?idxno=155502AGI 판단하는 'GAIA 벤치마크' 등장..."GPT-4가 30%로 1위"일반인공지능(AGI)을 판단하는 벤치마크가 추가됐다. 인간에게 어려운 작업을 해결하는 능력보다 일상 작업에서 인간과 같은 추론과 능력을 보여줄 수 있는지 평가하는 데 초점을 맞췄다. 그리고 이 테스트에서는 'GPT-4'가 현존 인공지능(AI) 모델 중 최고 점수인 30%를 기록했다.벤처비트는 27일(현지시간) 메타, 허깅페이스, 오토GPT, 젠AI의 연구진이 추론과 멀티 모달 처리, 웹 브라우징, 도구 사용 등 일련의 기본 능력이 필요한 질문으로 대형언어모델(LLM)을 평가하는 ‘일반인공지능 어시스턴트(GAIA)’ 벤치마크를 발표했www.aitimes.com
https://www.aitimes.com/news/articleView.html?idxno=155502AGI 판단하는 'GAIA 벤치마크' 등장..."GPT-4가 30%로 1위"일반인공지능(AGI)을 판단하는 벤치마크가 추가됐다. 인간에게 어려운 작업을 해결하는 능력보다 일상 작업에서 인간과 같은 추론과 능력을 보여줄 수 있는지 평가하는 데 초점을 맞췄다. 그리고 이 테스트에서는 'GPT-4'가 현존 인공지능(AI) 모델 중 최고 점수인 30%를 기록했다.벤처비트는 27일(현지시간) 메타, 허깅페이스, 오토GPT, 젠AI의 연구진이 추론과 멀티 모달 처리, 웹 브라우징, 도구 사용 등 일련의 기본 능력이 필요한 질문으로 대형언어모델(LLM)을 평가하는 ‘일반인공지능 어시스턴트(GAIA)’ 벤치마크를 발표했www.aitimes.com
아니 인간이 92%면 100%는 뭐임?
똑똑한 인간
벤치마크는 뭐, 필요에 의해서 계속 만들어지는거고, 쓸만한지는 써보면서 판단하면 되고.
30%여 15%여
주관식이겠지?
왜 30퍼센트라했다가 15퍼센트가대나
수동 플러그인이 30%
gpt5 60점 넘을듯 ㄷㄷ
진짜 상식관련 문제인가보네.
gpt 7쯤돼야하나