9일(현지시간) 파이낸셜타임스(FT)에 따르면 기업들은 '벤치마크'로 불리는 테스트를 통해 AI 모델의 능력을 평가하는데, 최근 기존 테스트로 신모델을 평가할 경우 정확도가 90%대로 지나치게 높아 새로운 테스트의 필요성이 부각되고 있다.
메타플랫폼(페이스북 모회사) 관계자는 "업계의 발전 속도가 극히 빠르다"면서 "측정 능력이 포화하기 시작했으며 (AI 신모델을) 평가하기가 점점 어려워지고 있다"고 말했다.
9일(현지시간) 파이낸셜타임스(FT)에 따르면 기업들은 '벤치마크'로 불리는 테스트를 통해 AI 모델의 능력을 평가하는데, 최근 기존 테스트로 신모델을 평가할 경우 정확도가 90%대로 지나치게 높아 새로운 테스트의 필요성이 부각되고 있다.
메타플랫폼(페이스북 모회사) 관계자는 "업계의 발전 속도가 극히 빠르다"면서 "측정 능력이 포화하기 시작했으며 (AI 신모델을) 평가하기가 점점 어려워지고 있다"고 말했다.
또 새로운 벤치마크 나오노 다 백점 나와야지 해결되는 agi
벤치마크에 만족하지 못하는 것은 실제 상황에서의 만족감과 불일치하기 때문
이제 작고 귀여운 AI를 위한 가벼운 퀴즈가 아닌 무자비한 실전용 평가 목록이 필요함
온다
너무 빠르다
가이아 arc 프런티어매스 심플벤치 이거 4개 인간 전문가 수준 도달하면 AGI라고 인정할수 있음.
그거 전부 전문가면 환각,장기기억,스토리베리r갯수 세는것 등등 전부 좆밥으로 가능해지는거?
빠른걸~