Noam Brown (@polynoamial): LLM(대규모 언어 모델) 평가에 대한 이야기가 많은데, LLM이 어려워할 만한 평가 요소는 충분히 더 만들 수 있다고 봐요. 예를 들면:
젤다 게임 깨기
시주석 시장에서 수익 내기
독창적이고 웃긴 스탠드업 코미디 세트 작성하기
저는 AI에 대해 낙관적이지만, 아직 갈 길이 멀어요.
Chubby ♨+ (@kimmonismus): 제 생각에는, 당신이 나열한 벤치마크들이 얼마나 오래 갈지가 문제인 것 같아요. '독창적이고 웃긴' 건 중기적으로 LLM에게 가장 어려운 과제가 될 것 같네요. 하지만 3년 뒤에는? '젤다 깨기' 같은 테스트가 얼마나 유효할까요?
Noam Brown (@polynoamial): 지금부터 3년도 안 걸릴 거라고 장담하죠. 제가 "갈 길이 멀다"라고 한 건 시간보다는 모델 성능 측면에서 한 말이었어요.
휴 겨울인줄
맞아. 이제 에이전트가 될테니까 약간 text에 한정된 벤치 말고 더 개선된 벤치 나오면 재미있을 것 같음. 마리오 다 깨는 데 걸리는 시간이라든지, 뭐 롤체 최고 티어라든지, 포켓몬 도감 다 채우는데 걸리는 시간이라든지.
모두 ‘3년 이내’