트위터 대화 내용 (약간의 의역 포함)

Noam Brown (@polynoamial): LLM(대규모 언어 모델) 평가에 대한 이야기가 많은데, LLM이 어려워할 만한 평가 요소는 충분히 더 만들 수 있다고 봐요. 예를 들면:

  • 젤다 게임 깨기

  • 시주석 시장에서 수익 내기

  • 독창적이고 웃긴 스탠드업 코미디 세트 작성하기

저는 AI에 대해 낙관적이지만, 아직 갈 길이 멀어요.


Chubby ♨+ (@kimmonismus): 제 생각에는, 당신이 나열한 벤치마크들이 얼마나 오래 갈지가 문제인 것 같아요. '독창적이고 웃긴' 건 중기적으로 LLM에게 가장 어려운 과제가 될 것 같네요. 하지만 3년 뒤에는? '젤다 깨기' 같은 테스트가 얼마나 유효할까요?


Noam Brown (@polynoamial): 지금부터 3년도 안 걸릴 거라고 장담하죠. 제가 "갈 길이 멀다"라고 한 건 시간보다는 모델 성능 측면에서 한 말이었어요.