념글 저거 ㅇㅇ
[일반] 트랜스포머라랑 스케일이랑 먼 관계임?
익명(sphere9209)
2024-03-25 14:59
추천 0
댓글 5
다른 게시글
-
누가기도좀해주라 [3][일반] 락(61.105) | 24.03.25추천 0
-
난 10년 정도까진 버틸 수 있음 [3][일반] 익명(180.226) | 24.03.25추천 0
-
영어 잘하고 싶은데 어떻게 공부함? [15][일반] 익명(110.46) | 24.03.25추천 1
-
클로드3 왜 자꾸 대화 한계치에 뻘리 도달함 [5][일반] 질문봇(ace8052) | 24.03.25추천 0
-
나 피아노 잘치고싶은데 [3][일반] 익명(180.227) | 24.03.25추천 0
-
죽으면 어디로 가는걸까 [34][일반] WHY?(125.143) | 24.03.25추천 0
-
Asi이후 유토피아가 올진 모르겠음 [1][일반] 익명(sisibalbal0) | 24.03.25추천 0
-
속보) 알트먼 : 튜링 테스트 통과했다. [23][일반] 익명(1.244) | 24.03.25추천 14
-
특이점을 예언한 커즈 와일.. [5][일반] 익명(1.244) | 24.03.25추천 1
-
클로드3 대학과제 가능한 성능인가? [1][일반] 익명(110.46) | 24.03.25추천 0
트랜스포머는 어텐션매커니즘 쓴 새로운 딥러닝 모델이고, 념글 저거는 정수 정답을 뒤집었더니 정확도가 100%로 떡상한 이유에 대해서 설명하고있음. 이처럼 한계가 명확한 부분이 있으니 Scale is all you need가 불가능하다는 얀르쿤의 의견에도 어느정도 일리가 있다고 동조하고있는거임.
정확도가 올라가면 좋은거 아님? 그러면 가 방식이 더 우월하니깐 트랜스포머는 열등한 방식이라는거?
ㄴㄴ 그게 아니라 어텐션 메커니즘의 특성때문에 저런 현상이 나타난것뿐임. 스케일을 늘려도 그런부분이 개선되지 않으면 AGI는 못간다. 이게 얀르쿤이 줄창 주장하고있는거고.
쉽게 설명하면 트랜스포머는 문장 전체를 보고 어텐션으로 중요도를 부여하는 방식이라 문장은 잘 뽑아도 덧셈의 올림은 이해못함. 그런데 이 어텐션 매커니즘의 특성때문에, 8+8=16이라고 학습시킬때보다 8+8=61이라고 뒤집어서 학습시켰을때 올림에 대해서 잘 이해하는 현상이 나타났다는거임. 왼쪽에서 오른쪽으로 읽는 Autoregressive 특성때문에 높은 자릿수를 뒤로 보냈을때 가중치가 높아져서 올림을 잘 계산하게 된것같다고 추정하고있는데, 정확한 이유까지는 나도 모르겠음. 너처럼 정확도 올라가니까 이 방식 쓰자는 댓글도 보였는데, 결국 트랜스포머의 구조적 한계를 극복 못하면 임시방편에 불과함. 그래서 자꾸 아키텍처 개선 얘기하는거.
아 몬말인지 이해함 ㅇㅋㅇㅋ