1ebec223e0dc2bae61abe9e74683766c7ee4c788f7b559272f8d6b0d23bb09c4d6449d798f95ef14bc2502329276d9dcd6


빨간색 글자가 현재읽고 있는 단어고

파란색글자가 활성화된거라는데

저 활성화 기준이 빨간색 글자와의 연관성을 뜻하는게 맞냐?

그리고 그 연관성이라는게 "같이 등장하는 단어들"이 맞냐?

그러니까 같이 등장하는 단어들이 활성화 된거아님?

셀프어텐션도 저 문장 달랑 한개만 가지고는 할수없는거 아님?

다른 여러 문장을 배우고 "같이 등장할 확률이 높은 단어"를

제시하는게 어텐션아님?



1ebec223e0dc2bae61abe9e74683766d111567bef40d08562dd3e24a4c7156d8665f5ffc062f7dd0aaa233


그런데 이 두번째 짤에서 셀프어텐션의 예시는

그냥 분포가설 써서 일치하는 단어를 알아내고있음


첫번째 짤은 내추측으로는 같이 등장하는 단어들을 강조.

두번째 짤은 내추측으로는 일치하는 단어들을 강조.


첫번째 짤과 두번째 짤 둘다 셀프어텐션이라면 공통점이 있겠지.

그 공통점은 내 추측으로는 두 문맥을 비교해서 일치하는 단어가 있으면 강조하는거 같다

시발 어텐션원리 좀 그냥 간단하게 설명해놓은게ㅜ없네

왜이러냐? 연구자들 이거머 시련의 일종이냐? 아니면 일부러 못알아먹게 존나어렵게 QKV가 어쩌고 씨발

진심 분포가설도 어쩌다찾은건데 기본원리는 존나쉬우면서

그걸 구현한다고 개피똥싸놓은거만 올려놓고

왜 핵심사실을 안말하냐고 죽이고싶네

- dc official App