익숙하지 않은 특붕이들은 가볍게 읽으셈
이번 딥넷 논문에 나온 어텐션 구조임.
참고로 어텐션은 신경망이 일에 집중하는 방법이라고 생각하면 돼.
(참고로 '노베를 위한 트랜스포머'에 나온 자동 입력 강화기랑 같은 친구야!)
복잡한 어텐션일수록 성능은 좋지만, 계산하는 시간이 오래 걸리겠지?
참고로 아래는 트랜스포머 처음 나왔을때의 어텐션이야.
구조는 비슷하지만 확실히 복잡해졌다는 걸 알 수있어.
QKV 보면 앞뒤로 뭐가 더 붙어있는데,
이건 어텐션 신경망 안에 또 다른 신경망을 넣었다는거지.
층을 늘렸으면 성능이 부담될 만 한데
마이크로소프트는 오히려 어텐션을 더 복잡하게 만들었지.
빠르게 실행되는 것 보다 안 될 일을 가능하게 만드는 게 더 중요하다는거야.
노베를 위한 트랜스포머:
https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=57914
이번 딥넷 논문:
https://arxiv.org/abs/2203.00555
트랜스포머 처음 나온 논문 '어텐션이 필요한 전부임':
https://arxiv.org/abs/1706.03762
가중치(파라메터)가 늘어났네. - dc App
ㅇㅇ 코랩 프로 돌리는 특붕이로서는 상상도 못 할 방법임
아, 물론 층을 늘리면서도 간단하게 복잡도를 줄일 수 있는 방법이 논문에 있대. 그건 아직 좀 더 읽어봐야 됨
아무래도 DeepNorm이라는 놈이 핵심인 것 같은데
딥한 놈이군
딥한 놈이지. 수식이 이것저것 있어서 해독에 시간이 들 듯