0. 서론

https://github.com/Mids/TransformerProject

레포 이름에 j가 빠져서 프로엑트였던걸 이제야 알고 수정함;;

이번꺼는 좀 짧습니다.



1. 본론


viewimage.php?id=2ab4c42ef0d0&no=24b0d769e1d32ca73ced82fa11d02831fe384ecd5bf5471a0304a0eb0c93158624431c1ad6cb4c45401eab9288a8cac5e0f3345940cb9121c42dd4c905a8a6896e2b


인코더 안에 이거 구현할거임



viewimage.php?id=2ab4c42ef0d0&no=24b0d769e1d32ca73ced82fa11d02831fe384ecd5bf5471a0304a0eb0c93158624431c1ad6cb4c45401eab9288a8cac5e0f3345940cb9922c52cd49e52a1a6896090


주석으로 다 써있다.


1. 인풋을 Multi-Head Attention에 넣고

2. 결과에 인풋 더하고나서 LayerNorm을 해준다.

3. Feed Forward에 다시 넣어주고

4. Attention의 아웃풋을 더해주고 또 LayerNorm


저 norm은 같은걸로 써도 별로 상관 없을거같은데 이리저리 구글링해보니까 다들 두개로 나눠서 했더라

처리하면서 내부의 뭔가가 바뀌거나 하나..?

정확히 어떻게 돌아가는건지 나도 모르겠음...

NLP고수의 조언이 필요하다ㅠㅠ