0. 서론

https://github.com/Mids/TransformerProject

레포 이름에 j가 빠져서 프로엑트였던걸 이제야 알고 수정함;;

이번꺼는 좀 짧습니다.



1. 본론



인코더 안에 이거 구현할거임




주석으로 다 써있다.


1. 인풋을 Multi-Head Attention에 넣고

2. 결과에 인풋 더하고나서 LayerNorm을 해준다.

3. Feed Forward에 다시 넣어주고

4. Attention의 아웃풋을 더해주고 또 LayerNorm


저 norm은 같은걸로 써도 별로 상관 없을거같은데 이리저리 구글링해보니까 다들 두개로 나눠서 했더라

처리하면서 내부의 뭔가가 바뀌거나 하나..?

정확히 어떻게 돌아가는건지 나도 모르겠음...

NLP고수의 조언이 필요하다ㅠㅠ