요즘 AI모델 쭉 따라서 읽고있는데
seq2seq(RNN)과 일반 transformer모델이 어떻게 작동하는지는 알았음

근데 갑자기
BERT모델은 Transformer의 Encoder만 쓰고
GPT모델은 Transformer의 Decoder만 쓴다길래

문서찾아보려고 해도 '모델을 학습시키는 방법'만
많이나오고 모델이 실제 작동하는 방법을 자세하게 설명하진 않더라

그래서 나름대로 이해한게 맞는지 알고싶어서 글 써봄

1. Encoder only(BERT)는 학습시 수많은 데이터를 받아서
그 데이터에 상응하는 attention map을 만든다
1-1. 실제사용 시 Encoder only model은 attention map을 통해 하나의 context vextor를 내놓는다
1-1. 그 context를 다시 FC layer에 넣어서 classification 하는데 사용하거나
1-2. 긴 문장을 요약하거나 이 모델이 읽은 내용(데이터) 내에서 질의응답을 할 수 있다
1-3. 따라서 용도에 따른 Fine tuning이 필요하다
1-4. 하지만 encoder-only model이므로 'generation'(예측,추론)은 불가능하다?

2. Decoder only(GPT)에서
'원래 Transformer모델의 Decoder'는 2개의 input
Context vector와 input(학습시 ground truth / 실사용시 <start> token)을 받았으나
Decoder only는 context vector와 cross-attention 없이
(masked) self-attention과 FC layer만 반복한다
2-1. 학습된 FC layer로 인해
어떠한 sequence에 대해 다음 token을 예측(generation) 할 수 있다


AI 빡고수님들의 많은관심 감사합니다