말로만 푸니까 아리까리 한데 보니까 걍 token embedding은 1 x 30,000 one hot vector들이랑 30,000 x 768 학습 가능한 실수 가중치 행렬이랑 내적한거 말하는거 같은데 맞음? lookup table 쓴다음 쓱쓱 빼온걸수도 있겠지만 그놈이 그놈이고 결과물은 어차피 30,000 x 768 짜리 행렬로 BERT 자체로는 그냥 ELMo 같이 문맥에 따라 임베딩 생성하는 모델인데 여기에 레이어 하나 추가해서 여타 태스크에서 성능 잘 나왔다 정도인거 맞음?