말로만 푸니까 아리까리 한데 보니까 걍 token embedding은 1 x 30,000 one hot vector들이랑 30,000 x 768 학습 가능한 실수 가중치 행렬이랑 내적한거 말하는거 같은데 맞음? lookup table 쓴다음 쓱쓱 빼온걸수도 있겠지만 그놈이 그놈이고 결과물은 어차피 30,000 x 768 짜리 행렬로 BERT 자체로는 그냥 ELMo 같이 문맥에 따라 임베딩 생성하는 모델인데 여기에 레이어 하나 추가해서 여타 태스크에서 성능 잘 나왔다 정도인거 맞음?
[일반] BERT는 token embedding 맞게 이해한거임?
딥삣삐(14.35)
2025-11-28 12:14
추천 0
댓글 2
다른 게시글
-
멀티 gpu에서 실험 여러개 돌리기 vs ddp로 한개 돌리기 [1][일반] 망한인생(dconly36) | 25.11.28추천 0
-
타대 석사동안 탑티어 논문 highlight급 여러개 쓰면 [5][일반] 딥삣삐(222.235) | 25.11.28추천 0
-
오늘 드디어 tmux 4개 띄워봤어 [7][일반] 익명(vista200) | 25.11.27추천 3
-
CNN, RNN, Attention까지 다 했는데 이제 머함? [6][일반] 딥삣삐(140.248) | 25.11.27추천 0
-
타분야인데 ai 왤케 어려움? [5][일반] 딥삣삐(211.179) | 25.11.27추천 0
-
근데 7t짜리 multimodal model 만들려면 강좌 뭐 보면 되냐 [10][일반] 딥삣삐(218.150) | 25.11.26추천 0
-
finding == workshop임?? [2][일반] 딥삣삐(211.235) | 25.11.26추천 0
-
특슬람새끼들은 부모고혈을 얼마나 빨아먹는거냐 [3][일반] 딥삣삐(182.212) | 25.11.26추천 11
-
비전에서 llm쪽으로 넘어가본사람 있어? [2][일반] 딥삣삐(118.235) | 25.11.25추천 0
-
보통 연구 목적 워크스테이션은 뭐 구매하나요?? [7][❓질문] Taste_Bull..(tmflsdl7629) | 25.11.25추천 0
결과물이 30,000 x 768이 아니라 토큰에 따라 달라지는거네 쏘리 입력 토큰 길이 x 768
ㅇㅇ