GPT 성공은 지구상의 모든 문서에서 다음 단어를 예측하는 학습방법일수 있다Transformer가 아니라 LSTM, CNN 으로도 그 많은 문서들의 다음 단어를 학습하면 큰 성과를 낼수 있을 것이다
무식한소리 - dc App
개인적으로는 모델 아키텍쳐 관련해서는 skip connection, self-attention, mlp의 적절한 조합이 한 몫 했다고 봄 - dc App
헛소리임. LSTM은 기억력도 안좋을 뿐더러 Serial 연산이라서 Transformer 만큼 대규모 연산을 빠르게 하지도 못함. CNN도 그 자체로는 연속형 데이터 처리도 못하고
하이에나는 웃고있다...
https://arxiv.org/abs/2302.10866
하이에ㅡ나ㅡ
CNN은 될것도 같애. 1D conv 형태로 긴 토큰도 빠르게 학습 할수 있지 않을까? 다만 어텐션과 다르게 인접한 단어위주로 따져보니까 멀리 떨어져 있는 단어관계 중요성을 놓칠지도 몰라
Hyena Hierarchy 논문에서 LSTM 언급하는건 안보이는데, 관련 있는건가?