GPT3부터지
아직 우리는 gpt3의 여파속에 있구나
순서는 대충 기초가 되는 논문 Transformer -> ELMo(Transformer 기반아님 LSTM기반임) -> GPT1 -> BERT -> GPT2 ->RobertA -> T5 ->GPT3 -> 하이퍼클로바 -> 메가트론일걸
참고로 GPT 시리즈랑 BERT 시리즈랑 T5시리즈랑 각각 사용방법이다름
GPT는 보통 대답 이어쓰는 생성에 쓰이고 BERT는 텍스트 임베딩 T5는 보통 질의 응답 하는 쪽의 모델에서 사용됨
우와 엄청 잘아네 메가트론은 뭐임?
엔비디아랑 마이크로소프트가 합작해서 만든 5천억 파라미터짜리 모델임.대충 GPT3가 1750억이니까 3배정도 됨
메가트론에서 기존모델대비 추가된기능은 없음?
없음 그런거
파라미터 늘어난게 기능이라면 기능이지
GPT3부터지
아직 우리는 gpt3의 여파속에 있구나
순서는 대충 기초가 되는 논문 Transformer -> ELMo(Transformer 기반아님 LSTM기반임) -> GPT1 -> BERT -> GPT2 ->RobertA -> T5 ->GPT3 -> 하이퍼클로바 -> 메가트론일걸
참고로 GPT 시리즈랑 BERT 시리즈랑 T5시리즈랑 각각 사용방법이다름
GPT는 보통 대답 이어쓰는 생성에 쓰이고 BERT는 텍스트 임베딩 T5는 보통 질의 응답 하는 쪽의 모델에서 사용됨
우와 엄청 잘아네 메가트론은 뭐임?
엔비디아랑 마이크로소프트가 합작해서 만든 5천억 파라미터짜리 모델임.대충 GPT3가 1750억이니까 3배정도 됨
메가트론에서 기존모델대비 추가된기능은 없음?
없음 그런거
파라미터 늘어난게 기능이라면 기능이지