밑에 "스타트업 개발자 입장에서 본 alphacode"라는 글쓴 사람임.


최근에 핫한 이슈였는데, 여기 특갤에는 안올라 온 것 같아서 글 써봄.

이미지 쪽은 agi랑은 관련이 적어서 그런가?


이런 ai학계 관련된 글 사람들 좋아하나?

앞으로는 간단하게 논문같은 것도 리뷰해보려고 하는데, 좋아하려나 모르겠네.

관심 있는 분들 추천 부탁드림.


이번 이야기는 이미지 인식 분야에 관한 이슈임.


자 먼저 CNN에 대해 알아보자...

알아볼 필요가 있나? 딥러닝 공부하면 가장 먼저 공부하는 거라,

우리 특갤에는 모르는 사람이 없다고 생각하고 넘어갈게.

이미지 인식분야에서는 완전 초기 모델이지.


이미지 인식 분야에서 가장 핫한 모델은 Vit야

vision transformer의 약자인데, nlp에서 피바람을 불러온 transformer를 이미지 분야에 적용시킨 거지

(transformer는 gpt3같은 언어 모델의 핵심 기술, 나중에 기회되면 간단하게 설명하고 싶네)


그런데, 오늘 주가 폭락한 meta에서 한 논문이 올라오게 되지.

바로 ConvNext라는 cnn으로만 구성된 이미지 인식 모델인데, vit를 성능으로 발랐다는 거임.





아래 사진은 imageNet이라는 테스트에 대한 성능을 나타낸 거임.

다른 모델들 다 transformer인데, 혼자 CNN달아논거 ㅋㅋㅋㅋㅋㅋㅋㅋㅋ





논문을 자세히 보지는 않았지만, CNN에서 근본적인 메커니즘을 바꾼건 아니고,

vit와 같은 최근 연구를 통해서 발견한 기법들을 적용했다고 말하고 있음.

누군가는 skill에 관한 논문이라고도 함.


아무튼 이렇게 transformer가 다 잡나했더니, cnn이 또 이악물고 기어올라온 거임 ㅋㅋ

이러니 트위터에서 연구원들끼리 토론이 진행되는 상황이 온 것.


정말 딥러닝은 알면 알수록 어렵고 재미있는 듯.

또 재미있는 이야기 있으면 전달하러 옴 ㅇㅇ,


뭐 별 이야기 안했지만 잘못된 부분이 있으면, 언제든 반박, 지적 환영!