// arXiv 둘러보고 있는데 재밌는 검색 태그 있으면 추천 좀
요즘도 연구성과가 계속 나오고 있는 캡슐 네트워크 개념을 정리해보고 싶어서 글을 올림.
구글이 캡슐 네트워크(이하 캡슐넷)을 소개할 때 이미지 인식을 예로 들었어.
이미지 인식은 보통 이미지를 압축해주는 CNN이라는 신경망을 쓰는데, 이 CNN은 가로 세로 같은 패턴을 인식하게 설계되었기 때문에 원래 이미지에서 약간만 회전해도 전혀 다른 연산을 하게 된다는거야.
수평선에서 30도 돌리면 사선이라는 전혀 다른 패턴이 되니까.
구글은 이런 정보들을 처리하기위해 신경망이 불필요하게 커진다고 말을 해.
약간 회전한 숫자 1 이미지까지 처리하기 위해서는
- 수직선은 1이다.
- 약간 돌아간 사선도 1이다.
이렇게 여러 개를 기억해야하기 때문이야.
이 상황이 많은 신경망에서 나타나게 되는데, 이런 비효율성을 줄이면 학습도, 실행도 쉬워질 거라고 생각한거야.
그래서 구글은 캡슐넷을 만들었어.
일반 신경망은 정보를 처리해서 결과를 내놓는데
캡슐넷의 캡슐은 정보를 처리해서 정보를 내놓는거지.
그리고 캡슐을 연결해서 신경망을 만드는거야.
예를 들면 숫자 이미지에서 선을 추출하는 캡슐을 만들고
선에서 숫자를 추측하는 캡슐을 만들어서 연결시키는거지.
이러면 부분적으로 학습시킬수도 있으니까 학습이 더 빨라지겠지?
그걸 노린거야.
그리고 이 캡슐넷은 이런 저런 분야에서 활약을 하고있어.
// 사족1
캡슐을 분리해서 판매하는 플랫폼이 나올 것 같다는 생각이 들었다.
그림에서 윤곽선 분리하는 캡슐...
문장에서 중요 단어 분리하는 캡슐...
// 사족2
캡슐넷은 요즘 메타인 빅 넷 + 희소화 + 연산 감소랑 약간 결이 다른 것 같다는 생각이 든다.
둘 중에 어느쪽이 혁신을 일으킬까? 아니면 둘 다? 빅 캡슐이라니 가슴이 웅장해진다. 그런데 이번에 도조랑 세레브라스 나왔으니까 가능성 없는 얘기도 아니야 ㄷㄷ
// 사족3
예전에 비슷한 생각으로 특갤에 글 올렸던 적이 있는데,
논문이 먼저 나왔더라.
역시 공부는 중요해.
// 사족4
구글같은데는 캡슐 라이브러리를 만들어놓고 이것저것 조립하면서 놀고있겠지?
// 사족5
구글이 인공지능 개발 접근 방향(패스웨이) 발표한 거 보면 거리가 먼 것 같은데 설마 캡슐넷을 마스터한거려나? ㄷㄷ
// 사족6
생각해보니 캡슐넷은 태생부터 파멸적 망각(전에 배운거 까먹는거)에서 거의 면역 아닌가? 수확체증 가즈아??!
캡슐 네트워크는 시각쪽에서 pooling할때 나타나는 문제 때문에 힌튼이 제안했는데 문제는 이놈 그냥 cnn보다느리고 성능 안좋아서 지금은 cnn대체못함
겁나 느릴 것 같긴 해 ㅋㅋ
정보 ㄱㅅ