어쩌다가 보게 됐는데
AGI through Large-Scale, Multimodal Bayesian Learning - YouTube
AGI Through LargeScale Multimodal Bayesian Learning Brian Milch (slidetodoc.com)
2008년이면 딥러닝이 유명해지기도 전인데
이때 나온 구상이 이제 실현되고 있지
AGI에 근접한 시스템의 등장은 멀지 않았다고 생각함. 그게 진정한 AGI냐 아니냐는 논쟁거리겠지만.
구글이 최근에 PolyViT을 내놨는데 딥마인드의 Perciever IO랑 뭐가 다른지는 잘 모르겠지만 아마 더 발전했겠지?
Google, Cambridge U & Alan Turing Institute Propose PolyViT: A Universal Transformer for Image, Video, and Audio Classification | Synced (syncedreview.com)
[2111.12993] PolyViT: Co-training Vision Transformers on Images, Videos and Audio (arxiv.org)
여기에 메타버스까지 제대로 확산 보급되면 가상공간의 정보량과 다양성, 복잡성이 현실세계를 능가할거고 그런 데이터와 환경에서 학습하고 활동하고 인간들과 상호작용한 AI에게 있어 오히려 현실세계의 정보를 처리하는 건 상대적으로 단순하고 손쉬울지도 모르겠다.
생명체가 멀티모달리티 데이터에 노출되면서 의식이 탄생했으니 기계도 충분히 가능할거라 봄
PolyViT 초록 번역 학습 가능한 거의 모든 매개변수를 공유하면서 여러 양식과 데이터세트를 처리할 수 있는 단일 변환기 모델을 훈련할 수 있습니까? 이 질문에 답하는 이미지, 오디오, 비디오로 훈련된 모델인 PolyViT를 소개합니다. 단일 양식에 대해 서로 다른 작업을 공동 훈련함으로써 각 개별 작업의 정확도를 개선하고 5개의 표준 비디오 및 오디오 분류 데이터 세트에서 최첨단 결과를 얻을 수 있습니다. 여러 양식 및 작업에 대한 PolyViT 공동 교육은 훨씬 더 매개변수 효율성이 높은 모델로 이어지며 여러 도메인에 걸쳐 일반화되는 표현을 학습합니다. 또한 데이터 세트의 각 조합에 대해 하이퍼파라미터를 조정할 필요가 없지만 표준 단일 작업 훈련의 하이퍼파라미터를 간단히 조정할 수 있으므로 공동 훈련이
구현하기에 간단하고 실용적임을 보여줍니다.
Perciever IO은 멀티모달 모델이 아님,PolyViT:얘는 멀티 모달임,Perciever IO는 모든 유형의 데이터를 처리할수 있지 멀티모달은 아님