일리아가 최근에 언급한 논문인데 텍스트, 비디오, 오디오 등 모든 종류의 모델이 결국엔 동일한 내부 구조, 즉 월드 모델로 수렴한다는 내용을 담고 있음.
즉 시각장애인 모델도 생각하는 방식 자체는 눈 달린 모델과 비슷할 수 있다는 것
일리아가 최근에 언급한 논문인데 텍스트, 비디오, 오디오 등 모든 종류의 모델이 결국엔 동일한 내부 구조, 즉 월드 모델로 수렴한다는 내용을 담고 있음.
즉 시각장애인 모델도 생각하는 방식 자체는 눈 달린 모델과 비슷할 수 있다는 것
비디오랑 오디로를 학습자료로 써먹을 수 있다는게 중요한거지
ㅇㅇ 그게 의미 없다는 건 아닌데, 그와는 별개로 '얘가 텍스트로 생각하는 방식도 영향을 받지 않을까?' 하는 내 가설은 틀릴 수도 있을 것 같음
이번처럼 단일 신경망으로 통합된 모델은 어케 다를 지 궁금하네
인간의 뇌도 비슷하게 작동함. 선천적으로 혹은 마약같은 약물로 가끔 뇌의 연결이 꼬이면 공감각을 느낀다고 하잖아? 뇌 내부의 구역별로 사용하는 언어가 모두 동일한거임. 단지 해석하는 방식이나 입력이 통제되어 있을 뿐
즉 정보라는 건 형태만 다를 뿐 본질은 같다는 거네
아니었다면 멀티모달ai가 지금보다 훨씬 뛰어났고 이미 agi가 도래했을듯