이때까지 멀티모달이라고 하면 사진 생성이랑 텍스트 생성 ai 합치고 여기에 추가로 동영상도 넣을 수 있을지도??? 정도 였는데


일찍이 하사비스나 일부 전문가가 지적한 거처럼 곧 촉각이나 동작성 지능 관련 데이터가 함께 들어간 LMM(라지 멀티모달 모델) 시대가 올 거


머스크도 "오픈 ai는 텍스트부터, 우리는 시각 데이터부터 시작해왔는데 장기적으로는 누가 이기나 해보자" 하는 식으로 언질을 던지기도 했고


뭣보다 오픈ai의 LLM이 주도하는 ai시장에서 구글이랑 테슬라도 뭐라도 해야하기 때문에 저렇게 공개적으로 멘트 던진 이상 


LLM 분야에서는 일단 뒤졌지만 저런 시각, 동작, 촉감 데이터랑 텍스트 인풋을 결합하는 작업에 열심히 착수하고 있을 거라고 생각함


더 이상 3년동안 개발 휴가니 뭐니 같은 거 가질 여유는 없다 이거야