헬렌켈러마냥 눈도 안보이고 귀도 안들리는 상황에서 오직 설리번쌤이 손바닥에 적어주는 촉각만 가지고
태양이란 무엇이고 비는 왜 내리고 시공간은 무엇이고 이런걸 이해하는거잔음...
그런점에서 난 멀티모달 아닌애들은 한계가 있다고 생각하고,
이런 한계가 있음에도 그럴듯한 답변을 해주는게 굉장하다 생각함
그래서 오히려 리얼월드에 물리적 실체가 없는 수학이나 코딩 이런쪽을 먼저 공략한걸까 싶기도함
헬렌켈러마냥 눈도 안보이고 귀도 안들리는 상황에서 오직 설리번쌤이 손바닥에 적어주는 촉각만 가지고
태양이란 무엇이고 비는 왜 내리고 시공간은 무엇이고 이런걸 이해하는거잔음...
그런점에서 난 멀티모달 아닌애들은 한계가 있다고 생각하고,
이런 한계가 있음에도 그럴듯한 답변을 해주는게 굉장하다 생각함
그래서 오히려 리얼월드에 물리적 실체가 없는 수학이나 코딩 이런쪽을 먼저 공략한걸까 싶기도함
LLM이 미친새끼는 맞음 ㅋㅋ. 시각, 청각, 촉각 장애인한테 뇌파로만 신호보내고 그정도 성능 보여주는거라 보면 됨 ㅋㅋㅋ - dc App
사실 멀티모달도 진짜 보는게 아니라 사진을 토큰화시켜서 분석하는거지 - dc App
LLM 이 미친새끼
그 뭐더라 무슨 용어가 있던데, 네가 말한것처럼 사진에 대한 정보를 그걸 무슨 중간에 토큰화해서 인식하는거랑, 그냥 그 RGB 픽셀값 그대로 인식하는거. 옛날에 advanced voice가 그런식으로 동작한다고 들었음
토큰화가 아니라 벡터임
그래서 현실세계에서 더 활용 가능한 방식으로 발전할 듯
ㅎㄷㄷ