gpt라는 이름에서 탈피한 새로운 세대의 ai를 빨리 릴리즈했으면 좋겠음
오디오도 결국 텍스트 변환이라 목소리의 고저차, 음량, 호흡, 억양에서 오는 의미 전달이 안되고
이미지 인풋도 이미지에 대한 설명을 텍스트로 변환한 다음에 그걸 데이터베이스로 아웃풋을 내는거고
달리 붙여놓은 것도 그림 수정해달라하면
그림의 원형을 제대로 유지하거나 연속성을 갖고 수정하는 게 아니라
같은 프롬프트에 몇 가지 키워드만 약간 변화시킨 뒤에 새로 뽑아내는거고
구체적으로 내가 원하는 형태를 뽑아내기도 어려움
결국 모든 입력이 다 txt로 한 번 변환되어서 입출력되다보니까
한계가 너무 뚜렷함
환각이나 실질적인 이해, 창발성 이런 것도 아직 한참이긴 해도
그런 것들은 oai측에서 인지하고 개선해나가는 중인 것 같아서 그러려니 하는데
근데 멀티모달 쪽으로는 llm의 한계가 너무 뚜렷한,
지금 이 모듈형으로 구색만 맞춘 걸로 은근슬쩍 사람들 속여먹는 것 같아서
얘네가 입출력 수단에 대해 어떤 연구를 하고 있는지가 너무 답답함
아예 다른 차원의 ai가 빨리 등장해야 로봇에 집어넣든 일자리를 대체하든 하게 생겼음
테슬라에서 나오는 ai가 다른 접근법에서 나온 인공지능이지
4는 변환 시키는건데, 5는 직접 입력 제공 받는다는 카더라 본 것 같긴 해. 엄청 아님 말고였지만.
멀티모달은 제미나이가 어느정도 개선하지않았어? - dc App
이미지는 변환하는거 아닌데? 당연히 transformer에 다이렉트로 꽂는건데 뭔