gpt라는 이름에서 탈피한 새로운 세대의 ai를 빨리 릴리즈했으면 좋겠음

오디오도 결국 텍스트 변환이라 목소리의 고저차, 음량, 호흡, 억양에서 오는 의미 전달이 안되고

이미지 인풋도 이미지에 대한 설명을 텍스트로 변환한 다음에 그걸 데이터베이스로 아웃풋을 내는거고


달리 붙여놓은 것도 그림 수정해달라하면

그림의 원형을 제대로 유지하거나 연속성을 갖고 수정하는 게 아니라

같은 프롬프트에 몇 가지 키워드만 약간 변화시킨 뒤에 새로 뽑아내는거고

구체적으로 내가 원하는 형태를 뽑아내기도 어려움


결국 모든 입력이 다 txt로 한 번 변환되어서 입출력되다보니까

한계가 너무 뚜렷함


환각이나 실질적인 이해, 창발성 이런 것도 아직 한참이긴 해도

그런 것들은 oai측에서 인지하고 개선해나가는 중인 것 같아서 그러려니 하는데

근데 멀티모달 쪽으로는 llm의 한계가 너무 뚜렷한,

지금 이 모듈형으로 구색만 맞춘 걸로 은근슬쩍 사람들 속여먹는 것 같아서

얘네가 입출력 수단에 대해 어떤 연구를 하고 있는지가 너무 답답함


아예 다른 차원의 ai가 빨리 등장해야 로봇에 집어넣든 일자리를 대체하든 하게 생겼음