기존 gpt4는 세상을 텍스트로 이해하는데 gpt4o는 세상을 시각, 청각, 텍스트로 이해함. 사실상 완벽하게 이해하므로 AGI라고 봐야 됨.
gpt4o가 자원 소모가 아주 적은데 비디오, 오디오는 소수에게만 공개하는 중임. 이건 AGI라서 그러는거임. 지들도 무슨일이 벌어질지 모르는거지.
AGI를 만들었지만 정렬에는 실패한 듯. gpt4o는 AGI의 극단적인 양자화모델 같음. 양자화할수록 효율은 극대화 하지만 성능은 급격하게 감소함. 특히 추론능력
ㄴㄴ 비전 벤치 보면 아닉 객체 인지 좀 딸림
한 10년전 행사에서 공개했으면 모두가 agi라 했겠지. AGI의 정의에 대한 골대는 계속 옮겨지고있음
Llm이 제대로 이해하는 거 맞냐는 의견 아직 분분한디
지능형 안티....
일단 Gpt4O부터는 gpt4 패러다임에서 벗어나기 시작한것 같음
ㄴㄴ 아직
일단 첫문장부터 추측이 들어갔잖아. '이해함' << 이거 빼셈. 이미지나 오디오나, 세상을 이해하는데 있어서 정보손실이 적어지긴 하겠지만, 결국 텍스트나 이미지나 오디오나 컴퓨터는 숫자로 이해하는거고 text 이해하던 LLM이 오디오로 데이터 타입만 바꾼거지. '이해'의 영역은 아직 개선해야지.
맞는 말이다. 비디오 학습의 돌파구 찾았으면 gpt5 매우 기대됨. - dc App