영상 학습 계산량을 줄이는 알고리즘이 나와줘야 AI가 눈을 뜨고 세상을 빨리 이해하게 된다
3차원 시공간에서 벌어지는 것들을 단어와 연결을 시켜야돼
장기기억이 되어야 영상학습이 되는거임 용량사이즈부터가 다른데 저걸 전체맥락고려하면서 적절하게 텍스트로 디테일 요약해내려면 장기기억은 무조건 필수임
장기기억안되면 결국 GPT랑 연결안되어서 그림AI랑 똑같이 컨트롤넷 발전못하고 결국 발렌시아가밈만들떄나 쓰는 수준 벗어나기가 매우힘듬
장기기억이 되어야 영상학습이 되는거임 용량사이즈부터가 다른데 저걸 전체맥락고려하면서 적절하게 텍스트로 디테일 요약해내려면 장기기억은 무조건 필수임
장기기억안되면 결국 GPT랑 연결안되어서 그림AI랑 똑같이 컨트롤넷 발전못하고 결국 발렌시아가밈만들떄나 쓰는 수준 벗어나기가 매우힘듬