비디오 몇프레임을 줘놓고(소리 정보도 같이) 다음 프레임 몇장 동안에 일어날 일을 맞춰봐라 하면

잘은 모르겠는데 뭔가 쓸만한 놈이 나올 수도? 있지? 않을까? 아님?말고?


일단 시청각으로 정답/오답 맞추기부터 시작하고

어떤 일이 일어났나, 일어날까 를 텍스트화해서 맞추고.. 이건 라벨링이 좀 힘들거고


마지막으론 휴머노이드의 신체가 어떻게 움직여야 자연어로 설정된 목적을 달성할지를 맞추게 하면...

어떤 놈이 만들어질까?