영상이란게 사진의 연속이자나


그럼 영상을 학습했다는건 매 프레임 단위마다 객체를 인식하고 학습을 한다는거임?


그럼 단순 이미지 학습에 비해 말도안되는 비용과 용량 아냐? 이게 가능함? ㄷㄷ