영상이란게 사진의 연속이자나그럼 영상을 학습했다는건 매 프레임 단위마다 객체를 인식하고 학습을 한다는거임?그럼 단순 이미지 학습에 비해 말도안되는 비용과 용량 아냐? 이게 가능함? ㄷㄷ
유튜브는 단순히 영상만 있는게 아니라 '내용'이 있잖아 단순히 여러장에 사진을 학습 하려고 유튜브를 학습시킬거면 너무 아깝지 좀 말을 잘하거나 확실히 '내용'이 있는 전 세계 유튜브 영상을 학습시킨듯 - dc App