Sora같은 생성모델은 아니고

비디오 이해를 잘 하는 인코더 모델인데

지금까지 공개된 것 중 가장 광범위한 동영상 데이터로 학습했다캄

5억개 넘는 영상


비디오 캡셔닝, QA, 디텍션, 분류 등등 다양한 작업을 수행가능험



기존 동영상 이해 벤치마크 Sota들과 비교. 많이 향상됨


특정 과학 분야에 특화된 모델들보다

동영상에 대한 이해도가 더 높았음


VideoPrism은 다양한 과학 벤치마크에서 도메인 전문가보다 뛰어난 성능을 발휘합니다.

VideoPrism의 상대적인 개선 사항을 강조하기 위해 절대 점수 차이를 표시합니다. 클래스 평균 상위 1 정확도를 사용하는 KABR을 제외하고 모든 데이터 세트에 대한 평균 평균 정밀도(mAP)를 보고합니다.

우리는 분류 및 현지화 작업을 다루는 기존 대규모 비디오 이해 벤치마크( VideoGLUE )에서 VideoPrism을 평가합니다. 우리는 (1) VideoPrism이 다른 모든 최신 FM보다 성능이 뛰어나며 (2) 지속적으로 2위를 차지한 다른 단일 모델이 없음을 확인했습니다. 이는 VideoPrism이 다양한 비디오 신호를 하나의 인코더에 효과적으로 묶는 방법(다양한 세분성의 의미부터 모양 및 모션 큐까지)을 학습했으며 다양한 비디오 소스에서 잘 작동한다는 것을 알려줍니다.


기존 모델들과의 비교... 다양한 분야에서 상당히 많이 성장하였다.

제프리 힌튼, 일리야 수츠케버 등등 많은 AI 전문가들은

비디오 학습이 AGI를 향한 필수 요건임을 강조허고 있음.

그런 면에서 비디오 이해 능력이 빠르게 정복되고 있는 것을 보니 기분이 좋다.

https://blog.research.google/2024/02/videoprism-foundational-visual-encoder.html

VideoPrism: A foundational visual encoder for video understandingVideoPrism: A foundational visual encoder for video understandingblog.research.google


https://blog.research.google/2024/02/videoprism-foundational-visual-encoder.html