Sora같은 생성모델은 아니고
비디오 이해를 잘 하는 인코더 모델인데
지금까지 공개된 것 중 가장 광범위한 동영상 데이터로 학습했다캄
5억개 넘는 영상
비디오 캡셔닝, QA, 디텍션, 분류 등등 다양한 작업을 수행가능험
기존 동영상 이해 벤치마크 Sota들과 비교. 많이 향상됨
특정 과학 분야에 특화된 모델들보다
동영상에 대한 이해도가 더 높았음
VideoPrism은 다양한 과학 벤치마크에서 도메인 전문가보다 뛰어난 성능을 발휘합니다.
VideoPrism의 상대적인 개선 사항을 강조하기 위해 절대 점수 차이를 표시합니다. 클래스 평균 상위 1 정확도를 사용하는 KABR을 제외하고 모든 데이터 세트에 대한 평균 평균 정밀도(mAP)를 보고합니다.
우리는 분류 및 현지화 작업을 다루는 기존 대규모 비디오 이해 벤치마크( VideoGLUE )에서 VideoPrism을 평가합니다. 우리는 (1) VideoPrism이 다른 모든 최신 FM보다 성능이 뛰어나며 (2) 지속적으로 2위를 차지한 다른 단일 모델이 없음을 확인했습니다. 이는 VideoPrism이 다양한 비디오 신호를 하나의 인코더에 효과적으로 묶는 방법(다양한 세분성의 의미부터 모양 및 모션 큐까지)을 학습했으며 다양한 비디오 소스에서 잘 작동한다는 것을 알려줍니다.
기존 모델들과의 비교... 다양한 분야에서 상당히 많이 성장하였다.
제프리 힌튼, 일리야 수츠케버 등등 많은 AI 전문가들은
비디오 학습이 AGI를 향한 필수 요건임을 강조허고 있음.
그런 면에서 비디오 이해 능력이 빠르게 정복되고 있는 것을 보니 기분이 좋다.
https://blog.research.google/2024/02/videoprism-foundational-visual-encoder.html
VideoPrism: A foundational visual encoder for video understandingVideoPrism: A foundational visual encoder for video understandingblog.research.googlehttps://blog.research.google/2024/02/videoprism-foundational-visual-encoder.html
저번주에 말한 빅뉴스 3 4개중 하나가 이건가?
크으으으으으 이거제 구글이 사료 뿌려주시네
지금부터 구글찬양을 시작한다
솔직히 내부에 들고있는거 모른다 치고 최근에 밖으로 공개하는것만 보면 구글이 더 맘에들음 AlphaGeometry로 올림피아드 금메달 Gemini 1.5로 이전 내용 까먹어버리는 문제 해결 + 1천만 토큰 그리고 오늘 이거 속도 돌아버린거같음
AI기술 잘 모르니 함부로 말 못하긴하는데, Sora는 기존 기술에서 스케일법칙이 여전히 ㅈㄴ잘먹힌다는걸 재확인한거 정도인거같은데 구글이 보여준것들은 뭔가 기본 원리를 바꾼 느낌이 들어서 좋음. 그냥 내(고졸) 감상임
실적도 실적인데 알파지오메트리 같은거 오픈소스로 내는게 개좋음 ㄹㅇ ClosedAI 십새끼들은 이제 국물도없는데
이게 특갤 오늘의 정보글 감이노
동영상으로도 로라 만들 수 있겠넹
세계최고의 분리수거 머신 만들 수 있는거냐