오픈AI가 자사 AI모델인 ‘GPT-4′를 훈련하기 위해 100만 시간 이상의 유튜브 영상을 무단 활용했다고 6일(현지 시각) 뉴욕타임스가 보도했다.
뉴욕타임스는 “오픈AI는 2021년부터 AI훈련에 쓰일 양질의 텍스트 데이터 부족에 직면했다”며 이를 타개하기 위해 영상에서 자동으로 스크립트를 추출하는 ‘위스퍼(Whisper)’라는 소프트웨어를 개발했다고 전했다. 위스퍼를 사용해 유튜브 영상에서 말소리를 텍스트로 받아적고, 이를 ‘GPT-4′의 AI훈련에 사용했다는 것이다.
https://n.news.naver.com/article/023/0003826988?lfrom=twitter오픈AI, GPT-4 훈련 위해 유튜브 영상 100만 시간 무단 사용구글·메타도...빅테크의 데이터 사용 실태 오픈AI가 자사 AI모델인 ‘GPT-4′를 훈련하기 위해 100만 시간 이상의 유튜브 영상을 무단 활용했다고 6일(현지 시각) 뉴욕타임스가 보도했다. 뉴욕타임스는 “오픈AIn.news.naver.com
뉴욕타임스는 “오픈AI는 2021년부터 AI훈련에 쓰일 양질의 텍스트 데이터 부족에 직면했다”며 이를 타개하기 위해 영상에서 자동으로 스크립트를 추출하는 ‘위스퍼(Whisper)’라는 소프트웨어를 개발했다고 전했다. 위스퍼를 사용해 유튜브 영상에서 말소리를 텍스트로 받아적고, 이를 ‘GPT-4′의 AI훈련에 사용했다는 것이다.
https://n.news.naver.com/article/023/0003826988?lfrom=twitter오픈AI, GPT-4 훈련 위해 유튜브 영상 100만 시간 무단 사용구글·메타도...빅테크의 데이터 사용 실태 오픈AI가 자사 AI모델인 ‘GPT-4′를 훈련하기 위해 100만 시간 이상의 유튜브 영상을 무단 활용했다고 6일(현지 시각) 뉴욕타임스가 보도했다. 뉴욕타임스는 “오픈AIn.news.naver.com
유튜브 데이터로 잼민이 같은 개쓰레기 따위나 만들거면 걍 사회를 위해 공짜학습으로좀 풀어라 치타새끼들아 - dc App
일리야: 데이터는 부족하지 않을 것 같다(무단사용하면 되기 때문에)
샘게이트만:유튜브 프리미엄 끊고 했으니 무단아니라규! >
뉴욕타임즈 얘들 작정하고 오픈ai패노
프리미엄 끊었다잖아 한잔해
근데 이건 유튜브 영상 데이터 사용이 아니라, 유튜브 텍스트 데이터 사용이네.... 양질 텍스트 데이터가 필요했다는건데..... ㅇㅎ 강의 영상들에서 스크립트 따면 양질 데이터 되는구만? 똑똑하네.
NYT는 걍 척지기로 결심했나보네 ㅋㅋㅋ
엔비디아가 응디 밀어주는데 규제가 뭐 어쩔건데 ㅋㅋ