난 그게 가능한건지부터 의심스러움데이터 학습을 한다는게 아예 ai의 근간 자체에 융합이 되는 방식인거 아닌가?학습 데이터만 뭐 어디 따로 구분가능한곳에 보관이 되기라도 하나? 아닌거같은데
txt쪽은 맘먹고 보관하면 꽤 많은 양을 보관 가능함 리비전별로
그냥 모델 학습 때 사용한 텍스트, 이미지 파일이 학습 데이터임
그니까 그걸로 빌미 안 잡히고싶으면 학습만 하고나서 버릴텐데 뭐 어떻게 잡아냄
저번 챗GPT<-구글 공격 사례처럼 몇몇 작은 예외 이외엔 강제로 추출하긴 힘들거고 내놓으라고 멱살을 잡겠지
그런 의미라면 못 잡아냄. 모델 파라미터만 보고 학습 데이터 역추적은 못함.
그래서 합법 데이터인 증거 없으면 전부 불법이다 하려고 하잖아. EU가.
ㄹㅇ 그런 얘기도 있었음? 설마 eu가 그렇게 또라이일리가 그런식이면 꼭 ai 아니라도 세상 모든 기업이 자기들 불법적인 짓 안 했다는 증거를 제출해야하는 꼴인데
데이터셋 공개하라는게 그러한 요구의 연장선이라고 알고 있음. 지금 단계의 기술력에서는 죄다 불법인 게 뻔하니깐...