이제 AI가 인터넷에 올리는 정보가 더 많아지면 AI의 학습을 쓸데없는걸로 해서 애가 더 멍청해지지 않을까 이런 고민을 하는사람들이 있던데
사실 지금 인터넷에도 유의미한 정보가 많나? 다시 한번 생각하게됨
지금 인터넷에 있는 정보들도 병신 글 많은디
이제 AI가 인터넷에 올리는 정보가 더 많아지면 AI의 학습을 쓸데없는걸로 해서 애가 더 멍청해지지 않을까 이런 고민을 하는사람들이 있던데
사실 지금 인터넷에도 유의미한 정보가 많나? 다시 한번 생각하게됨
지금 인터넷에 있는 정보들도 병신 글 많은디
그래서 요즘 사전 학습을 잘 안하잖아 Gpt5도 컷오프가 2024까지고
LLM 초기에 트위터 데이터도 학습에 쓰인다는 이야기 있었는데, 잘 모르는 애들은 '트위터에 똥글도 많고 거기 사상 이상한 거 많던데 그런 거 학습하면 성능 떨어지는 거 아니냐?'라는 반응을 하던데. 인터넷에 있는 데이터를 쓴다고 똥글 쓰는 게 아니고, 죄다 전처리를 함. 특히나 트위터는 미국 지식인 애들이 많이 쓰고, 글을 압축해서 써야 하다보니 퀄리티가 높다는 말이 있었음. 그래서 머스크가 트위터 사고 바로 AI 접근 막아버린 이유라는 말도 있었고. 넷상에 AI글이 많아져서 그걸 학습하면 또 바보된다. 이런 말도 있었지만, 역시나 전처리 잘 하면 문제 안 되고. 일리야는 2년 전에 이미 합성 데이터로도 잘 할 수 있다고도 말해왔었고. 요즘 연구결과들도 그렇고. 인터넷 똥글 학습 문제는 신경 안 써도 될듯