최근에 oai에서 박사들 뽑았는데박사급 인재들이 고급 데이터 생산해서 ai가 학습하면 되는건데그럼 박사 수준의 LLM이 탄생할 거고 그게 초기 agi 되겠지- dc official App
레딧이나 트위터, 비영어권은 디시나 5ch 이런 저질데이터도 좀 학습하면 좋겠음
저질 데이터 학습해도 성능 떨어지지 않으면 학습해도 될 듯함 - dc App
그럼 논문으로만 학습하면 AGI 되냐여
매년 쏟아지는 논문만 해도 엄청 많은데 왜 데이터 부족 얘기가 나오는지 몰겠음 - dc App
데이터가 조 단위로 필요한데 박사급 인력이 데이터 암만 생산해 내도 유의미하나?
작년에 한창 라마2로 파인튜닝하면서 LLM 리더보드 순위 경쟁 치열할 때 파인튜닝하던 기업들이나 연구자들이 gpt-4로 생성한 합성 데이터로 파인튜닝한다는 말 나왔었는데 - dc App
gpt-4가 스스로 생성한 합성 데이터로 학습해서 성능이 개선된다면 그게 재귀 개선이라고 할 수 있지 않을까 - dc App
그 재귀 개선이 가능해지는 임계점이 있을 거고 임계점애 도달할 때까지만 박사급들이 데이터 만들어주면 이후에는 LLM 스스로 생성한 데이터로 발전하지 않을까 희망회로 돌려봄 - dc App
현실을 반영한 데이터를 만들어주는 툴이 있으면 이미 그 툴이 AGI겠지