1. 자기가 gpt라고한댄다: oai제외하고 인간지네마냥 서로가 싼 데이터 서로 먹으며 훈련하는건 2년전부터 오픈소스고 클로즈드고 해온 유구한 전통. 의도하든 의도하지않았든 크롤링, api로 뽑아낸 데이터에는 gpt발 데이터가 많이섞임. 제발 r1한테 누구냐고 물어보고 캡쳐해서 증거떴다!! 드립치는건 그만봤으면..
2. 현재 딥시크가 공개한 방법론은 비용 효율적이며 재현가능한가: 허깅페이스 주도로 풀스케일 r1의 모든 훈련과정을 재현시도중(https://huggingface.co/blog/open-r1)
3. oai, 구글, 앤트로픽, 엔당은 좆됐는가: ㄴ
4. 머야시발 내 무료 r1 돌려줘요:
https://openrouter.ai/deepseek/deepseek-r1:free chatroom에서 무료로 사용가능 (exa ai기반 웹서치 내장)
5. 딥시크 중국 공산당 개인정보유출 어쩌고... : https://openrouter.ai/perplexity/sonar-reasoning
퍼플렉시티에서 서빙하는 r1써라. 미국에서 퍼플렉시티가 직접 서빙하는거임(유료)
6. 그래서 이제뭐함: grok3, gemini 2.0 pro(thinking?), o3-mini 기다리면서 손가락빨기
- dc official App
1은 반만 맞는 얘기임 미국 기업즐도 죄다 oai데이터로 학습했기에 유구한 전통은 맞지만 의도하지 않은 건 아님
그래서 본문에서도 '의도하든 의도하지않았든' 이라고 햇잖슴 - dc App
순수 commoncrawl에서 추출한 웹 덤프데이터를 훈련시켜도 최신날짜로갈수록 gpt발 텍스트데이터가 섞임 - dc App
ㄴ 아니 자동생성이든 복붙이든 누가 ‘저는 gpt입니다’라는 문장을 같이 집어넣냐구ㅋㅋㅋㅋ 트위터봇들이나 블로그 자동 생성 포스트도 그런 내용이 빠져있는데 그 가설이 맞으려면 지피티도 최신 버전일수록 스스로를 클로드나 제미나이라고 하는 환각을 보여야 이치에 맞지 의도치않게라는 말은 거짓말임
내가 1번에서 하고싶은말은 현재 '파운데이션모델들이 의도치않게 gpt데이터를 훈련에사용했다'가 아님. 직접 oai api로 추출하든, 데이터셋에 섞여들어가든 어떤경로로 데이터를 수집해서 훈련했던지 간에 모델에게 정체성이 무엇이냐고 물어보는것자체가 무의미하다는게 논지임 - dc App