딥시크의 의의를 잘못 생각하는 거같음
알못 일반인들은 딥시크 등장으로 이제 암드나 화웨이 gpu로도 충분하다는 둥 엄청난 경량화로 민주화를 이룩했다는 둥 착각했지만 그건 그런 의견 내는 사람들이 ai에 대해 아무것도 모르는 선형충들이라 그런거고
관련업계나 학계에서 딥시크가 고평가받은건 oai나 앤스로픽이 못할 거같은 일을 딥시크가 해서가 아니라 턱끝까지 쫓아온 패스트팔로워로서 스스로를 증명 & 오픈 웨이트로 가중치를 풀어버려서임
존나 유명한 짬뽕 맛집이 재료 뭐 들어가는지 만드는 방법이 뭔지 절대 안 공개하면서 한 그릇 2만원에 짬뽕 비싸게 팔고잇는데
갑자기 무명 쉐프가 나와서 그 짬뽕집이랑 90퍼센트 비슷한 맛나는 레시피를 전격 공개한 거랑 같은 상황
즉 중국에 굳이 붙지 않아도 연구 결과를 자유롭게 적용할 수 있게 해서 찬양받은 거임
네 2만원 짬뽕 먹을게요
아니. v2 v3 r1 전부 경량화가 핵심이라니까 fp8, MoE, MLA 로 gputime 줄이고 저수준 언어로 gpu까지 손본거고 그 모든 과정에서 레시피를 공개한게 아니라고. 예를 들어서 네카오가 저 논문보고 그대로 따라할 수 있는건 칩간 대역폭 한정시켜서 gputime 줄이는거지 90% 똑같은 맛을 낼 수 있는게 아니라고. 답답하다. 맛을 내게 하려면 트레이닝데이터셋이 필수인데 api로 oai나 anthropic q&a 셋 모으면 데이빗 색스가 차르인판에 국가간 갈등까지 생길거임
경량화 자체는 걍 추세선에 따른 경량화일뿐이라 큰 의미 없어 4o같은 모델도 경량화 모델인데 뭐 그리고 오픈 웨이트라는 건 그냥 가져다 붙여 쓸 수 있다라는 개념이라 재현을 위해 자원을 투입할 필요가 없음 강화학습 환경이나 조건을 공개하지 않아서 불완전하다는 비판을 받은 것과 별개로 아키텍처랑 학습 파이프라인을 공개했기 때문에 저 정도 알려줫는데 못따라하는 거는 걍 해당 기업의 역량 미달일뿐 딥식의 연구는 sota라고 보긴 어려움
오픈웨이트는 만든거 걍 다운받아서 쓰는거지 이게 우리 모델 개발이랑 뭔상관이냐고 레시피 90퍼 비유는 완전 틀린 소리니까 이상한소리 ㄴ
본문이 그 얘기야 그냥 다운 받아서 쓰는 거니까 짬뽕을 먹는거에 비유하는 거지 중국측에 안붙어도 그냥 모델을 무료로 쓸수 있는거니까 그리고 단순히 가중치만 공개한게 아니라 아예 학습 파이프라인이랑 아키텍처에 관한 기술이 상세하게 있어서 학계나 업계에서 이미 재현시도가 되고 있는데 딥식 개발진이 뭐 즈그들이 대단한 moat을 가지고 있다고 생각도 안한 거라고 보면 됨 비트넷이나 gpt4 생각하먼 MoE나 fp8같은건 새로운 개념도 아니고 진부하지