니가 말하는 foundation model 기술적인 용어 + 정량적으로 정의나 하고 오는게 어떠냐?
가능하냐고? 가능하지. 근데 니가 월화수목금금금 10-10 할 자신이 있으면 그런거고
코드야 걍 pretrained model 딸깍+ fine tuning으로 니 목적에 맞춰서 바꾸고 싶다 이런거면 그리 어렵지는않을껄?
근데 바닥부터 니가 짜고 싶다? 그럼 일단 트랜스포머 부터 구현하고 와라. 거기서 decoder만 때고 몇개 수정하면 그게 gpt-1의 시작이니까
딥삣삐 5(14.35)2025-12-05 12:29
답글
아 물론 gpu로 억단위로 쓸 생각 있는거지? 뭐 runpod에서 일시적으로 왕창 대여하고 수천만원 쓸꺼면 그것도 괜찮고
딥삣삐 5(14.35)2025-12-05 14:45
내가 너랑 똑같은 목적을 가진 사람인데 단순계산상으로 연산력이 2천만 테라플롭스 필요하다. 돈부터 가져오던지 아니면 목표를 줄이던지. 난 초기에 3B로 하려다가 그건 말도안된다는 얘기 듣고 100-500M으로 하는중이다. 근데 이걸로 해도 당연하게도 1-2 epoch만 잡아도 학습 시간 12시간은 기본임.
Induction(knife4221)2025-12-05 15:41
답글
뭐 나처럼 모델 구현은 클로드한테 계획이랑 이것저것 던져주고 걔가 코드 짠 거 보고 대충 수정할거 수정하고 데이터셋 모아서 학습시키고 하는 수준이라면 너도 충분히 할 수 있을거임. 하지만 아는게 전혀 없다면 모델 구조 계획부터 못할거다.
대충 아무렇게나 AI한테 시키면 GPT-2 로 짜올텐데 그걸로 한국어 한다고 하면 니가 뭔짓을 하던 모델 자체가 멍청해서 지금까지 한 모든게 다 전기낭비, 시간낭비가 될거임. 딥시크, OpenAI, 구글 이런애들이 모델 구조에 대해서 설명하고 대충 논문 써놓은거를 챗지피티한테라도 물어봐서 따라해보는게 나음.
나는 클로드한테 MLA 만들어달라고 해서 그걸로 쓰는중이긴 하다. 물론 MLA라고 해도 연산력은 똑같이 들어가고 학습에만 수 주가 걸리는건 똑같음.
Induction(knife4221)2025-12-05 15:45
답글
"파운데이션 모델을 만들어서 그게 작동하게 만든다" 라는 것은 사실 수B 수준의 모델, 그리고 고품질의 데이터셋에 대해 접근할 기회가 적은 우리에게는 애초에 달성하기 힘든 조건이고 그건 네 취미가 될 수는 있지만 본업이 될 수는 없음. 그걸 하는 실력으로 대학에 간다면 교수가 너를 대학원생으로 받아서 평생 키우겠지만 그게 아니라 고졸로 그걸 하겠다고 하면 그건 그냥 시간낭비다. 연구를 하는것도 아니고 그냥 취미인거지.
Induction(knife4221)2025-12-05 15:47
답글
결론적으로 데이터셋을 어떻게 모을 건지 & 모델의 타겟은 어떤 분야인지 (그 중에서도 특화된 부분은?) & 학습용 하드웨어와 그런것들은 어떻게 할 건지 를 해결해야 함.
LLM 학습은 진짜 연산력과 메모리 대역폭 집약적인 분야이기에 지포스 이런걸로는 택도없고 테슬라나 그런거 구해야 한다.
데이터셋도 AI로 만들라면 만들수는 있지만 토큰비용때문에 학습시키기 이전에도 털릴거고
Induction(knife4221)2025-12-05 15:50
답글
나는 CSV로 말 그대로 엑셀작업을 하는 모델을 만들거고 내가 만든 결론은 이거임.
학습 데이터 -> GPT-OSS 로컬로 돌려서 채팅할 수 있는 수준의 데이터셋을 뽑고, Deepseek API 돌려서 추론 능력 만들고, OpenAI API로 마지막 10% 데이터셋 만들어서 반복훈련시킬거다.
학습용 하드웨어 -> 타오바오에서 파는 V100 구해다가 써야지 뭐 ㅋ
모델 구조 -> MLA 에 RoPE + SwiGLU 적용한게 지금 상황에서는 제일 잘 되는듯.
Induction(knife4221)2025-12-05 15:53
답글
그리고 가장 중요한거는 이거는 그냥 니 놀이에 불과하다는거임. from scratch 로 300M짜리 모델 전기 갈아가면서 만들어도 상용 모델에 파인튜닝한것보다 성능 안나온다 그냥 재미라고 보고 해라
Induction(knife4221)2025-12-05 16:04
답글
일단 간단하게 딥시크의 +99 강화 트랜스포머 몽둥이 <- 이 영상 검색해서 보고 이게 뭔 개소린가 싶으면 진지하게 접는것을 추천함. 수학? ㅈ까고 그냥 레고블럭 조립해서 뭐가뭐가 더 나아요? 식의 박치기로 만든다고 해도 저 영상을 이해하지 못한다면 그냥 무용지물이다. 그 때 부터는 그냥 레고블럭 수십개로 수많은 경우의 수를 전부 시도하는 브루트 포스밖에 안됨.
일단 넌 ChatGPT Plus 부터 결제하고 VSCode 깔아서 GPT-2 기반으로 Tinystories 데이터셋 학습하는거 코드 짜달라고 해서 그거부터 학습돌려봐라. 걸리는 시간 보고 니가 이걸 할 마음이 있다고 하면 해. 물론 시간 보자마자 안한다고 하겠지만
Induction(knife4221)2025-12-05 16:10
답글
애초에 나는 학부 1학년이고 너는 고등학생이니까 이게 의미가 있나 싶네 그냥 대학이라도 가는게 나음. 그래야 니 연구를 들어줄 교수가 생긴다. 사실 이게 내가 한다고 해서 친구가 자기 교수한테 이런거 한다고 말했더니 그럼 연구실 GPU 신청하라고 했다함. 이게 혼자서 하는거랑 학생으로 하는거랑 대우가 완전 다름.
Induction(knife4221)2025-12-05 16:17
답글
그냥 쉽게 qwen한테 니가 하고싶은걸 말해봐 걔 ㅈㄴ 표독해서 니말에 계속 반박하려고 우길텐데 걔가 하는 말 대부분 맞는말이라서 어느정도 정신이 들거다
Induction(knife4221)2025-12-05 16:23
답글
이 똥글은 새내기의 급발진으로 성공되었다. 이 새내기는 아직도 똥글싸개가 고딩인줄 알고 있다...
대학에서mt도안가고술도안마신나를저격하는거냐?????????
니가 고3처럼 열심히 하겠냐... 성실함을 보여놓고 말을 해라
노력은 노력이고 학습비용 수십억부터 마련해야하는데 우짜게
고3처럼 해서 수포자부터 탈출좀 해보던가 ㅋㅋㅋ - dc App
커뮤니티 내의 유아적 만능감 사례로 쓰고싶네
나 머리 ㅈㄴ 좋다니까?
@글쓴 딥삣삐(14.32) 웩슬러 검사 받고 결과 알려줘
뭔소리야 머리 좋았으면 수포자가 안됐겠지
머리 좋은애들은 이런거 안물어보지
힘내!! - dc App
니가 말하는 foundation model 기술적인 용어 + 정량적으로 정의나 하고 오는게 어떠냐? 가능하냐고? 가능하지. 근데 니가 월화수목금금금 10-10 할 자신이 있으면 그런거고 코드야 걍 pretrained model 딸깍+ fine tuning으로 니 목적에 맞춰서 바꾸고 싶다 이런거면 그리 어렵지는않을껄? 근데 바닥부터 니가 짜고 싶다? 그럼 일단 트랜스포머 부터 구현하고 와라. 거기서 decoder만 때고 몇개 수정하면 그게 gpt-1의 시작이니까
아 물론 gpu로 억단위로 쓸 생각 있는거지? 뭐 runpod에서 일시적으로 왕창 대여하고 수천만원 쓸꺼면 그것도 괜찮고
내가 너랑 똑같은 목적을 가진 사람인데 단순계산상으로 연산력이 2천만 테라플롭스 필요하다. 돈부터 가져오던지 아니면 목표를 줄이던지. 난 초기에 3B로 하려다가 그건 말도안된다는 얘기 듣고 100-500M으로 하는중이다. 근데 이걸로 해도 당연하게도 1-2 epoch만 잡아도 학습 시간 12시간은 기본임.
뭐 나처럼 모델 구현은 클로드한테 계획이랑 이것저것 던져주고 걔가 코드 짠 거 보고 대충 수정할거 수정하고 데이터셋 모아서 학습시키고 하는 수준이라면 너도 충분히 할 수 있을거임. 하지만 아는게 전혀 없다면 모델 구조 계획부터 못할거다. 대충 아무렇게나 AI한테 시키면 GPT-2 로 짜올텐데 그걸로 한국어 한다고 하면 니가 뭔짓을 하던 모델 자체가 멍청해서 지금까지 한 모든게 다 전기낭비, 시간낭비가 될거임. 딥시크, OpenAI, 구글 이런애들이 모델 구조에 대해서 설명하고 대충 논문 써놓은거를 챗지피티한테라도 물어봐서 따라해보는게 나음. 나는 클로드한테 MLA 만들어달라고 해서 그걸로 쓰는중이긴 하다. 물론 MLA라고 해도 연산력은 똑같이 들어가고 학습에만 수 주가 걸리는건 똑같음.
"파운데이션 모델을 만들어서 그게 작동하게 만든다" 라는 것은 사실 수B 수준의 모델, 그리고 고품질의 데이터셋에 대해 접근할 기회가 적은 우리에게는 애초에 달성하기 힘든 조건이고 그건 네 취미가 될 수는 있지만 본업이 될 수는 없음. 그걸 하는 실력으로 대학에 간다면 교수가 너를 대학원생으로 받아서 평생 키우겠지만 그게 아니라 고졸로 그걸 하겠다고 하면 그건 그냥 시간낭비다. 연구를 하는것도 아니고 그냥 취미인거지.
결론적으로 데이터셋을 어떻게 모을 건지 & 모델의 타겟은 어떤 분야인지 (그 중에서도 특화된 부분은?) & 학습용 하드웨어와 그런것들은 어떻게 할 건지 를 해결해야 함. LLM 학습은 진짜 연산력과 메모리 대역폭 집약적인 분야이기에 지포스 이런걸로는 택도없고 테슬라나 그런거 구해야 한다. 데이터셋도 AI로 만들라면 만들수는 있지만 토큰비용때문에 학습시키기 이전에도 털릴거고
나는 CSV로 말 그대로 엑셀작업을 하는 모델을 만들거고 내가 만든 결론은 이거임. 학습 데이터 -> GPT-OSS 로컬로 돌려서 채팅할 수 있는 수준의 데이터셋을 뽑고, Deepseek API 돌려서 추론 능력 만들고, OpenAI API로 마지막 10% 데이터셋 만들어서 반복훈련시킬거다. 학습용 하드웨어 -> 타오바오에서 파는 V100 구해다가 써야지 뭐 ㅋ 모델 구조 -> MLA 에 RoPE + SwiGLU 적용한게 지금 상황에서는 제일 잘 되는듯.
그리고 가장 중요한거는 이거는 그냥 니 놀이에 불과하다는거임. from scratch 로 300M짜리 모델 전기 갈아가면서 만들어도 상용 모델에 파인튜닝한것보다 성능 안나온다 그냥 재미라고 보고 해라
일단 간단하게 딥시크의 +99 강화 트랜스포머 몽둥이 <- 이 영상 검색해서 보고 이게 뭔 개소린가 싶으면 진지하게 접는것을 추천함. 수학? ㅈ까고 그냥 레고블럭 조립해서 뭐가뭐가 더 나아요? 식의 박치기로 만든다고 해도 저 영상을 이해하지 못한다면 그냥 무용지물이다. 그 때 부터는 그냥 레고블럭 수십개로 수많은 경우의 수를 전부 시도하는 브루트 포스밖에 안됨. 일단 넌 ChatGPT Plus 부터 결제하고 VSCode 깔아서 GPT-2 기반으로 Tinystories 데이터셋 학습하는거 코드 짜달라고 해서 그거부터 학습돌려봐라. 걸리는 시간 보고 니가 이걸 할 마음이 있다고 하면 해. 물론 시간 보자마자 안한다고 하겠지만
애초에 나는 학부 1학년이고 너는 고등학생이니까 이게 의미가 있나 싶네 그냥 대학이라도 가는게 나음. 그래야 니 연구를 들어줄 교수가 생긴다. 사실 이게 내가 한다고 해서 친구가 자기 교수한테 이런거 한다고 말했더니 그럼 연구실 GPU 신청하라고 했다함. 이게 혼자서 하는거랑 학생으로 하는거랑 대우가 완전 다름.
그냥 쉽게 qwen한테 니가 하고싶은걸 말해봐 걔 ㅈㄴ 표독해서 니말에 계속 반박하려고 우길텐데 걔가 하는 말 대부분 맞는말이라서 어느정도 정신이 들거다
이 똥글은 새내기의 급발진으로 성공되었다. 이 새내기는 아직도 똥글싸개가 고딩인줄 알고 있다...
머리가 그렇게 좋으면 글쓰기 전에 알수 있는거 아님?