LLM 쪽 잘 안본지 꽤 지나서 요즘거를 전혀 모르는데 mid-training 단계는 또 뭐야 ㅅㅂ
pretrain -> SFT -> RL 이거 아니었냐? pretrain에서 단계 reasoning, long-context train 나눠가지고 하는걸 mid-training이라고 하는건가?
mid-training이라고 불리는 단계는 뭐를 주로 먹이는거임? staged-pretrain에서 고품질 데이터로 annealing하는거랑 어떻게 달라지는거임?
그리고 annealing하고 mid-train임? annealing 한 다음에는 optimizer state는 유지하는거임?
annealing 뭔가 야하다 - dc App
그쪽은 너무 뭐가 많이 생겨서 그들만의 리그 된듯