LLM 쪽 잘 안본지 꽤 지나서 요즘거를 전혀 모르는데 mid-training 단계는 또 뭐야 ㅅㅂ

pretrain -> SFT -> RL 이거 아니었냐? pretrain에서 단계 reasoning, long-context train 나눠가지고 하는걸 mid-training이라고 하는건가?

mid-training이라고 불리는 단계는 뭐를 주로 먹이는거임? staged-pretrain에서 고품질 데이터로 annealing하는거랑 어떻게 달라지는거임?

그리고 annealing하고 mid-train임? annealing 한 다음에는 optimizer state는 유지하는거임?