강화학습에다가 추론 데이터 때려박는건 똑같지않나
그냥 궁금해서
토큰 문제로 오류나는거자나
갑자기 뭐라는거
맞음 아모데이도 강화학습 패러다임 스케일링하려고 랩실들 혈안이라고 말함
그럼 뭐 베이스모델 학습데이터 늘리는거랑 크게 차이는 없는데 고품질 추론데이터를 때려박아야 하니까 더 난이도가 올라갔을 뿐이구만
토큰 문제로 오류나는거자나
갑자기 뭐라는거
맞음 아모데이도 강화학습 패러다임 스케일링하려고 랩실들 혈안이라고 말함
그럼 뭐 베이스모델 학습데이터 늘리는거랑 크게 차이는 없는데 고품질 추론데이터를 때려박아야 하니까 더 난이도가 올라갔을 뿐이구만