애초에 프롬프트 엔지니어링 자체가 말장난인건 다들 알고있지?
명령어를 잘 입력하면 AI가 더 잘 이해하는 건 맞지만 그 한계점을 강화학습 없이 단순 CoT 굴리는 방식으로 돌파할 수 없다는 거임
o1이나 딥시크같은 추론모델은 추론 과정(CoT) 자체에 수학자들 피드백으로 강화학습 ㅈㄴ 돌렸고 이것도 결국은 스케일링이라고
애초에 프롬프트 엔지니어링 자체가 말장난인건 다들 알고있지?
명령어를 잘 입력하면 AI가 더 잘 이해하는 건 맞지만 그 한계점을 강화학습 없이 단순 CoT 굴리는 방식으로 돌파할 수 없다는 거임
o1이나 딥시크같은 추론모델은 추론 과정(CoT) 자체에 수학자들 피드백으로 강화학습 ㅈㄴ 돌렸고 이것도 결국은 스케일링이라고
rl이나 test time scaling이 핵심이 아닐텐데. 당장 긴 데이터셋으로 sft만 해도 추론 능력 rl로 학습한 reasoning 모델과 비빈다는 연구가 계속 나오는데 - dc App
o1 같은 추론모델은 CoT 프롬프팅 딸깍이 아니라 그 사고의 연쇄를 AI가 창조할 수 있도록 훈련된 모델임