애초에 프롬프트 엔지니어링 자체가 말장난인건 다들 알고있지?


명령어를 잘 입력하면 AI가 더 잘 이해하는 건 맞지만 그 한계점을 강화학습 없이 단순 CoT 굴리는 방식으로 돌파할 수 없다는 거임


o1이나 딥시크같은 추론모델은 추론 과정(CoT) 자체에 수학자들 피드백으로 강화학습 ㅈㄴ 돌렸고 이것도 결국은 스케일링이라고