7cec8177abc236a14e81d2b628f1736f4bbad46f


어떻게작동하는거냐


쭝궈놈들이나 딥마에서 나온건 걍 빔서치 문장이나 풀이 단계 단위로 돌리고 별도 보상모델로 평가해서 스코어 높은거 채택하는거던데


아니 이럼 걍 보상모델에 의존하는거고 기존 LLM은 온도 조절해서 창발성만 뽑아쓰는거아님?


그럼이게 RLHF랑 뭐가다르지?


이거 깔끔하게 설명해줄 킹쪽황공자 없냐


이럴땐 또 숨어서 안나오냐