강화학습이나 추론 모델이 적용되긴 했지만


결국은 확률적으로 token 생성하고 검증해나가면서 추론하는 거아닌가..

큰 틀로보면 확률적 단어 생성기를 벗어나진 못한 것 같음


선쌤들을 반박할 수 없다.