24b0d121e09c28a8699fe8b115ef046c68f62a499a



병렬적으로 한 번에 여러 응답을 생성한 다음에 응답을 개선하고 조합하고 하면서 최선의 응답을 도출하는 방식임


이걸 강화학습으로 더욱 최적화했고