멀티턴 에이전트 학습을 위해

RL 실험 중에 문제를 한 턴에 풀어내지 못하는 경우에도
다시 시도해보라고 기회를 한 번 더 주고
다음 턴에 풀어내면 보상을 주도록 했음

self correction의 기회를 준건데 처음 몇 스텝만에 나타났대


RL 전에는 사용자의 존재를 무시하거나, 앞서 했던 답변을 그대로 반복하거나 했다고 하는데, 그런 모습은 금방 사라졌대

그니까 이게 RL 과정에서 자연스럽게 등장하는 특성일 수 있다니...