멀티턴 에이전트 학습을 위해 RL 실험 중에 문제를 한 턴에 풀어내지 못하는 경우에도 다시 시도해보라고 기회를 한 번 더 주고 다음 턴에 풀어내면 보상을 주도록 했음 self correction의 기회를 준건데 처음 몇 스텝만에 나타났대 RL 전에는 사용자의 존재를 무시하거나, 앞서 했던 답변을 그대로 반복하거나 했다고 하는데, 그런 모습은 금방 사라졌대 그니까 이게 RL 과정에서 자연스럽게 등장하는 특성일 수 있다니...
해당 댓글은 삭제되었습니다.