정답 라벨링을 그대로 따라 쓰는걸 학습하는건데

정답지를 인간이 만드는 이상

GPT-37271647813671가 나와도 인간 수준 절대 못 뛰어넘음 ㅇㅇ

강화학습은 정렬을 도와주고 내재된 지식을 최대한으로 끌어쓰는용도이지 그 내재된 지식조차도 인간에 의해 주입된거임