정답 라벨링을 그대로 따라 쓰는걸 학습하는건데
정답지를 인간이 만드는 이상
GPT-37271647813671가 나와도 인간 수준 절대 못 뛰어넘음 ㅇㅇ
강화학습은 정렬을 도와주고 내재된 지식을 최대한으로 끌어쓰는용도이지 그 내재된 지식조차도 인간에 의해 주입된거임
정답 라벨링을 그대로 따라 쓰는걸 학습하는건데
정답지를 인간이 만드는 이상
GPT-37271647813671가 나와도 인간 수준 절대 못 뛰어넘음 ㅇㅇ
강화학습은 정렬을 도와주고 내재된 지식을 최대한으로 끌어쓰는용도이지 그 내재된 지식조차도 인간에 의해 주입된거임
뭐 인간 전문가 퍼포먼스를 더 효율적으로 달성하는거지
근데 그게 agi의 목표는 아니잖아.
비지도학습도 많이 쓰이는데요..
Llm에서는 비지도학습이나 지도학습이나 걍 말장난임