https://gall.dcinside.com/thesingularity/516250

 

1. 인공지능으로 풀이를 만듬


2. 그 풀이를 모델의 입력에 넣고 출력에 긍정,중립,부정을 내놓도록 학습시킴


3. 그렇게 학습시킨 모델은 풀이가 맞는지 틀린지를 내놓는 모델이 됨


4. 이 모델로 풀이를 평가해서 옳은 풀이를 학습시킴



여기서 4번


"옳은 풀이를 학습"


이게 강화학습임


강화고 뭐고 그딴말로 부를필요도 없음