알파고에 쓰인 강화학습을 일반화해서 언어모델에 적용한것 같음 당연히 학습이 필요함
알파고: 체스에서이기기에중점든강화학습 언어모델: 추론으로답맞추기에중점둔강화학습 둘다특정분야에대한강화학습인데 일반화햇다는건무슨말임
애초에 모델 실행 알고리즘에는 변화가 없음 모델 실행 알고리즘에 변형이 생기면 기존의 파라미터가 무쓸모가 돼서 학습을 안 한다는 게 말이 안 되고 o모델 경우는 알고리즘은 동일한데 파라미터를 미세조절한 거임
미세조정
알파고에 쓰인 강화학습을 일반화해서 언어모델에 적용한것 같음 당연히 학습이 필요함
알파고: 체스에서이기기에중점든강화학습 언어모델: 추론으로답맞추기에중점둔강화학습 둘다특정분야에대한강화학습인데 일반화햇다는건무슨말임
애초에 모델 실행 알고리즘에는 변화가 없음 모델 실행 알고리즘에 변형이 생기면 기존의 파라미터가 무쓸모가 돼서 학습을 안 한다는 게 말이 안 되고 o모델 경우는 알고리즘은 동일한데 파라미터를 미세조절한 거임
미세조정