유전알고리즘은
돌연변이(랜덤탐색)->점수가 최대인것을 선택->교배->돌연변이(랜덤탐색)->점수가 최대인 것을 선택 -> 교배-> ...
강화학습은
랜덤탐색->점수가 최대인 조합선택->랜덤탐색 -> ...
인걸로 알고있는데
유전은 랜덤탐색(돌연변이) +교배 로 적합도 함수의 점수가 최대가 되도록 조합을 찾고
강화학습은 그냥 랜덤탐색하고나서 점수가 최대가 되도록 조합하는데
뭐가더 점수 최대화에 유리한거임??
유전알고리즘이 교배라는 연산자를 사용한다는게 차이점인데
그냥 랜덤탐색 직후에 바로 점수를 최대화하는게 유리한건가? 아니면 높은 점수인것끼리 교배하는게 유리한건가?
교배라는게 진짜 필요하긴 한건가?
댓글 1