내가 참고한 내용이 영어라서 번역하고 이해한 다음 여기 쓰는거니까 진지한 말투 좀 쓸게 ;;
일단 강화학습에 대해 설명하자면 로봇을 범용적인 목적으로 사용하기 위해 설계된 프레임 워크야.
해당 머신러닝은 액션을 취할 수 있는 능력을 가진 로봇들을 위해 존재하고,
그렇기 때문에 로봇이 취하는 액션은 로봇들의 다음 행동에 영향을 끼치게 되지.
행동에 대한 성공여부는 스칼라로 된 신호값으로 측정한다네.
강화학습에선 강화해야할 액션들을 선택하는 행위가 되게 중요해.
이 선택으로 미래에대한 보상이 크고 작아지거든.
강화학습의 핵심은 이런 보상이 최대화될 수 있도록 만드는 거다.
뭐, 강화학습의 최종 목표는 다들 알겠지만, 인간 수준의 일들을 로봇이 처리하게 하는 거다.
여기서 대충 파악할 수 있는 변수들은
로봇이 가지는 각각의 행동 스텝에 따라
- 상태값 수신
- 스칼라로 된 성공여부 값(이하 보상값) 수신
- 액션 수행
이 파생되고,
그럼 시스템 입장에서 측정되는 변수는
- 액션 수신
- 상태값 파생
- 보상값 파생
이 되겠지.
이런걸 가지고 장난치는 거라고 보면 된다.
머신러닝계의 삼대장(인지학습, 비인지학습, 강화학습) 중 하나니까 알아두면 좋아 ㅇㅇ
앙-! 도커띠~