내가 참고한 내용이 영어라서 번역하고 이해한 다음 여기 쓰는거니까 진지한 말투 좀 쓸게 ;;


일단 강화학습에 대해 설명하자면 로봇을 범용적인 목적으로 사용하기 위해 설계된 프레임 워크야.

해당 머신러닝은 액션을 취할 수 있는 능력을 가진 로봇들을 위해 존재하고,

그렇기 때문에 로봇이 취하는 액션은 로봇들의 다음 행동에 영향을 끼치게 되지.

행동에 대한 성공여부는 스칼라로 된 신호값으로 측정한다네.


강화학습에선 강화해야할 액션들을 선택하는 행위가 되게 중요해.

이 선택으로 미래에대한 보상이 크고 작아지거든.

강화학습의 핵심은 이런 보상이 최대화될 수 있도록 만드는 거다.


뭐, 강화학습의 최종 목표는 다들 알겠지만, 인간 수준의 일들을 로봇이 처리하게 하는 거다.

여기서 대충 파악할 수 있는 변수들은

로봇이 가지는 각각의 행동 스텝에 따라

- 상태값 수신

- 스칼라로 된 성공여부 값(이하 보상값) 수신

- 액션 수행

이 파생되고,


그럼 시스템 입장에서 측정되는 변수는

- 액션 수신

- 상태값 파생

- 보상값 파생

이 되겠지.


이런걸 가지고 장난치는 거라고 보면 된다.

머신러닝계의 삼대장(인지학습, 비인지학습, 강화학습) 중 하나니까 알아두면 좋아 ㅇㅇ