액션이 이동,추적,가드,공격3종류 이렇게 6가지로 구성된
간단한 격투게임인공지능 만들어보고있는데
이게 맨처음에는 스마트한, 그러니까 주어진 상황에서 사람보다 얼마나 더 똑똑하게 행동할까? 이걸 생각했거든여
근데 적중하면 보상을 주고 피격당하거나 빗나가면 보상을 차감하고, 보상체계를 계속 디테일하게 구성하다보니까
뭔가 그냥 내 의도데로 충분히 예상가능한(?) 인공지능이 만들어지는거같음...
3일내내 이걸로 고민하고있어서 똥글써봤어요...
- dc official App
그게 최적인가보지 뭐
무겐 인공지능들만 봐도...
실수를 안 하겠죠 뭐.. 저도 약간 의문이긴 함 ㅋㅋ 인공지능 판사 같은 거
리워드 설계를 세부적으로 할 수록 학습 난이도는 떨어지는 경향이 있지만 인공지능이 달성가능한 최대 성능은 줄어듬.
극단적으로 리워드를 승리 시에만 1 주는 식으로 한다면 학습 난이도는 많이 증가하겠지만, 많은 량의 리소스로 학습에 성공 할 경우 달성가능한 최대 성능이 훨씬 높음. 인간의 리워드 설계에 제약받지 않고 행동이 가능하기 때문
현재 강화학슴 수준으로는 숨바꼭질 정도는 sparse한 리워드로 학습 시킬 수 있지만(승리 시에만 보상), 그 외의 경우는 사실상 어려워서 리워드 설계를 해서 리우드를 dense하게 만들어 줌
물론 위의 숨바꼭질이 sparse한 리워드로 학습 가능하다는 것도, 일반인이 집 컴퓨터로 할 수 있단건 아님
관련 논문
https://openai.com/blog/emergent-tool-use/
오 막연히 생각만 했는데 진짜인가보네