우선 현 대국 상황(문제)을 에이전트모델의 입력에 두고 출력에 다음에 어디에 돌을 놓을건지(해답)를 출력에 두고 학습할 예정
보상모델에는 문제와 해답을 입력에 두고 그 문제와 해답을 적용했을때 승리했다면 출력에 1점을 두고 학습
자가대국씀
- dc official App
댓글 12
아예 첫수부터 시작하는 인공지능은 아닌건가? 아니면 그...특정상황에 제일 좋은 수를 두는 인공지능을 만드는건가?
익명(221.144)2025-01-29 21:05
답글
문제(현 대국 상황)에대해 답(다음수)를 잘두도록 강화학습하는거.. 라고 할수있나 모르겠네 - dc App
익명(220.89)2025-01-29 21:06
답글
잘은 모르겠지만, 바둑은 보통 강화학습으로 하긴 할거임. MCTS써서 경우의수를 줄이고.
네가 적어준 건 일반 딥러닝처럼 타겟값 있어서 그걸 학습하는 느낌인데...보상모델이면 자가학습 시키겠다는 거지? 그러면, 해답<<이거는 어떻게 하는 거? 준비된 데이터 인거야 아니면 승부의 결과로 이긴 애가 둔 수는 해답으로 보는건가
익명(221.144)2025-01-29 21:09
답글
승부의 결과로 ㅇㅇ - dc App
익명(220.89)2025-01-29 21:10
답글
즉 정답이 없고 스스로 대국을 두면서 학습시킨다는 말일거야.
그럼 강화학습일거고, 요건 내가 잘 모르겠다.
흠. 알파고 시리즈가 강화학습인데, 걔를 GPT한테 물어보고 네가 생각하는 거랑 비교해보는 게 좋을 것 같아.
근데 네가 말한 게 강화학습의...잔상 같은 느낌인데
익명(221.144)2025-01-29 21:17
답글
난그냥 아는거 없이 망상으로 생각한거라서 - dc App
익명(220.89)2025-01-29 21:19
답글
그걸 그냥 하면 연산량이 어마어마하겠지.
바둑이 뭐 경우의 수가 무한이다. 콤푸타는 못 푼다. 그 말 나오는.
그래서 더 단순화 시킬거고, 결국 완벽한 수가 아니라 확률적으로 최적화된 수를 찾을거고, 그럼 MCTS라는 애를 만나겠지. 이럼 네가 하고픈 게 어떻게 될 지 아마 이해할 수 있을 듯.
익명(221.144)2025-01-29 21:19
답글
ㄱㅅㄱㅅ - dc App
익명(220.89)2025-01-29 21:20
답글
근데 바둑AI를 만드는 기본적 출발이 네 말이랑 비슷할 것 같아.
하사비스한테 물어보진 않았지만.
아예 첫수부터 시작하는 인공지능은 아닌건가? 아니면 그...특정상황에 제일 좋은 수를 두는 인공지능을 만드는건가?
문제(현 대국 상황)에대해 답(다음수)를 잘두도록 강화학습하는거.. 라고 할수있나 모르겠네 - dc App
잘은 모르겠지만, 바둑은 보통 강화학습으로 하긴 할거임. MCTS써서 경우의수를 줄이고. 네가 적어준 건 일반 딥러닝처럼 타겟값 있어서 그걸 학습하는 느낌인데...보상모델이면 자가학습 시키겠다는 거지? 그러면, 해답<<이거는 어떻게 하는 거? 준비된 데이터 인거야 아니면 승부의 결과로 이긴 애가 둔 수는 해답으로 보는건가
승부의 결과로 ㅇㅇ - dc App
즉 정답이 없고 스스로 대국을 두면서 학습시킨다는 말일거야. 그럼 강화학습일거고, 요건 내가 잘 모르겠다. 흠. 알파고 시리즈가 강화학습인데, 걔를 GPT한테 물어보고 네가 생각하는 거랑 비교해보는 게 좋을 것 같아. 근데 네가 말한 게 강화학습의...잔상 같은 느낌인데
난그냥 아는거 없이 망상으로 생각한거라서 - dc App
그걸 그냥 하면 연산량이 어마어마하겠지. 바둑이 뭐 경우의 수가 무한이다. 콤푸타는 못 푼다. 그 말 나오는. 그래서 더 단순화 시킬거고, 결국 완벽한 수가 아니라 확률적으로 최적화된 수를 찾을거고, 그럼 MCTS라는 애를 만나겠지. 이럼 네가 하고픈 게 어떻게 될 지 아마 이해할 수 있을 듯.
ㄱㅅㄱㅅ - dc App
근데 바둑AI를 만드는 기본적 출발이 네 말이랑 비슷할 것 같아. 하사비스한테 물어보진 않았지만.
그러면 좋겠다 - dc App
모델 자체는 작아도 학습에 컴퓨팅 파워 무지막지하게 먹음 개인이 돌릴수 있을지 모르겠네
그렇군 - dc App