o1을 어떻게 훈련시켰냐면
우선 인간이 라벨링한 80만개의 자료로 보상모델을 만듬
보상모델은 풀이를 입력하면 그 풀이가 옳은지 그른지 판정내림
옳다고 판정받은 풀이를 o1에 학습시킨것임
o1은 처음에는 틀린 풀이도 만드는데
틀렸다는 판정을 받으면 다른 풀이를 만들도록 시도함
그 다른풀이들 중 옳다고 판정되는게 또 학습되고
이게 계속 반복됨
그러니까
풀이를 계속 만들어내고 맞으면 그풀이를 학습시키고 틀리면 다른풀이를 시도해서
그 다른풀이중에 맞는 풀이를 또 학습시킴
학습 ai 다 이렇게 해... 알파제로 찾아보고 와라
강화학습을 재귀개선이라고 할수있어? ChatGPT의 말: ChatGPT 강화학습을 '재귀개선'이라고 볼 수 있을까요? 어느 정도 그렇습니다. 강화학습에서는 에이전트가 환경과 상호작용하면서 경험을 통해 보상을 최대화하는 정책을 학습해 나갑니다. 이 과정에서 에이전트는 반복적으로 자신의 정책을 개선해 나가는데, 이를 통해 최적의 행동 전략을 찾게 됩니다. 재귀개선은 기존의 상태와 결과를 기반으로 계속해서 개선해 나가는 것을 의미합니다. 강화학습에서 에이전트는 반복적으로 상태와 보상에 따라 행동을 조정하므로, 이와 유사한 개념으로 볼 수 있습니다. 즉, 강화학습의 핵심은 환경과의 상호작용을 통해 지속적으로 자신을 개선하는 과정이기 때문에 재귀개선과 비슷한 면이 있습니다.
지금 o1이 스스로 목표를 설정하고 성능 개선을 할수있냐..? 저건 알파제로때 이미 다 하던거야 설레발 좀 그만쳐라
o1에게 주요목표를 설정하고 추론을 통해 작은목표를 만들도록하고 추론을통해 그걸 해결하도록 하면됨
니가 하는 말 똑같이 알파제로때부터 염불 외던거다
인공지능이 스스로 자신의 프로그래밍마저 새로 하는 단계를 재귀개선이라고 해 단순히 강화학습이 아니고 본인 성능 자체를 뜯어 고쳐야되는걸 말하는거야 특붕아.....
재귀개선이라하면 보통 모델을 스스로 만들 수 있어야 되지 않나
강화학습을 재귀개선이라고 할수있어? ChatGPT의 말: ChatGPT 강화학습을 '재귀개선'이라고 볼 수 있을까요? 어느 정도 그렇습니다. 강화학습에서는 에이전트가 환경과 상호작용하면서 경험을 통해 보상을 최대화하는 정책을 학습해 나갑니다. 이 과정에서 에이전트는 반복적으로 자신의 정책을 개선해 나가는데, 이를 통해 최적의 행동 전략을 찾게 됩니다. 재귀개선은 기존의 상태와 결과를 기반으로 계속해서 개선해 나가는 것을 의미합니다. 강화학습에서 에이전트는 반복적으로 상태와 보상에 따라 행동을 조정하므로, 이와 유사한 개념으로 볼 수 있습니다. 즉, 강화학습의 핵심은 환경과의 상호작용을 통해 지속적으로 자신을 개선하는 과정이기 때문에 재귀개선과 비슷한 면이 있습니다.
재귀 개선이 뭔지나 찾아보고 와라
강화학습을 재귀개선이라고 할수있어? ChatGPT의 말: ChatGPT 강화학습을 '재귀개선'이라고 볼 수 있을까요? 어느 정도 그렇습니다. 강화학습에서는 에이전트가 환경과 상호작용하면서 경험을 통해 보상을 최대화하는 정책을 학습해 나갑니다. 이 과정에서 에이전트는 반복적으로 자신의 정책을 개선해 나가는데, 이를 통해 최적의 행동 전략을 찾게 됩니다. 재귀개선은 기존의 상태와 결과를 기반으로 계속해서 개선해 나가는 것을 의미합니다. 강화학습에서 에이전트는 반복적으로 상태와 보상에 따라 행동을 조정하므로, 이와 유사한 개념으로 볼 수 있습니다. 즉, 강화학습의 핵심은 환경과의 상호작용을 통해 지속적으로 자신을 개선하는 과정이기 때문에 재귀개선과 비슷한 면이 있습니다.
니한테 도움 안되는 챗지피티 답변은 왜 복붙하는 거? 비슷한 면이 있다는 건 말 그대로 비슷한 면이 있다는 거야. 두 개체의 주요 특징을 임의로 선별했을 때 겹치는 부분이 있다는 거지 재귀 개선이라는 게 성립하려면 필요한 조건을 만족시켰다라는 것하곤 다른 거임 돌고래하고 흰수염고래하고 비슷한 점이 있으니까 돌고래가 흰수염고래임?
할 거면 니한테 도움되게 GPT 탈옥이라도 시킨다음에 복붙해라
얘는 GPT보다 지능이 딸리네
비교 ㄴ 압도적으로 얘가 딸림
난.. 재귀개선이 뭔지이미 알고있었는데도 그냥한번 강화학습을 가져와본것뿐임..
강화학습이랑 재귀개선은 비슷한거지 같은 게 아님. 연구자들한테 가서, 강화학습이 재귀개선 아니예요? 라고 하면 어디부터 설명해야 할 지 난감해할거다. GPT한테 둘이 같은거냐고 물어봐. 그럼 갑자기 정색할 걸.
GPT는 이미 억울함. 할 수 있는 건 다 함. 저기서 뭘 더 말하냐. "비슷하다고 볼 수 있다" "어느 정도 그렇다" "유사한 개념으로 볼 수 있다" "비슷한 면이 있다" 온몸 비틀기로 똑같은 거 아니라고 울부짖는 중 GPT는 무죄야 범죄자는 따로 있다
특갤평 ㅋ