이것을 수학에 적용해서 합성데이터 만으로 초등수학문제수준인 더하기,빼기,나눗셈,곱하기 로 구성되어있는 문제집을 풀이하는데에 성공함 그리고 자신이 만든 합성데이터를 또다시 연구하고 추론해서 또 더 나은 수식을 만들어나가는거지
익명(211.184)2023-12-19 02:04
답글
익명(873dvejis77)2023-12-19 02:12
답글
연구하고 추론하는 방법이 뭐임근데? - dc App
익명(175.201)2023-12-19 02:18
강화학습 부분에 Q러닝이라는 게 있음 이걸 딥러닝으로 최적화(옵티멀)하는 게 딥Q네트워크고 최적의 Q값을 Q*(큐 옵티멀)이라고 했었던 거 같은데
초존도초(htr3c654r6ft)2023-12-19 02:45
답글
난 강화학습에 한계가 있다고 생각함.. 그래서 강화학습을 모티브로 따진 않았을거같음
익명(175.201)2023-12-19 02:54
답글
강화학습은 사실상 그냥 자연의 법칙 그 자체인데 한계가 있다 생각하는 근거가 머임?? 인간을 포함한 모든 생명체, 심지어 바이러스조차도 강화학습으로 동작하는데
초존도초(htr3c654r6ft)2023-12-19 03:27
답글
적절한 보상을 제공하는거 자체가 쉽지않은일 같아서
익명(175.201)2023-12-19 03:34
답글
지구 40억년간 적절한 보상 주는 법 가르쳐줬잖음 진화 알고리즘 + 시뮬레이션만 갖고도 강화학습 여태 엄청 발전한 거긴 한데...
초존도초(htr3c654r6ft)2023-12-19 03:40
답글
땅에 새 모이를 일정한 간격으로 늘어놓듯이 보상이 적절한 타이밍에 지속적으로 제공되어야하는데, 그렇지 못하다고 생각한 부분이 알파스타 만들때 처음에 그냥 게임이기면 보상준다고 하고 던져놓으니까 허공에 클릭질만했음. 그래서 게임을 미니게임으로 나누고 미니게임을 이기면 보상주고 그랬는데. 이렇게 보상을 주는 시스템을 인간이 설계해야하니까 한계가 있는거같음..
익명(175.201)2023-12-19 03:43
답글
이번에 논문제목 유레카 였나? 거대언어모델 보고 보상 설정하게 했더니 미친 성능 나왔잖음 보다 상위 인공지능이 보상 설정하게 설계하면 돌파할 거 같은데 ㄷ
그러면서 더 나은 답을 향해서 재귀개선 하는것임
이것을 수학에 적용해서 합성데이터 만으로 초등수학문제수준인 더하기,빼기,나눗셈,곱하기 로 구성되어있는 문제집을 풀이하는데에 성공함 그리고 자신이 만든 합성데이터를 또다시 연구하고 추론해서 또 더 나은 수식을 만들어나가는거지
연구하고 추론하는 방법이 뭐임근데? - dc App
강화학습 부분에 Q러닝이라는 게 있음 이걸 딥러닝으로 최적화(옵티멀)하는 게 딥Q네트워크고 최적의 Q값을 Q*(큐 옵티멀)이라고 했었던 거 같은데
난 강화학습에 한계가 있다고 생각함.. 그래서 강화학습을 모티브로 따진 않았을거같음
강화학습은 사실상 그냥 자연의 법칙 그 자체인데 한계가 있다 생각하는 근거가 머임?? 인간을 포함한 모든 생명체, 심지어 바이러스조차도 강화학습으로 동작하는데
적절한 보상을 제공하는거 자체가 쉽지않은일 같아서
지구 40억년간 적절한 보상 주는 법 가르쳐줬잖음 진화 알고리즘 + 시뮬레이션만 갖고도 강화학습 여태 엄청 발전한 거긴 한데...
땅에 새 모이를 일정한 간격으로 늘어놓듯이 보상이 적절한 타이밍에 지속적으로 제공되어야하는데, 그렇지 못하다고 생각한 부분이 알파스타 만들때 처음에 그냥 게임이기면 보상준다고 하고 던져놓으니까 허공에 클릭질만했음. 그래서 게임을 미니게임으로 나누고 미니게임을 이기면 보상주고 그랬는데. 이렇게 보상을 주는 시스템을 인간이 설계해야하니까 한계가 있는거같음..
이번에 논문제목 유레카 였나? 거대언어모델 보고 보상 설정하게 했더니 미친 성능 나왔잖음 보다 상위 인공지능이 보상 설정하게 설계하면 돌파할 거 같은데 ㄷ
그럼 그 보상을 설정하는 거대언어모델이 강화학습보다 더 뛰어나다는 증거아님?