추론
1. 특정문제에 대한 정답이 나올때까지 무한정 재추론 루프 돌림
2. 정답이 나오면 그 정답이 도출될때까지의 사고과정을 강화학습을 통해 다시 학습시킴
3. 그렇게 학습시킨 추론모델은 다시 강해짐 그리고 강해진 추론모델을 다시 상향조절된 더 어려운 문제에 대한 정답이 나올때까지 무한정 재추론 루프를 돌림
4. 정답이 나오면 다시 또 그 사고과정을 강화학습을 통해 학습시킴
이하 무한반복
리만가설 ㄱㄱ싱
추론
1. 특정문제에 대한 정답이 나올때까지 무한정 재추론 루프 돌림
2. 정답이 나오면 그 정답이 도출될때까지의 사고과정을 강화학습을 통해 다시 학습시킴
3. 그렇게 학습시킨 추론모델은 다시 강해짐 그리고 강해진 추론모델을 다시 상향조절된 더 어려운 문제에 대한 정답이 나올때까지 무한정 재추론 루프를 돌림
4. 정답이 나오면 다시 또 그 사고과정을 강화학습을 통해 학습시킴
이하 무한반복
리만가설 ㄱㄱ싱
저게 만능은 아님 정답이나 평가가 애매한 상황에는 적용 못함 물론 수학 과학은 비교적 그게 용이한 부분이 많으니 발전이 있겠지
정답이 있는 수학문제와 정답이 정해져있는 과학문제같은경우는 저거 적용가능함
닫힌계 문제에 대해선 거의 무적에 가까우나 열린계 문제에 대해선 환각때문애 활용이 불가능하지 ㅋㅋ 그래서 옳음 에 대한 평가가 가능한 지도의 필요성이 강조되는거고