왜 갑자기 돌파구가 된겨
[일반] 근데 강화학습 근 몇년간 유기됐었던거 아니냐?
익명(115.139)
2025-04-22 10:41
추천 1
댓글 28
다른 게시글
-
요즘 죄다 스캠느낌..오픈ai도 [6][일반] 먼데이(await3622) | 25.04.22추천 0
-
역노화 기원 300일차 [2][일반] 익명(silk5852) | 25.04.22추천 0
-
ai가 발달할수록 사람들 도파민 수용치가 높아지는듯 [2][일반] 익명(u56uhr) | 25.04.22추천 0
-
중국이 드디어 뛰는 로봇 만들었다고 좋아하던데 [6][일반] 익명(196.244) | 25.04.22추천 2
-
제미나이 비유 능력이 진짜 뒤지게 웃김 ㅋㅋㅋㅋ [4][일반] 익명(219.248) | 25.04.22추천 6
-
그래도 요즘 한국 정치인들도 ai에 관심 많은듯 [15][일반] 익명(xxme91005) | 25.04.22추천 0
-
속보) 딥시크 팬보이 : r2 찌라시는 구라 확률이 높아 [5][일반] 익명(220.78) | 25.04.22추천 4
-
잼황이 진짜 쩔긴 하네 [5][일반] 익명(121.146) | 25.04.22추천 0
-
하사비스 agi면 세상 모든 문제 해결되는거잖아 [4][일반] 익명(211.224) | 25.04.22추천 1
-
특이점 오면 많은 인구가 필요없다 인구수가 무의미해진다들 하는데.. [2][일반] 익명(xxme91005) | 25.04.22추천 0
강화학습이 유기된게 아니고 하고싶어도 못하다가 최근에 돌파구가 생긴거임
어떤 돌파구가 생긴거임?
추론을 강화하는 방법
안 통하는 줄 알았는데 통하니까 - dc App
그니간 그 이유가 머냐는거지
작년에 얘기가 안 나온 게 아니고 o1 추론도 사람 작업이 포함된 강화학습이었음 딥시크가 사람 작업 포함 없이 강화학습 적용 성공시킨 거고 - dc App
그럼 지금 딥시크쪽이 돌파구의 기점인거임?
딥마인드는 꾸준히 씀
강화학습만 -> 단순행동 병신 트랜스포머에 강화학습 결합 -> 좀 침
그걸 알게된 계기가 머임?
유기된적없음 - dc App
작년 제작년 특갤 보면 강화학습 얘기 거의 안 나왔던거같은데 기업들도 딱히 얘기 안했고
유기의 기준이 특갤이 유기해서 ㅋㅋㅋㅋㅋ - dc App
학계입장은 모르겠고 작년까진 주로 스케일링 얘기만 했는데 강화학습 하는 얘기가 뭐냐는거지
내가 학계입장을 어케 정확히 알겠음 봐봤자 ceo 연구진들 인터뷰하는거나 기사나는거 여기서 떡밥 도는건데 그게 정확히 특갤에 맨날 올라오는거잖아 논문 팔로업하고 빅테크다니고 학회다니고 이럴순 없지
강화학습이 주목받은게 딥마인드가 게임에서 강화학습으로 ASI를 달성해서인데, 게임은 룰도 정형화 가능하고 목표가 확실하니 보상함수 설계가 간단함. 근데 자연어모델에선 이게 잘 안되고 있었음
ㅇㅇ거기까진 대충 알고있음
그래서 차선책으로 인간 피드백에 의존하는 강화학습이란걸 하고 있다가 최근에 CoT의 발전에 힘입어 수학, 코딩 등 객관적으로 품질평가가 가능한 분야에서 목표와 보상모델 설정하는 방법을 찾으면서 자연어 분야의 알파고 모먼트가 찾아온거
그러니까 강화학습을 안한게 아니라 계속 하고는 있었음
결국 연구자들은 모든 방법을 다 동원해서 실험하고 있는데 대중한테는 그 중에 제일 효과본 놈만 이슈가 되니까 강화학습이 유기됐다가 재조명받는 것처럼 보이는 거 뿌닝지
그럼 CoT가 곧 강화학습임? 난 단순히 단계를 세분화시킨게 CoT인줄
최근 2~3년 정도는 스케일업만 해도 성능이 계속 오르니 그런 기사만 계속 특갤에 올라온거지 이제 슬슬 비용과 리소스 한계에 도달해서 스케일링이 안되니 다른 돌파구로 관심사를 돌리는거고
돌파구 제시 자체는 이전에도 여러차례 있었는데 관심사를 돌렸단건 알겠음. 근데 왜 강화학습임? 이건 단순히 특갤에서 화제가 됐을 뿐인건가?
CoT는 질문-단답으로 하지 말고 step by step으로 풀이과정을 끼워넣자 라는 아이디어일 뿐임. 근데 이렇게 하고 보니 풀이과정 자체에도 보상함수를 주자는 process supervision을 도입할 수 있게 됨. 그러다보니 CoT 자체를 강화학습 시켜볼 수 있겠네? 그렇게 CoT 성능을 극한까지 올려보니 지금까지 기존의 자연어모델은 아무리 스케일을 키워도 못하던 논리추론능력이 갑자기 생기네? <- 지금 여기임
ㄱㅅㄱㅅ
딥식이가 R1 내놓으면서 사람 없이 강화학습 되는거 같은데?? 이러니까 다들 강화학습 딥하게 파본거 같음 뭐 그전부터 내부적으로 파고 있었을수도 있지만
딥식이 논문에 강화학습 얘기 나와있길래 그거로부터 파생된건가 했는데 대충은 맞나보네
강화학습 자체는 gpt3.5도 적용되어있음 보상함수가 다를뿐이지