https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=874016&s_type=search_subject_memo&s_keyword=%EA%B5%AC%EA%B8%80&page=1
구글에서 기존 강화학습의 단점을 보완할 지도강화학습을 제시하다링크: https://arxiv.org/abs/2510.25992대충 결과만 보고 보상을 주는 게 아니라 그 결과에 도달하기까지의 과정도 보상을 주는 방식으로 학습시키는 것 같아요.창의성도 보장이 됐으면..gall.dcinside.com'사고의 연쇄(Chain of Thought)'나 '테스트 시간 컴퓨팅(Test-Time Compute)'과 같은 기술이 도입되면서 인공지능은 한 단계 진보한다. 이 모델들은 단순히 정답을 출력하는 것을 넘어, 문제 해결 과정을 스스로 여러 번 시뮬레이션하고 더 나은 결과물을 도출하기 위해 추론 시간을 더 많이 사용한다. 즉, 연산 시간이 길어질수록 출력의 질이 높아지는 부분적인 자기개선 능력을 갖추게 된다.
하지만 이 단계의 모델은 여전히 완전한 자율성을 갖지 못한다. 생성된 최종 결과물은 반드시 인간 전문가의 검토와 승인을 거쳐야만 한다. 이로 인해 AI와 인간 연구자가 공동으로 연구를 진행하는 '인간-AI 협업' 모델이 보편화되며, 완전한 자율적 피드백 루프는 구축되지 못한다. 구글의 Co-scientist, 메타의 생성자-추론자(Generator-Reasoner) 모델 등이 이러한 과도기적 형태에 해당한다.
놀랍구나
이거 타임라인 상황인식임?
SAMA 타임라인 이랑 상황인식 이랑 합쳐서 내가 만든거임