?? 아직까지는 언어모델에선 그 강화학습을 인간이 라벨링 시켜주는거잖음
그리고 비전모델에 어떻게 강화학습을 적용할거임
인간이 다르게 알고있으면 틀린 사실 그대로 학습이 되는데 - dc App
익명(2013sla)2025-02-06 10:59
답글
언젠가는 비전모델에 적용하는 보상함수도 찾아내겠지. llm에 적용하는 보상함수를 만들거라곤 상상도 못했었고 이미 존재하는 지금도 그게 대체 어떤구조인지 감도 안잡히는데 - dc App
Lily(fraction3193)2025-02-06 11:30
다들 알다시피 뇌과학적으로 꿈과 현실세계에 대한 인간의 지각은 큰 차이가 없는데 - dc App
요정여왕에르핀등장!(plate0434)2025-02-06 11:03
답글
옹 설명을 내가 많이 안적긴했네내 생각은 결국에 아인슈타인 사고실험처럼모델이 알고있는 사실 기반으로 상상을 통해 연구할때는 효과적일 확률이 높은데llm 모델이 새로운 과학적 사실을 연구했다고 치면그걸 소라로 증명할 수는 없잖아결국에 현실세계에와의 상호작용을 통해 얼마나정합성이 높은지 증명이 필요한거니까아예 쓸모없다는 얘기는 아님 - dc App
이거 진짜에요??
인터넷에 올라온건데 가짜일리가 없잖음;; - dc App
입력된 지식만 나오면 강화학습을 왜하노 모델 스스로 통찰을 얻으니까 강화학습을 돌리지
?? 아직까지는 언어모델에선 그 강화학습을 인간이 라벨링 시켜주는거잖음 그리고 비전모델에 어떻게 강화학습을 적용할거임 인간이 다르게 알고있으면 틀린 사실 그대로 학습이 되는데 - dc App
언젠가는 비전모델에 적용하는 보상함수도 찾아내겠지. llm에 적용하는 보상함수를 만들거라곤 상상도 못했었고 이미 존재하는 지금도 그게 대체 어떤구조인지 감도 안잡히는데 - dc App
다들 알다시피 뇌과학적으로 꿈과 현실세계에 대한 인간의 지각은 큰 차이가 없는데 - dc App
옹 설명을 내가 많이 안적긴했네내 생각은 결국에 아인슈타인 사고실험처럼모델이 알고있는 사실 기반으로 상상을 통해 연구할때는 효과적일 확률이 높은데llm 모델이 새로운 과학적 사실을 연구했다고 치면그걸 소라로 증명할 수는 없잖아결국에 현실세계에와의 상호작용을 통해 얼마나정합성이 높은지 증명이 필요한거니까아예 쓸모없다는 얘기는 아님 - dc App